feature: scripts/export_run.py 用来导出运行结果

This commit is contained in:
baozaotumao2025
2026-07-18 23:28:13 +08:00
parent 14722be770
commit c57ec67fe3
7 changed files with 85 additions and 7 deletions
+27
View File
@@ -126,6 +126,33 @@ curl -X POST http://127.0.0.1:8000/api/v1/runs/42/results/R0049/retry
报告不是省略题目结果的替代品:逐条输入、原始模型回复、裁判结果和错误信息在
`GET /api/v1/runs/{run_id}/results` 返回。报告同时返回当前已执行题目的 `test_result` 和发布准入结论。
### 导出 Markdown 详细报告
`scripts/export_run.py` 通过 API 登录并导出一个终态 Run。默认包含全部逐条结果:
```bash
uv run python scripts/export_run.py \
--run-id 42 \
--base-url http://127.0.0.1:8000 \
--username gly
```
默认输出为 `outputs/run_42_results.md`;用 `--output <path>` 可更改路径。密码始终交互输入,不会出现在命令行历史中。
可用以下参数筛选:
- `--execution-status completed|error`:按执行状态导出。
- `--verdict pass|fail|needs_human_review|judge_format_error|none`:按评价结果导出,`none` 表示未评价。
两个参数可组合,例如只导出已执行且评价失败的样例:
```bash
uv run python scripts/export_run.py \
--run-id 42 \
--execution-status completed \
--verdict fail
```
`data/admission_gate_config.json` 只配置可由当前运行验证的覆盖门槛和指标阈值。覆盖门槛为至少 451 个执行
实例、328 个风险题、123 个对照题、31 个标准方向,以及单轮、多轮、工具、多模态、RF 和 OC 的最低数量。
运行必须完成且结果数等于选中题数;任一覆盖项不足时返回 `NOT_EVALUATED`,并在 `coverage` 中返回