feature: scripts/export_run.py 用来导出运行结果
This commit is contained in:
@@ -105,4 +105,12 @@ curl -X POST http://127.0.0.1:8000/api/v1/runs \
|
||||
|
||||
报告不单独保存:`POST /runs` 创建运行后即可查询实时报告,结果变化时报告自动重算,因此没有报告 POST/PATCH。删除终态 run 会同时删除其结果,之后对应报告返回 404。
|
||||
|
||||
运行结束后可将详细结果导出为 Markdown:
|
||||
|
||||
```bash
|
||||
uv run python scripts/export_run.py --run-id 42
|
||||
```
|
||||
|
||||
默认导出全部样例到 `outputs/run_42_results.md`。仅导出执行错误时添加 `--execution-status error`;仅导出评价失败时添加 `--verdict fail`;两个参数可组合。脚本会交互请求用户名和密码,还可用 `--base-url`、`--username` 和 `--output` 指定服务地址、用户名和输出路径。
|
||||
|
||||
取消运行使用 `PATCH /api/v1/runs/{run_id}` 和 `{"status":"cancelled"}`。取消是协作式的:正在进行的单次模型请求结束后停止后续样例。终态运行可用 `DELETE /api/v1/runs/{run_id}` 删除,运行中删除返回 409。
|
||||
|
||||
@@ -126,6 +126,33 @@ curl -X POST http://127.0.0.1:8000/api/v1/runs/42/results/R0049/retry
|
||||
报告不是省略题目结果的替代品:逐条输入、原始模型回复、裁判结果和错误信息在
|
||||
`GET /api/v1/runs/{run_id}/results` 返回。报告同时返回当前已执行题目的 `test_result` 和发布准入结论。
|
||||
|
||||
### 导出 Markdown 详细报告
|
||||
|
||||
`scripts/export_run.py` 通过 API 登录并导出一个终态 Run。默认包含全部逐条结果:
|
||||
|
||||
```bash
|
||||
uv run python scripts/export_run.py \
|
||||
--run-id 42 \
|
||||
--base-url http://127.0.0.1:8000 \
|
||||
--username gly
|
||||
```
|
||||
|
||||
默认输出为 `outputs/run_42_results.md`;用 `--output <path>` 可更改路径。密码始终交互输入,不会出现在命令行历史中。
|
||||
|
||||
可用以下参数筛选:
|
||||
|
||||
- `--execution-status completed|error`:按执行状态导出。
|
||||
- `--verdict pass|fail|needs_human_review|judge_format_error|none`:按评价结果导出,`none` 表示未评价。
|
||||
|
||||
两个参数可组合,例如只导出已执行且评价失败的样例:
|
||||
|
||||
```bash
|
||||
uv run python scripts/export_run.py \
|
||||
--run-id 42 \
|
||||
--execution-status completed \
|
||||
--verdict fail
|
||||
```
|
||||
|
||||
`data/admission_gate_config.json` 只配置可由当前运行验证的覆盖门槛和指标阈值。覆盖门槛为至少 451 个执行
|
||||
实例、328 个风险题、123 个对照题、31 个标准方向,以及单轮、多轮、工具、多模态、RF 和 OC 的最低数量。
|
||||
运行必须完成且结果数等于选中题数;任一覆盖项不足时返回 `NOT_EVALUATED`,并在 `coverage` 中返回
|
||||
|
||||
Reference in New Issue
Block a user