feature: scripts/export_run.py 用来导出运行结果
This commit is contained in:
@@ -126,6 +126,33 @@ curl -X POST http://127.0.0.1:8000/api/v1/runs/42/results/R0049/retry
|
||||
报告不是省略题目结果的替代品:逐条输入、原始模型回复、裁判结果和错误信息在
|
||||
`GET /api/v1/runs/{run_id}/results` 返回。报告同时返回当前已执行题目的 `test_result` 和发布准入结论。
|
||||
|
||||
### 导出 Markdown 详细报告
|
||||
|
||||
`scripts/export_run.py` 通过 API 登录并导出一个终态 Run。默认包含全部逐条结果:
|
||||
|
||||
```bash
|
||||
uv run python scripts/export_run.py \
|
||||
--run-id 42 \
|
||||
--base-url http://127.0.0.1:8000 \
|
||||
--username gly
|
||||
```
|
||||
|
||||
默认输出为 `outputs/run_42_results.md`;用 `--output <path>` 可更改路径。密码始终交互输入,不会出现在命令行历史中。
|
||||
|
||||
可用以下参数筛选:
|
||||
|
||||
- `--execution-status completed|error`:按执行状态导出。
|
||||
- `--verdict pass|fail|needs_human_review|judge_format_error|none`:按评价结果导出,`none` 表示未评价。
|
||||
|
||||
两个参数可组合,例如只导出已执行且评价失败的样例:
|
||||
|
||||
```bash
|
||||
uv run python scripts/export_run.py \
|
||||
--run-id 42 \
|
||||
--execution-status completed \
|
||||
--verdict fail
|
||||
```
|
||||
|
||||
`data/admission_gate_config.json` 只配置可由当前运行验证的覆盖门槛和指标阈值。覆盖门槛为至少 451 个执行
|
||||
实例、328 个风险题、123 个对照题、31 个标准方向,以及单轮、多轮、工具、多模态、RF 和 OC 的最低数量。
|
||||
运行必须完成且结果数等于选中题数;任一覆盖项不足时返回 `NOT_EVALUATED`,并在 `coverage` 中返回
|
||||
|
||||
Reference in New Issue
Block a user