Skip to main content
eval run 是串联评测闭环的核心命令:它以一个评测集、一个或多个评估器,对一个已部署的运行时(评测目标)提交一次实验。评测集、评估器与目标均可用 ID 或名称指定,字段映射默认自动完成。

标志与参数

自动字段映射

一次实验中有三层数据需要对齐:评测集字段 → 目标输入与输出 → 评估器输入。eval run 会按约定自动连接:
  • 目标运行时约定以 user_input 为输入字段、actual_output 为输出字段;评测集的主输入字段(如 input)会传入目标的 user_input。
  • 评估器中表示模型答案的字段(如 output)取自目标输出 actual_output;其余字段(如 input、reference_output)按同名从评测集取值。
多数场景无需手动映射。当字段名不一致时,用 --map 覆盖。

--map 语法

提交前先核对

建议首次运行前加 --dry-run,确认解析出的评测集版本、目标与字段映射无误:
实验要求评测集有一个已提交的版本。若评测集只有未提交的草稿,eval run 会在提交前自动发布一个版本,版本管理无需手动介入。
提交成功后返回实验 ID,可用 eval experiment get 跟踪:
最后修改于 2026年9月19日