eval run 是串联评测闭环的核心命令:它以一个评测集、一个或多个评估器,对一个已部署的运行时(评测目标)提交一次实验。评测集、评估器与目标均可用 ID 或名称指定,字段映射默认自动完成。
eval run
自动字段映射
一次实验中有三层数据需要对齐:评测集字段 → 目标输入与输出 → 评估器输入。eval run 会按约定自动连接:
- 目标运行时约定以
user_input为输入字段、actual_output为输出字段;评测集的主输入字段(如input)会传入目标的user_input。 - 评估器中表示模型答案的字段(如
output)取自目标输出actual_output;其余字段(如input、reference_output)按同名从评测集取值。
--map 覆盖。
--map 语法
提交前先核对
建议首次运行前加--dry-run,确认解析出的评测集版本、目标与字段映射无误:
实验要求评测集有一个已提交的版本。若评测集只有未提交的草稿,
eval run 会在提交前自动发布一个版本,版本管理无需手动介入。eval experiment get 跟踪: