Skip to main content
eval run 是串联评测闭环的核心命令:它以一个评测集、一个或多个评估器,对一个已部署的运行时或 TEA 源评测目标提交一次实验。评测集、评估器与目标均可用 ID 或名称指定,字段映射默认自动完成。
CLI 会先解析当前账号使用的评测后端。TEA 后端要求每个 --evaluator 都对应一个 --evaluator-version;Coze 后端继续使用评估器当前版本。需要查看当前后端时,运行 eval backend。

eval run

自动字段映射

一次实验中有三层数据需要对齐:评测集字段、目标输入与输出、评估器输入。eval run 会按约定自动连接:
  • 目标运行时通常以 user_input 为输入字段、actual_output 为输出字段;评测集的主输入字段(如 input)会传入目标的 user_input。
  • 评估器中表示模型答案的字段(如 output)取自目标输出 actual_output;其余字段(如 input、reference_output)按同名从评测集取值。
多数场景无需手动映射。当字段名不一致时,用 --map 覆盖。

--map 语法

TEA 后端使用带前缀的箭头语法:
Coze 后端使用等号语法:

提交前先核对

建议首次运行前加 --dry-run,确认解析出的评测集版本、评估器版本、目标版本与字段映射无误:
实验要求评测集有一个已提交的版本。未指定 --dataset-version 且评测集只有未提交草稿时,eval run 会在提交前自动发布一个版本;指定 --dataset-version 时会使用该版本。
提交成功后返回实验 ID;TEA 后端还会返回 run ID。可用 eval experiment show 跟踪:
最后修改于 2026年9月19日