eval run 是串联评测闭环的核心命令:它以一个评测集、一个或多个评估器,对一个已部署的运行时或 TEA 源评测目标提交一次实验。评测集、评估器与目标均可用 ID 或名称指定,字段映射默认自动完成。
CLI 会先解析当前账号使用的评测后端。TEA 后端要求每个
--evaluator 都对应一个 --evaluator-version;Coze 后端继续使用评估器当前版本。需要查看当前后端时,运行 eval backend。eval run
自动字段映射
一次实验中有三层数据需要对齐:评测集字段、目标输入与输出、评估器输入。eval run 会按约定自动连接:
- 目标运行时通常以
user_input为输入字段、actual_output为输出字段;评测集的主输入字段(如input)会传入目标的user_input。 - 评估器中表示模型答案的字段(如
output)取自目标输出actual_output;其余字段(如input、reference_output)按同名从评测集取值。
--map 覆盖。
--map 语法
TEA 后端使用带前缀的箭头语法:
提交前先核对
建议首次运行前加--dry-run,确认解析出的评测集版本、评估器版本、目标版本与字段映射无误:
实验要求评测集有一个已提交的版本。未指定
--dataset-version 且评测集只有未提交草稿时,eval run 会在提交前自动发布一个版本;指定 --dataset-version 时会使用该版本。eval experiment show 跟踪: