4 话一屏看完
点任意一格跳到下方「干货解读」看 punchline。
第 01 话 · feature
评估 = 模型 + Harness
换马不涨 = 缰绳问题,换马大跌 = 马的问题
第 02 话
内部评估 4 件套
消融 / AB / 特性开关 / 提示词 CI
第 03 话
仿真 = 评估到训练桥梁
几千次评估 → 几百万次训练,Rubric = 奖励
第 04 话
零容忍 = 一票否决
幻觉/安全/隐私/合规,4×100 救不回 1×0
评估的不只是模型,是模型 + Harness 的组合。同一模型在不同 Harness 下表现差 10x。模型替换实验:换强模型不涨分 = 瓶颈在 Harness;换弱模型大跌 = 瓶颈在模型。管理者买模型钱花错了的最大坑,就是不知道钱该花在马还是缰绳。
外部评估告诉你「Agent 有多好」,内部评估告诉你「哪个改变让它变好」。4 件套:消融(摘部件看掉多少)/ AB(双臂拉对比)/ 特性开关(远程遥控启停)/ 提示词 CI(每次改提示跑回归)。件件是工程实践,件件能落地。
评估几千次就够;训练几百万次。Rubric 验证器 = RLVR 奖励函数,判分脚本直接当奖励脚本。仿真环境 2 硬要求:可靠的 reset 语义(数百万次不残留)+ 高吞吐(并行度决定训得了)。数字 + 具身 2 大类:前者 GAIA/AWorld,后者 RoboTwin2/OSWorld。
4 维度零容忍:幻觉/安全违规/隐私外泄/政策违规 = 一票否决。4 个 100 分救不回 1 个 0 分。评估不能合成平均分绕过 veto。管理者配 AI 必看的底线:不强求完美,但绝不容忍违规——这是评估的硬底线,不是软指标。