文哥说 · 看完就懂

给 AI 出考卷 · Agent 评估 4 话

4 话 bento 一屏版
来源 bojieli/ai-agent-book 第 6 章(Apache 2.0)
↓ 2x2 网格,ep01 跨 2 行作主图
← 返回 4 话连载

4 话一屏看完

点任意一格跳到下方「干货解读」看 punchline。

第 01 话 你以为的好,不是真的好
第 01 话 · feature
你以为的好,不是真的好
拍脑袋觉得不错 = 数据打脸
第 02 话 给 AI 出考卷
第 02 话
给 AI 出考卷
5 要素:题库/参考/场景/评分/执行
第 03 话 答对几道算及格
第 03 话
答对几道算及格
Pass^k + 显著性 + LLM 当评委
第 04 话 怎么选 Agent 就像买车
第 04 话
怎么选 Agent 就像买车
评估驱动选型:看真考卷,不看 demo
第 01 话 · 你以为的好,不是真的好
员工说我们 AI 客服能答 80% 问题了,老板信了——客户投诉率翻倍。拍脑袋觉得不错 = 真不行。评估不是为了打分,是为了让你能快速跟上模型演进。
第 02 话 · 给 AI 出考卷
给 AI 出考卷要凑齐 5 要素:题库(任务集)/ 参考(啥叫对)/ 场景(在哪做)/ 评分(怎么判)/ 执行(终止条件)。不是让 AI 自由发挥,是闭卷考试。SWE-Bench Verified 从 2294 题筛到 500 题,AndroidWorld 116 题跨 20 个 App——题库设计比评分更重要。
第 03 话 · 答对几道算及格
AI 准确率 80% 涨到 82% 不算进步——可能运气。Pass^k(跑 k 次都成功的概率)比 Pass^1 更能反映你敢不敢上生产。LLM-as-a-Judge 便宜可规模化,但有风格偏差;配对比较 + Bradley-Terry 能给多模型排实力榜。
第 04 话 · 怎么选 Agent 就像买车
10 个 Agent 该用哪个?不是看 demo 漂亮,是拿你的真实业务题库跑一遍,谁分高选谁。买车不是看广告,是看实测油耗+保养+二手价——选 Agent 也不是看 demo,是看真考卷。H1 改提示词(0% → 75%,只多 8% token)一定部署;H4 全局思考(88% → 91%,但延迟 3x)拒绝——不是所有有效改进都值得部署。