4 话一屏看完
点任意一格跳到下方「干货解读」看 punchline。
第 01 话 · feature
经验 4 种更新方式
知识/Prompt/程序/参数,看能力表示性质
第 02 话
在线+离线双循环
在线跑+记 / 离线改+验,不混双角色
第 03 话
睡眠学习 5 步
触发/定向/采集/验证/修剪
第 04 话
3 道安全边界
证据隔离/待验证隔离/可信根不可改
经验写哪里看能力的「表示性质」:事实 → 知识(可检索)/ 可表达策略 → Prompt/Skill(可解释)/ 硬约束/可执行流程 → 程序(可测试)/ 隐式能力 → 参数(可泛化)。同一条经验可能走多个载体:事实进库+解释进 Skill+不可绕过约束进代码+高维识别进参数。
在线 Agent 只管跑 + 记证据,不直接改写正式 Agent;离线 Agent 才改 Prompt/Skill/参数。两者通过版本化经验库 + 评估集连接。不混双角色——一次成功不是更新,网络故障也不是更新,采集和整理必须分开,这是持续进化的工程约束。
睡眠学习 5 步:触发(达门槛)→ 定向(读正式能力目录)→ 采集(找新信号)→ 验证(过 3 套测试)→ 修剪(去重去冲突)。采集整理分离:整理结果不能跳过验证,修剪不能删审计/回滚依据。这是章 9 给「睡眠」的工程化定义,跟人睡觉整理记忆一个意思。
3 道红线:① 证据与指令隔离(LLM 摘要不是指令)② 待验证与正式能力隔离(灰度发布)③ 安全机制不可自我修改(验证器/测试/日志/版本备份)。安全在搜索空间外:搜索空间越大,可信根越要在外面,自我修改安全机制 = 用降低测试阈值把退化伪装成进步。