
【Sutton 批判大模型路线】说起强化学习之父 Rich SuttonAI 圈几乎没人陌生。他写下的《苦涩的教训》至今仍被很多人视为理解 AI 发展的重要框架即从长期看能够随着计算规模扩展的通用方法往往会战胜依赖大量人工知识设计的方案。然而最近接受红杉资本访谈时Sutton 却把矛头对准了今天最主流的大模型路线。在他看来LLM 虽是一次伟大的科学突破却也可能成为《苦涩的教训》的反面案例。【大模型的局限】原因在于今天的大模型虽摆脱了大量人工规则却重新被“人类已经知道的东西”限制住了。互联网数据有限合成数据背后依然需要人来决定什么值得生成。更关键的是模型不具备人类那样的持续学习能力。一个司机开 10 年车会形成大量直觉但今天的大模型大部分学习集中在预训练和后训练阶段上线后核心权重基本被冻结。在 Sutton 看来今天的大模型行业可能已陷入“局部最优”继续堆 GPU、做 Scaling 性能还能上涨所以头部实验室难转向新路线。【Oak Lab 的出发点】这也是 Sutton 和学生 Khurram Javed 创办 Oak Lab 的出发点。Oak 想重新做一种能从自身经验中持续学习的 AI Agent模型上线后还能更新对世界的理解提炼新规律并调整自己。如果持续学习路线走通被重写的可能是“训练—冻结—上线”的整套基础模型范式不能持续学习是大模型最大的问题。【Sutton 对大模型的矛盾态度】Sutton 对大模型的态度很有意思。他不否认 LLM 的成功认为大型语言模型是“惊人的科学突破”。过去语言被认为是符号主义 AI 最后的堡垒之一神经网络靠规模化训练学会了复杂语言能力这符合《苦涩的教训》的观点即少往机器里手工塞人类规则多寻找随计算规模扩展的学习方法。过去几十年 AI 历史证明人类精心设计的规则短期好用长期却输给更通用、能吃下更多计算的方法AlphaGo、深度学习、大语言模型都是如此。LLM 把互联网“喝”进去增加计算量能力快速上升所以是《苦涩的教训》最成功的案例之一。但大模型同时可能成为反面案例因为它虽摆脱大量人工规则却被互联网这种“人类知识”限制。互联网只是人类已记录的知识现实世界远比其复杂真实世界信息量远超互联网存储的一切。这意味着只靠训练前准备数据会撞墙。而且大模型学习和工作被人为切成两个阶段训练时疯狂学习上线后权重基本冻结它通过 Context 临时获新信息、通过 Memory 记偏好但这和真正的学习还差得远真正的学习是系统经历事情后本身发生变化而现在的大模型更像刚毕业被冻结的大脑工作靠翻毕业笔记。这也是 Sutton 对当前 LLM 最核心的质疑为什么模型形成新概念、修改内部结构的能力只能在训练阶段上线后为什么不能继续改变权重【合成数据的问题】互联网高质量数据有限热门答案是合成数据。理论上算力足够数据可无限生成但 Sutton 评价这是“大错误”甚至可能成下一条“苦涩的教训”。因为合成数据虽摆脱真实数据限制背后仍藏人类瓶颈谁决定生成什么数据、判断问题重要性、定义奖励最后还是人。只要合成数据需人类决定生成内容其扩展速度就受人类知识限制。Sutton 背后的理论是 Big World Hypothesis即大世界假说现实世界太大智能体不可能提前掌握一切如无人机飞行会遇到模拟器里没有的细节这些不可能全写进训练集。所以他认为智能体面对的世界永远比自身复杂唯一可行方法是边走边学这颠覆了 AI 行业过去把模型训练得接近“全知”的假设他想做的 AI 更注重出生后进化。【持续学习的难题】既然持续学习符合直觉为什么 OpenAI、Anthropic 等公司不让模型每天更新权重因为这样模型可能被学废这也是 Continual Learning 研究多年未解决的灾难性遗忘Catastrophic Forgetting问题。比如告诉模型公司内部项目改名它更新权重可能影响其他能力。所以很多模型把新信息塞进 Context、RAG 或 Memory不轻易改底层权重。Cursor 产品做了持续更新但方式是先收集大量用户数据攒成 Batch 再统一训练这对公共模型有用对个人智能体就不合适若只想教自己的 AI 助手新习惯没必要等大量用户数据一起训练且自己希望它学的东西可能和别人无关。所以 Oak 想解决底层算法问题让模型用单条经验更新自己且不破坏旧知识Sutton 给出的方向是 Step - size Optimization即不同知识“可塑性”不同权重有不同学习速度像人的大脑不会因看到特殊情况就推翻旧认知若规律变化大脑能慢慢调整。还有 Continual Backprop 方法传统神经网络训练久了内部结构会固化Sutton 想让训练多年的神经网络有可塑性Oak 认为未来训练基础模型应把这种能力训练进去模型从第一天开始同时学知识和学习知识的方法即 Meta - learning真正的持续学习模型可能需从底层重新训练。【Oak Lab 的终极目标】如果 Oak 只是解决“模型记忆”没那么值得关注。其真正野心大的地方是 Sutton 想把持续学习和自主形成抽象能力连起来。今天 AI 会做数学、下棋但这些任务的“世界规则”人类已提前告诉它现实世界不是围棋智能体在开放环境要知道什么值得预测等。顶尖运动员和科学家会建立概念体系和提出新抽象Sutton 认为当前 AI 最缺失“先学世界模型再规划”的能力。Oak Lab 的终极目标是打造一个从微小感知到宏大计划都能统一组织知识的 AI 系统它要持续训练不失控、修正自己不混乱、吸收新经验且保持长期知识连贯即想要的不是更会回答问题的模型而是能长期自洽并变好的心智。这条路不轻松要跨过一系列未解决问题研究团队要容忍性能不如现有产品。对大公司来说“先退一步、再换范式”的选择不容易但这也许正是 Sutton 想提醒行业的。大语言模型已证明规模化学习的力量会继续是重要技术基础但把语言能力等同于完整智能、训练结束等同于学习完成可能让行业错过关键东西。在 Sutton 的设想里未来不是单一全知全能模型统治所有任务而是有许多因经历不同而成长的“心智”它们在不同环境学习不同知识彼此无法穷尽地替代这更接近真实世界世界大系统学不完智能是遇到新问题能继续长出新理解。而 Oak Lab 要下注的正是这件事。