2026-07-19
#Tech

Richard Sutton:如何设计一个智能体的心智

解读 Richard Sutton 的演讲《AI 的第一性原理:从经验培育超级智能》(First Principles of AI: Growing Superintelligence from Experience with Reinforcement Learning):与其给智能体预装大量知识,不如设计一套能持续发现知识、形成技能并利用知识规划的心智——OaK(Options and Knowledge)架构。

Richard Sutton:如何设计一个智能体的心智

First Principles of AI: Growing Superintelligence from Experience with Reinforcement Learning

现在的大语言模型很像一个在出发前读完了半座图书馆的人。它见过海量文字,善于从上下文里调取模式,也能在对话中表现出惊人的应变能力。可当一次任务结束,刚才发生的事通常不会沉淀为它自己的长期经验。模型下次醒来,权重还是那组权重,成长主要发生在下一轮训练;它正在经历的生活很少留下持久改变。

Richard Sutton 在《First Principles of AI: Growing Superintelligence from Experience with Reinforcement Learning》(AI 的第一性原理:从经验培育超级智能)这场演讲里讨论的,恰好是这条边界。他想设计一种能在真实世界里持续长出概念、技能和预测的心智。演讲提出的 OaK(Options and Knowledge)架构只是答案的技术轮廓,背后更值得讨论的,其实是 Sutton 对当下 AI 路线的判断:如果智能只在训练时形成,部署后主要负责调用已有能力,那么我们得到的更像一件出厂成品,缺少生活带来的持续改变。

LLM 把“苦涩的教训”学到了一半

Sutton 在《The Bitter Lesson》里总结过一条贯穿 AI 史的规律:依赖搜索、学习和算力扩展的通用方法,长期看往往胜过研究者手工塞进去的领域知识。今天的 Transformer 几乎就是这条规律最壮观的胜利。写诗、编程、翻译和解题不再各有一套人工规则,同一套 attention 与预测目标在巨大算力和数据上学习,能力随规模一起涌现。

但这次胜利有个前提:它学的全是人类已经写下来的东西。主流 LLM 从人类写下的文本、代码、图像和偏好中学习;预训练和训练后阶段结束后,参数通常被固定,再以服务的形式部署。它可以在上下文里临时适应,也可以借助检索、记忆库和工具延伸能力,可这些经验大多停留在上下文或外围系统中。一次操作究竟造成了什么后果,往往不会持续改写模型日后的判断。

真正的分歧不在网络结构,而在学习发生在什么时候。Transformer 完全可以留在未来智能体里,继续负责表示和推理。当前主流方案把最昂贵、最持久的学习集中在 train time;Sutton 把重心移到 runtime,要求智能体在行动中不断修正表示、策略和知识。LLM 擅长压缩人类已经留下的经验,Sutton 想让机器拥有一条属于自己的经验流。

David Silver 与 Sutton 后来在《Welcome to the Era of Experience》中把这个分歧说得更直接:只靠模仿人类数据,能力终究会碰到人类知识本身的边界。要越过那条线,智能体需要长期处在行动与观察的连续流中,用环境里真实发生的后果来学习。这个论断比“再多收集一些数据”激进得多,因为数据的生产者、课程的安排者和错误的承担者都开始变成智能体自己。

从下一个 token 到一段可复用的行动

OaK 在这里提供了一个很有意思的切口。演讲里,Sutton 把现实称为“大世界”:环境复杂、持续变化,任何智能体都只能握有近似知识,也不可能一次求出永远有效的最优策略。这样的系统必须边运行边调整,还要自己发现哪些现象值得表示,哪些目标值得反复追求。

OaK 的基本生长过程并不复杂。智能体从经验中发现一个有用特征,例如“门已经打开”;随后形成让这个特征再次出现的子问题,学会一套“开门”的策略,并把它封装成一个 Option。它还要学习这个技能在不同情境下通常会带来什么结果、耗费多久、何时失败。这些关于行动后果的预测,就是 OaK 里的 Knowledge。

这一小段机制真正重要的地方,在于规划的时间尺度。语言模型以 token 为基本生成单位,当然可以写出一份长计划,也可以通过工具调用把计划变成动作;然而在典型系统里,高层步骤来自本次推理,执行结果很少沉淀为一个经过环境检验、以后还能调用的技能。Option 则是一段跨越多个时间步的策略,有启动条件、内部行为和终止条件。智能体可以直接思考“到车站”之后会怎样,不必把未来反复展开成每一步移动。Sutton 所说的“单步陷阱”正发生在这里:短期预测有一点误差,连续滚动后就会累积;面对随机世界,未来还会迅速分叉成一棵难以计算的树。

从这个角度看,LLM agent 目前最常见的做法仍像给语言模型加了一套行动脚手架:模型生成下一段文本或工具调用,外层循环执行,再把结果塞回上下文。它已经能做很多事,却很少自行发明稳定的时间抽象,更少把亲历的成败变成长期可更新的 Option 模型。OaK 关心的是脚手架跑上一年后,里面有没有真的长出新结构。

OaK 现在更像研究纲领

这条路线的方向感很强,工程证据却远不如 LLM 成熟。Sutton 在演讲中也承认,目前还拿不出 OaK 的大规模案例;可靠的持续学习仍是主要障碍。神经网络在线吸收新经验时会灾难性遗忘,也可能逐渐失去可塑性。让系统自己发现特征、提出子问题、学习技能,还要保证这些变化不会破坏既有能力,任何一项都没有现成的规模化答案。这场演讲的报道也保留了他对这一缺口的明确说明。

现实环境中的试错还比语料训练更贵。动作会产生真实后果,反馈常常延迟,奖励也可能被钻空子。一个会持续改变自己的系统更难复现、更难审计,安全边界也比固定模型复杂。OaK 目前提供的是一张颇有吸引力的设计图,还谈不上已经验证的新范式。短期内,它大概率不会取代 Transformer;更可能的路径,是 Transformer 继续负责强大的表示与推理,持续学习、经验驱动的奖励以及 Option 级规划逐渐进入同一个系统。

不过,Sutton 的问题已经足以改变我们评价 agent 的方式。今天很多产品只要接上工具、记忆和任务循环,就会被称作智能体。按他的标准,还得继续看:它能否从行动后果中形成持久知识,并在运行时学会原本不会的技能?环境变化之后,它会不会调整自己的抽象和计划,而不是等下一次训练更新?

如果每次启动仍要靠 prompt 重新交代过去,这套系统已经会行动,却还没有真正开始成长。那个读完半座图书馆的人,终究要走出门去,让路上发生的事一点点留在自己身上。

CC BY-SA 4.0

This article is licensed under CC BY-SA 4.0. You are free to share and adapt this work, provided you attribute Kevin Zhong and distribute under the same license.