Rich Sutton 在《The Bitter Lesson》中提出:长期来看,能够利用计算规模的通用方法,往往会胜过依赖人工领域知识的方法1。如果接受这个判断,那么今天为大语言模型智能体设计的意图分类、任务阶段、状态结构、规划器和安全规则,最终会不会都被模型从执行轨迹中学到的策略替代?

我的判断是:其中一部分会逐渐被学习系统吸收,但显式设计不会因此消失。这是对 Bitter Lesson 在智能体场景中的一种外推,而不是已经被证明的发展规律。

如果模型能从足够丰富的交互数据和反馈中学习行为策略,今天由人手工编写的一些意图、阶段和工具选择规则,可能不再承担主要的智能行为。设计工作则会更多转向训练环境、工具接口、数据结构、评估标准、安全边界和可观测性。可能退场的不是设计本身,而是把人的直觉直接写成行为策略的那部分设计。

从执行轨迹中学习

本文把“轨迹学习”(trace learning)作为一个讨论用的统称,而不是指某一种已经统一定义的训练方法。它描述的是:智能体不再主要依靠人工编写的意图分类、状态机和流程规则,而是利用大量交互记录学习行为策略。一条轨迹可能包含用户输入、可见状态、行动、工具调用与结果、中间错误、用户修正、最终结果,以及成功、失败或其他反馈信号。

trajectory = observation + action + tool use + outcome + feedback

不同形式的轨迹数据可以进入模仿学习、偏好学习、离线强化学习或在线强化学习,也可以为恢复策略提供更细的训练和评价信号。相关研究也开始把评价范围从最终答案扩展到工具使用过程。例如,TRACE 从效率、幻觉和适应性等维度评价工具增强型智能体的轨迹2;TRAJECT-Bench 则检查工具选择、参数正确性,以及调用依赖和顺序3。

这类评价方式揭示了最终答案容易隐藏的信息:两个智能体即使给出同样的答案,执行质量也可能不同。一个可能选择了合适的工具,以较低成本完成任务;另一个可能经过错误调用和无效循环后才碰巧得到正确结果。轨迹不能告诉我们一切,但它能提供比最终答案更细的证据,用来诊断行为并构造训练或评价反馈。

手工模式会被逐渐吸收

把 Bitter Lesson 放进智能体设计中,会自然引出一个不太舒服的问题:今天常见的意图分类、槽位填充、任务阶段、状态机、规划模板、追问规则和工具选择启发式,有多少只是当前模型能力不足时的工程支架?这些结构包含了人对“智能体应该如何行动”的显式假设,但它们并不因此就是错误的;关键在于哪些职责适合长期保留在系统中,哪些可能逐渐被学习策略取代。

这些设计目前很有用。它们能让系统更快落地,也更容易控制和调试。一个合理的外推是:如果交互轨迹足够丰富,反馈信号能够反映任务质量,训练方法也能有效利用这些数据,那么其中一部分局部判断可能由模型学习,而且粒度可以比固定规则更细。这一结果依赖数据、反馈和训练方式,并不是规模增长本身就会自动带来的。

今天的系统可能会规定:当置信度低于某个阈值时,向用户追问。未来的模型则可能从轨迹中学到更具体的判断:这个用户不喜欢频繁被打断;当前动作风险很低,可以先给出草案;缺少的参数能够通过工具补齐;问题表面上是在比较选项,实际已经进入决策阶段。这样的策略很难被一组固定规则完整描述,却可能从大量反馈中逐渐形成。

因此,如果只看面向任务的行为策略,意图识别、阶段判断、工具选择、参数补全、追问时机、错误恢复和多轮推进,都可能越来越多地由模型学习,而不是由人逐条编写规则。这里说的是可能的职责迁移,而不是这些显式结构会在所有系统中消失。

状态结构会变成系统契约

未来,模型也许不再需要依靠显式状态结构来理解用户和任务。例如,今天的系统可能保存这样的任务状态:

{
  "goal": "...",
  "stage": "...",
  "constraints": {},
  "pending_questions": []
}

随着模型能力增强,这种显式结构未必仍要充当模型决策的主要认知支架。模型可以直接从上下文中形成下一步判断,而不必先把用户归入某个固定阶段。至于模型内部究竟形成了怎样的表示,不能仅凭外部行为作出确定结论。

但外部系统往往仍需要明确结构。前端要展示任务进度,工具接口要验证参数,日志系统要保留记录,权限模块要检查操作,工程师要调试失败,某些场景还需要审计和合规留痕。因此,状态结构即使不再承担主要的模型推理职责,仍可以作为模型与外部系统之间的契约。

换句话说,显式状态是否保留,不应只由“模型还需不需要它来思考”决定,还要看其他组件是否需要稳定、可验证的接口。

安全边界不是一种行为偏好

推荐酒店和执行付款,涉及的风险完全不同。如果智能体能够发送邮件、删除文件、提交代码、操作账户或控制设备,就不能只相信它已经从轨迹中学会了“通常什么时候应该确认”。

不可逆操作、高风险交易、隐私数据外发和高权限工具调用,都需要由独立于模型偏好的权限与策略机制约束。具体是否要求用户确认,只是其中一种实现;有些操作也可以由预先授权、额度限制、双重审批或事务机制控制。这些边界的目的不是让智能体显得更聪明,而是明确谁有权承担什么后果。

学习策略可以帮助系统更自然地完成任务,却不应单独决定权限边界。模型越能改变外部世界,系统越需要独立的授权、审批、隔离、审计和必要的恢复机制。

轨迹本身也需要被设计

Bitter Lesson 并不是说人的设计毫无价值。它提醒我们警惕那些无法随计算和数据扩展、又把人的领域直觉固化成核心智能机制的做法。轨迹学习同样离不开设计:任务环境、工具、数据采样、反馈信号和评估标准都会决定系统最终能学到什么。

什么算成功?什么算危险?工具失败应该怎样归因?哪些错误比其他错误更严重?用户的短期满意是否代表任务真的完成?如果这些问题定义错误,模型只会更有效地从轨迹中学到错误策略。

真实轨迹也不是天然可靠的数据。用户可能表达不清;智能体可能误解需求而没有被纠正;工具可能返回错误;任务可能表面成功,却在稍后暴露问题。直接把这些轨迹当作“正确行为”会把噪声和偏差一起带进训练。轨迹学习不会消除设计工作,而是把更多设计压力转移到数据选择、反馈质量、环境构造和评价方法上。

这与 Harness Engineering:模型之外的工程 的问题是一致的:工程师设计的重点不再只是模型的某一次输出,而是模型依据什么信息行动、可以使用哪些工具、怎样获得反馈,以及失败如何被发现和恢复。

显式结构仍为实际系统提供修复入口

智能体通常连接不断变化的接口、企业系统、权限模型和工作流。如果行为完全藏在模型的隐式策略中,外部环境一旦变化,问题就很难定位,也难以及时修复。

显式的工具结构、状态接口、策略规则和模块边界,让工程师能够以较低成本检查问题、替换相关部分。模型可以负责理解复杂语境,系统则保留稳定的连接方式。即使模型最终学会了端到端地产生高质量行动轨迹,工程系统仍需要知道一次行动用了什么权限、改变了什么状态、为什么失败,以及应该从哪里恢复。

这种结构也与事件驱动的智能体运行时有关。在 从工具调用到事件驱动:大语言模型智能体的运行时架构 中,系统通过规划器、观察器、执行器和状态事件来划分职责。未来,模型可能吸收其中一部分判断能力,但持续任务、外部事件、权限检查和执行结果仍然需要稳定的运行时来管理。

手工设计不会消失,只会下沉

如果把这种职责迁移画成一条可能的演进路径,可以粗略分成四个阶段。它不是必然发生的路线图,不同系统也可能长期停留在不同位置。

第一阶段由手工模式主导。系统使用意图分类器、状态机、人工规划器、工具规则和追问规则推进任务。

第二阶段由模型学习局部模式。模型逐渐负责意图识别、状态更新、工具选择和追问时机,但系统仍保留显式状态和安全规则。

第三阶段由模型承担更多端到端的行为决策。模型根据上下文和工具环境直接生成行动序列,许多人工规划模板、阶段分类器和意图体系的重要性下降。

第四阶段,更多人工设计从行为策略中移到模型之外:状态结构承担可观测接口,策略规则约束权限和风险,评估提供训练与验收信号,轨迹成为学习材料,环境和工具则规定系统实际能够采取哪些行动。

变化的不是系统是否需要设计,而是设计位于什么位置。

任务阶段是工程语言,不是最终认知结构

以“目标发现、探索、比较、决策、执行、反馈”这样的任务推进模型为例,它为人们讨论任务提供了一套有用的语言。产品和工程团队可以借助它讨论用户处于什么状态,系统缺少什么信息,以及下一步是否应该追问、推荐或执行。

但这不意味着模型内部最好的表示也一定是 stage = comparison。模型从轨迹中学到的状态可能更细:用户还没有明确决定,但对价格越来越敏感;用户已经倾向于某个选项,只是在寻找一个足以确认的理由;用户表面上询问地点,实际是在排除风险;此时最合适的回应不是增加一张表格,而是给出两句明确判断。

任务阶段可以作为产品语言、轨迹标注、评估维度、调试线索和安全控制的中间表示,却没有必要假设模型内部也必须使用同一种离散阶段。工程抽象只要能稳定支持沟通、验证和控制,就已经有价值,不必被当成对智能体认知结构的描述。

结论

沿着 Bitter Lesson 提出的方向,可以合理预期:今天一些手工设计的智能体行为模式,会逐渐被学习系统吸收。意图分类、阶段识别、追问策略、工具选择、参数补全、错误恢复和多轮推进,都可能越来越多地成为模型学到的能力。但这取决于数据、训练和反馈机制,不能仅从模型规模推导出来。

但显式设计不会随之消失。它会更多地用于模型之外的系统:定义任务环境,设计工具接口,收集高质量轨迹,提供可审计状态,建立评估体系,设定安全边界,并约束高风险行为。

更现实的方向可能是一种混合系统:模型从轨迹和反馈中获得更多行为能力,外部系统则继续提供稳定接口、权限边界、观察、验证和恢复机制。显式结构与学习策略不必互相取代,它们可以分别承担不同职责。

因此,Bitter Lesson 在智能体时代更值得提醒我们的,不是“设计会消失”,而是不要把今天方便工程落地的手工认知结构误认为长期不变的智能机制。学习系统仍然需要环境、反馈、接口、边界和责任;真正可能不断迁移的,是智能行为本身究竟由规则显式规定,还是由模型从经验中学习。

Footnotes

  1. Rich Sutton, The Bitter Lesson, 2019。文章回顾了棋类、围棋、语音和视觉等领域,认为长期胜出的通常是能够随计算规模扩展的通用搜索与学习方法。 ↩

  2. Wonjoong Kim 等,Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents, 2025。论文提出 TRACE,从效率、幻觉和适应性等维度评价工具增强型智能体的完整推理轨迹。 ↩

  3. Pengfei He 等,TRAJECT-Bench: A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use, 2025。该基准除最终正确性外,还评估工具选择、参数正确性以及依赖和调用顺序。 ↩