xisiid · AGENT INSIGHT

AI Agent 为什么一做长任务就容易跑偏?

演示惊艳、上手翻车——长程任务正在成为智能体真正的分水岭。问题不在某一次出错,而在整个执行系统缺少稳定的结构支撑。

羲悉智能 xisiid INTELLIGENCE2026 · 06AGENT / 长程执行

你大概见过这样的演示:一个 AI Agent 接到指令,拆任务、查资料、调工具、写代码,十几分钟干完一件要人忙一下午的活,一路丝滑。

你可能也亲自上手试过。前二十分钟,它确实惊艳。

然后任务拉长,事情开始变味。它重复做已经完成的步骤,忘掉你最开始给定的约束,把某个局部子任务当成最终目标;工具返回异常,它若无其事地继续编排。第 5 步还像个专家,第 50 步开始像个没睡醒的实习生。

单看任何一次出错,都像是模型答错了一道题。连起来看,你会发现问题不在某一道题,而在整个长程执行系统——它缺少稳定的结构支撑。

这正是当下讨论 Agent 时最容易被低估的一点:智能体的难题,已经从「能完成一个动作」,变成「能长期稳定地完成一组相互依赖的动作」。

DATA 01

数据摆出来,长任务确实是分水岭

τ-bench 专门考察 Agent 在真实工具调用、用户交互和业务规则约束下的表现。它有一个很说明问题的指标叫 pass^k——看同一个任务独立跑 k 次,能否次次做对。结果是,不少强模型的单次成功率已经相当可观,但在 retail 场景下,顶级模型的 pass^8 掉到了 25% 以下。

连续做对 k 次,成功率一路下坠
 τ-bench pass^k 趋势示意(基于公开结果近似)。单次能做对,不代表每次都做对——k 越大,「系统稳定性」与「单点能力」的差距越明显。

一次做对靠能力,八次全对靠系统。这两件事之间,隔着很远。

OSWorld 的曲线则更直观。它把 Agent 放进真实电脑环境,跑 369 个操作系统任务。2024 年刚发布时,人类基线是 72.36%,当时最好的模型只有 12.24%。两年过去,Stanford 2026 AI Index 显示任务成功率已涨到 66%,最新顶级系统更是摸到了人类基线附近。

看起来差距快抹平了?恰恰相反,这组数据把真正的问题暴露得更清楚:单步操作的成功率追上来了,但 pass^k 式的一致性、异常恢复能力、跨任务的稳定表现,并没有同步收敛。剩下的差距,已经很难靠「模型更聪明一点」来填。

<25%
τ-bench retail 场景下,顶级模型 pass^8 成功率
12.24→66%
OSWorld 模型成功率两年变化(人类基线 72.36%)
≈1/4
TheAgentCompany 模拟公司中,最强 Agent 自主完成的任务比例

TheAgentCompany 给出了第三个视角。它把 Agent 放进一个模拟公司,处理接近真实办公场景的任务,结果最强的 Agent 也只能自主完成大约四分之一。这个结果更像一个提醒:当任务从单轮问答变成复杂工作流,Agent 面对的是一个系统工程问题,而非一个智力问题。

GAPS 02

长任务暴露的五个系统性短板

1目标保持

人做长任务时会持续把当前动作和原始目标对齐。Agent 缺少这种稳定的目标锚点。任务推进到中段,工具结果、临时对话、局部约束和子任务不断涌入上下文,原始目标的权重被一点点稀释,系统开始沿着局部线索往前走。

关于 goal drift 的研究也指出,目标漂移的根源在于 LLM 的底层机制——它在上下文中做的是模式匹配和局部补全。当竞争目标、诱导信息或中间步骤持续出现时,Agent 会逐渐偏离初始意图,而且自己意识不到。这是自回归生成范式的结构性特征:模型在每一步只回答「下一个词是什么」,而非「当前任务走到了哪里」。

2状态管理

长上下文让模型看见更多文本,但看见和掌握是两回事——上下文并不等于任务状态。一个可靠的执行系统需要清楚地维护:当前任务处于哪个阶段,哪些步骤已经完成,哪些约束仍然有效,哪些信息经过验证,哪些风险还待处理。

很多 Agent 把这些状态隐含在对话历史里。短任务还能勉强运转,长任务中,状态会被噪声覆盖。系统看似记得很多,实际上从未形成一张稳定、可更新、可校验的「当前任务图景」。

3记忆治理

Agent 需要记忆,但记得多和表现好是两回事。长期记忆真正困难的地方在于判断什么值得保留、如何压缩经验、怎样处理冲突记忆,以及这些记忆如何在下一次任务中真正影响决策。

Reflexion、Voyager 这类工作已经证明,反馈、经验和技能库可以显著提升 Agent 的后续表现。它们的启发在于:智能体应当在执行中持续沉淀经验,但经验沉淀必须服务于未来的任务执行,否则它只是新的上下文负担。

4工具协调

会调用工具只是起点。长程任务真正考验的是执行秩序——什么时候查资料,什么时候写入文件,什么时候验证结果,什么时候该停下来,工具失败之后如何回滚,多个工具之间如何避免互相污染。

缺少这套秩序,Agent 会在错误信息上继续推理,在过期结果上继续决策,或者为了走完表面流程而偏离最终目标。

5反馈修正

长任务的失败很少发生在最后一刻。更常见的剧本是:小错误在早期出现,未被识别,后续动作继续建立在错误状态上,偏差逐步放大,等到暴露时,系统已经离原始任务很远了。

可靠的执行系统需要把每一次反馈转化为状态更新、风险信号、经验沉淀和下一步的约束条件。执行是一个持续校正的闭环。

MODEL 03

更强的模型重要,但补不齐这五块

更强的基础模型当然会改善 Agent 表现。推理更好、上下文更长、工具调用更稳,都会抬高系统上限——过去两年 benchmark 的快速爬升,主要也是模型驱动的。

但长程任务的核心是目标、状态、记忆、工具和反馈这五件事的协同。《AI Agents That Matter》提醒过,Agent 评估要看成本、鲁棒性、可复现性和真实场景的适用性。一个 demo 能跑通和一个系统能长期稳定运行,差距很大。

过去大家关心模型能否「想出下一步」,
现在更应该关心系统能否持续判断
「下一步是否仍然在正确的轨道上」。
ROOT 04

这五个短板的根源,在模型架构本身

把五个短板放在一起看,一个更底层的问题浮出水面:这些问题能在应用层彻底解决吗?

目前主流的解决思路是在大模型外部叠加工程:RAG 补记忆,prompt 工程补约束,外挂状态机补流程控制,重试机制补异常恢复。这些方案有价值,也确实提升了短任务体验。但大模型仍然是任务执行的中心,外部系统本质上是在帮一个自回归生成器维持它天然缺少的能力。

自回归的核心机制是:根据已有上下文,从左到右预测下一个 token。这套机制为语言生成而设计,它的预测对象是「下一个词」,而非「下一步任务状态」。当任务从「生成一段文本」变成「持续执行一个复杂流程」,这个底层范式本身就面临结构性挑战:

目标漂移的根源是模型在做局部补全,缺少全局状态锚点;状态丢失的根源是任务状态被隐含在上下文 token 流中,从未被显式维护;记忆失效的根源是所有信息被平铺为文本序列,缺少分层和压缩机制;反馈断裂的根源是模型每一步都在重新生成,而非在持续维护的状态上修正。

换句话说:应用层的工程努力可以缓解症状,但长程执行的可靠性最终取决于底层模型的预测范式。

NEXT 05

下一步:从生成到约束性预测

如果把模型的预测对象从「下一个 token」切换为「下一步任务状态」,前面五个短板的解法就会发生根本性变化。这正是约束性预测模型架构的核心思路:

预测对象变了。模型的核心工作从「生成下一个词」变为「给定当前任务状态与约束,预测下一步行动路径」。约束越清晰,预测越确定。

状态成为一等公民。任务目标、执行规则、阶段进度、风险标记,这些信息作为显式的约束结构持续伴随执行过程,而非隐含在上下文文本里。这意味着系统在整个执行过程中始终知道「当前走到哪里,应该按什么方向继续」。

记忆参与执行。长期交互中沉淀的偏好、规则、知识和反馈,经过筛选和压缩后写入分层记忆,在下一次执行中直接影响预测路径。记忆的价值在于能让系统下一次执行得更稳、更准,而非保存更多历史。

反馈形成闭环。每一次执行结果、工具返回、异常信号,都转化为状态更新和约束修正,回流到模型的下一步预测中。执行是持续校正的过程。

这四点指向同一个结论:长程执行的可靠性,最终需要在模型架构层面建立约束结构。有约束,才有确定。

OUTLOOK 06

稳定执行复杂任务,才是下一阶段

AI Agent 一做长任务就跑偏,恰恰说明智能体进入了更真实的阶段。

当 Agent 只需完成单步任务时,我们主要看模型的生成能力。当它要持续完成复杂任务时,我们还要看它能否守住目标、维护状态、治理记忆、协调工具,并且在反馈中修正自己。

过去十年,自回归生成定义了 AI 的核心范式,让机器学会了语言。下一个阶段的问题已经不同:模型预测的对象到底应该是什么。

从预测下一个 token,走向预测下一步任务状态。从无约束的开放生成,走向有约束的确定性执行。这是底层模型架构需要回答的问题,也是长程 Agent 真正可靠运行的前提。

REFERENCES
  1. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
  2. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
  3. Stanford HAI, Artificial Intelligence Index Report 2026
  4. TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
  5. Evaluating Goal Drift in LLM Agent Systems
  6. Reflexion: Language Agents with Verbal Reinforcement Learning
  7. Voyager: An Open-Ended Embodied Agent with Large Language Models
  8. AI Agents That Matter