自回归的天花板
自回归生成的核心机制是:根据已有上下文,从左到右预测下一个 token。
这套机制极为适合语言生成,给出的上下文越丰富,输出越流畅。整个行业过去几年的主要努力,是把这套机制推到极致:更大的参数、更长的上下文、更精细的对齐。
但当任务从「生成一段文本」变成「持续执行一个复杂流程」时,自回归的结构性问题开始暴露。具体在以下几点:
①记忆的 U 型曲线
Liu 等人(2024)的《Lost in the Middle》证实了大模型存在 U 型性能曲线:关键信息放在上下文中间,准确率就跳水。后续研究进一步揭示了「注意力陷阱」——模型过度聚焦于最前面的 token 作为数学锚点,导致中段信息被系统性忽略。
②多跳推理的失效
陈宇等人(2026)的 BRIDGE 研究确认:模型能定位单条线索,但当需要将散落在长文本不同位置的多条线索串联起来时,表现系统性下滑。模型看得到每一颗棋子,但看不到整盘棋局。
③长程任务的漂移
任务越长,目标越容易在多轮生成中漂移,约束越容易被上下文稀释,执行结果越难校验。
这些问题的根源是同一个:自回归模型的工作单元是 token,它在每一步只回答「下一个词是什么」,而非「当前任务走到了哪里」。
行业的五次尝试
围绕这些瓶颈,行业形成了五条主要技术路径:
| # | 路径 | 思路 | 局限 |
|---|---|---|---|
| 1 | 更长的上下文窗口 | 把更多信息塞进一次推理 | 看见 ≠ 记住,U 型曲线依旧,成本平方级上涨 |
| 2 | RAG 检索增强 | 外部知识检索后拼回上下文 | 检索的是文本片段,不是任务状态 |
| 3 | 提示词工程与工作流编排 | 用 prompt 和流程图约束行为 | 软约束,随上下文稀释而失效 |
| 4 | 外挂记忆与状态系统 | 在模型外维护记忆库 / 状态机 | 开始有状态记忆了——但大模型仍是任务中心,外部系统只是增强 |
| 5 | 多智能体协作 | 多个 Agent 分工互查 | 每个个体仍是自回归生成器,漂移叠加而非抵消 |
前三条路都在自回归框架内修修补补,第四条开始真正有意思——因为开始有状态记忆了。但即便走到这里,大模型仍然是任务中心,外部系统只是在围绕它做增强。
因此应用层的工程努力,无法替代模型架构层面的范式转换。
约束性预测:一种不同的底层逻辑
哥德尔不完备定理指出:任何足够复杂的封闭系统,都存在无法从内部自证的盲区。今天的大模型正在验证这一点——系统越强,长程任务中的状态丢失和约束漂移就越显著。靠堆参数从内部填满盲区,在数学意义上是死路。
真正的出路,在模型架构本身。
预测下一步行动路径。约束性预测的核心:预测对象从 token 变为任务状态
需要强调:约束性预测不是取消生成能力,生成仍然是交互和表达的核心。但在执行长程任务时,模型的首要工作应当是维护任务状态、预测行动路径、校验执行结果——生成服务于执行,而不是反过来。
羲悉智能正在做的
对记忆架构的探索,把我们引向了一个更大的问题:如果一个智能体不只能回答问题,还能记住经历、总结经验、修正行为,并且越用越懂你——它就不再是一次性工具,而是形成一种长期的智能能力。
我们不只是想做一个更好的 RAG,也不是在大模型旁边挂一个记忆插件。我们真正想构建的,是一套让智能体可以长期运行、持续成长的类脑智能体基座。
这个基座的底层逻辑,来自对人脑机制的借鉴。人处理复杂任务时,不是只靠临时反应,也不是只靠长期记忆——我们是一边快速判断和行动,一边调动过去的经验和规则来修正自己。
羲悉的类脑智能体基座,正是希望让智能体也具备这样的双系统能力:
System 1 · 执行系统
理解任务、拆解步骤、判断下一步、执行动作,并在过程中持续校验结果。解决的是:眼前这件事,怎么一步步做下去。
System 2 · 经验系统
把用户长期使用中的偏好、规则、知识和成功经验沉淀下来。解决的是:哪些东西值得留下,哪些经验下次还能用,哪些错误以后要避免。
关键在于,这两个系统不是各自独立,而是持续循环——记忆不再只是「存起来的历史」,而是真正进入了智能体的运行过程。
当一个智能体持续沉淀你的偏好、规则和做事方式,它就不会每次都像重新开始,而是慢慢形成一套属于你的经验系统。我们把这种长期沉淀出来的智能能力,称为「智能自体」。
往前看
自回归生成定义了过去十年的 AI 范式,让机器学会了语言,这是了不起的成就。
但当智能体的任务从「生成一段回答」变成「持续执行一个流程」,模型架构本身需要回答一个更根本的问题:预测的对象,到底应该是什么?
羲悉的判断是:从预测下一个 token,走向预测下一步任务状态。从无约束的开放生成,走向有约束的确定性执行。
- Liu et al. (2024), Lost in the Middle: How Language Models Use Long Contexts
- 陈宇 et al. (2026), BRIDGE:长文本多跳推理研究
- Sierra, τ²-bench: Evaluating Conversational Agents in a Dual-Control Environment
- Evaluating Goal Drift in LLM Agent Systems (arXiv 2505.02709)