xisiid INTELLIGENCE / ARCHITECTURE NOTE

从自回归到约束性预测:下一代模型架构新范式

为什么下一代模型架构需要从「生成下一个词」走向「预测下一步任务状态」,以及羲悉智能在这条路上的判断和实践。

作者 Dr Yansong Chua文章出处 羲悉智能2026 · 06
CEILING 01

自回归的天花板

自回归生成的核心机制是:根据已有上下文,从左到右预测下一个 token。

这套机制极为适合语言生成,给出的上下文越丰富,输出越流畅。整个行业过去几年的主要努力,是把这套机制推到极致:更大的参数、更长的上下文、更精细的对齐。

但当任务从「生成一段文本」变成「持续执行一个复杂流程」时,自回归的结构性问题开始暴露。具体在以下几点:

记忆的 U 型曲线

Liu 等人(2024)的《Lost in the Middle》证实了大模型存在 U 型性能曲线:关键信息放在上下文中间,准确率就跳水。后续研究进一步揭示了「注意力陷阱」——模型过度聚焦于最前面的 token 作为数学锚点,导致中段信息被系统性忽略。

关键信息的位置,决定模型记不记得住
 Lost in the Middle 的 U 型性能曲线(示意)。关键信息越靠近上下文中段,被「看见却记不住」的概率越高——上下文不等于记忆。

多跳推理的失效

陈宇等人(2026)的 BRIDGE 研究确认:模型能定位单条线索,但当需要将散落在长文本不同位置的多条线索串联起来时,表现系统性下滑。模型看得到每一颗棋子,但看不到整盘棋局。

长程任务的漂移

任务越长,目标越容易在多轮生成中漂移,约束越容易被上下文稀释,执行结果越难校验。

这些问题的根源是同一个:自回归模型的工作单元是 token,它在每一步只回答「下一个词是什么」,而非「当前任务走到了哪里」。

ATTEMPTS 02

行业的五次尝试

围绕这些瓶颈,行业形成了五条主要技术路径:

#路径思路局限
1更长的上下文窗口把更多信息塞进一次推理看见 ≠ 记住,U 型曲线依旧,成本平方级上涨
2RAG 检索增强外部知识检索后拼回上下文检索的是文本片段,不是任务状态
3提示词工程与工作流编排用 prompt 和流程图约束行为软约束,随上下文稀释而失效
4外挂记忆与状态系统在模型外维护记忆库 / 状态机开始有状态记忆了——但大模型仍是任务中心,外部系统只是增强
5多智能体协作多个 Agent 分工互查每个个体仍是自回归生成器,漂移叠加而非抵消
注:原文此处为图片表格,本表按上下文脉络重建(示意)。

前三条路都在自回归框架内修修补补,第四条开始真正有意思——因为开始有状态记忆了。但即便走到这里,大模型仍然是任务中心,外部系统只是在围绕它做增强。

因此应用层的工程努力,无法替代模型架构层面的范式转换。

PARADIGM 03

约束性预测:一种不同的底层逻辑

哥德尔不完备定理指出:任何足够复杂的封闭系统,都存在无法从内部自证的盲区。今天的大模型正在验证这一点——系统越强,长程任务中的状态丢失和约束漂移就越显著。靠堆参数从内部填满盲区,在数学意义上是死路。

真正的出路,在模型架构本身。

给定当前任务状态与约束,
预测下一步行动路径。约束性预测的核心:预测对象从 token 变为任务状态

需要强调:约束性预测不是取消生成能力,生成仍然是交互和表达的核心。但在执行长程任务时,模型的首要工作应当是维护任务状态、预测行动路径、校验执行结果——生成服务于执行,而不是反过来。

PRACTICE 04

羲悉智能正在做的

对记忆架构的探索,把我们引向了一个更大的问题:如果一个智能体不只能回答问题,还能记住经历、总结经验、修正行为,并且越用越懂你——它就不再是一次性工具,而是形成一种长期的智能能力。

我们不只是想做一个更好的 RAG,也不是在大模型旁边挂一个记忆插件。我们真正想构建的,是一套让智能体可以长期运行、持续成长的类脑智能体基座。

这个基座的底层逻辑,来自对人脑机制的借鉴。人处理复杂任务时,不是只靠临时反应,也不是只靠长期记忆——我们是一边快速判断和行动,一边调动过去的经验和规则来修正自己。

羲悉的类脑智能体基座,正是希望让智能体也具备这样的双系统能力:

System 1 · 执行系统

理解任务、拆解步骤、判断下一步、执行动作,并在过程中持续校验结果。解决的是:眼前这件事,怎么一步步做下去。

System 2 · 经验系统

把用户长期使用中的偏好、规则、知识和成功经验沉淀下来。解决的是:哪些东西值得留下,哪些经验下次还能用,哪些错误以后要避免。

关键在于,这两个系统不是各自独立,而是持续循环——记忆不再只是「存起来的历史」,而是真正进入了智能体的运行过程。

当一个智能体持续沉淀你的偏好、规则和做事方式,它就不会每次都像重新开始,而是慢慢形成一套属于你的经验系统。我们把这种长期沉淀出来的智能能力,称为「智能自体」。

OUTLOOK 05

往前看

自回归生成定义了过去十年的 AI 范式,让机器学会了语言,这是了不起的成就。

但当智能体的任务从「生成一段回答」变成「持续执行一个流程」,模型架构本身需要回答一个更根本的问题:预测的对象,到底应该是什么?

羲悉的判断是:从预测下一个 token,走向预测下一步任务状态。从无约束的开放生成,走向有约束的确定性执行。

REFERENCES
  1. Liu et al. (2024), Lost in the Middle: How Language Models Use Long Contexts
  2. 陈宇 et al. (2026), BRIDGE:长文本多跳推理研究
  3. Sierra, τ²-bench: Evaluating Conversational Agents in a Dual-Control Environment
  4. Evaluating Goal Drift in LLM Agent Systems (arXiv 2505.02709)