
这项由ETH苏黎世计算机科学系与ETH AI中心联合开展的研究,于2026年7月发表,论文编号为arXiv:2607.07953。有兴趣深入了解的读者可以通过该编号在arXiv平台上查阅完整论文。
**每一次阅读,都是一场记忆的挑战**
每当你打开一本厚厚的书,试图记住前面章节的细节,同时还要理解当前页的内容,你的大脑就在同时处理"记忆"与"理解"两件事。现代AI语言模型——那些能写文章、回答问题、辅助编程的智能助手——面临的正是同样的挑战,只不过规模要大得多,而且它们的"记忆方式"直接决定了速度与质量之间的权衡。
这篇研究的核心问题,用最简单的话来说就是:AI应该怎样"记东西",才能既快又准?研究团队从ETH苏黎世出发,对目前几种主流的AI记忆机制做了一次全面的横向比较,并提出了一种让不同层次的记忆之间"互通消息"的新思路。
---
一、AI的记忆困境:为什么"看全文"会把电脑累垮
要理解这项研究,先得明白AI是怎么"读"文章的。
当前最主流的AI语言模型依赖一种叫做"自注意力机制"的技术。用一个生活化的比喻来理解:你正在读一篇关于厨师张三的长篇小说。读到第200页时,你需要回忆第5页张三用的是什么锅。为了找到这个信息,你必须把书翻回去,逐字逐句对比——不是只查一个地方,而是把第200页的每一个字都和前面199页的每一个字做一次对比,才能判断哪句话最相关。
这就是"自注意力机制"的工作方式:它让文章中的每一个词都和其他所有词做配对比较,从而找出最关联的信息。这个机制极其强大,也极其消耗资源。文章越长,比较的次数就以"平方"的速度暴增——文章长度翻倍,计算量变成四倍;文章长度翻四倍,计算量变成十六倍。对于需要处理超长文档或超长对话的场景,这种"二次方代价"很快就会把计算机的时间和内存耗尽。
正是为了解决这个问题,一批研究者开始探索"线性注意力"机制。线性注意力的核心思路是:与其每次都把当前词和所有历史词做比较,不如维护一个固定大小的"记忆矩阵",把历史信息压缩进去,每次只需要查这个矩阵就够了。这样一来,无论文章有多长,查询的代价始终是固定的,整体计算量只和文章长度成正比——也就是"线性"代价。
这个矩阵就像一个笔记本,你边读书边往里面写关键信息,每次需要回忆时,只需要翻这本笔记,而不是把整本小说从头翻一遍。效率大幅提升,代价是笔记本的大小是固定的,写满了就需要决定哪些内容要保留、哪些要覆盖。
---
二、从"粗心的笔记员"到"精细的记忆管理者":四种架构的演进
ETH团队这次重点比较了四种线性注意力架构,它们都围绕同一个核心思路展开,但在"如何管理笔记本"这件事上,一代比一代精细。
**DeltaNet:只记"补丁"的聪明笔记员**
最早的线性注意力有一个严重问题:每次读到新信息就直接往笔记本里叠加,久而久之,新旧内容混在一起,互相干扰,想查某条信息时总会带出一堆无关内容。
DeltaNet提出了一个聪明的解法,研究者们称之为"Delta规则"。它的做法是:在往笔记本写新内容之前,先查一下笔记本对这条信息已经知道多少。如果笔记本已经记了"张三用铁锅",而新读到的信息是"张三用铁锅(确认)",那就不需要重复写一遍,只记录一个零差值就好;如果新读到"张三其实用铜锅",那就只写下"把铁锅改成铜锅"这个修正量。
这种"只写修正量"的方式,让记忆更新变得精准,大大减少了信息叠加造成的混乱。DeltaNet的局限在于,它没有办法主动"清空"笔记本上已经过时的内容。一旦某条信息在很久之前写入,即便它已经不再重要,也还是会一直待在那里影响后续的查询。
**Gated DeltaNet:加了"橡皮擦"的改进版**
Gated DeltaNet在DeltaNet的基础上加入了一个"遗忘旋钮"。每次写入新信息之前,先把整个笔记本的内容按照一个可学习的比例"淡化"——就像把铅笔字用橡皮轻轻擦淡,再在上面覆盖新内容。这个比例由当前读到的词动态决定,读到一段全新的话题时,遗忘率自动调高;读到与之前高度相关的内容时,遗忘率自动调低。
这样一来,笔记本就有了"主动遗忘"的能力,不再是无限堆积。代价是,这种遗忘是对整个笔记本"一刀切"的——无论哪部分内容,都按同一个比例淡化,精细控制能力还不够强。
**Kimi Delta Attention:用"分区橡皮擦"精细管理**
Kimi Delta Attention把这个"淡化比例"从一个数字升级成了一个向量——也就是说,笔记本的不同区域可以按不同的速率淡化。某些记录"地点信息"的区域可以保留得久一些,而记录"临时状态"的区域则可以很快被清空。这种分区域、分速率的遗忘机制,让记忆管理变得更加灵活精细。
研究团队在实验中发现,在350亿参数、150亿词训练量的标准测试下,使用Muon优化器的Kimi Delta Attention混合架构达到了本次实验中最低的最终验证损失2.273,是所有架构中表现最好的。当然,精细的管理也带来了更高的计算开销,它在所有架构中训练速度相对较慢,相对速度约为70.9%。
**Gated DeltaNet-2:把"写入"和"擦除"彻底分开**
Gated DeltaNet-2是这个系列目前最精细的版本。它的核心创新是把"擦除旧内容"和"写入新内容"这两件事彻底解耦,分别由两个独立的门控机制来控制。一个"擦除门"专门决定从笔记本的哪些区域移除旧内容,另一个"写入门"专门决定把新内容写进哪些区域。这两个门各自根据当前读到的词独立计算,互不干扰。
如果把Gated DeltaNet比作"用一把刀又切又抹",那Gated DeltaNet-2就是"用两把专业工具,一把专门刮旧内容,一把专门涂新内容"。当这两个门的参数设置成相同值时,整个机制就退化回Kimi Delta Attention,再进一步退化就成了Gated DeltaNet,体现了清晰的包含关系。
---
三、大型实验场:在同一个擂台上,谁赢了?
为了做公平比较,ETH团队搭建了一个统一的实验平台。所有模型都采用3.5亿参数规模,在同一个高质量网页文本数据集上训练150亿个词,使用相同的序列长度、批大小、精度和硬件配置。这就像让不同品牌的汽车在同一条赛道上跑同样的圈数,只比较最终成绩。
实验区分了两种架构模式。"混合栈"是指把线性注意力层和传统的软最大值注意力层交替排列,每三层里有一层是传统注意力;"纯栈"则是全部使用线性注意力层,不混入传统注意力。这两种模式代表了两种不同的设计哲学:混合栈试图兼顾质量和效率,纯栈则追求最极致的速度优势。
从验证损失这个衡量模型质量的核心指标来看,Kimi Delta Attention配合Muon优化器的混合架构以2.273的最终损失拔得头筹。DeltaNet配合Muon的混合架构紧随其后,达到2.299。即便是传统的软最大值注意力,在换用Muon优化器后也达到了2.349,优于多个线性注意力的AdamW版本。
从训练速度来看,纯栈Gated DeltaNet配合AdamW优化器以100%的相对速度排名第一,是整个实验中最快的设置,但其最终损失为2.433,比最佳质量的结果差了不少。Kimi Delta Attention由于计算机制更复杂,速度只有68.5%到70.9%左右。
这两项结果合在一起,清晰地揭示了一个根本性的权衡:你想要最好的质量,就要付出速度的代价;你想要最快的速度,就要接受质量上的妥协。没有哪个单一设置能同时在两个维度上称王。
---
四、优化器的选择比你想象的重要得多
这项研究揭示了一个很多人可能忽视的细节:选择哪种优化器,对最终结果的影响巨大,而且必须和学习率一起考虑。
优化器可以理解为AI学习时的"调参策略"——它决定了每次根据错误信号调整模型参数的方式。实验比较了两种主流优化器:AdamW和Muon。表面上看,从AdamW换成Muon只是换了一个工具,但实验数据显示,在所有测试的架构和栈结构组合中,Muon都稳定地带来了更低的最终验证损失。
更有趣的是,不同的架构对"学习率"这个参数的最优值需求截然不同。学习率就像调味料的用量——太少了菜没味道,太多了则会咸苦难以入口。研究团队在2000步的短期训练实验中发现,使用Muon的模型普遍偏爱较低的学习率,约在3×10??附近;而使用AdamW的线性注意力模型则偏爱较高的学习率,约在10??附近。唯一的例外是传统软最大值注意力,它在两种优化器下的最优学习率都落在3×10??附近。
这个发现有重要的实践意义:如果你想比较两种架构的好坏,必须分别为它们各自调到最优的学习率,否则得出的结论很可能是因为调参失误导致的,而不是架构本身的差异。用一个烹饪类比来说:同样是比较铁锅和不粘锅哪个煎蛋更好,如果铁锅用了适合不粘锅的火候,最后铁锅煎出焦糊的蛋,你不能就此得出铁锅更差的结论。
---
五、长文本的速度测试:线性优势在这里最明显
研究团队还专门测试了当文本序列变长时,不同架构的表现如何变化,这是线性注意力架构存在意义最直接的体现。
测试在4096个词、16384个词和32768个词三种长度下分别测量了每次训练迭代需要的时间。结果非常直观:在32768个词的长度下,传统软最大值注意力每次迭代需要3.37秒;Gated DeltaNet的混合栈需要1.56秒;而纯栈Gated DeltaNet只需要0.96秒。
更能说明问题的是增长幅度:从4096词增长到32768词,传统注意力的时间增加了约192%,接近三倍;混合栈Gated DeltaNet增加了约65%;纯栈Gated DeltaNet仅增加了约8%,几乎没有变化。这正是"线性"与"二次方"在实际中的差距——序列越长,线性架构的优势越明显,到了足够长的序列,差距可以是数倍乃至数十倍。
混合栈的增长幅度(65%)非常接近纯软最大值注意力(192%)的三分之一,这个比例并非巧合——混合栈中恰好有三分之一的层是传统注意力层,它们贡献了几乎全部的序列长度相关开销。这个细节说明,混合架构的速度特性几乎可以线性地由"有多少比例的层是传统注意力"来预测。
---
六、规模扩展的验证:更大的模型说了什么
研究团队还把DeltaNet扩展到了更大的规模,以验证在3.5亿参数之外的表现是否一致。
在13亿参数、训练400亿词的规模上,实验发现学习率的选择对结果依然至关重要。使用3.6×10??学习率的混合架构DeltaNet最终损失为2.066,对应的纯栈版本为2.085;但同样是纯栈版本,把学习率降到1.5×10??后,最终损失反而更低,达到2.063——差距虽然不大,但方向相反,说明最优学习率因栈结构不同而不同。
在30亿参数、训练600亿词的更大规模上,同样的规律再次出现:学习率为5×10??的混合架构DeltaNet最终损失高达2.332,而把学习率降到3×10??或1.5×10??,损失都降到了1.955,差距显著。这再次证明,在任何规模的实验中,学习率调参都不能省略。
研究团队还在多个下游任务上做了评测,包括HellaSwag(常识推理)、PIQA(物理常识问答)和WinoGrande(指代消解)。这些任务的结果显示,各架构之间的差异不大,没有任何一个架构在所有任务上明显占优,也没有明显的退化。这意味着验证损失所反映的质量差异,并没有在这几个基准任务上造成明显的功能差距,至少在这个规模和任务集合上如此。
---
七、跨层"传话":让深层网络不再遗忘浅层的发现
解决了"如何管理单个层的记忆"之后,研究团队把目光转向了一个更深层的问题:当模型有很多层堆叠在一起时,浅层提取的有用信息,会不会被深层网络"淡忘"或"覆盖"?
这个问题的背景是:深度神经网络由许多层组成,每一层都对输入做一定的变换,输出传给下一层。理论上,浅层发现的某个关键模式,应该能通过层层传递影响到最终输出。但实践中,随着层数增加,早期信息确实可能被稀释。一些研究者(包括Kimi团队)提出了用"注意力残差"或"深度混合注意力"等方案,专门在层与层之间建立额外的信息通道。
ETH团队的思路是:既然DeltaNet风格的架构在每一层都会产生一个"写入残差"(也就是前面说的"修正量"),这个信息不用了就被丢掉了。那能不能把它传递给更深的层,让更深的层也能利用这个信息?而且,这种传递方式必须不破坏线性注意力的速度优势。
**第一次尝试:传递"写错了多少"(CLER)**
最直觉的想法是把浅层的"修正量"直接传递给下一个线性注意力层,让接收层把它加入自己的写入目标中——相当于告诉下一层"上一层觉得自己对这条信息的记录还差这么多,你帮忙补上"。这个方案被命名为"跨层错误残差"(CLER)。
然而实验结果令人失望。使用Muon优化器时,CLER版本的Gated DeltaNet比原始版本损失反而略高了0.0013;CLER版本的DeltaNet虽然有-0.0004的微弱改善,但这个差距小到可以忽略不计,不具统计意义。使用AdamW优化器时,CLER对两个架构都没有改善,DeltaNet版本甚至损失大幅上升了0.019。
研究团队并没有因此放弃,而是仔细分析了原因。他们认为问题在于"空间错位":浅层的修正量是在浅层自己的"值空间"中定义的,这个空间和深层的值空间之间没有天然的对齐关系——就像一个厨师用法语写的菜谱,传给一个只懂中文的厨师,对方根本无法直接利用。
**第二次尝试:传入"公共频道"(CLER-H)**
意识到问题所在后,团队做了第一个改进:不把信息传入接收层的"私有值空间",而是传入所有层共享的"残差流"——也就是整个网络中各层之间传递信息的公共通道。这个方案叫做CLER-H,传递的信号仍然是写入错误量。
结果有了明显改善。在350亿参数、10亿词训练的实验中,CLER-H使Gated DeltaNet的损失降低了0.0073,使DeltaNet降低了0.0047。在更长的150亿词训练中,改善依然存在但幅度缩小,分别为-0.0042和-0.0002。
**第三次尝试:传递"写了什么"而不是"差了多少"(CLVR)**
团队进一步思考:既然"写入错误量"能有所帮助,那"写入量本身"会不会更有用?毕竟,写入错误量只是"写入值减去已有记忆对该位置的预测",而完整的写入值包含了更多信息。这个方案被命名为"跨层值路由"(CLVR)。
结果证实了这个判断。在350亿参数、10亿词的实验中,CLVR使Gated DeltaNet损失降低了0.0103,使DeltaNet降低了0.0119,均优于CLER-H。在150亿词的训练中,改善持续存在,分别为-0.0059和-0.0016。在13亿参数、400亿词的更大规模实验中,仅有Gated DeltaNet的数据,CLVR使损失降低了0.0019。
关键的一点是:CLVR使用了零初始化的投影矩阵——一开始,这个跨层传递通道完全不起作用,模型和没有CLVR时完全一样。随着训练进行,模型自己"学会"了是否以及如何利用这个通道。训练结束后检查这个投影矩阵,发现它在所有路由层上都有了非零但可控的参数值,说明模型确实主动使用了这个通道,而不是把它置之不理。
研究团队还做了几个控制实验来确认改善来自路由本身而非额外参数。把路由的信号从"写入值"换成"该层的隐藏状态",效果几乎持平(改善仅-0.0014);把Gated DeltaNet的参数量直接增加到和CLVR版本相同,不引入路由机制,损失反而上升了+0.0021。两个控制实验都说明,改善来自"传递了什么信息",而不是"增加了多少参数"。
---
八、研究的边界:什么结论是稳健的,什么还是初步的
ETH团队在论文中对研究局限性的描述相当坦诚,这也是值得称道的学术态度。
整个实验中,每种配置只跑了一次,没有多次随机种子的重复实验,因此所有结果都不附带误差范围。对于损失差距小于约0.001到0.01的比较,研究者明确表示不做强结论——这个量级的差异可能只是随机波动,在单次实验中无法区分。
下游任务评测的覆盖面也相对有限,仅测试了HellaSwag、PIQA和WinoGrande三个标准基准,而且这三个任务对于长上下文记忆能力的要求不高。研究者明确指出,这些评测的主要用途是"检查有无明显退化",而不是作为改善的独立证据。
CLVR目前只在DeltaNet和Gated DeltaNet两种宿主架构上做了验证,Kimi Delta Attention和Gated DeltaNet-2上还没有对应的实验数据。Gated DeltaNet-2特别值得关注——它把写入值和擦除操作分开了,"路由写入值"这个逻辑在这种架构上意味着什么,还是一个开放的问题。
此外,随着模型规模增大或训练时间增长,CLVR的改善幅度有所收窄。在13亿参数级别,改善已经缩小到0.0019,这是否意味着在更大规模或更充分训练的情况下收益会消失,目前还不清楚。研究者猜测这可能是因为更大、训练更充分的模型自己已经能够学会浅层的有用信息,不再那么需要显式的跨层传递。
---
九、对工程实践者的启示:速度还是质量,你只能先选一个
从这项研究的全部实验结果中,可以提炼出几个对实际应用直接有用的认识。
关于架构选择,没有一个在所有维度都最优的选项。如果部署场景对推理延迟极其敏感、需要处理很长的上下文,纯线性注意力栈在序列长度增加时几乎不增加时间成本,是值得认真考虑的方向。如果对质量的要求高于速度,混合架构通常能在不大幅牺牲速度的前提下,让验证损失接近更大计算量的纯软最大值注意力。
关于优化器,不能只试AdamW就做定论。研究显示Muon在所有测试架构上都能改善质量,而且它们偏爱的学习率范围不同——用AdamW的最优学习率来跑Muon,或者反过来,都会得到远未达到潜力的结果。
关于跨层路由,CLVR在小规模和中等规模上有一定的改善,而且不增加推理成本,工程代价很低,可以作为一个值得尝试的技巧。但目前的实验仅限于两种宿主架构和有限的规模,不宜过度推广。
---
说到底,这项研究做的事情,就是把几个"AI记忆笔记本"的不同管理方式放在同一张桌子上,认真地量了量各自的重量和容量。结论不是"这个笔记本最好,其他都可以扔掉",而是"每本笔记本适合不同的场合,而且你选的笔还会影响写出来的字好不好看"——这里的笔就是优化器。
研究团队还发现,让不同层的笔记本"互相传阅"是有价值的,但传阅方式很关键。把"我哪里记错了"传给别人,没有把"我原本打算写什么"传给别人更有用。这个发现打破了最初的直觉——毕竟,"记录我的错误"才是DeltaNet这个系列的核心设计哲学。
这项工作的价值,一方面在于对已有架构的系统梳理,让不同机制的异同在数学上变得透明;另一方面在于CLVR这个轻量级的新机制,它在保留线性注意力全部速度优势的前提下,提供了一个让深层网络不遗忘浅层智慧的方式。它的改善目前还比较小,在更大规模上是否依然有效还是未解之谜,但作为一个几乎没有工程成本的改进,已经值得关注。
有兴趣深入了解全部细节的读者,可以通过arXiv编号2607.07953找到这篇论文,同时研究团队也在GitHub上开放了完整的实现代码,可以直接复现实验。
---
**Q&A**
Q1:线性注意力和传统软最大值注意力相比,质量真的能差不多吗?
A:根据ETH苏黎世的实验,在3.5亿参数、150亿词训练的标准设置下,Kimi Delta Attention配合Muon优化器的混合架构最终验证损失为2.273,而传统软最大值注意力配合Muon达到2.349,线性注意力反而更优。但这个结论的前提是架构、优化器和学习率都经过合理匹配,不是随便换一个就能得到这个结果。
Q2:CLVR跨层值路由对推理速度有没有影响?
A:CLVR通过一个零初始化的投影矩阵把浅层的写入值加入残差流,这个操作在推理时也同样存在,理论上会增加一点点计算量,但由于投影矩阵的维度相对较小,且不改变任何一层的主体计算逻辑,研究团队描述其为"保留宿主架构线性时间结构"的轻量方案。论文中没有单独列出CLVR对推理速度的具体影响数字。
Q3:混合栈和纯栈Gated DeltaNet的训练速度差距有多大?
A:根据论文中的实验数据,在32768词的长序列下,纯栈Gated DeltaNet每次训练迭代约需0.96秒,混合栈需要1.56秒,传统软最大值注意力需要3.37秒。从4096词增长到32768词,纯栈时间只增加了约8%,混合栈增加了约65%,而传统注意力增加了约192%。在相对吞吐量上,纯栈AdamW版本被定为100%基准,混合栈AdamW版本约为90.5%。