跳到正文

目录

深度的幻觉:Nested Learning 如何重新定义机器学习的层次

一场关于"深度"的审判

2012 年,AlexNet 用 8 层卷积网络赢下 ImageNet 挑战赛。2015 年,ResNet 把层数推到 152 层,“更深 = 更强"成为深度学习的黄金法则。十年后,GPT-4 拥有上百层 Transformer,Claude 也不遑多让。堆更多的层,模型就能学到更复杂的东西——这成了默认前提。

Google Research 的 Ali Behrouz、Meisam Razaviyayn、Peilin Zhong 和 Vahab Mirrokni——这个团队此前创造了 Titans 架构——在 arXiv 上传了一份详细的技术报告,给出了一个反直觉的论断:

深度学习架构的"深度"可能是一种幻觉。

堆叠同质层并不增加真正的计算深度——就像把同一段楼梯重复画十遍,并不会让你离地面更远。

深度学习当前面临的瓶颈——灾难性遗忘、持续学习困难、架构与优化器的割裂——或许正是因为一直在用"堆层"这种旧思维。

论文提出的替代方案叫 嵌套学习(Nested Learning, NL)。它不否定深度,而是重新定义深度。

文章分三条线走:先看优化器——SGD、Momentum、Adam 都不是工具,而是记忆;再用同样的眼光拆开架构——注意力、MLP 也是记忆;最后看二者的统一——连续记忆系统(CMS)与 Hope 实验。贯穿始终的只有一个概念:联想记忆。区别只在它处在嵌套的第几级、以什么频率更新。频率快的处理瞬时模式,频率慢的沉淀长期知识,嵌套层级越多,能记住的东西越不互相覆盖。

大脑的两个启示

论文的出发点来自神经科学。

启示一:记忆的两个巩固系统

人脑的持续学习靠神经可塑性(neuroplasticity)。记忆形成至少涉及两个独立的巩固过程:

  • 快速在线巩固(突触巩固):学习发生后立即启动,记忆痕迹在毫秒到分钟级别开始稳定化。
  • 离线巩固(系统巩固):睡眠中,海马体重放最近编码的模式,将记忆从临时存储转移到新皮质的长期存储。

两个过程运行在不同时间尺度上,共享同一套神经结构。没有谁"负责"记忆——记忆分布在全脑。

启示二:LLM 像一个顺行性遗忘患者

顺行性遗忘(anterograde amnesia)的患者无法形成新的长期记忆,但短期记忆(工作记忆)完好。他们可以正常对话,却记不住昨天的事。

LLM 的处境惊人地相似。上下文窗口是它的工作记忆,FFN 层权重是它的长期记忆。问题在于:上下文中的信息永远不会自动写入长期记忆参数——除非用梯度下降做微调。对话结束后,一切烟消云散。

Transformer 的注意力机制让模型在上下文窗口内拥有出色的"工作记忆”,但这种记忆无法持久化。结构是割裂的:注意力负责短期,FFN 负责长期,两者之间缺乏大脑那样的统一巩固机制。

嵌套学习的出发点是:让模型的不同部分以不同频率更新,模拟大脑的多级巩固过程。

当 SGD 变成记忆

嵌套学习的第一个贡献,是把优化器看透了。

优化器通常被视为"工具"——SGD、Momentum、Adam,各有各的更新规则,选一个用就行。但论文指出:已知梯度优化器实际上是联想记忆模块(associative memory modules),它们通过梯度下降来压缩梯度信息。

SGD:一级联想记忆

SGD 的更新规则是 $\theta_{t+1} = \theta_t - \eta \nabla f(\theta_t)$。每一步用当前梯度更新参数。论文重新解读了这个过程:SGD 在学习一个映射——从数据点到对应的损失梯度符号值(LSS-value)的映射。参数 $\theta$ 存储的就是这个映射。

当 SGD 在数据点 $x_i$ 上计算梯度时,它在"记住":看到 $x_i$ 时,梯度方向是这个。一级联想记忆——只有一层。

Momentum:二级嵌套

SGD with Momentum 引入动量项 $v_t$:

$$v_t = \beta v_{t-1} + \nabla f(\theta_t), \quad \theta_{t+1} = \theta_t - \eta v_t$$

现在有两层结构。内层($v_t$)存储梯度值,外层($\theta$)用更慢的频率更新。Momentum 本质上是一个二级嵌套优化——内层快速记忆近期梯度,外层缓慢调整长期方向。

Adam:对逐元素回归的最优记忆

Adam 同时跟踪梯度的一阶矩和二阶矩,自适应调整每个参数的学习率。论文证明,Adam 在理论上是对逐元素 L2 回归目标的最优联想记忆——它在最小化"记忆的梯度"与"实际梯度"之间的差异。

这个洞察的价值不在于"Adam 很好"。价值在于:认识到优化器是联想记忆后,就可以设计更深、更强的记忆结构来获得更好的优化器。

M3:更深的记忆

论文据此设计了 M3 优化器,使用更深的记忆层次和更强的学习规则来压缩梯度信息。在 ImageNet-21K 上训练 ViT 时,M3 的训练损失和测试损失都优于 AdamW 和 Muon。

M3 的领先不是调参调出来的。它把梯度历史压进比 AdamW、Muon 更深的记忆结构——嵌套层级更多,压缩也更充分。这是设计层面的差异,不是超参数搜索的产物。

拆解 Transformer

优化器是记忆,那架构呢?嵌套学习的第二个贡献:Transformer 的组件也可以分解为嵌套优化问题

线性注意力 = 二级嵌套

Linear Attention 的公式可以写成:

$$Y = (QK^T)V = Q(K^TV)$$

$K^TV$ 是一个记忆矩阵——它压缩了上下文信息。这恰好是一个二级嵌套优化:

  • 内层:用梯度下降优化记忆矩阵 $M = K^TV$,把上下文序列压缩到矩阵中
  • 外层:优化投影层 $Q$,从记忆中检索相关信息

MLP vs 线性注意力:同一家族的两个变体

MLP 是一级嵌套。它的权重只有持久形态——训练完成后固化成参数,推理时不再变化。

Linear Attention 则多了一层。它的记忆矩阵 $M_t = M_{t-1} + v_t k_t^\top$ 会随输入序列动态更新。每一级记忆单元都在用自己的频率压缩当前上下文——不是被动等待梯度更新,而是主动把见过的 $k_t$、$v_t$ 配对压进矩阵。举例说,读完"猫坐在垫子上",“猫"的 key-value 对和"垫子"的 key-value 对都已经写进了矩阵;等到问题"谁坐在上面?“进来,查询向量直接从矩阵里把"猫"捞出来,不需要回头重扫整句话。

给 Linear Attention 加上一个可学习的初始记忆状态(论文称之为 Linear Attention++),它就同时拥有了"持久参数"和"上下文记忆"两个层级。与 MLP 的差别只剩下"是否随输入动态调整”。在嵌套学习的视角下,MLP 是 Linear Attention 退化到一级记忆的特殊情形。

重新审视混合架构

近两年流行把 softmax attention 和 linear RNN 混在一起(比如 Samba = softmax attention + linear RNN)。主流观点认为这是"表达力 + 效率"的折中。

嵌套学习给出了一个更深的视角:所谓"折中"实际上是一种记忆分层。Softmax attention 提供高精度的短期上下文记忆(每步更新,保留全部 token 间的精确交互),linear RNN 提供压缩的中长期记忆(每次写入一次累加,自动衰减旧信息),MLP 提供持久的参数记忆(训练时固化,推理时只读)。三者各自占据一个嵌套层级——短期、中期、长期——协作形成多级记忆层级。

连续记忆系统:从二分到连续谱

“长期记忆 vs 短期记忆"的二分法太粗糙了。人脑有突触巩固、系统巩固等多个时间尺度的记忆过程;模型如果只有两级,就像一个只区分"今天"和"非今天"的日历——日常够用,但一到持续学习就捉襟见肘。

论文提出 连续记忆系统(Continuum Memory System, CMS),将记忆推广为多级结构,每一级有自己的更新频率:

  • 低级记忆:每步更新(如注意力缓冲,每个 token 都刷新)
  • 中级记忆:每隔若干步更新(如 RNN 隐藏状态,对近期上下文做有损压缩)
  • 高级记忆:每数千步才更新一次(如模型权重,承载最稳定的知识)

这是一个频谱,不是一刀切的开关。每一级记忆的更新频率决定了它"记住什么、忘记什么”——更新越频繁的层级,越擅长处理瞬时模式;更新越慢的层级,越擅长沉淀抽象规律。

大脑的海马体-皮层系统正是这样运作的:海马体快速编码当前经历(低级),睡眠期间通过 sharp-wave ripples 把重要模式重放到皮层(中级到高级的转移)。CMS 的设计哲学,就是把这个神经科学的事实翻译成可工程化的模块。

不同级别的记忆是统一的、可复用的,而非各自为政的组件。它们共享同一套参数化机制(都是联想记忆),区别只在更新频率。

Hope:嵌套学习的实战验证

这套理论是否站得住,得看实验。论文给出的载体是 Hope 模块——结合自我修改序列模型和连续记忆系统的持续学习模块。

语言建模

760M 参数 / 30B token 规模:

模型WikiText ppl↓LMBench ppl↓PIQA acc↑平均 acc↑
Transformer++24.1824.2737.150.11
Samba21.0722.8539.251.46
Titans20.0821.5238.151.68
Hope18.6820.0738.852.28

困惑度(perplexity)越低越好。Hope 在 WikiText 上比 Titans 低了 1.4 个点。Samba 和 Titans 都已经是相当强的基线;Hope 依然在它们之上拉开了可见的距离。

1.3B 参数 / 100B token 规模,Hope 的优势进一步拉大:

模型WikiText ppl↓平均 acc↑
Transformer++17.9253.38
Titans15.6056.82
Hope14.3958.04

困惑度从 Transformer++ 的 17.92 降到 14.39——相对降幅 19.7%。在这个规模上,每降 0.5 个点都异常困难。Hope 的嵌套结构随规模增大展现出更强的优势——相对 Titans 的平均准确率领先从 760M 时的 0.60 个百分点扩大到 1.3B 时的 1.22,Wiki ppl 的相对改进从 7.0% 扩大到 7.8%。

不过,这些数字测的是语言建模能力,不是下游任务表现。perplexity 降低 19.7% 不直接等价于推理能力或指令遵循能力同等提升。嵌套结构带来的优势是否能在代码生成、数学推理等场景中复现,这些实验本身没有直接回答。

形式语言识别

这类任务测试模型处理结构化模式的能力。比如 $a^nb^n$(等量 a 和 b)和 $a^nb^nc^n$(等量 a、b、c)——前者需要计数到 2,后者需要计数到 3。

Transformer 和 Linear Attention 在这些任务上表现挣扎——前者甚至在 $a^nb^n$ 上 0% 准确(Bin1 完全失败),后者在 $a^nb^nc^n$ 上同样全军覆没。这些任务要求精确的层级化计数:模型需要在某个层级上追踪"已经出现了几个 a”,在另一个层级上确认"b 的数量是否匹配"。

Hope 在所有任务上达到 100% 准确率,和 LSTM、SRWM 这种非线性循环模型平起平坐。但 Hope 的优势在于可并行训练——它不像 LSTM 那样只能顺序计算,可以利用现代 GPU 的并行性扩展到语言建模规模。

这个对比揭示了一个反直觉的事实:在处理结构化模式时,线性循环是不够的。Linear Attention 也用矩阵记忆,但它假设了线性变换,丢失了精确计数的能力。Hope 引入非线性循环(chunk-wise 非线性),保留了循环模型的精确性,又通过矩阵形式保持了可并行性。

持续学习:更多层级 vs 更多遗忘

在 CTNL(Continual Translation of a Novel Language)基准上,论文测试了 Hope-2(2 级记忆)和 Hope-3(3 级记忆)在序列学习两种新语言(Manchu → English 和 Kalamang → English)时的表现。

结果是:更多记忆层级 = 更少的灾难性遗忘。Hope-3 在学习第二种新语言时,对第一种语言的翻译能力显著优于 Hope-2——而 Hope-2 又显著优于普通的 in-context learning baseline。

灾难性遗忘(catastrophic forgetting)困扰深度学习几十年了:模型学新任务时会把旧任务的知识覆盖掉。教科书解释是"梯度下降改变了所有参数",但嵌套学习给出了更精确的诊断——问题在于记忆层级不够多。当只有一个更新频率时,新数据只能覆盖旧参数,无处可放。当存在多个频率层级时,新数据可以先沉淀到高频记忆(短期适应),再缓慢向低频记忆转移(长期整合),从而保留住已经学会的能力。

但 CTNL 的规模较小——它测试的是翻译任务,不是通用持续学习。三级记忆在 CTNL 上有效,但能否在 ImageNet 规模的持续学习或大模型增量预训练上同样有效,这些实验没有直接回答。

嵌套学习的数学骨架

定义 1:嵌套系统

一个 K 级嵌套系统包含 K 个有序层级。每一级 $k$ 包含一组优化问题,每个问题有自己的:

  • 目标函数 $\mathcal{L}_k$
  • 上下文 $C_k$(该级能看到的信息)
  • 参数空间 $\Theta_k$

关键约束:参数按更新频率排序。同一级内频率相同,层级越高更新越慢。

一级每步更新,二级每十步更新,三级每百步更新——频率的差异创造了"深度"。堆叠同频更新的层(比如一百个相同结构的 Transformer block)不会增加嵌套层级,只是在同一级内增加宽度。

定义 2:联想记忆嵌套系统(NSAM)

如果嵌套系统中的每个优化过程都是联想记忆——上下文是键值对,目标是衡量记忆映射质量——那么它就是一个 NSAM。

NSAM 的价值在于它提供了一个统一视角:优化器和架构本质上都是联想记忆,区别只在于它们处于嵌套层级的不同位置、操作不同的时间尺度。

五个哲学命题

论文最后讨论了嵌套学习的哲学意义,指向深度学习研究的方向性转变。

一、预训练就是上下文学习。 预训练数据本身就是一个超长的上下文——整个互联网语料、上万亿 token。每一次梯度更新,都在做一次"在上下文中学习"。预训练和推理时的 few-shot 提示学习,区别只是上下文长度的数量级差异——本质上是同一个嵌套过程在不同时间尺度上的体现。

二、上下文学习自然涌现。 当模型足够大、嵌套层级足够多时,上下文学习不需要被特殊设计——它是多级记忆系统运行的必然结果。高一级的记忆从低一级的记忆中读取信息,这个过程本身就是"在上下文中学习"。

三、更多层级 ≠ 更多层。 嵌套学习的"深度"指的是嵌套层级而非网络层数。增加同质层(比如再叠 12 个 Transformer block)只增加宽度;增加嵌套层级(比如增加一个新的更新频率)才增加深度。这就是为什么有些上百层的模型并没有比浅层模型好多少——它们的嵌套层级可能还是 2(权重 + 注意力),堆叠只是在同一层级里复制结构。

四、优化器和架构应当统一设计。 既然优化器(SGD/Adam)和架构(注意力/MLP)都是 NSAM,分开设计就是人为割裂一个自然统一的系统。M3 优化器的成功表明,联合设计可以打开新的设计空间。过去十几年,优化器(Adam → LAMB → LION → Muon)和架构(CNN → RNN → Transformer → Mamba → Titans)各自演进,但很少同时改变两者。嵌套学习提供了把它们放回同一张桌面的理由。

五、“深度"需要重新定义。 如果嵌套学习是对的,那么"深度学习"的"深度"应该指嵌套层级,而非网络层数。一个 100 层的同质 Transformer 可能只有 2 级嵌套深度;一个 10 层但精心设计了 5 级嵌套的模型,可能拥有更强的学习和泛化能力。过去十年关于"哪个模型更深"的争论,可能问错了问题——真正值得问的是"哪个模型在嵌套层级上更丰富”。

未竟之业

一篇论文不可能解决所有问题。嵌套学习作为一个新范式,有几个明显的局限和开放问题。

实验规模的天花板。 目前最大的实验是 1.3B 参数 / 100B token。这与当前前沿模型的规模(数百 B 参数、数 T token)还有数量级的差距。嵌套层级的优势能否在大规模上保持、会不会被简单的"堆更多同质层"反超,需要验证。Hope 的消融实验显示 CMS 比不用 CMS 好 0.8 个百分点(语言建模平均困惑度 12.24 vs 13.04)——这个收益在大规模上是否线性放大、还是会被淹没,是关键未知数。

工程复杂度的代价。 多级嵌套意味着多个优化过程以不同频率运行,这对分布式训练的通信和同步提出了新挑战。论文提到 M3 优化器"因使用多个动量(记忆)相对 Muon 较慢,与 AdaMuon 效率相当"——这是真实的工程成本。M3 在 140M 和 1.3B 模型上的训练时间都比 Muon 长,多级记忆不会免费获得。

嵌套层级的设计空间未被穷举。 论文提出了"增加层级"的原则,但具体设计仍凭直觉。Hope 模块的成功经验能否复用到其他任务(图像、音频、多模态)?层级的最佳数量是多少?每一级应该占据多少参数比例?这些都是开放的设计问题。

与现有基础设施的兼容性。 当前深度学习的工具链(PyTorch 自动微分、CUDA kernel、Triton 内核、分布式框架如 FSDP/Megatron)都是为同质层堆叠设计的。嵌套学习需要不同频率的更新,可能需要新的系统支持——要么改造编译器,要么把同一频率的层打包成"超级层"以兼容现有基础设施。

理论保证的缺失。 论文展示了实验成功和直觉解释,但没有提供收敛性保证或泛化误差界。对于一个声称要"重新定义深度学习"的范式来说,形式化的理论支撑是不可或缺的——为什么多级嵌套一定优于单级?为什么 Hope-3 比 Hope-2 更少遗忘?这些都需要严格的数学证明。

与已有成果的连接尚未打通。 神经网络历史上有大量关于"分层时序记忆"(HTM)、“快速权重编程器”(FWP)、“元学习"的研究。嵌套学习在概念上与它们多有重叠,但论文没有详细比较差异、整合洞见。如果 NL 真是一个统一框架,它应该能把这些历史上的工作收纳进来,而不是另起炉灶。

读者决策指南

哪些团队应该优先关注嵌套学习?

  • 做优化器研究的团队——M3 优化器已经证明了多级嵌套的有效性,值得在更大规模上验证。
  • 做持续学习/终身学习的团队——Hope 的 CTNL 结果是最直接的证据,三级记忆 vs 二级记忆的差异值得深入。
  • 做架构设计的团队——嵌套学习提供了一个新的设计维度(嵌套层级 vs 层数),但加嵌套层级之前,应该先评估工程复杂度的代价。

哪些团队可以再等等?

  • 大模型预训练团队——嵌套学习在 1.3B 规模上有效,但距离数百 B 的训练场景还有验证 gap。在工程复杂度没有被充分解决之前,直接替换现有架构风险较高。
  • 应用层团队——嵌套学习主要影响模型训练和架构,不是推理或部署层的技术。如果你的工作集中在模型服务、finetune 或 prompting,嵌套学习暂时不直接影响你。

尾声:幻觉之后

2012 年 AlexNet 之后的十几年,深度学习从一个实验室方法变成了整个行业的基础设施。但"更深 = 更强"的信念也许一直在遮蔽我们的视线。嵌套学习不是要否定深度学习的成果——它试图回答一个更根本的问题:我们看到的"深度”,到底是真正的深度,还是大量浅层结构的叠加?

如果嵌套层级才是"深度"的本质,那么当前的大部分架构设计——在同级内堆叠更多层——可能是在错误的方向上投入算力。GPT-4、Claude、Gemini 这些模型也许确实"更深",但如果它们的嵌套层级和 GPT-3 一样是 2 级,那么所谓的"深度"增量,更多来自数据规模和参数数量的扩展,而非真正的层级增加。未来的突破也许不来自更大的模型,而来自更聪明的嵌套。

Google 这支团队之前做 Titans 时已经在探索"长期记忆"的概念——加了一个可学习的长期记忆模块,让模型在注意力之外多了一个记忆通道。嵌套学习把这个想法推到了更远的地方:不只是加一个记忆模块,而是把整个模型(包括优化器本身)重新理解为多级嵌套的记忆系统。Titans 是嵌套学习的一次单点实验,NL 是它的理论上位概念。

论文标题中的"幻觉"(illusion)指向一个被集体忽略了几十年的事实:层数不等于深度。一百层同质结构叠在一起,如果只是重复同一个嵌套层级,就等于在原地踏步——台阶很多,海拔没变。

下一个十年,深度学习的研究方向或许会从"如何堆叠更多的层"转向"如何设计更聪明的嵌套"。当那一天到来时,这份技术报告可能会被回溯性地视为一个转折点——和 2012 年的 AlexNet 一样,标志着一种新思维方式的起点。

只是这一次,新思维方式不是"做更深",而是"做更对"。


论文链接:arXiv:2512.24695

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。