ARTICLE SIGNAL

混合大模型计算之谜揭晓:全注意力层如何重塑LLM架构 | AI资讯

深入解读混合线性注意力大模型内部计算机制,揭示注意力前尖峰(PAS)与尖峰间平台(ISP)之谜。全面覆盖LLM架构演进、AI资讯、AI新闻、大模型技术解析,探讨人工智能、AGI未来趋势,助力关注AI变现与chatGPT技术前沿的开发者获取最新AI日报。

type
status
date
slug
summary
tags
category
icon
password
网址
Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。
兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态?
本研究由以 StartLux 为核心的联合团队完成。StartLux 是专注全本地智能解决方案的科技企业,致力于打造可部署于个人终端的高性能人工智能系统。StartLux 携手清华大学、中国科学院大学、香港大学、悉尼大学和哥伦比亚大学的研究者,选择以 Massive Activations(MAs,大值激活)为「探针」,对这一问题展开系统研究。研究覆盖五种 Linear Attention 架构、六种混合配置、五个数据域,以及 12 个公开 HLA LLM 检查点,模型总参数量从 1.2B 横跨至 397B。
• 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus • 论文链接:https://arxiv.org/abs/2608.12149 • Hugging Face:https://huggingface.co/papers/2608.12149 • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA
Full Attention 前一层的「尖峰」
研究者首先汇总所有 Full Attention 层和注意力头接收到的注意力,选取被最多注意力头关注的 token 作为「全局 Attention Sink」,再固定该 token 沿深度追踪其 MAs 。
在 1.3B、12:1 混合比例的 M-A-P 模型上,RetNet、HGRN、GLA、DeltaNet 和 Gated DeltaNet(GDN)五种骨干呈现出一致的规律:在每个 Full Attention 层之前的连续 Linear Attention 区间内,与 Sink 相关的 MAs 总是在 Full Attention 前一层达到局部最大值。作者将这种形态命名为「注意力前尖峰」(Pre-Attention Spikes,PAS)。
五种 Linear Attention 骨干中,MAs 均在 Full Attention 之前形成尖峰。红色虚线为 Full Attention 前一层,绿色虚线为 Full Attention 层。
这一规律随后在五个数据域得到验证,在 Full Attention 前一层恰好取得前置 Linear Attention 区间最大激活值的平均比例达到 99.4%—100%,远高于随机选层时 9.1% 的期望值。
真正反直觉之处在于,尖峰并非 Full Attention 输出的产物,而是在 Full Attention 开始计算之前便已形成。换言之,Full Attention 所在位置对应的结构性印记,已经提前显现在上游残差流中。
从孤立「尖峰」到持续「平台」
当研究者固定模型骨干,只改变 24 层模型中 Full Attention 的数量,对比纯 Linear Attention、24:1、12:1、6:1、3:1 和纯 Full Attention 六种配置时,另一种形态随之浮现。
Full Attention 稀疏时,例如 24:1,PAS 像彼此分离的孤峰。随着 Full Attention 变密,例如 6:1、3:1,两个尖峰之间的 MAs 不再充分衰减,而是穿过中间的 Linear Attention 层保持高位,逐渐托起「尖峰间平台」(Inter-Spike Plateaus,ISP)。
从孤立 PAS 到 ISP 的过渡 —— 随着 Full Attention 变密,尖峰逐渐被平台连接。
定量结果清晰展示了这一趋势。在 1.3B 模型上,当混合比例从 12:1 变为 3:1,RetNet 的尖峰间保留分数从 18.8% 升至 85.4%,HGRN 则从 7.2% 升至 92.5%。全部 20 组相邻密度比较,都呈现 Full Attention 越密、尖峰间保留分数越高的趋势。
混合比例因此不只是一项效率参数,它也在塑造 MAs 沿深度展开的「时间形态」:Full Attention 稀疏时,离群值短暂而局部;变密后,离群值开始在层间驻留,彼此分离的尖峰也由此连成平台。
开源模型验证:振幅会变,节拍不变
上述规律首先来自共享训练配方的受控模型。为检验其广泛性,作者进一步分析了 Kimi Linear、Qwen3.5、Nemotron-H 和 Zamba2 的 12 个公开模型权重,规模从 1.2B 到 397B。不同模型中,均可观察到与 Full Attention 排布相对齐的 MA 组织形态。
跨模型比较中,一个差异格外清楚:层间形态比绝对幅值更加稳定。不同规模的 Qwen3.5 中,尖峰高度并不随参数量单调变化,但 PAS 与 ISP 始终紧随 Full Attention 的排布。Nemotron-H 与 Zamba2 的结果,则将这一规律从 Linear Attention 延伸至状态空间模型(SSM)与 Transformer 的混合架构。不同输入也呈现类似特点:数据域会明显改变峰值高低,但尖峰出现的位置和平台覆盖的区间总体稳定。
公开混合模型中的 MAs 轨迹。
尖峰与平台,在训练早期便已写入
这些规律是训练完成后偶然形成的,还是在预训练早期便开始出现?为观察其演化过程,作者从头训练了 340M 和 1.3B 的 24 层 GDN 模型。
答案出现得很早:340M 模型训练 10 亿 token 后已能观察到 PAS;1.3B 模型在 50 亿 token 时出现较弱前兆,100 亿 token 时形成清晰尖峰,并持续与 Full Attention 的位置对齐。改变 Full Attention 的插入位置,PAS 也随之移动。ISP 同样在训练早期出现,并随着训练推进逐步稳定。
Full Attention 层与 GDN 层的输出门控干预实验
研究者还进行了两组门控干预实验:给 Full Attention 增加逐元素输出门控,以及移除 GDN 原有的输出门控。结果呈现出明显的不对称性:前者显著压低 PAS 和 ISP 的绝对幅值,却不消除其层间组织;后者仅带来温和放大。
这组结果表明,Full Attention 的排布是 MA 动力学的主要「组织者」,GDN 门控则更多调节离群值的传播幅度。门控可以压低尖峰,却没有改变尖峰出现的层间节奏。
「写入 — 汇聚 — 消除」:
一个贯穿 PAS 与 ISP 的生命周期
研究者在一个 1.3B、12:1 的 GDN 模型中,固定同一个 Sink token 与特征维度,追踪第 12 层 Full Attention 边界前后的残差流变化。系统性离群值分析显示,PAS 对应一个紧凑的三阶段过程:
• 写入(write)——Full Attention 的前一层在该 token— 特征坐标上形成极端值,为整个事件提供起点。 • 汇聚(sink)—— 进入 Full Attention 后,承载该离群值的 token 从后续 query 获得不成比例的注意力,成为 Attention Sink。 • 消除(cancel)—— 同一坐标随后出现符号相反的大幅更新,显著抵消此前写入的离群值,PAS 随之快速回落。
作者将其概括为「写入 — 汇聚 — 消除」(write—sink—cancel)。在 PAS 中,三个阶段集中发生在 Full Attention 边界附近,于是激活曲线上留下一个短促而尖锐的峰。
PAS 对应一次局部的 write—sink—cancel 过程——三步在相邻两层内连续完成。
ISP 的持续形态,则与同一生命周期中的「延迟消除」相一致:极端值形成后,符号相反的抵消更新没有立即到来,而是被推迟到更深的层。离群值因此得以穿过多个 Linear Attention 层持续存在,形成连接相邻 PAS 的平台。
ISP 对应 write—sink—cancel 生命周期中的延迟消除状态 —— 消除被推迟,MAs 穿过多层 Linear Attention 持续存在。
由此,PAS 与 ISP 可以被纳入同一个由消除时机组织的解释框架:局部、快速的消除形成 PAS,更晚发生的消除则让大值激活延伸为 ISP。随着 Full Attention 变得密集,尖峰之间的低谷逐渐被平台填平;到纯 Full Attention 的极限,尖峰与平台的区分消失,最终恢复为传统 Transformer 中横跨大部分中间层的稳定 MA 形态。
稀疏 Full Attention 配置中的局部 PAS → 密集配置中由 ISP 连接的 PAS → 纯 Full Attention 模型中的稳定 MAs
三者由此构成一条连续的形态谱系,为理解 PAS 与 ISP 提供了机制解释。
为混合架构绘制一张内部计算地图
这项研究为理解混合线性注意力大模型的内部计算提供了一张新的地图:混合比例远非一张效率配方 —— 多少层使用 Linear Attention、隔多久插入一次 Full Attention,也在组织模型内部计算的「节奏」。
Full Attention 的位置对应 MAs 在哪里形成尖峰,其密度影响离群值能够在层间保持多久;Linear Attention 的具体状态更新机制,则进一步调节 ISP 从何时开始出现。少数 Full Attention 层并非只在轮到自身时才发挥作用,它们与前后多个层中的离群值写入、传播和消除联系在一起。
离散分布的 Full Attention 会沿模型深度留下有规律的跨层痕迹;PAS、ISP 与传统 Full Attention 模型中的持续 MAs,也由此汇入同一条形态演化路径。对这条路径的理解,不仅为 Full Attention 的插入位置、混合密度和门控方式等架构选择提供了新的观察维度,也可能为模型压缩与量化带来线索:针对极端激活集中出现的层和架构边界,或许可以采用更具位置感知能力的处理策略。
文章来自于"机器之心",作者 "机器之心"。
Loading...

没有找到文章