一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

将思考折叠入序列:WeLM 617B MoE的隐式Scaling路径

时间:2026-07-24 17:34:50 编辑:袖梨 来源:一聚教程网


新智元报道


大模型变强,过去靠两条路。

做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。

想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。

问题是,除了Scaling参数和思维链之外,到底有没有第三条路?


微信WeLM团队给了一个全新的答案——

把额外算力折叠进序列内部,让模型在token之间完成隐式思考。输出不变长,每个token想得更深。

这套方法叫Hidden Decoding,隐式序列缩放。

而WeLM做到的关键一步,是把它推到了前沿规模。

从3月的80B参数,到现在的617B MoE,不仅增量续训只用了完整训练量的5.3%,而且9个评测全部超越自回归基线。


把思考折叠进序列

WeLM 617B MoE的隐式Scaling路径

7月14日,微信WeLM团队放出了Hidden Decoding系列的第二篇博客,并首次展示了一个新模型的进展:一个总参数617B、评估表现达到开源头部水平的模型。


博客地址:https://welm.weixin.qq.com/posts/hidden_decoding_at_scale/

这并非该系列的首度发声。

今年3月2日,WeLM 团队就发表了系列的第一篇博客,彼时Hidden Decoding还是一套相对朴素的早期实现,只在80B规模上跑通了初步验证。

四个月过去,新博客不仅把方法做扎实,更第一次展示了将该方案上推到600B+模型的效果。

这篇博客的核心,是介绍Hidden Decoding如何被推进到100B+ MoE的前沿规模——

把每个token在序列维度上展开成多条并行的「流」,让同一套Transformer权重在一次前向传播里完成多步隐式推理,而只在最后一条流上计算损失。

换句话说,模型在落笔写下下一个token之前,先在自己的序列内部折叠进了一段不为人见的思考。

如果说过去一年大模型的两条主线是「把参数做大」和「把思维链做长」,Hidden Decoding展示的是第三条路:在不动参数的前提下,把额外算力藏进序列本身,让推理在模型内部多走几步。

参数与思维链之后,第三条路指向隐式序列

过去一年,大模型社区的努力可以粗略分成两条线。

一条是把模型本身做大,总参数冲到万亿、激活参数冲到30B以上;另一条是在后训练阶段堆算力,靠强化学习和更长的思维链把推理能力「逼」出来。

随着o1、DeepSeek-R1以及一众「思考模型」的走红,这后一条路线几乎成了默认叙事。

但两条线共享同一个隐含前提,都需要「更多」。更多参数、更多高质量推理数据。

Hidden Decoding的提出,恰好绕开了这个前提。它不在数据侧做文章,而是回到预训练与继续预训练阶段,问了一个更朴素的问题——

同一套权重、同一批数据,能不能通过更聪明的算力组织方式,逼出更多能力?

这条路并非没人走过。

循环模型、各类「在序列维度做扩展」的尝试,都属于同一种思路。让同一套权重在一次前向里多走几步。

卡点也很清楚。循环模型串行不可并行,序列扩展又容易让注意力按序列长度的平方膨胀,在大模型上训不动、也用不起。

因此相关讨论虽多,真正在前沿规模跑通的却很少。WeLM这篇博客文章,正是要把这条被绕开的路,在100B+ MoE的体量上重新打通。


先认识一下WeLM:微信大模型的四代演进

WeLM是微信AI团队持续研发的通用大语言模型系列,承载着微信在大模型时代的核心技术战略,也是微信参与前沿人工智能竞争最为关键的技术底座。

从2024年首次公开亮相至今,WeLM已连续迭代四代。

虽然团队过往对外发声始终秉持审慎的态度,但从近期集中发布的技术博客来看,其已清晰勾勒出一条技术演进路线——

从V3时代的训练体系搭建,到V4时代的效率与质量创新,再到600B级模型的Scaling突破与Hidden Decoding的推理范式创新。

这标志着WeLM已形成覆盖预训练、后训练和推理优化的完整技术版图。

更重要的是,WeLM绝非止步于论文指标与实验室评测的试验性模型。

当前已进入灰度测试阶段的微信AI助手「小微」,其核心模型能力由WeLM提供。依托微信这一拥有超大规模用户基数的国民级产品生态,WeLM已成功进入由真实用户、真实流量与真实复杂任务所构成的终极试炼场。

从这次Hidden Decoding系列技术博客的发布中,我们可以窥见WeLM团队将前沿模型技术和规模化应用实践相结合的思考。

Hidden Decoding:把思考折叠进序列

Hidden Decoding的做法,可以概括为三步:

给定输入序列和n份词表嵌入,把第i个token的第k条「流」表征放在物理位置(i−1)n+k上,构成长度为nL的扩展序列;

扩展序列在标准因果注意力和连续的位置编码下,送进同一个Transformer,不新增任何主干参数;

训练时只在每个token的最后一条流上计算下一个token的预测损失,前n−1条流不接收任何直接监督。

换句话说,前面的流像是给最后一流「打草稿」——逐步精炼表征、保留更宽的候选集合,等最后一流再收敛到最终预测。


Hidden Decoding vs Loop Latent Computation

此前,团队已经在6B、8B、80B上验证了这套方法的损失下降与评测提升。这次的目标,是把它推进到真正的前沿规模。

关键工程:让扩展在100B+体量上可训

把序列从L拉到nL,非注意力计算大致线性增长,但稠密注意力会按序列长度的平方膨胀。

以n=4为例就是16倍,对长序列的大模型,这直接不可训。

团队的解法叫Stream-Factorized Attention:让大多数层只在同一条流内部做注意力,只让少数层做跨流混合。

流内注意力层:只关注同一条流中更早的位置;

跨流注意力层:额外跨流关注,沿用基座原本的注意力形态,滑动窗口或全注意力。


关键在于,团队不新增注意力层,而是对基座里已有的局部注意力层和一小部分全注意力层启用跨流功能。

这样就把新增的注意力成本从n的平方量级压到了接近线性的n倍。而这也是Hidden Decoding能在100B+稀疏模型上落地的核心。

此外,团队还利用了WeLM主干的一项既有设计KV-mirror来进一步加速。也就是,后段三分之一的层复用前段三分之一层的隐状态来构造键值缓存。

由于镜像层的键值只依赖早期层的隐状态,而只有最后一条流被监督、中间流只通过它们贡献的键值起作用,团队只让最后一条流通过镜像层,前段仍处理全部n条流。

在80B、32k训练设置下,这把单步时间从15秒降到12秒,约两成的提升,叠加在流因子化注意力已提供的近线性成本之上。

结果:全面超越基线

团队对每个基座比较两种形态,除Hidden Decoding外一切相同。随后用同一套短指令微调配方适配,不涉及强化学习。

结果显示,Hidden Decoding在两个规模上都实现了全面的提升。

其中,80B平均提升约0.99个百分点、在617B上提升约1.03个百分点,较大的提升出现在SuperGPQA、MMLU-Pro等更难的推理与知识任务上。


成本:近线性的训练开销,

且无需重跑完整预训练

这样一套方法,训练成本到底如何?实测数据给出了明确答案。

n=4时,有效序列在80B上花费5.1×单batch时间、在617B上花费4.4×,接近n=4的线性参考,远低于稠密注意力的16×膨胀。


更关键的是,Hidden Decoding并非从零训练,而是在已有自回归基座checkpoint上做增量续训(CPT)。


推理吞吐:并行计算,小batch下反而有优势

相比循环模型,Hidden Decoding的额外计算是并行的。

循环模型逐步重复主干,每步都要等上一步,额外成本无法隐藏;Hidden Decoding把计算摊到n条stream上,一次前向并行处理。

实测吞吐矩阵显示:

大batch下,解码受计算限制,额外计算会降低吞吐(所有增加计算的方法都如此);

小batch下,解码受显存带宽限制,计算大量闲置,并行stream恰好利用这些空闲算力,相对基线损失更小。


这意味着在实际在线服务场景中,Hidden Decoding的推理成本并非简单的线性增长,而是与batch size和序列长度分布强相关。

探针:折叠进去的思考,究竟在算什么

Hidden Decoding依赖一个反直觉的选择:只训练最后一条流,前面的流零监督。

主结果说明这能提升准确率,但收益到底来自「更长的序列」「更多的预测目标」,还是「中间流真的在做某种精炼」?

注意力组合消融中,团队比较了三种配置:27层全跨流、4层、1层。

所有变体都大幅超过自回归基线,全跨流最好,但只用1层或4层全注意力的变体恢复了大部分收益。少数几层跨流就足够了,这让流因子化注意力能在保住准确率的同时保持廉价。

键值缓存保留的消融则表明,为不同流保留独立状态优于共享状态,两种布局下平均分都小幅下降,说明独立的中间状态确有帮助。

最有趣的是流与语言模型头的探针实验。在8B基座加Hidden Decoding(n=8)上,团队观察到两点:

其一,同一token的各流在Transformer中间层显著分化、临近输出层又部分靠拢,且最终流对其他流分配了可观的注意力,构成从中间流到预测流的读取通路;


其二,把共享的输出头施加到各流时,中间流的最优预测常与最终流不同,最大差异率约63%,且其不确定性普遍高于最终流——说明在最终预测收敛前,中间流保留了更宽的候选分布。


综合起来,消融与探针指向同一解释:中间流在最终流收敛到预测之前,保留并精炼着一个更宽的候选集合。

研究团队认为,这正是「把前面的流用作潜空间计算状态」的含义,也是Hidden Decoding区别于简单「加长序列」或「多目标预测」的关键。

展望:更强的基座,

以及与强化学习的结合

博客最后透露了一点后续进展。

在采用更高质量、更大规模的数据做后训练后,80B与617B的自回归基座已经展现出显著更高的基准成绩与更稳定的使用体验。

这组数据说明,WeLM的自回归基座本身就已经很有竞争力,而Hidden Decoding是在这个扎实基座之上的进一步增益。

研究团队表示,接下来他们会在这套更强的基线上继续验证Hidden Decoding的增益,并将其与强化学习充分结合。


回顾WeLM团队近期公开的技术博客,可以看到一条逐渐清晰、前后呼应的技术路线。

《以适度资源构建高效稀疏MoE模型》探索了如何以更稀疏、更高效的模型获得有竞争力的能力,在同等智能下压低资源消耗。

Hidden Decoding 系列则从创新的推理范式入手,在同等模型参数下继续上推智能上限。

前者让智能服务得起更多用户,后者让有限资源解决更难的问题。

沿着两个方向回看,这系列博客并非彼此孤立的技术尝试,而是一套围绕资源效率展开的系统性探索,也呼应了团队博客首页「极致的资源效率」的命题。


对于需要面对超大规模真实用户与复杂任务的微信团队而言,极致的资源效率不是智能增长的约束,或许恰恰是通往更高智能的另一条路径。

博客原文:

https://welm.weixin.qq.com/posts/hidden_decoding_at_scale/

首篇播客:

https://welm.weixin.qq.com/posts/hidden_decoding/

论文PDF:

https://arxiv.org/abs/2607.08186

GitHub仓库:

https://github.com/Tencent/Sequential-Hidden-Decoding

编辑:摩西 大卫

热门栏目