大模型真的存在不可告人的技术壁垒吗?前不久从OpenAI空降腾讯的姚顺雨曾直言“做大模型其实并没有什么秘密”。起初外界以为这只是一句玩笑,但在腾讯混元4(Hy4preview)近期交出答卷后,这句话的含金量彻底显现。
面对智谱、月之暗面、DeepSeek以及千问等强敌环伺的竞争格局,腾讯在短短四个月内完成了混元大语言与多模态部门的重组,并推出了770B参数规模、支持百万上下文的混元4。细究其技术配置会发现,大模型所谓的独家秘笈,早已在开源机制与顶尖人才的高速流动下被彻底解构。

从底层骨架来看,混元4在700B这一中大规模档位上,直接对齐了国内此前由智谱GLM-5(744B)跑通并立住口碑的工程最优解。其主干网络的隐藏维度为6144、78层、64个注意力头,这些参数决定了Transformer网络在深度、宽度和注意力并行结构上的统一选择。对于急需突围的腾讯而言,站在前人验证过的共识底座上,避免了重复踩坑。
在核心技术沿路迁移上,混元4的注意力模块巧妙融合了多方开源成果。其主干借鉴了DeepSeek在V3.2中开源的稀疏注意力机制(DSA),通过轻量级索引器在超长上下文中筛选Top-K Token,从而避免遍历全部历史。随后,它又吸收了智谱团队在IndexCache中验证的跨层索引复用机制,允许相邻Transformer层直接复用已有索引结果,最高可砍掉75%的索引器计算量,实现端到端性能提速。此外,在残差侧优化上,混元4放弃了复杂的mHC,转而采用了源自微软研究员谢天在社交平台上公开讨论的恒等超连接(iHC)方案。
技术接力的背后,是顶尖人才的深度流动。清华姚班毕业、曾担任智谱GLM-5新模型架构及DSA负责人白雨石,已于数月前正式加入腾讯混元团队,并出现在混元长上下文稀疏注意力论文的作者栏中。正是在这些天才研究员的推动下,隐性工程经验完成了从一家企业到另一家企业的物理迁徙。
如今,任何能够通过论文、代码和实验数据表达出来的技术优势,其独占期都在急剧缩短。从顶会论文到开源代码,再到社区热议的讨论帖,前沿架构的传播路径已彻底扁平化,大模型的行业护城河正被开源生态与人才流动迅速填平。