今天凌晨的骁龙峰会,高通一口气发布了两款旗舰芯片——第六代骁龙8超级至尊版和第六代骁龙8至尊版。这是高通首次双旗舰策略,区别在于上限拉到多高。超级至尊版是顶配中的顶配,堆料最足,给那些追求极限性能的旗舰机型用。至尊版则是把大部分核心体验保留下来,覆盖更广泛的旗舰产品线。

高通手机业务总经理Chris Patrick的原话是:“为OEM厂商提供更丰富的选择。”目前确认首批搭载的厂商名单,包括但不限于小米、vivo、OPPO、一加、iQOO、荣耀、红魔……小米18 Pro系列今日首发登场。

不过,这次峰会最核心的技术看点是高通拉上了三家伙伴——阶跃星辰、无量火、江波龙,把阶跃的StepEdge-Omni 30B-MoE模型完整部署到了超级至尊版平台上。
300亿参数MoE模型是个什么概念?以前手机上跑的端侧AI,大多是几亿到几十亿参数的小模型,能干的事情很有限。而300亿参数差不多是你现在用的云端大模型的十分之一到五分之一。这个量级的模型,理解能力、推理能力、上下文长度,都不是一个档次的。
MoE架构的妙处就在于不是每次推理都把300亿参数全部激活,而是根据任务只调用相关的“专家”模块。 就像你遇到数学题找数学老师,遇到作文题找语文老师,不用把全校老师都叫过来。

所以虽然模型总参数是300亿,但实际跑起来每次只激活其中一小部分,内存和算力压力都小了很多。无量火的Ember推理引擎又在这个基础上做了优化,运行内存需求比行业常规方案降低了一半以上。江波龙则从存储端下手,让模型权重可以从闪存里高效加载,不用一直占着运行内存。
高通给出的数据显示,模型预填充吞吐超过330 Token/s,比只用NPU的方案快了30%以上,解码吞吐超过28 Token/s。现场还演示了具体场景,从理解一封邮件,到帮你规划行程、同步日历、推荐航班酒店、生成行程分享,最后草拟一封回复邮件,一整套流程,全在手机上完成。这就是高通说的“智能体AI”。
参数背后,再说说硬件本身的升级。两款平台都用了2nm工艺。从3nm到2nm,最直接的好处就是能效提升,同样的性能,功耗更低;同样的功耗,性能更强。

CPU方面,定制的Oryon CPU峰值频率到了5GHz。配合全新的FlexCache可扩展缓存架构,多任务处理和系统规划能力更强。GPU这边,Adreno引入了Matrix Cores和Neural Fusion技术。把AI处理和图形渲染融合到一起了,不需要单独走NPU,GPU自己就能干,效率更高,延迟更低。
Hexagon NPU加了全新的Element Accelerator,专门为Transformer工作负载设计,共享内存容量扩大了50%。大模型可以更自如地跑在NPU上。
如此大的提升,除了常规的性能升级外,更重要的是为了手机端侧AI。为什么要花这么大力气在端侧AI上?第一是隐私,端侧跑意味着数据不出手机。第二是延迟,端侧毫秒级响应,不用每一步都等云端返回。第三是离线可用,飞机上、地下室、信号不好的地方,端侧AI照样能干活。

这样一来也可以让端侧AI和云端AI更好协作。 简单的、隐私敏感的、需要快速响应的任务,在手机本地跑;复杂的、需要深度推理的,还是交给云端。
这次骁龙峰会,高通传递的信号很明确:AI智能体已经成为移动端的下一个竞争维度。从今天发布的两款芯片来看,高通在硬件层面已经把基础打好了——2nm工艺、5GHz CPU、扩容50%的NPU内存、MoE模型的端侧部署。剩下的,就是看各家手机厂商怎么在这个基础上做出真正好用的智能体体验。真正的好戏,才刚刚开始。


