PTT
Submit
Submit
选择语言
正體中文
简体中文
PTT
MobileComm
[新闻] Snapdragon 8 Elite Gen 6的Hexagon NPU
楼主:
takeshi911
(L.Lawlite)
2026-09-11 17:53:54
1.原文连结:https://reurl.cc/vGK9V1
2.原文标题: Snapdragon 8 Elite Gen 6的Hexagon NPU为代理AI与专家混合
模型而生,新增Element加速器与更大共享快取
3.原文来源(媒体/作者):Cool3c/Chevelle.fu
4.原文内容:
高通继为即将在9月下旬于Snapdragon高峰会公布的Snapdragon 8 Elite Gen 6抢先预览
CPU、GPU的特色后,再针对新一代Hexagon NPU进行预览解密;Snapdragon 8 Elite Gen
6的Hexagon NPU将是为代理式AI与专家混合模型而生,加入Element加速器、进一步增加
共享快取与支援广泛的精度,提供自预填充、推论到输出更迅捷、低延迟的代理AI体验。
AI运算需求从单一推论转化为持续、多模、低延迟
高通提到,随着代理式AI成为继生成式AI后的新趋势,AI的运算需求也从原本聚焦在执行
单一模型、追求推论速度转化为需要具备持续、多模态及低延迟,也成为高通在规划新一
代Hexagon NPU的重点;具体而言,高通全新Hexagon NPU聚焦在两个重点:Element加速
器与增加50%容量的共享快取。
为代理式AI执行设计的Element加速器
Element是因应新一代生成式与代理式AI所设计的加速器,结合纯量、向量与矩阵扩展,
可加速大型模型最重要的运算,使代理式AI可更快的反应、更有效率的推论,进而在不影
响续航力的前提提供丰富的代理体验。
更大的共享快取减少频繁的资料传输
新一代Hexagon NPU也将共享快取容量提升50%,借由更大的内存系统容纳更多模型状态
、启动质与中间张量,减少资料需要频繁传输到外部的DDR内存的情况,可以减少记忆
体瓶颈,加速AI执行速度与响应,也能降低资料频繁传输的能耗。
因应代理式AI负载需求的设计
代理式AI的效能关键在于维持代理式AI执行多个任务时仍可维持响应迅速、上下文相关与
高效率运作,新一代Hexagon NPU借助添加上述两项特色,使得在进行AI、长上下文推论
、多模态模型具有更出色的持续性能,并带来低延迟。
更大的快取能使NPU把资料尽可能保持在近端,可协助代理式AI更快完成响应、修正、规
划与行动,带来更丰富的上下文视窗、更快的Token输出与多工具、多任务的代理式AI转
换。Element加速器则提升生成式与代理式AI最关键的转换器操作效能,透过项量扩展加
速高吞吐量AI数学运算与纯量扩展,支援代理最关键的决策逻辑、路由与编排。
藉更低内存频宽执行更大的模型
新一代Hexagon NPU也放眼下一代模型架构,高通携手领先的内存与模型供应商合作,
将基于MoE专家混合模型的新一代装置端AI架构整合至Hexagon NPU,加载一个30B参数的
MoE模型时,在NPU输出Token阶段仅需动用3B的参数。
MoE模型与密集模型不同,MoE会透过动态方式从混合模型中选择任务对应的专家模型,进
而使运算资源与内存频宽需求降低;在整合智慧的快闪存储器及内存专家管理与快取
技术,专家混合模型能够以低功耗、低内存需求时现更广泛全面的AI体验,并提供手机
快速回应、安全的产生高品质的AI代理。
支援广泛精度及提升预填充
为了应对专家混合模型需求及降低对内存频宽需求,新一代Hexagon NPU具体的作法是
支援更广泛的精度,提供自INT2、INT4、INT8、FP8至FP16的支援,开发者可灵活的在效
能、内存、模型品质与功耗之间选择合宜的格式与模型规模。
此外对于影响响应最关键的预填充,新一代Hexagon NPU在INT4模型提高50%的预填充性能
,并具备更快的解码吞吐、更强的预测性解码能力及更高的每秒Token,最终提供即时、
流畅的装置端AI体验。
与CPU及GPU异构运算同样重要
虽然Hexagon NPU的目的是高效率的尽可能执行所有阶段的AI任务,不过现行的AI负载仍
须仰赖异构运算,其中任务于核心之间移动的智慧路由、编排与资料可用性需要透过CPU
,而GPU也同样在现代图形运算纳入特定的AI运算需求。
Snapdragon 8 Elite Gen 6引入超越5GHz时脉的下一代Oryon CPU及Oryon Flex Cache快
取架构,协助在AI任务编排的CPU负载更高效的完成;而全新Adreno GPU亦纳入神经网络
加速架构,于图像处理阶段自管线进行AI增强处理,带来更出色的视觉体验。
5.心得/评论:
新一代Hexagon NPU凭借快取与加速器升级,完美解答代理式AI的低延迟与高算力需求。
作者: Hohenzollern
2026-09-11 22:05:00
高通S8 Elite Gen6芯片多核CPU应该赢过苹果A20 Pro芯片三大芯片厂牌 高通最后发表产品压力最大苹果CPU单核和联发科GPU比不上 高通只能极限压榨多核CPU跑分
作者:
shengshampoo
(Sheng Shampoo)
2026-09-12 11:29:00
不懂就问,板上乡民版友怎么用AI?聊天机器问问?会应用到AI agent 融入整合工作流?边缘运算场景,乡民版友的等级会怎么做?
继续阅读
[讨论] i18pro各电商预购优惠比较
aa98403
Re: [问题] iPhone Duo 最后会跟Air一样后继无力吗
deann
[问题] iPhone Duo 最后会跟Air一样后继无力吗
xz4979265
Re: [讨论] iPhone Duo后发先至fold不断退步
asahi98
Re: [讨论] 搞得好像折叠手机第一次发明?
neil136
[问题] Sony 10 viii 比 1 viii 有质感
senma
Re: [问题] 安卓后来怎么舍弃全面屏的
AUQ
[讨论] 钟文泽 苹果新品各颜色推荐
oopsskimo
Re: [问题] 为什么1999美金兑换台币74900
yokann
Re: [问题] 为什么1999美金兑换台币74900
xross
Links
booklink
Contact Us: admin [ a t ] ucptt.com