近日,ARM举办边缘AI专场媒体沟通会,ARM边缘AI执行副总裁Chris Bergey、ARM边缘AI智能终端计算副总裁James McNiven深度解读了ARM在边缘AI领域的核心技术布局、产品迭代逻辑、成本优化方案、终端体验升级路径以及生态合作规划,全方位展示了ARM针对终端边缘AI、神经图形计算的技术创新与未来发展方向。
Arm 边缘 AI 执行副总裁 Chris Bergey(左)
Arm 边缘 AI 智能终端计算副总裁 James McNiven(右)
异构算力架构革新 实现算力、精度与能效协同最优
针对终端设备多元化、差异化的AI计算负载,ARM打造了全新分层异构算力体系,通过精准的任务拆分与统一调度机制,实现运算精度、处理性能与设备能效的多维平衡。
在精度适配层面,ARM专用神经网络加速器专注INT8、INT16轻量化运算,高效适配神经超级采样等主流终端AI场景,在保障基础画质与运算精度的前提下,最大化释放终端能效优势。对于精度要求更高的FP16浮点运算,ARM将其交由执行引擎标准着色器核心承载,不占用专属AI加速算力,避免算力资源闲置浪费,实现专用AI加速与通用计算的高效协同。
在整体算力部署上,ARM采用多引擎分布式AI加速架构,让不同硬件单元各司其职、互补增效。其中,集成于GPU内的神经网络加速器可共享各级缓存资源,专项优化神经图形类负载,实现图形AI任务的低延迟并行处理。全新C2 CPU集群可搭载两组SME2单元,依托成熟CPU指令集完成AI加速运算,具备响应迅速、超低延迟的显著特点。
区别于传统终端依赖独立NPU的单一算力模式,ARM异构架构可联动CPU安全体系与GPU图形渲染管线,完成全域算力统一调度。同时,ARM开放硬件生态,支持合作伙伴自研集成专用NPU,灵活适配各类垂直化、定制化AI场景,全面提升终端整机运行效率。
基于这套先进异构架构,ARM同步实现了性能升级与成本优化,有效对冲当下行业存储、晶圆成本持续上涨的压力。公司将AI模型轻量化作为核心突破口,通过精简模型结构、优化运算逻辑,大幅降低终端内存与存储资源消耗。
目前,ARM已与阿里巴巴通义千问达成深度合作,在SME2单元成功落地2-bit量化模型,在保障核心性能不变的前提下,实现了设备性能、硬件成本与运行能效的精准平衡。与此同时,GPU神经网络处理能力的加持,可有效分流系统运算压力,进一步提升终端在有限硬件规格下的AI算力释放效率。
让技术优势转化为沉浸式用户体验
ARM持续迭代终端核心架构,稳步夯实硬件算力底座。相较于上代Cortex-X925架构,全新C1-Ultra架构实现IPC两位数增长与主频提升,整机综合性能最高提升20%。由于性能增益主要集中在AI运算、大型游戏等高负载场景,用户日常轻量使用时难以感知明显差异。
未来,ARM将延续每年两位数的性能迭代节奏,后续C2-Ultra及新一代架构将跳出传统参数竞赛,聚焦用户可直观感知的体验升级,重点优化AI运算效率、应用启动速度、系统交互流畅度等核心体验指标。
为将硬件算力优势充分落地,ARM持续深耕全域软硬件生态,大幅降低终端AI开发门槛。软件层面,ARM积极推动主流AI框架适配SME2单元,联动安卓生态优化终端算力调度逻辑。
依托Kleidi软件库与ExecuTorch抽象化框架,终端设备可实现算力智能适配,根据自身硬件配置,自动调用SME2专属AI算力或通用运算能力,具备极强的设备兼容性。
相较于传统独立NPU碎片化、专属化的开发模式,SME2沿用通用CPU编程逻辑,开发者无需适配全新开发模型,通过常规CPU指令即可调用矩阵运算能力,兼顾开发便捷性与运算低延迟。同时,GPU端AI加速器基于Vulkan工作流开发,为开发者提供多元灵活的算力选型方案,显著提升AI应用的开发与落地效率。
在图形生态落地领域,ARM携手腾讯游戏、Unity中国等行业头部合作伙伴,落地神经超级采样、神经帧率提升、神经纹理压缩等前沿神经图形技术,能够在完全保留原生画质的基础上,精简资源占用、释放终端硬件潜能。
由Sumo Digital开发、ARM提供核心神经图形技术支持的游戏《光影新生》已完成主体制作,目前正针对ARM全新芯片平台开展30至60天的适配调试与稳定性验证,优化完成后将正式公布上线时间,为玩家带来极致沉浸式AI图形游戏体验。
拓宽边缘AI落地应用边界
针对移动端AI智能体长期后台运行引发的高功耗、高内存占用痛点,ARM通过精细化任务调度与双场景运行机制,完美平衡终端性能与续航表现。终端AI智能体无需全程高强度不间断运算,通过周期性触发、按需调度的轻量化运行模式,即可完整实现核心功能,大幅降低系统资源消耗。
在此基础上,ARM区分电池供电与充电供电两大场景,搭建差异化算力运行逻辑,日常移动使用阶段,通过精细化线程管控保障智能体低功耗稳定运行。设备充电状态下,集中完成KV缓存优化、上下文预处理、词元生成等高负载任务。通过场景化算力分流,有效缓解移动端续航压力,支撑AI智能体长效稳定运行。
依托成熟的算力与功耗优化技术,ARM持续拓宽边缘AI应用边界,业务已全面覆盖手机、PC、机器人、物理AI等多元终端赛道,并通过定制化计算子系统(CSS)完成全域产品布局。
ARM技术迭代始终以市场真实需求为核心导向,形成“通用技术复用、场景需求定制”的成熟发展模式。一方面,复用经过市场验证的成熟IP与架构技术,将移动端优质方案快速落地至PC等新兴场景,保障技术迭代高效稳定;另一方面,针对PC、机器人等赛道的专属需求,研发搭载高端安全算力、定制化功能模块的全新计算子系统,精准适配各类垂直边缘AI应用,满足不同终端的差异化算力需求。
神经图形技术持续进阶
在前沿神经图形领域,ARM移动端技术与桌面端高端帧生成技术底层原理同源,具备成熟的实时画面优化能力。其搭载的NFRU神经帧率提升技术可实现游戏帧率翻倍,搭配NSS神经超分辨率技术,全方位提升移动端游戏的流畅度与画面清晰度。
基于移动端设备的能效约束特性,ARM图形模型架构更精简、能效表现更优异,同时已明确多帧生成技术迭代规划,持续缩小移动端与桌面端的图形渲染体验差距。未来,ARM还将重点布局全局光照、辐射缓存等高端图形技术,持续拉高移动端实时渲染的画质上限。
生态建设层面,ARM坚持开放协作的核心发展思路,打破行业技术壁垒。通过全面开放模型权重资源与配套开发工具,支持开发者依托Hugging Face快速开展技术研发与场景落地。
开源开放的发展模式有效激活了全行业创新活力,加速边缘AI与神经图形技术的全域普及,推动终端AI产业形成共建、共享、共赢的良性发展格局。
