智能体时代的移动计算,Arm 通过一场大会给出自己的答案
文 / 小亚
2026-09-11 23:39:06
来源:亚汇网
感谢亚汇网网友9月8日,Arm在上海举办年度旗舰活动ArmEverywhereChina,并在会上发布了第二代移动终端计算子系统CSSforMobile2。这是一个面向智能体AI与AI原生图形的计算平台,集成了ArmC2CPU集群、MaliG2-UltraNXGPU以及SIL2系统互连,同时将系统IP、软件和开发者工具整合为完整平台。如果只看新计算平台的命名,CSSforMobile2看起来就是一次常规的更新迭代。但听完整场发布、又在采访中和Arm高管们聊过技术细节后,小编对于这次的新平台又有了新的认知。CSSforMobile2每一项技术细节的升级,Arm其实都在回答一个更根本的问题:当AI从问答助手进化成能理解意图、规划任务、替用户干活的智能体,手机里的计算平台该长什么样。Arm的判断是,移动设备的性能取决于三个核心维度——各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度。CSSforMobile2据此从系统层面统筹优化,并把优化延伸到物理实现阶段,让合作伙伴在SoC集成之前就能把功耗、性能和面积与架构设计放在一起考量。组件上保留了弹性,可整套采用,也可与自研或第三方IP组合。这背后其实是ArmCSS一贯的思路:把底层计算技术做成集成化、经过验证、可灵活配置的计算基础。换句话说,合作伙伴不必再把大量时间和工程资源耗在底层技术的整合上,而是可以站在CSS之上,把资源投向真正能形成差异化的地方——自己的加速器、内存架构、互连技术、系统技术和软件能力,针对自己的目标市场和工作负载打造定制化芯片。底层少走了弯路,开发进程更快、复杂性更低,差异化创新自然能更快推向市场,同时还能充分借力Arm生态系统的优势。下面我们具体来看。C2CPU集群:双SME2与编排引擎如今,智能体不再只是执行推理,还要保持上下文、运行应用、协调不同模型与服务,并在用户授权下自主完成任务,而这一切都得装进手机的功耗和散热约束里。手机里的计算任务,从“回答一个问题”变成了“独立跑完一整套流程”。Arm认为,在这条流程中,CPU被重新定义为系统的编排引擎,负责维护上下文、调度负载、协调任务。新的C2CPU集群由Arm迄今最强的移动CPUC2-Ultra、面向能效的C2-Pro和双SME2引擎组成。全新CPU集群在面对最新AI模型性能最高提升1.7倍,单线程性能提升15%,相同性能下功耗最多降低38%。进一步来看,在跑Moonshine和Parakeet语音转文本模型时,C2-Ultra比上一代C1-Ultra延迟降低40%,直接缩短智能体“开口回应”前的等待;记忆阶段的内存检索性能提升41%,推理阶段小语言模型生成指令的平均速度提升25%。端到端算总账,整条工作流性能提升24%。这里需要解释一下的是,上面的15%来自GeekBench6.3这类通用基准,1.7倍对应特定AI模型上的矩阵运算吞吐,功臣是SME2——这一代把SME2引擎从一颗增加到两颗,矩阵算力翻倍,才有这个量级的跃升。此外,这一代平台还可以支持2nm等更前沿的工艺节点,合作伙伴也可以在更先进工艺上部署更多SME2单元,为未来留出进一步的性能空间。看到这,可能有朋友会好奇,这几年手机厂商都在卷NPU的TOPS,智能体时代到来后,竞争中心是不是又回到了CPU和内存系统?在采访中,也有媒体问了这个问题。对此Arm边缘AICPU产品管理总监DanielLu的回答是,过去十年行业对不同负载的侧重一直随计算需求演进,永远在为不同设备和场景寻找最合适的算力平衡点。当前旗舰NPU算力约100到200TOPS,搭载SME的CPU集群等效算力约5到6TOPS,计算密度极高的负载更适合交给GPU或NPU,CPU的战场是那些装得进本地算力预算的小语言模型。他特别强调CPU看重延迟而非峰值,一味追峰值反而可能拖累延迟。此外,为了应对端侧普遍存在的内存密集型瓶颈,C2CPU集群采用了差异化的拓扑架构,私有L2缓存加上大容量共享L3缓存,通过两级缓存的容量优势减少访问DRAM的频次。DanielLu坦言,端侧内存密集型的问题其实比计算密集型更严峻,缓存拓扑是他们应对这一挑战的核心手段。还有一个容易被忽略的角色是编排层。它负责维护任务状态、整合上下文,并决定工作流的每个阶段交给哪个计算资源,可能是本地应用、端侧模型,也可能是云端服务。CPU在其中统一协调权限管理和任务执行。进入智能体时代后,CPU的角色已经从单纯的算得快,变成了管得好。关于核心数量,DanielLu透露C2CPU集群最高可支持14个核心,合作伙伴可以根据实际工作负载灵活选择。有些合作伙伴评估后认为智能体工作负载至少需要十个核心,就会选十核配置。Arm并不替客户做决定,而是把灵活性交给他们。SME2的生态采用也在加速。Arm边缘AI智能终端计算副总裁JamesMcNiven介绍道,目前几乎所有旗舰智能手机,无论MaliG2-UltraNX:AI原生图形架构,把神经网络嵌进着色器说完CPU,再看GPU。MaliG2-UltraNX是Arm首款AI原生MaliGPU,最大的变化是把专用神经网络加速器直接嵌入了GPU着色器核心。这样神经图形工作负载可以和图形、计算任务并行运行,同时复用GPU的内存系统、一致性缓存和控制结构,减少数据在不同计算单元之间的搬运。Arm边缘AI高级产品经理DeyanLazarov在采访中特意澄清了一个技术细节,他们用的是卷积神经网络,不是Transformer。这套系统并不是像大语言模型那样凭空生成画面,而是从GPU渲染出的真实画面出发,用CNN做超分辨率和细节补全。如果游戏有独特的美术风格,开发者还可以基于自己的游戏内容重新训练模型。MaliG2-UltraNX支持三项神经网络加速技术。其中神经超级采样NSS从低分辨率画面重建高分辨率图像;神经帧率提升NFRU通过生成中间帧提高帧率;神经超级采样与降噪NSSD则把超分和降噪结合,面向复杂光线追踪场景。在Arm与SumoDigital基于虚幻引擎联合打造的演示游戏《光影新生》中,NFRU与NSSD方案相比传统渲染实现了最高4倍的性能效率提升,外部内存流量降低多达70%,也让虚幻引擎MegaLights等技术得以应用于移动设备。对于大家可能比较关心的延迟问题,DeyanLazarov算了一笔账。以30FPS为例,单帧时间预算约33毫秒,开发者需要在这个窗口内既完成原始帧渲染,又完成AI生成帧插入,从而在30FPS的时间预算内输出60FPS的效果,同时配合帧步调方案应对渲染时间的波动。目前这一代NFRU只支持在两个渲染帧之间生成一帧AI重建帧,但Arm已经规划了更丰富的路线图来扩展多帧生成能力。为了给开发者更多权衡空间,Arm还引入了不同质量等级的模型,开发者可以在画质和性能之间灵活选择。DeyanLazarov说,《光影新生》本身就采用低分辨率渲染,在生成帧流程中完成分辨率放大和重建,渲染压力大时还可以进一步降低原始渲染分辨率。传统图形性能也没有被忽视。全新执行引擎是ArmMali过去七代产品中规模最大的指令集架构升级,每个线程束的寄存器数量比上一代多达2倍,并采用动态寄存器分配减少溢出。第三代光线追踪单元对不透明度微贴图提供硬件级支持,使用OMM可使帧率提升30%,光线追踪工作负载最多降低70%。与上一代相比,基准测试性能最高提升24%,非AI游戏性能最高提升14%,光线追踪场景下DRAM流量最多降低13%,可支持最高120帧每秒的稳定运行。在采访中,也有媒体问到了与桌面端帧生成技术的对比。JamesMcNiven坦言手机毕竟不同于PC,受限于功耗和散热,可用资源有限,因此必须针对移动平台做专门的架构设计和优化。Arm的另一个不同点是开放策略,模型是开放的,手机厂商在验证后可以根据自身产品需求进一步优化和定制。近期Arm还宣布与腾讯游戏开展合作,共同探索神经动态全局光照等未来技术。最后,SIL2系统互连是整个平台的粘合剂,支持LPDDR6、LPDDR5X和LPDDR5等多种内存标准,在缓存一致性和大模型优化方面相比上一代有明显提升。JamesMcNiven表示,Arm的工作就是确保各类新型内存标准推出时SIL2都能高效适配。如果合作伙伴没有采用SIL2,他们大概率也会通过类似的系统级优化来降低延迟、支持新内存类型。芯片之外,一张让智能无处不在的网单看硬件,CSSforMobile2平台已经足够完整,不过关注行业的朋友可能还会进一步思考,除了技术本身之外,CSSforMobile2这样的平台,究竟如何赋能当前的AI行业?Arm执行副总裁兼首席商务官WillAbbey在活动开场给出了一个宏观数字,Arm全球合作伙伴累计出货的基于Arm技术的芯片已超过3500亿颗。这个体量意味着,任何发生在Arm架构上的技术演进,都会迅速扩散到海量终端设备中。CSSforMobile2正是在这样一个基数上,为智能体时代的边缘计算提供了一个统一的底座。软件生态是Arm赋能边缘AI的关键支点。CSSforMobile2依托全球超过2200万的Arm开发者社区,通过KleidiAI与主流AI框架的深度集成,为ArmCPU提供优化的软件执行路径,开发者不需要改变现有开发流程就能利用SME2等底层能力。ArmAIPortal则在统一平台汇聚经过优化和验证的模型、性能数据、代码示例及部署资源,ArmMCP服务器将这些能力引入智能体AI开发环境,帮助开发者加快从评估到部署的流程。产业合作方面,CSSforMobile2已经获得了广泛的生态响应。支付宝、OPPO和vivo等合作伙伴已采用SME2技术;神经网络图形技术方面,Arm与叠纸游戏、网易、腾讯游戏、Unity中国以及虚幻引擎等合作伙伴共同推进。网易《燕云十六声》计划今年推出支持神经超级采样的版本,腾讯游戏《暗区突围:无限》开展神经超级采样与降噪技术演示,叠纸游戏《无限暖暖》推进神经超级采样技术集成。腾讯游戏公共技术线的MagicDawn和Unity中国团结引擎已将Arm神经网络技术集成到开发流程中。而对于第三方开发者而言,CPU和GPU的通用性价值更突出。Arm表示,第三方开发者选择面向CPU开发的一个重要优势,是能够获得更好的跨平台、跨厂商兼容性。CSSforMobile2通过SME2增强CPU的AI能力,实际上是在降低第三方开发者接入端侧AI的门槛。最后,物理AI是Arm在边缘之外的另一个方向。Arm正在将成熟的全面设计生态项目扩展至物理AI领域,汇聚了AWS、HuggingFace、LiquidAI、QNX等80多家行业领先企业,首项重点协作倡议聚焦于构建机器人能力分级框架,旨在建立一套统一的语言来描述和评估自主机器的能力发展水平。结语当然,最后小编想说的是,CSSforMobile2是可灵活配置的基础平台,后续在终端芯片和整机上的落地进展仍有待观察。首批新平台旗舰机何时上市、纸面数据能兑现几分,还是要交给时间回答。不过印象中手机行业上一次这么认真地讨论重新设计计算平台,还是在智能手机替代功能机的前夜。而这一次,Arm正在用一个系统化的平台,把智能体时代的计算需求拆解成可交付的技术组件,再通过庞大的生态网络扩散到每一个终端。智能无处不在,正在从愿景变成可以触摸的产品。剩下的悬念,留给时间和生态。
更多行情分析及广告投放合作加微信: hollowandy
请用微信扫一扫
【免责声明】本文仅代表作者本人观点,与亚汇网无关,且不构成任何投资建议,仅供参考,并自行承担全部风险与责任。本站部分文章信息来源于自由投稿人或网络转载,出于传递更多信息之目的,如对文章内容有疑议或侵权,请及时与我们联系处理。