0
导语:200瓦功耗之差的新战场
记者:郭思
编辑:包永刚

9月9号,人社部公布了第八批新职业名单,尤为瞩目的一个新职位是智能体开发员。岗位的正式确立,意味着相关技术已走向主流,而背后则是底层技术的实质性跃迁,当模型不再停留在问答层面,而是开始具备“行动”能力——底层算力的需求结构也在重塑。智能体在运行过程中,需要频繁地获取数据、调用工具并等待结果返回,这对系统的响应延迟提出了极高的敏感度。因此,以往“唯算力论”的粗放型资源配置模式,已逐渐失去经济性与合理性。
正是在这一技术范式转移的关键节点,产业界给出了最直接的回应。就在职业名单公布的前一天(9月8日),Arm在Arm Everywhere China年度大会上展示了Arm AGI CPU 在中国生态的最新进展,发布了Neoverse CSS N4。精准呼应了智能体时代对高效推理算力的迫切需求,更预示着底层硬件架构正加速向适应AI Agent复杂交互的方向演进。

两条路径,一个底座
在首款自研芯片上直接冠以“AGI”之名,足见Arm对AGI CPU这款处理器的自信。
在今年三月正式发布时,Arm AGI CPU的核心性能就备受关注,136个Arm Neoverse V3核心、96条PCIe Gen6通道、12通道DDR5内存。
而更常被人问起的一个问题则是,客户为什么要选择Arm AGI CPU?
在Arm Everywhere China年度大会上,Arm云AI业务拓展副总裁Eddie Ramirez直接通过一个数据给出了答案:同等性能下x86方案的TDP通常是500瓦,AGI CPU只有300瓦。
这200瓦的功耗差距,并非仅仅是参数表上的数字优化,而是精准击中了当前数据中心基础设施的痛点。 如今,数据中心最稀缺的资源早已不是芯片本身,而是电力供应和机架空间。将这200瓦的差距摊到机架级别,意味着在同等功耗限制下,能够部署的计算核心数几乎可以实现翻倍,这笔成本帐也让客户的迁移成为了一件顺理成章的事情。
IDC 报告显示,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算领域的主流平台。
当Arm亲自下场推出自研芯片,市场存在的另一大疑虑则在于:这是否会与购买Arm IP进行自研设计的客户形成竞争?对此,Arm给出的答案相当务实。
推出Arm AGI CPU,本质是响应客户的真实需求。
Arm 举例,像 SAP 这类客户,在云端业务会采用基于 Arm 架构的 Graviton 实例,但本地私有云环境仍大量部署第三方芯片。同一家企业,云端用 Arm 架构、本地采用另一套架构,造成了计算环境割裂。
Arm 从 SAP 以及众多客户处收到的核心诉求,就是需要一套能够贯通云端到本地、体验一致的计算平台,Arm AGI CPU 正是为此打造。这类本地场景此前并非 Arm 的覆盖范围,从这个意义上理解Arm AGI CPU ,更多的是Arm对市场空间的外延拓展,而非抢夺现有云服务客户的存量市场。
事实上,今年 3 月 Arm AGI CPU 发布之际,亚马逊云科技、Google、微软、NVIDIA、甲骨文等超大规模云厂商均表态支持。这些巨头早就依托 Arm 架构收获可观的能效红利,也更希望推动更多软件完成 Arm 生态适配。
而当我们把目光看向Arm此次发布的Neoverse CSS N4时,我们会惊奇的发现,Arm在智能体时代,不止提供IP,升级点也从单个性能指标拓展到系统级升级。
官方介绍,Neoverse CSS N4是Arm迄今可配置程度最高的CSS平台,单裸片能从8核配到128核,最高频率3.8GHz。
在2026年,单纯比拼核心数量已经不算什么新鲜事了。竞争对手早已推出了核心数更多的产品。
所以,CSS N4 真正的杀手锏,并不在于堆叠了多少个核心,而在于它极大地提升了数据搬运的速度和效率。
它有两个值得一提的设计,一是支持最新一代 LPDDR6 内存。相比于目前主流的 DDR5 内存,LPDDR6 不仅更省电、占用芯片面积更小,还能让数据传输更顺畅。当其他厂商还在使用上一代内存技术时,Arm 已经率先将新一代内存引入了数据中心。
另一方面,他还支持最新的 PCIe Gen 7 接口标准。这个接口就像是芯片与外部设备之间的“高速公路”,Gen 7 的带宽比目前主流产品领先了一代。这意味着数据进出处理器的速度会大幅提升。
也就是说,当行业趋势从更大的算力集群走向更快的数据搬运速度之时,Arm早已做好了系统准备,在核心数、内存和接口上同时实现跨代升级的组合,让“数据搬运瓶颈”这个老大难问题变得可解决,可突破。
从商业角度,Arm的产品逻辑其实也非常简单。无论客户处于哪种阶段,哪个规模,只要他还在做智能体行业,Arm就会为其提供选择。
头部大厂有完整的芯片团队,要的是IP授权或CSS。N系列、V系列的核心、互连、内存和I/O预集成好,客户再加自己的加速器、内存拓扑和软件栈。这条路的门槛是5亿到8亿美元的流片投入,以及从RTL到量产软件栈的多年工程积累。AWS七年做了五代Graviton,微软18个月迭代两代Cobalt,背后都是这种投入。
当然,市场上并非每一家客户都需要打造定制芯片。对于希望部署量产就绪算力的客户而言,Arm AGI CPU 也能提供 Neoverse 平台具备的卓越性能与能效。
“一些此前从没考虑过Arm的厂商,现在也开始关注这条路径”。Eddie Ramirez在大会上直言。
换句话说,无论客户从哪个入口进来,最后用到的工具链和开发环境是同一套。Arm从IP授权扩展到CSS再到商用CPU,背后其实是同一件事——做人工智能时代的基石平台。
“做人工智能时代的基石平台”——听起来十分宏大的概念,但落到具体的工程实践中,除了非常出色的硬件性能表现外,其实还需要回答一个非常朴素的问题:在AI时代,开发者究竟需要什么样的支持?
芯片是底座,但底座之上还有很长的路要走。从模型选型到性能调优,从部署测试到上线运维,开发者需要工具、数据和参考实现。如果这些环节各自分散在不同的仓库、文档和论坛里,即便芯片性能再强,开发效率也会被拖慢。
这正是 Arm 试图补齐的环节。
Arm Create 开发者大会上海站上,Arm 正式宣布,Arm AI Portal 正式上线,定位是为开发者提供一个统一入口,在 Arm 计算平台上完成 AI 软件的发现、优化和部署。

从功能上看,它做的事情并不复杂:开发者可以在上面查找针对特定任务预优化的模型,获取性能和准确率数据,对比延迟、内存占用和模型规模,还能找到代码示例和部署工作流。
听起来像是一个模型市场加文档中心的组合。但它的特殊之处在于,所有工作都围绕 Arm 架构做了优化,并且考虑到了智能体时代的开发模式变化。
值得一提的是,Arm AI Portal 并未强行嵌入开发者的工作流,而是选择适配现有开发环境。这种“不改变用户习惯”的设计思路虽然在业内并不罕见,却也存在着较大难度,模型版本迭代频繁,性能数据需要持续更新,不同硬件平台的优化参数也需要分别维护。
Arm 的做法是先把基础打好——平台目前支持语言、语音、视觉及神经图形等多类 AI 工作负载,首批预优化模型包括阿里巴巴通义千问、Google Gemma 以及 Ultralytics YOLO,支持的运行框架涵盖 ExecuTorch、LiteRT 和 ONNX-RT。生态合作伙伴包括阿里巴巴、树莓派和 Ultralytics。

图:开发者可借助 Arm AI Portal,基于性能数据评估模型在特定 Arm 平台上的适配情况
从而为模型选型与部署决策提供参考。
另一个亮点是,Arm 优化后的模型可以直接在 Hugging Face 获取,而 Portal 的资源则通过模型上下文协议(MCP)开放给编程智能体。MCP 相当于给机器定了一套通用语言,不再需要人类开发者在中间做翻译或搬运。这意味着,随着开发工作流逐渐由智能体驱动,平台资源可以被它们自动发现和调用,省去了额外的适配成本。
这个设计选择的背后,触及了一个更深层的行业趋势:我们正在进入一个“硅碳共生”的时代,AI 应用的开发不再仅仅是人类开发者的专属工作,AI 模型和智能体正在成为开发流程中的协作者,甚至是独立的生产者。当开发工作日益向智能体驱动演进时,机器与机器之间的关系变得至关重要。
尽可能的将繁琐及复杂留给AI ,而将决策和创意留给人类,这便是Arm给出的对“碳硅共生”的理解。
在性能优化方面,Arm 提供了一些可量化的数据。例如,采用单线程执行与混合量化配置,搭载 Q8_0 talker 与 code predictor 组合方案,Qwen3-TTS 在 vivo X300 上通过第二代 Arm 可伸缩矩阵扩展(SME2)的加速,实现了超过 4 倍的速度提升。Ultralytics YOLO26 在 vivo X300 上依托 SME2 技术,单线程 FP16 相较 FP32 实现超 40% 性能提升;在树莓派 5 平台上,采用 FP16 与 INT8 混合量化方案,相比 FP32 同样实现超 40% 的性能提升。
这些数据当然不能代表所有场景下的表现,但至少说明了一个方向:在 Arm 架构上,通过软硬件协同优化,仍然可以在特定工作负载上获得有意义的性能收益。对于开发团队而言,这意味着他们不需要从零开始做模型调优,可以直接从已经优化过的起点出发,把精力集中在应用逻辑上。
不用重复造轮子,Arm给了开发者一个看上去最简单却也是最本质的开发平台选择。
而当我们把视线从芯片和架构中抽离,重新审视“智能体开发者”这个新职业时,我们会发现,当每一次技术奇点来临时,人类都会需要重塑对于人与工具之间的关系。而当硅基共生来临时,智能体开发者一方面代表着一个新的产业或者说技术范式的崛起,而另一方面也代表着,官方对于一种全新生产关系的认证。
在这场变革中,Arm正在铺设通往下一代 AI 的关键路径。从AGI CPU对能效边界的静默突破,到Neoverse CSS N4对数据流转的系统级疏通,再到Arm AI Portal借MCP协议为机器间搭起通用语言——应时而动,应需而生。它无意成为一方霸主,只愿做智能体、开发者与智能体经济背后,那片生生不息的底层土壤。雷峰网(公众号:雷峰网)
雷峰网原创文章,未经授权禁止转载。详情见转载须知。