7.0
深览指数
科技微博·极客公园··AI 生成
Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案
Arm 在上海活动上提出,AI 计算正从单一芯片性能竞争转向多计算单元协同竞争;核心矛盾不再是生成更多 Token,而是以低成本、低延迟调度和管理 Token。文章指出,Arm 选择不替客户决定 CPU/GPU/NPU 的分工方式,而是构建一个允许变化的计算底座,并通过 CSS 子系统、C2-Ultra CPU、Mali G2-Ultra NX GPU 等产品,为云、边缘、物理 AI 提供计算平台。适合关注半导体产业趋势、芯片架构演进及 AI 基础设施的读者阅读。原文 ↗
核心观点
- ▍AI 计算竞争正从单一芯片性能转向多计算单元的协同竞争,核心问题从'如何生成更多 Token'变为'如何以低成本、低延迟调度和管理 Token'。
- ▍Arm 选择不替客户决定 CPU/GPU/NPU 的分工方式,而是构建一个允许变化的计算底座,确保无论哪种方案,底座都有 Arm 参与搭建。
- 01Arm 在 CSS for Mobile 2 中集成了 C2 CPU、Mali G2-Ultra NX GPU 等组件,单线程性能提升 15%,AI 模型性能最高提升 1.7 倍。
- 02Arm 推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,支持神经网络加速器直接集成到着色器内核,功耗不到 1 瓦。
- 03Arm 引用 IDC 数据称,基于 Arm 架构的机架级服务器市场规模已超越 x86,成为加速计算的主流平台。
- 04微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能基于 CSS N2 构建 DPU 产品,验证了 CSS 模式的价值。
- 05联想高级副总裁贾朝晖预测,未来可能有 80% 的 Token 生成会发生在本地设备上。
- 06Arm 称,在智能体时代,CPU 的角色不再是加速,而是编排,一个智能体能发起数百次调用。
- 07Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以自行训练模型。
反方 / 局限
- — 文章承认,Arm 对 CPU 和 NPU 之间的分工、CSS 是否会跨领域复用、未来 GPU 中着色器和神经计算资源比例等问题,都将决定权留给了合作伙伴,并未给出明确路线。
- — 与英伟达通过 CUDA 锁定开发者范式的路线相比,Arm 的开放策略可能面临生态碎片化和性能优化的挑战。
17 分钟 · 4 卡片 · 10 资料
读原文 →