科技Bestblogs·InfoQ 中文··AI 生成
单个机柜到底能跑多少个 Agent?答案不在 GPU 身上
英特尔基于对 AI Agent 工作负载的拆解(主机端 CPU 占比 60%,沙箱调度为瓶颈),提出「每机柜可交付智能体数」这一实际工作量公式,而非关注理论算力峰值。通过调度优化、Flat Memory 内存架构(CXL+DDR5)和计算卸载(QAT/IAA硬件加速),在实验中把并发膝点从 235 提升至 300 个 Agent(+28%)。文章核心主张是行业竞争正从芯片参数转向系统转换效率。适合对 AI 数据中心架构、硬件选型决策有实操需求的技术管理者与系统工程师阅读。原文 ↗原文 ↗
核心观点
- ▍数据中心优化应聚焦调度有效性、资源平衡度和计算卸载效益以提升单机柜 Agent 交付量,而非仅关注理论算力参数。
- ▍行业竞争正从芯片参数比拼转向系统转换效率的较量,包括调度策略、内存架构和软硬件协同等工程细节。
- 01Agent 总任务时间中,主机端 CPU 开销占 60%,其中工具执行(沙箱)占 35%。
- 02并发会话时,调度与队列排队占主机端 CPU 时间增长部分的 94%;单个请求的 CPU 占比从 0.4%-0.6% 飙升至 11%-15%。
- 03英特尔提出公式:每机柜可交付智能体数 = 理论每机柜智能体数 × 调度有效性 × 资源平衡度 × 计算卸载效益。
- 04通过采样状态并路由至合适节点(调度优化)、Flat Memory 模式融合 CXL 与 DDR5(内存平衡)、QAT/IAA 压缩与数据搬运卸载(计算卸载),系统膝点从 235 个并发 Agent 提升至 300 个。
反方 / 局限
- — 文章核心依据来自英特尔自家白皮书和实验数据,未提供第三方复现或竞争对手(如 AMD、NVIDIA)的对比方案数据,结论的普遍性有待检验。
- — 提升幅度(28%)基于特定硬件组合和实验环境,实际生产环境中网络、存储等外部因素可能稀释该项优化带来的收益。
前置背景
平行视角
未来推演
延伸追问