7.0
深览指数
科技腾讯新闻·机器之心··AI 生成

一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重

本文报道了在个人设备上运行2.8万亿参数大模型Kimi K3的两种现实方案:一位开发者用128GB内存的Mac通过流式读取技术加载官方1.6TB权重,虽成功产出回复但速度极慢(0.32 token/s);另一团队用80张RTX 5090组成集群,实现20 token/s的可对话速度。文章提供了具体的技术方案、实测数据与成本参考,适合关注大模型推理部署、消费级硬件潜力的技术从业者阅读。原文 ↗

核心观点
  • 2.8万亿参数的Kimi K3模型可以借助流式读取技术,在128GB内存的Mac上运行,但推理速度极慢(0.32 token/s),仅能验证推理图调通
  1. 01开发者使用128GB统一内存的M5 Max Mac,加载Kimi K3官方1.56TB MXFP4权重,通过让97GiB静态权重常驻内存、其余部分从固态硬盘持续读取的方式运行
  2. 02Mac上模型处理输入速度约0.98 token/s,生成速度仅0.32 token/s,每生成一个token约需三秒
  3. 03Ning团队使用80张RTX 5090(10个节点,总显存2.56TB,25GbE以太网连接)完整运行Kimi K3官方MXFP4权重,单流推理速度达20 token/s,是Mac方案的60倍以上
  4. 0480张5090集群提供约143TB/s聚合带宽,高于32张H100方案的107TB/s和16张B200方案的128TB/s,但实际性能受多节点通信、算子效率影响
  5. 05团队此前曾将4090集群运行GLM-5.2的速度从30 token/s优化至110 token/s,表明Kimi K3仍有提速空间
反方 / 局限
  • Mac方案中权重需不断从硬盘搬入内存,模型每生成一个token都要等待大量数据读取和计算,导致推理速度极低,目前仅用于调通推理图
  • 80张5090方案虽降低了对HBM和高速互联设备的依赖,但80张消费级显卡、10个节点及配套网络、供电、散热设施的投入依然非常可观(接近百万美元级别)
6 分钟 · 4 卡片 · 9 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问