6.7
深览指数
科技智东西·程 茜··AI 生成
Qwen3.8,登顶英伟达榜单!
阿里通义千问最新发布的Qwen3.8预览版模型,在英伟达专为Blackwell架构设计的GPU算子优化基准测试SOL-ExecBench中登顶,得分超过腾讯混元、人类专家及AI编程工具Cursor。该榜单评估的是模型生成CUDA内核逼近硬件理论性能极限(SOL)的能力。文章详细介绍了测试基准的构成(235项任务、基于B200 GPU)以及Qwen3.8夺冠背后的技术细节,包括其基于真实GPU环境的强化学习训练和阿里巴巴Atrex推理框架,标志着大模型在底层算力自动化优化领域迈出关键一步。适合关注AI前沿技术、大模型应用及硬件协同的读者阅读。原文 ↗
核心观点
- ▍阿里Qwen3.8模型在英伟达SOL-ExecBench榜单上登顶,证明大模型已具备在底层硬件(GPU算子)层面进行自动化、闭环优化,并逼近理论性能极限的能力,这标志着AI在硬件工程自动化领域获得突破性进展。
- 01榜单排名:Qwen3.8在专为LLM推理设计的FlashInfer-Bench子集上排名第一,超越了腾讯混元Hyra、人类开发者以及Cursor等知名AI编程工具。
- 02基准测试细节:SOL-ExecBench包含235项CUDA优化任务,提取自124个商用及前沿模型,目标硬件为英伟达Blackwell系列B200 GPU,评估标准是“Speed-of-Light (SOL)”,即接近硬件理论性能极限的程度。
- 03训练方法:千问团队构建了基于真实GPU环境的强化学习体系,使用沙盒编译、真实Kernel仓库作为训练数据,并对RL基础设施进行优化以支持超长工具调用序列(平均2.9万轮)。
- 04推理框架:在推理侧使用阿里巴巴Atrex Kernel Agent框架,该框架承载了算子优化的完整分析迭代流程与经验沉淀机制,使模型能在数万轮迭代中保持方向一致性。
- 05硬件与精度:所有测试在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz,涵盖BF16与FP8两种精度格式,覆盖了融合注意力、FP8 MoE和RMSNorm等关键推理算子。
反方 / 局限
- — 文章主要关注于Qwen3.8在特定基准测试上的成功,对其局限性提及较少。例如,测试仅针对Blackwell架构,模型在其他架构(如Hopper、AMD GPU)上的泛化能力未知;且自动化优化是否能完全替代人类专家在复杂、非标准场景下的创造力,尚存疑问。
9 分钟 · 3 卡片 · 7 资料
读原文 →