6.8
深览指数
科技智东西·江 宇··AI 生成
市值暴涨1300亿!阿里最强千问大模型登场,2.4万亿参数,自主连续编程16天破纪录
阿里发布旗舰大模型Qwen3.8-Max,总参数量达2.4万亿,激活参数950亿,是千问首个计划开放权重的Max级模型。文章核心卖点不是参数规模,而是模型在长程自主任务上的突破:连续16天无人值守维护代码仓库、125小时独立复现并优化论文、调度330个子Agent完成6000次量化回测。模型在多项基准测试中逼近或超越Claude Fable 5、GPT-5.6 Sol等闭源旗舰,但SWE-bench Pro、TerminalBench等指标仍有差距。适合对AI前沿进展、大模型能力边界、开源与闭源竞争格局感兴趣的读者,尤其是关注模型实际交付能力而非仅看跑分的技术决策者。原文 ↗
核心观点
- ▍Qwen3.8-Max的核心升级方向并非单一参数堆砌,而是围绕复杂任务的长程自主交付能力:模型能在数天至数周内,在较少人工干预下持续处理反馈并完成开放目标。
- 01在长程编程案例中,Qwen3.8-Max被要求从零创建oh-my-cli项目,并在无人持续介入的情况下运行约16天,累计完成265次代码提交、127个PR和151个Issue。
- 02在论文复现任务中,模型连续工作约125小时,编写约7600行代码,完成33轮GPU训练,不仅复现六大结论,还自主提出并验证了改进方案,在AIME 2024上额外提升2.7分。
- 03在数字芯片设计测试中,模型经历约500轮交互,将GCD/RSA硬件加速器的逻辑门数从8298个优化至678个,芯片面积缩减81%,并在500MHz下实现时序闭合。
- 04在量化研究案例中,模型仅根据六条因子描述,调度约330个子Agent完成约6000次回测,最终入选因子的超额夏普比率介于0.64至1.48之间。
- 05在E-Commerce Bench模拟365天电商经营中,模型在超过2000轮交互后获得初始资金4.16倍的现金,成绩比第二名GLM 5.2高38%,比前代Qwen3.7-Max提高152%。
- 06Qwen3.8-Max在多个基准测试中逼近或超越闭源旗舰:PaperBench 93.0分高于GPT-5.6 Sol和Claude Fable 5;OSWorld-Verified 86.1分位居参评模型首位。
- 07在操作复刻基准RecreationBench中,Qwen3.8-Max得51.7分,低于Fable 5的56.1分,但高于Claude Opus 4.8、GPT-5.6 Sol和Gemini 3.1 Pro。
反方 / 局限
- — Qwen3.8-Max在SWE-bench Pro中仅获67.7分,落后于Fable 5的80.0分和Claude Opus 4.8的69.2分;在TerminalBench 2.1中为86.6分,略低于GPT-5.6 Sol的88.8分。
- — 文章承认Qwen3.8-Max在长视频基准VideoMME v2中得68.3分,低于GPT-5.6 Sol的71.1分,显示多模态长视频理解仍有短板。
- — 实测《奥德赛》3D世界生成案例中,模型一次生成的场景视觉效果相对简陋,与Andrej Karpathy使用Claude Opus 5生成的《指环王》3D世界在沉浸感上仍有差距。
Qwen3.8-Max千问阿里Claude Fable 5GPT-5.6 SolGemini 3.1 ProArenaPaperBenchOSWorld-VerifiedSWE-bench ProTerminalBench 2.1VideoMME v2Three.jsHugging FaceModelScopeAndrej Karpathy天池IverilogYosysOpenROADOpenClaw
19 分钟 · 5 卡片 · 14 资料
读原文 →