6.0
深览指数
科技腾讯新闻·AI产品阿颖··AI 生成

对阿里新模型Qwen3.8-Max的真实评价

作者是一位AI实践者,在实测Qwen3.8-Max后认为,该模型已进入全球第一梯队,与GPT-5.6 Sol、Claude Fable 5等头部模型在日常任务中“互有来回”。文章核心观点是国产模型与硅谷闭源模型的差距已大幅缩小,且价格优势成为关键变量。作者通过让模型在自家十几万行代码的真实项目中独立完成一个功能(从理解架构、技术选型、编码到测试)来验证其能力,并展示了其在办公场景(生成PPT课件)的表现。适合关注国产大模型能力现状、技术选型与工程落地的AI从业者、技术决策者阅读。原文 ↗

核心观点
  • Qwen3.8-Max已进入全球模型第一梯队,与GPT-5.6 Sol、Claude Fable 5在真实任务中互有来回,不再像过去一样明显差一截。
  • 当模型能力差距缩小,价格成为核心变量;Qwen3.8-Max是目前1T以上规模模型中最便宜的。
  1. 01Qwen3.8-Max参数规模为2.4T总参数、95B激活参数,是国内唯二超过2T规模的模型,采用稀疏MoE架构,支持100万Tokens上下文和原生多模态。
  2. 02作者通过让Qwen3.8-Max在自家十几万行代码的真实项目中,独立完成一个完整的签到系统功能(包括理解架构、选择Flutter技术方案、编写后端接口、设计前端页面、运行测试),整个任务耗时2小时且一次性交付,效果合格。
  3. 03Qwen3.8-Max在办公场景中展示了生成PPT课件的能力,能自动抓取产品Logo和官网设计风格,输出有美感的成品。
  4. 04作者认为,模型能自动处理长程任务,包括在下载依赖期间主动记入长期记忆以衔接后续会话,体现了工程化智能。
  5. 05Release Blog显示,Qwen将办公应用放在仅次于Coding的第二重要位置,这与OpenAI和Anthropic将最强模型向专业知识工作迁移的趋势一致。
反方 / 局限
  • 作者承认Qwen3.8-Max与GPT-5.6 Sol、Claude Fable 5相比“当然仍然会各有强弱”,并非全面超越。
  • 文章未提及任何第三方独立评测数据,所有结论基于作者个人在自家项目中的一次实测,样本量和客观性有限。
  • 作者未讨论模型在安全性、幻觉率、对齐等关键维度上的表现,评估维度不够全面。
10 分钟 · 4 卡片 · 10 资料
读原文 →

概念锚点

前置背景

平行视角

延伸追问