科技Bestblogs·千问大模型··AI 生成
Qwen3.8-Max:编程与办公,全面跃升
通义千问发布旗舰模型 Qwen3.8-Max,总参数达 2.4 万亿,支持百万上下文。文章核心在于展示其从「对话」向「自主交付」的跨越,在编程、科研、办公等场景中展现出端到端完成复杂长时程任务的能力。本文适合关注大模型前沿能力、尤其是 Agent 与强化学习落地进展的读者,但需注意其为官方发布宣传稿,缺乏独立第三方评测与局限性讨论。原文 ↗原文 ↗
核心观点
- ▍Qwen3.8-Max 的核心突破在于从「对话」向「自主交付」的跨越,能够独立完成跨越数天、涉及多步骤的复杂编程项目和科研循环。
- ▍模型通过创新的强化学习(RL)系统(环境解耦、统一奖励系统、在线数据均衡)解决了真实办公任务中多步骤、多工具协作的复杂性,提升了稳定性和广度。
- 01模型拥有 2.4 万亿总参数,激活参数 95B,支持 100 万上下文长度。
- 02在编程方面,展示了其独立完成一个涉及多文件、Git 协作、持续 10 天的工程项目开发的能力。
- 03在科研领域,模型能够复现一篇 2025 年 ICML 论文的核心算法,并进一步优化,取得了超越论文原报结果。
- 04在专业办公场景,模型被用于处理法律合规审查、结构工程计算和量化策略回测等任务,并生成详细报告或代码。
- 05在长程任务中,模型在芯片设计场景中进行了 500 轮交互优化,并在电商经营模拟中完成了 365 天周期的自主经营决策。
- 06模型具备混合智能体能力,能同时通过编写代码和操作 GUI 界面来推进任务,并利用视觉反馈进行自我纠错。
反方 / 局限
- — 文章未提及模型在推理成本、部署门槛、安全性(如代码生成中的漏洞)、以及在与 GPT-4o 等顶尖闭源模型对比中的具体短板。
- — 文章所有展示的案例均为官方精选,缺乏来自独立第三方或社区用户的验证,其真实泛化能力存在不确定性。
- — 2.4 万亿参数规模带来的巨大算力消耗,其端到端交付的经济性在当前商业环境下是否可行,文章未作讨论。
概念锚点
前置背景
技术原理
平行视角
延伸追问