科技量子位·文婷··AI 生成
实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug
文章实测了讯飞星火X2.5大模型(293B MoE)在创意编程、复杂办公和网站搭建三个场景下的交付能力。核心结论是:模型不仅掌握创意交互,能自动拆解61页英伟达财报并制作图表和风险简报,还能识别用户设计的数据集统计错误并输出可视化PDF,最后为一款原创游戏设计了完整的哥特风格官网。作者认为,该模型标志着AI能力从‘对话/写代码’向‘端到端交付’的转变,同时指出其背后是讯飞基于全国产算力(飞星一号)构建的训推闭环,这在大模型从‘尝鲜’走向‘规模化应用’的背景下具有战略价值。适合对国产大模型真实能力、技术路线以及产业落地感兴趣的从业者和技术决策者阅读。原文 ↗原文 ↗
核心观点
- ▍AI能力的评判标准正在从‘问答/写代码’转向‘端到端交付’,星火X2.5的实测表现表明它能独立完成从创意落地到复杂任务处理再到整站设计的闭环交付。
- ▍讯飞的差异化在于其‘全国产算力’标签,并非仅做推理适配,而是从模型训练到推理部署整条链路都落在国产算力平台上,能形成训推闭环。
- 01星火X2.5可根据Prompt直接生成‘中秋祈福’3D粒子手势交互网页,支持待机散点、握拳聚成圆月、比“1”拼出‘中秋快乐’等丝滑交互。
- 02在财报分析任务中,模型在半小时内自动摘要61页英伟达Q2财报,生成包括营收利润变化图、Future commitments表和一份投研风险简报在内的9份图表及1份报告。
- 03在论文实证任务中,星火X2.5能识别出用户模拟数据集的统计bug,并指出研究设计存在‘问卷样本少、未实现控制变量’等不严谨之处。
- 04模型基于游戏世界观Prompt,生成了一个包含导航栏、海报、闯关地图及Boss专题板块的沉浸式游戏官网,且玩法设定与底层世界观念理一致。
- 05据科大讯飞2025年度业绩说明会披露,其MoE模型在全国产算力上的训练效率,相较同规模A800集群,从开箱状态下的30%提升至93%。
反方 / 局限
- — 文章虽展示模型能识别用户数据的统计错误,但也间接承认其判断(如论文实证结论)是基于用户提供的有限且可能失真的模拟数据,其‘严谨性’受限于输入质量。
19 分钟 · 5 卡片 · 10 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问