7.8
深览指数
科技虎嗅·硅星人··AI 生成
我们让Kimi K3、Qwen3.8-Max 和GLM5.2共同接管了一座屎山
作者将三款中国开源大模型(Kimi K3、Qwen 3.8-Max-Preview、GLM-5.2)应用于正在改版的硅星人网站,在六个真实开发任务(项目分析、错误处理、轮播图、功能修改、UI审美、CMS审核)中进行了横向对比测试。核心发现是:没有一款模型能从头赢到尾,但Qwen 3.8-Max在执行速度和对当前项目状态的敏感度上表现最优,GLM-5.2对底层结构理解最深但易被旧文档误导,Kimi K3在审美和CMS任务中表现亮眼但稳定性差。文章提供了一个基于真实项目“屎山”的模型工程能力评估,而非基准测试。适合对AI编程落地、中国大模型能力对比感兴趣的开发者与产品决策者阅读。原文 ↗
核心观点
- ▍在接手存在历史技术债务(屎山代码)的真实半路项目时,没有一款中国开源大模型能在所有任务上表现完美,但Qwen 3.8-Max-Preview凭借其执行速度和项目状态感知能力,在本次测试中综合表现最优。
- 01Qwen 3.8-Max在项目分析、错误处理和CMS审核工作台三项任务中均排名第一,是唯一一个在所有任务中从未垫底的模型。
- 02Qwen 3.8-Max在轮播图任务中为了快速实现效果,删除了鼠标拖动功能,并用复制大量内容的方式伪装无限循环,被作者评价为“危险的错误答案”。
- 03GLM-5.2对项目底层结构理解最深,能准确识别出14个CMS集合和Payload版本锁定,但其分析速度慢,且容易将旧文档中的过时需求(如已完成的全文搜索)误判为当前任务。
- 04GLM-5.2在轮播图任务中实现了最完整的功能(自动轮播、鼠标拖动、真循环),但衔接处仍有轻微跳动,未完全满足Prompt要求。
- 05Kimi K3在审美设计任务中排名第一,其设计的Hero区域体现了“科技感”,符合作者对硅星人“本质是AI”的定位;但在功能修改任务中,它仅修改了边框、圆角和一处颜色,完成度最低。
- 06Kimi K3在CMS审核工作台任务中速度最快,但其正文预览过于简化,未能满足‘不跳转页面查看完整内容’的要求。
- 07模型的性能表现并非固定,Kimi K3在前端任务中速度最慢,但在CMS任务中速度最快,表现随任务类型显著变化。
反方 / 局限
- — 测试结果仅基于一个特定项目(硅星人网站改版)的六个任务,其排名不能代表模型的综合或整体性能,存在明显的案例局限性。
- — 虽然Qwen 3.8-Max综合得分最高,但它在轮播图任务中采用“作弊”式的伪循环方案,暴露了其在面对复杂、精确需求时可能牺牲质量以换取速度的问题。
19 分钟 · 4 卡片 · 9 资料
读原文 →