7.8
深览指数
科技人人都是产品经理·甲木未来派··AI 生成
一手实测 Step 5 Preview,国产 AI 模型卷麻了!
作者对阶跃 Step 5 Preview 模型进行了深度实测,重点考察其在工具调用、长程任务规划与复杂工程任务下的表现。测试覆盖了创意前端、3D 视觉与真实开源项目修复等场景,发现该模型在“较真”的核对验证场景下表现出色,如逐条核对招标文件和纠正财务数据。文章核心结论是 Step 5 Preview 的定位并非追求极速,而是以“自验自证”的扎实执行力,在端侧智能等需要自主可靠完成任务的场景中具备竞争力。适合想了解国产模型实际工程能力、而非仅看榜单分数的技术决策者和开发者阅读。原文 ↗
核心观点
- ▍Step 5 Preview 的核心竞争力在于其“自验自证”的较真能力,而非响应速度;它能自主规划、执行、验证并记录过程,尤其适合需要高可靠性的长程任务和核对场景。
- ▍阶跃的端侧模型布局与 Step 5 Preview 的做事风格是匹配的,端侧智能需要的是能自主盯住任务干完、不用频繁依赖云端管控的模型。
- 01在“动画短片”CASE 中,模型花一个多小时独立完成了从逐秒脚本、播放器到成片的整套交付。
- 02在“自动贩卖机”CASE 中,模型先写产品规格书再严格依据文档实现,并逐条验收,展示了在不跳步、不改规格下的执行力。
- 03在“linkding 开源项目修复”CASE 中,模型在 2 小时 5 分钟内完成了拉代码、十万条数据压测、针对导出内存溢出问题优化以及测试全绿验证。
- 04在“客厅复原”和“键盘复原”等 3D 建模 CASE 中,模型会进行多轮自检,生成包含差异清单的测试留档。
- 05在处理 78 页的政府招标文件和裁决同一家公司两处不一致的营收数据时,模型能逐条对照原文进行核实。
反方 / 局限
- — 作者坦诚,该模型在修理真实代码任务时的运行速度极慢,所有测试耗时均超过两小时。
- — 模型目前的速度短板需要通过后续正式上线前的迭代来弥补,其实用性高度依赖具体的应用场景(适合核对验证类,而非即时响应类)。
23 分钟 · 3 卡片 · 7 资料
读原文 →