7.6
深览指数
产品人人都是产品经理·奇点研究社··AI 生成
一次模型测评后,我开始重新理解WorkBuddy
作者通过对比测试发现,DeepSeek Flash 和 U2 Flash 在AI工作台 WorkBuddy 中表现优异,而 Qwen 3.8 Flash 在千问网页版中表现拉胯。但将 Qwen 3.8 Flash 接入相同工作环境后,其研报质量和游戏开发能力大幅提升,甚至能自动排错。文章核心观点是:当下模型能力日趋同质化,决定用户最终体验的胜负手已不是模型本身,而是“工程化环境”——即是否具备联网检索、工具调用、文件读写与自主纠错闭环的工作流。适合关注AI应用落地、Agent 架构与企业办公基础设施路径的读者。原文 ↗
核心观点
- ▍模型评测真正衡量的是模型在特定工程环境(工作流)中能交付的实际成果,而非模型智商的孤立对比。
- ▍决定 AI 办公产品竞争力的胜负手已从“调用哪家模型”转向“在怎样的工程环境里调用模型”,AI 应用的竞争正从“模型入口”走向“任务入口”。
- 01初测中,在 WorkBuddy 内运行的 DeepSeek Flash 和 U2 Flash 能联网检索、读写文件、调用工具以完成研报和游戏开发;而仅在千问网页版(孤立对话框)运行的 Qwen 3.8 Flash 在“新机全景”部分大量出错,游戏仅输出需手动复制的静态代码。
- 02复测将 Qwen 3.8 Flash 接入 WorkBuddy 环境后,研报准确性显著提升,系统自动输出七处排错的凭据清单及三级信源体系;游戏开发实现了“定位Bug、修改代码、重新编译验证”的闭环,交付可玩性较高的成品。
- 03千问办公平台将模型能力、应用工具与交互界面打包,限制用户手动切换底层模型,追求体验统一,但遏制了模型在复杂动态场景下的应变潜力。
- 04WorkBuddy 不绑定单一模型,允许用户按任务需求挂载不同模型,将模型视为“可插拔的算力引擎”,选择权交由任务。
- 05WorkBuddy 企业版已集成腾讯文档、网盘、乐享等套件,并打通企业身份系统(SSO、组织架构管理、用量控制),向企业 AI 基础设施演进。
反方 / 局限
- — 作者承认工作台无法凭空捏造模型本体的智力天花板,模型的推理上限、事实判断与自检能力仍是硬指标;Qwen 3.8 Flash 在部分任务中交付不及预期虽有环境因素,也有模型本身局限。
DeepSeek-V4.1-Flash云之声U2-FlashQwen-3.8-FlashWorkBuddy千问办公百度搭子Ulanzi腾讯文档腾讯乐享腾讯网盘Agent模型测评企业AI基础设施任务入口
15 分钟 · 4 卡片 · 11 资料
读原文 →