8.3
深览指数
产品少数派··AI 生成

Excel AI 辅助工作流横评:数据分析高手还是照葫芦画瓢?

通过对 ChatGPT、Claude、DeepSeek、Kimi 等主流模型搭配 Office 加载项与独立工作台两种载体进行多轮测试,发现 AI 写简单 Excel 公式已成熟,但复杂数据清洗、透视表创建等任务失败率高达 73%,且硬编码现象严重。作者明确指出,决定成品质量的关键因素不是模型本身,而是载体(Harness)—— Office 侧边栏加载项优于独立工作台,能调用现代 Excel 函数。适合需要将 AI 融入日常 Excel 工作流的办公人员阅读,文中提供了具体测试用例与提示词供复现。原文 ↗

核心观点
  • AI 辅助处理 Excel 时,载体(Harness)的重要性不亚于模型,Office 侧边栏加载项是当前最好的选择,因为它能调用现代 Excel 函数(如 XLOOKUP、FILTER),而独立工作台(如 Codex、Claude Cowork)依赖 Python 或老旧的 LibreOffice,导致硬编码比例更高、公式更落后。
  • AI 在数据清洗与复杂透视任务上的准确率仍然很差:22 个需创建数据透视表的输出文件中只有 6 个(27%)计算结果正确,且长流程复杂任务人工介入率高达 51%,根本原因是模型易「擅作主张」黑箱决策,以及思考词元浪费在小细节上。
  1. 01在「按姓名匹配员工信息」测试中,仅 Claude Cowork 主动停下来询问重名员工如何处理;其余模型(如 ChatGPT、Claude、DeepSeek 等)虽在对话中提到重名,但已擅自使用 XLOOKUP 默认匹配第一个值;Workbuddy 甚至凭空硬凑不存在的员工姓名。
  2. 02测试中 45 次长流程复杂任务(A08、A10、A11、Q11)的人工介入干预比例高达 51%,而基础短流程任务(A01-A07)仅 12%。模型耗时变长的三大主因:小问题过度思考、模型卡住、载体限制(如 Pi for Excel 的 4096 token 思考上限)。
  3. 03使用同一底层模型时,独立工作台(Claude Cowork、Codex)的硬编码比例明显高于 Office 加载项版本。Claude Cowork 因依赖开源 LibreOffice 解析 xlsx 文件,倾向于使用 VLOOKUP、INDEX+MATCH 等旧公式,而非加载项调用的 XLOOKUP、FILTER、SORT。
  4. 04Kimi K3(Pi for Excel)在「图书销售数据分析交付」测试中,因思考「缺失值应填'未知'还是'未知支付方式'」来回纠结,思考日志中直接出现 'Ugh.' 和 'I keep flip-flopping.',且每次中断后不会断点续传,最终未能完成任务。
  5. 05AI 难以准确处理文本型数字:许多模型习惯将数据转为 CSV 并用 pandas 读取,pandas 的自动类型推断将文本数字「洗白」,导致后续 Excel 原生函数计算时原始单元格仍被视为文本,出现 Python 结果与 Excel 汇总不一致的 bug。
反方 / 局限
  • 作者承认:即使明确在提示词中写「有歧义要提问」,也并非所有 AI 都会严格执行——数据错误类型一多,没有模型能一次性扫到全部问题。目前解决这个问题的最好办法只有一种:告诉 AI 有歧义要提问,但成功率并不高。
  • 深度思考并非越高越好:当思考链路过深、耗时过长时,模型更容易陷入自我怀疑与反复推演。例如 DeepSeek v4 Flash 在人工提示分类计算有误后,思考 10 分钟才意识到「数据类型不匹配」。测试模型统一开启了「高」推理强度,但强思考并未保证高质量输出。
110 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问