Excel AI 横评,写公式已经是高手,复杂工作流还是不行
少数派做了一轮 AI 辅助 Excel 的横评,用具体测试数据和盲评结果,测了当下用 AI 做表格的真实水平。
测试的设计是三类场景递进,数据清洗、高频重复公式编写、成品交付。模型和载体的组合统一用最新正式版,每轮测试都在全新的独立 Excel 文件里跑。观测指标有三个,硬编码情况、无损原则和实际交互次数。硬编码看的是两件事,AI 输出的是 Excel 原生动态公式,还是 Python 后台算完直接往单元格里写静态数据;无损原则看的是 AI 会不会在提示词没明确要求时,擅自改动、覆盖或破坏原始数据和版式;交互次数记录的是从发起到交付需要多少轮。

结论先给三条。AI 写公式的能力已经相当成熟,但复杂工作流后的交付问题不小。载体的重要性不亚于模型,Office 侧边栏加载项是目前最好的载体。用 AI 操作 Excel 时一定要当心它擅作主张的黑箱决策,提示词要写得足够严谨。
数据清洗,零干预一次做对的很少
测试用的数据集是一家小型连锁书店 2025 年的销售订单记录,要求做数据清洗、用数据透视表分析不同销售渠道中客户类型的订单分布、做数据看板并画统计图。提示词里明确写了「如有任何模糊不清的地方,停下来问我」。
结果这条指令没有被普遍执行。数据错误类型一多,即使是能力强的 AI 也很难一次扫到全部问题。能零干预、一次性彻底完成数据清洗的模型很少,要么没能统一同义词和异构字段,要么不能准确理解文本型数字。
测试者给了一个技术解释。AI 习惯把表格转成 CSV 再用 pandas 读取,pandas 的自动类型推断会把文本型数字悄悄「洗白」成数值,可后续一旦用 Excel 内置函数或数据透视表生成结果,Excel 引擎仍然把那些原始单元格当文本,直接排除在计算之外。最后就是 Python 算出来的结果和 Excel 原生汇总对不上。
这类问题最麻烦的地方是隐蔽。表面上公式跑通了、有输出,错在你看不见的地方。
数据透视表,27% 的结果是对的
数据透视表这一项最能说明问题。「图书销售透视汇总」和「图书销售数据分析交付」这两个任务一共产出 22 个文件。其中 16 个(73%)创建了数据透视表,14 个引用了正确的数据源区域,但只有 6 个(27%)的计算结果是对的。
也就是说,绝大多数 AI 知道该建透视表,也知道该用哪块数据,但真正算对的比例不到三成。
对透视表排序也难倒一批模型。Kimi K3 在使用 Pi for Excel 载体时,为了给透视表排序反复思考到触达载体的最大限制好几次,最终没能实现按销售额从高到低排序。
想得越久不等于做得越好
测试统一把模型的思考强度设成高档,给了充分的推理空间。但思考深度并非越高越好。
在长流程复杂任务里的 45 次实测中,需要人工介入干预的比例达到 51%,而短流程基础题目的人工干预率只有 12%。耗时变长的主要原因有几个。
一是因为小问题过度思考。Kimi K3 执行透视汇总任务时,反复纠结怎么用 Office.js API,超过 25 分钟后放弃用透视表排序。DeepSeek v4 Flash 在被人提示分类计算有误后,思考了 10 分钟才意识到是数据类型不匹配。
二是模型卡住。Claude Cowork 执行成绩表分析任务时,因为之前 LibreOffice 的文件残留卡了 10 分钟。Workbuddy 跑一个透视汇总任务 40 分钟还没解决,也没有任何后续输出。
三是载体本身的限制。Pi for Excel 对单次推理设了 4096 词元的思考长度上限,模型单次思考过长就会被截断,只能靠人工提示继续。
还有个细节挺有意思,不少模型会把数据在思考过程里完整抄一遍,浪费词元。Kimi K3 在一个交付任务里,为了「支付方式缺失值该填『未知』还是『未知支付方式』」这种无关痛痒的问题来回拉扯六七次,思考日志里直接蹦出了「I keep flip-flopping」和「Ugh」。而且让它继续时它不会接着断点做,反而从头开始,最后这个任务没完成。
载体比模型更要紧
测试里有个很清晰的对比。在底层模型相同的情况下,独立工作台一般耗时更长,硬编码比例也更高。
Office 加载项基于微软官方的 Office.js API 构建,比独立工作台更清楚当前版本的 Excel 能做什么。同样用 Claude 模型,Claude for Excel 加载项会更多使用 XLOOKUP、FILTER、SORT 这类现代动态数组函数,而在 Claude Cowork 里,它倾向于退回 VLOOKUP 甚至 INDEX + MATCH 这些传统写法,提取复杂数据时还会直接硬编码写入静态数据。
测试者认为这跟 Claude Cowork 后台依赖开源的 LibreOffice 解析和生成 xlsx 有关,LibreOffice 对新版高级函数的支持一直偏慢,只能退而求其次。
这也解释了为什么独立工作台更爱用 Python。Office 加载项需要经过微软审核才能上架,而且没有商业授权不能在云端挂载一个 Excel 处理文档,独立工作台没有这个约束,绕开 Excel 直接算反而更顺手。代价就是算出来的东西未必是 Excel 原生的,后续更新和维护要多留个心。
用起来该注意什么
几条实操建议,来自测试者的总结。
拿到 AI 处理完的文件,务必改一次原始数据,看计算单元格能不能自动更新。这一步能直接暴露出硬编码的静态数据,是最省事的验收办法。
提示词要写严。数据清洗任务里,把「如有模糊不清的地方停下来问我」这种止损条件写进去,虽然不能保证一定执行,但能减少 AI 自作主张的空间。
载体的选择上,如果你主要在 Excel 里干活,优先用官方或者成熟的侧边栏加载项,别图省事丢给独立工作台。同一句提示词,两种载体做出来的表格在维护成本上差得不小。
最后是一个更根本的判断。AI 现在写公式已经很靠谱,把常用公式、数据清洗这类明确的活交给它没问题。但涉及多步骤、需要判断的工作流,还是得人在关键节点上看着,把「看起来跑通了」当成「算对了」是这类工具最容易踩的坑。
你平时用 AI 做表格吗,敢让它直接交付给同事或者客户吗?
作者提示含AI生成内容。
