过去两个月,AI办公圈的资讯流被一种标题刷屏了:“全球第一!”“登顶国际榜单!”“又是第一名!”。6月中,飞书多维表格AI报TableBench登顶;紧接着,WPS AI报自己在SpreadsheetBench上"打败微软、OpenAI、超越人类专家";7月中,飞书晒出"三大榜单全冠";7月21日,TableBench更新,WPS报登顶方法榜。
如果你就是那个每天用表格对账、出周报、跑店铺数据的人,看着两家轮流第一,心里冒出来的问题大概很实际:我现在用的工具是不是已经落后了?要不要换?要不要为AI功能掏钱?
先给结论:别急着为榜单换工具——但也别一句"都是营销"就划走。 把这批榜单读对了,它恰好能回答你另一个真问题:哪些"AI会做表"的承诺已经可以放心用,哪些必须拿你自己的表验过才算数。
我把60天里的四次"登顶"、三个国际榜单的口径差异、以及社区里真实的翻车帖,摊开给你看。
一、先盘点:60天里,到底有几个"全球第一",分别踩在哪个榜上
6月15日,飞书: 多维表格AI位列国际表格数据问答评测TableBench第一。官方通稿给出的口径是:覆盖数据检索、统计计算、数据分析、可视化4项核心能力,18项专业测试任务、886个真实业务用例。微信公众号值得注意的是,通稿里没有写分数,也没写具体是哪个子榜。
6月中旬,WPS: 表格Agent Seed 2.0以73.46%登顶SpreadsheetBench的Full 912全量榜单。百家号这个榜来自NeurIPS 2024的论文,912道题全部取自真实Excel论坛的用户提问,42.7%的表格结构不标准、35.7%涉及多表格;论文测得的Excel人类专家基线是71.33%——"跑赢人类专家"的说法就是从这两个数字比出来的。微信公众号再往前,5月份金山自研的表格AI基座Qingqiu Agent已在SpreadsheetBench Verified 400(专家精标400题)拿过94.75%。
7月16日,飞书加码: 宣称6月份同时在三大评测拿第一——FDABench(2007个任务、覆盖金融医疗零售等50多个领域)三项任务均第一、SpreadsheetBench V1 Verified子榜96.50%第一、TableBench第一。微信公众号
7月21日,WPS回场: TableBench更新最新榜单,WPS AI以72.54分登顶Methodology Leaderboard(方法榜),事实核验与数值推理两个维度突破90分。百家号同时金山自己也披露了另一个事实:TableBench官网设有"方法榜"与"大语言模型榜"两个独立榜单,大语言模型榜第一是OpenAI的o4-mini-high,得分61.69——纯模型和"模型+工程"是两张卷子。

加起来:至少6个"第一",横跨3个基准、2家公司、60天。
二、96.5%和73.46%为什么不能比:很多转发稿自己都没读明白的坑
这批新闻下面传播最广的一条对比是:“飞书96.50,WPS才73.46,那飞书强23个点?”
错。这俩根本没答同一张卷子。
96.50%出在SpreadsheetBench的V1 Verified子榜——按飞书自己的说法,这是"经过人工校验后、更清晰、可自动评分的评测子集"。题目干净、判分无歧义,分数天然好-looking。微信公众号
73.46%出在Full 912全量榜——原卷全部硬题、脏题都在里面,同一个全量榜上WPS排第一。
两家通稿里的数字都真实,但把它们放进同一个句子比较,就变成了假。

TableBench那边同理:方法榜考的是"理解问题→找证据→多步计算→分析表达"的完整Agent链路(任务规划、工具调用、代码执行、结果校验),大语言模型榜考的才是裸模型。微信公众号WPS 72.54分在方法榜,而它主动点名的"模型榜第一61.69"恰恰说明:表格干得好不好,模型智商只是起点,场景工程才是胜负手——这反而是整场榜单混战里最值得记住的一个结论。至于飞书6月的"TableBench第一"和WPS 7月的"方法榜第一",一个没标榜名、一个榜单按月更新,两者完全可以同时为真,不构成打假素材。
一句话读法:看到表格AI的"全球第一",先找齐三样东西——哪个榜单、哪个子集/题量、几月数据。缺任何一个,这个"第一"就只配当个候选名单,不配当付费依据。
三、榜单管不到的那一半问题:社区翻车帖全在榜外
更扫兴的事实是:这些评测考的都是"会不会做对",而你日常翻车都翻在"懂不懂现场"。
有用户让AI助手处理一个VLOOKUP套HYPERLINK的门店标签表,连续卡死三次:第一次把FORMULATEXT读公式当成读单元格值,截出来的是"VLOOKUP"四个字母不是图片路径;第二次AI在Windows的Git Bash里用Linux习惯的heredoc跑Python,直接挂起;第三次Excel文件正开着,脚本写入被操作系统文件锁卡成僵尸进程。他的复盘很扎心:换更强模型解决不了这三次卡死——模型差异对结果的影响约5%,流程判断约60%。微信公众号
一个做"自然语言操控表格控件"的工程师给出同构证据:Demo阶段跑啥都顺,一上测试环境就炸——模型不知道用户当前选中了哪一列(它根本看不见你的界面)、让它直接生成代码会调用不存在的方法、工具从5个加到50个之后,你发现模型的工具选择准确率直线下降。今日头条
数字层面同样有前车之鉴:有人问AI行业数据,它秒回:1,287.6 万辆,同比增长 35.2%。微信公众号带小数点、带增长率,看着特别专业,真实数字是1286.8万,那个小数位在任何公开数据里都不存在。
当然也有另一面的真香帖:有人对着Excel看两小时看不出问题,最后靠AI把问题挑了出来。今日头条对照着看,边界就清楚了:检索、计算、汇总、公式生成这类"有标准答案"的活,榜单高分已经证明跨过了可信线;而文件锁、选区、数据脏这类"懂现场"的活,没有任何榜单替你担保。

四、到底谁该动、谁该看戏:对号入座
天天用飞书的团队: 不用为榜单迁移任何东西。这轮成绩里对你有实际意义的,是多维表格AI的问数能力——"找出连续三个月销售额下降且库存周转天数大于30天的产品"这类问题,从找数据分析师排期变成会打字就会分析。微信公众号但前提是数据本来就沉淀在多维表格里;你的资产如果还是一堆本地Excel,先解决搬家,再谈换工具。
WPS个人用户/表格党: 73.46%破71.33%的人类专家基线确实是节点性的——意味着跨表查找、条件汇总、公式生成这类真实论坛题级的任务,已经被验证到"专家水平"。但为"全球第一"四个字升级付费会员没必要;开不开AI套餐,按你每周实际要处理多少张表来算账,不按新闻热度算。
Office 365 Copilot阵营: 模型榜第一(o4-mini-high 61.69)和方法榜第一(72.54)之间那10分差距,说明国际巨头"裸模型强、表格工程化还在追"是真实存在的窗口;但对你而言,访问、合规、协同生态这些墙,比这10分更先决定选型。
通用大模型"扔Excel提问"用户(豆包/Kimi类): 这三个榜单测的都是产品化的表格Agent,不直接测通用对话框传文件的体验。如果你只是偶尔跑一张表,先用现有免费工具,别为榜单换阵营。
一句话:这批"全球第一"的正确用法,是给你一张候选名单,不是一张付款理由。
五、换工具前,花20分钟给你的表做一次私有TableBench
别用宣传里的demo表,用你手头最新那张真表——最好带合并单元格、带"文本格式数字"的那种脏数据。五道题:
多条件过滤汇总:"统计9月华东大区、剔除退款单的销售额合计。“看它是先问你"退款靠哪列识别”,还是直接开算。
跨表查找:两张表用编号关联。看它给出结果后,能不能把匹配逻辑讲清楚、对不上的行怎么办。
脏数据处理:故意在一列里留几个文本格式数字。看它是发现异常,还是给你输出一个偏小的总数。
单位理解:"把这列全部改成百分比显示。"看它把85当85%还是0.85%。
图表核对:让它出趋势图,你手抽查3个数据点。"字段对、数据错、图型也不对"在这类生成里不是小概率。
评分标准就一条:对不确定的事主动声明的,是能用;把瞎编说得像确数的,榜单分和你的表就是两回事。

后续值得继续盯的信号:下一次榜单更新,各家通稿是否肯标全"榜名+子集+分数+时间"(三样标几样,见它对读者的诚意);以及你自己那五道题的抽查错误率,有没有降到你敢直接交差的水平。
榜单还会继续翻转,下个月大概率又有一个"全球第一"。但对表格党来说,这60天的真正信息量只有一句话:"会不会做对"这一半,中国厂商确实在国际考卷上跑到了前面;"懂不懂你的现场"那一半,永远得你自己验收。 榜是它们的擂台,表才是你的地盘。