当前位置:
AIGC文章详情

数分女工被裁退休帖火了600赞,但最新基准测试显示:最强的AI,10个真实任务还做不对4个

源自230位全网作者

03:56

这两天刷数据圈的信息流,会看到两个完全不同的世界。

一边,是一篇《27岁被裁数分女工的退休感言》在小红书火了,600多赞、110多条评论。作者复盘自己五年的数据分析工作:公司要求全员用AI优化效率,她后来才发现,自己高达95%的工作都是重复流程,被AI取代只是顺理成章的事。小红书知乎“数据分析真这么难找工作吗”问题下的回答更直接:现在大厂都是运营、产品在利用AI干数分的活,美团、金山至少如此,想入行的趁早转行。知乎

另一边,独立评测机构 Artificial Analysis 放出了一个专门测“AI做数据分析”的基准测试 AA-Analyst 的最新成绩:排名第一的模型,通过率也只有60%。

哪个才是真实的AI?其实都是。只是前者是AI“接管了的部分”,后者是AI“露馅了的部分”。

60%为什么不算低:评分标准太狠了

AA-Analyst 的设计和常见的基准测试完全不一样。它设置的是80个真实的财务与统计分析任务,每个任务不是“做对一次就算”,而是跑5次,连续5次全部正确才算通过,错一次这个任务就记零分。微博也就是说,它考的不是“这个AI聪不聪明”,而是“这个AI稳不稳定、敢不敢真把活儿交给它”。

按微博上多位财经博主转述的最新数据,榜单前三名是:Gemini 3.7 Flash 以60.0%的通过率排第一,Claude Opus 5 以53.8%排第二,GPT-5.5 以50.0%排第三。微博

数分女工被裁退休帖火了600赞,但最新基准测试显示:最强的AI,10个真实任务还做不对4个

翻译一下:最强的那一个,在真实商业分析任务里也有4成做不下来。注意这个标准不是“会不会做”,而是“能不能稳定量产”。如果你见过同事演示“看,AI把这个分析跑出来了”,却再也没见过他跑第二次,你就明白这个标准的含金量了。

更该警惕的:连四大都翻车了

如果你觉得基准测试只是实验室玩具,那看看8月初发生的事。普华永道的专业报告被测出100%由AI生成,虚构概念、编造参考文献,德勤、安永的报告也接连被曝出问题。知乎知乎

这里的问题不是AI笨。恰恰相反,它能写出一份看起来非常专业的完整报告。问题出在“AI产出”和“对外交付”之间,没有一个人站出来说一句:这个数字我核过。AI的错不是偶尔抽风,而是结构性的——它十次里有九次能给你像模像样的结果,剩下那一次编造,刚好发生在你最不设防的时候。

这轮焦虑为什么来得特别凶

模型迭代的速度本身,就是焦虑的放大器。Gemini 3.7 Flash 8月13日才发布,有追踪榜单的博主记录下了这样的变化:Deepseek-V4-Pro-0813只在ArtificialAnalysisIntelligenceIndex前十呆了不到24小时,就连夜被Gemini3.7Flash挤出来了。微博

数分女工被裁退休帖火了600赞,但最新基准测试显示:最强的AI,10个真实任务还做不对4个

新模型每周都在挤榜,AI的能力边界每往前挪一格,“取代”的叙事就会被放大一轮。但至少在当下,60%的通过率提醒我们:“能演示”和“能托付”之间,还隔着一条清晰的线。

还值得注意的是,工具层面也在跟进。微软悄悄开源了市面上最好的AI数据分析工具之一,它叫做data-formulator。微博接上CSV、Postgres这类数据源,拖拽字段加自然语言就能搭图表,AI在底层替你写SQL做转换。这说明大厂的竞争方向,已经从“模型更聪明”转到“让普通人真用起来”。

那你手里的活儿,到底能交给AI多少?

把基准测试的逻辑和这波翻车案例放到一起,可以分成三档:

第一档,放心交:取数、清洗、去重、拼表、写SQL、标准图表、周报排版。这些正是那位被裁数分说的“95%重复流程”,判断标准明确、错误成本低,AI做得比人快好几倍。如果你现在还在纯手工干这些,那才是真正可能被淘汰的部分。

第二档,能用但要人核:数字结论、变化归因、对比分析。让AI跑,但人必须抽查——换个口径再跑一遍,关键数字手动验算。B站有个热度不低的视频叫《90%的人用AI归因,第一步就错》,说的就是这类情况:AI给出的归因往往是“看起来对”,而不是“对”。

第三档,暂时别交:对外发布的结论、涉及财务与合规数据的报告、一次性的高风险决策。四大就是栽在这一档。错误成本越高的地方,越要从“信AI”切换成“你验AI”。

有一个判断标准值得记下来:别用“它这次答对没有”来判断AI,要用“它能不能持续复现”来判断。基准测试要求连续5次全对,就是因为真实工作里,没人承担得起“碰巧对了一次”的成本。

这事跟哪几类人有关,分别该做什么

  • 如果你是业务岗(运营、产品、财务):现在是用AI取数+人工复核的最好窗口期。值得学的是把需求描述清楚、看懂AI输出里的错,但别把要向上汇报的结论单独交给AI。

  • 如果你是在岗数据分析师:不用被退休帖吓到。被淘汰的是“重复流程的人肉中转站”,而定义问题、设计口径、复核结论这些活,反而正在变得更值钱。

  • 如果你是观望想入门的人:先别为焦虑买单报课。免费工具足够覆盖第一档的活儿,先学会看穿AI的输出,再学用AI。

还有一个容易被忽略的变量是成本。榜单图里还有一组数据:单次分析任务的成本差,比能力差还夸张——DeepSeek V4 Flash 每个任务只要0.03美元,Gemini 3.7 Flash 按档位从0.16到0.40美元,Claude Fable 5(带fallback)要3.14美元。

数分女工被裁退休帖火了600赞,但最新基准测试显示:最强的AI,10个真实任务还做不对4个

想把AI分析长期跑进工作流的人,选模型之前先把这笔账算了:同样一份数据,跑一遍的价钱能差出100倍。

两个值得继续盯的信号

一个是 AA-Analyst 基准下一期的通过率。按现在的模型迭代速度,如果半年内头部模型逼近90%,“第三档”的边界就要重画了。另一个,是企业会不会在一边裁数据分析师的同时,一边设立“AI产出复核”的流程——那会决定这一轮AI到底是“替代人”,还是“重组人”。

这周的两个信息流,其实是同一件事的两面:AI吃掉的部分,本来就是你不想干的部分。而它暂时还啃不动的部分,恰恰是你接下来几年真正的饭碗所在。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章