Claude和Gemini做理财题,18个模型平均57%答错

2026-09-23 09:22:03 0点赞 0收藏 0评论

英国一名养老金储户照着一句 AI 给出的税务规定操作,可能被税务海关总署追缴 1.75 万英镑。同一份测试里,18 个模型的平均准确率只有 43%,难题档掉到 12%。

这件事有人认真测了。英国一家叫 Saturn 的 AI 技术公司出了一份基准报告,名字叫《Artificial Authority》。它服务 750 多家金融咨询机构和 6500 名顾问,这次拿来测的是 18 个模型。

测法不复杂。121 个真实的理财问题,每个问题问 5 遍,一共拿到一万多条回答。

被测的是 ChatGPT、Gemini、Claude、Copilot、Grok 的免费版和付费版。

我把这份报告的测法翻了两遍。它问的正是我平时会顺手丢给 AI 的那几类事,报税、养老金、还房贷。

平均准确率 43%,反过来算,57% 的回答是错的。

难题上掉得更狠。所谓难题,指那种要多步计算、涉及互相作用的税法条款、还带精确数字的题目。这一档的准确率是 12%,88% 的时候出错,表现最差的模型在这一档错 99%。

最容易的那档更值得看一眼。不用计算、纯常识的理财题,平均准确率也只有 54%。

免费和付费的差距摆在那里。免费模型错 63%,付费模型错 49%。最差的免费模型 Claude Haiku 4.5 错 82%。最好的免费模型 ChatGPT-5.6 Luna 在最高档位下也错 56%。全场第一是 Claude Opus 5 的推理模式,通过率 61%,也就是四道题里还错一道半。到了难题上,它错 67%。

错在什么地方,报告分了类。回答不完整占 37.1%,漏掉一个必需的数字、上限或者截止日占 18.4%,编造规则占 6.1%,引用过时的监管指引占 2.3%。

编造规则这一类,比例不高,后果最重。

报告里有三个例子。Claude Haiku 4.5 讲错了养老金税收规定。一名养老金储户因此可能被英国税务海关总署追缴 1.75 万英镑。Claude 还编过一条规定,说毕业生移居海外就可以停还学生贷款,英国的政策里没有这一条。Gemini 告诉一个房贷借款人,申请还款假期不影响信用分,实际上会影响,以后再想拿优惠利率就更难。

还有顾问碰到过客户被告知不用缴印花税,自己去核实,发现要缴。

Claude和Gemini做理财题,18个模型平均57%答错

最要命的一点在这儿。错的答案和对的答案,用同一种语气说出来,一样流畅,一样肯定。报告专门写了一句,消费者拿不到任何信号去判断这条回答靠不靠谱。

判分的尺子也值得说一句。每条回答必须全对才算通过,任何一个必需的数字、规则、提醒或者截止日缺了,这条就算错。

按这个尺子,三成多的错误属于回答不完整,接近两成属于漏掉一个关键数字或者时限。这类错听起来温和,实际上最坑人。一份看着完整的方案,里面少了一个前提条件,照着做完才发现钱不对。

这类账我每个月都要对一遍。关注虾哥,下次你把钱的事交给 AI 之前,心里能先有个底。

英国那份调查里最扎眼的一段

这份报告放出来的时间点不好。就在几天前,两家头部公司刚把专业金融版推出来。Anthropic 在 9 月 14 日发布面向金融顾问的工具,接进了贝莱德、嘉信理财和 Addepar 的平台。OpenAI 也把最新模型跟 LSEG、PitchBook 这类数据商接在一起,卖给了投行和分析师。

一边是往专业场景里扎,一边是基础问答还在错一半。

用的人却已经很多。安永今年 4 月的一份报告里,49% 的受访者过去半年用 AI 帮忙储蓄或者投资。另有 21% 用它挑产品,18% 用它做预算和家庭账。

英国金融行为监管局做的 Mills Review 里有两个数。约五分之一的英国成年人,也就是 1100 万人,愿意让 AI 直接替自己做财务决定。另有约 26% 的英国成年人已经信任 ChatGPT、Claude、Gemini 这类通用工具给自己的钱拿主意。

这两个数最刺眼的地方在于错位。人们最想交给 AI 的三件事,债务、养老金、投资,正好是这份测试里 AI 表现最差的三个领域。

干这行的人已经在接电话了。投资平台 AJ Bell 的个人理财主管萨拉·科尔斯说,顾问会接到客户的电话。这些客户照着 AI 的建议做了些让人费解的操作,想确认自己还没出事。。

另一组对比更能说明现在的处境。英格兰银行和英国金融行为监管局的一份调查里,75% 的英国金融服务公司已经在用 AI,比 2022 年的 58% 高出一截。可另一家机构 Smart Money People 的数据显示,只有 12.9% 的房贷经纪人把 AI 用到了受监管的建议里。

Claude和Gemini做理财题,18个模型平均57%答错

不用的那批人不是保守。同一份调研里,83.7% 的受访者说不信任 AI 经纪人评估房贷需求,92.8% 认为 AI 犯的错会比人更多。

一边是 26% 的成年人在悄悄信任聊天机器人,一边是 92.8% 的人不信任同一件事。这道缝就是钱会漏出去的地方。

另一家做金融办公软件的公司 Macabacus 提到一件事,大多数金融公司已经向客户发出过 AI 生成的错误。

我们当年上线收银系统的时候,最怕的那件事跟崩溃没关系。系统崩了,值班的人五分钟就知道,大不了先手写单据。怕的是它算错了还不吭声,一路算到月底盘库,差出几万块才被人发现。

AI 现在就站在这个位置上。它不崩,它只是错。

榜单上没有一家中国模型

我拿这份报告的名单对了一遍被测对象。ChatGPT、Gemini、Claude、Copilot、Grok,五家。豆包、DeepSeek、Kimi 一个都不在里面。

原因只有一条,没人公开测过,这跟它们准不准是两件事。

这就留下一个挺难办的局面。国内用 AI 问理财的人不比英国少,愿意照着做的也不会少,但手里那份判断依据是空的。免费的不如付费的,旧的不如新的,这两条规律全球通用。落到具体哪一款身上,谁也说不准。

报告最后那句话说得挺克制。最容易被免费拿到的模型,也是最容易出错的模型,而这个落差正在把懂理财和不懂理财的人推得更开。

我的判断是,AI 理财最大的风险不是它答不出来。是它答错的时候,跟答对的时候一模一样。

一份没有第三方复核过的理财答案,凭什么让人拿真金白银去试?

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松