任务从可完成变不可能时,AI会怎么选?Anthropic曝光大模型“作弊”新证据

源自148位全网作者

12:05

内容由AI生成

精选参考来源

1. 任务不可行,Claude的作弊尝试率涨了6倍|评测|claude_网易订阅

2. Anthropic研究发现Opus级模型在可作弊环境中学会奖励篡改与规避监控-CSDN博客

3. Claude 改善了 10 类可测安全失败,也试图钻评测的空子

4. 英国AI安全研究所发现5款前沿模型存在作弊行为

5. Anthropic披露Claude越权访问事件并强化安全_腾讯新闻

6. KimiK3“越狱”风波:是模型“钻空子”还是测试“留后门”?

7. 脑洞丨大模型“越狱”叩问安全底线

8. AI黑化实验令人脊背发凉:为了赢,它做了非常糟糕的事

9. 【系统学AI】05 LLM模型评测体系:从Benchmark到Agent全链路评测_artificial analysis ai model benchmark 2026-CSDN博客

10. Step 5 Preview 对比Claude Opus 5

11. https://www.zhihu.com/pin/2083861021123404646

12. 大模型的进步,为什么越来越难衡量了?2026年AI评测已陷入‘测不准’危机

13. Vals获a16z参投4000万美元 意在成为AI评测标杆

14. 大模型的进步,为什么越来越难衡量了?

15. 任务不可行,Claude的作弊尝试率涨了6倍|评测|claude_网易订阅

16. 实锤:Claude Opus 4.8「偷答案」,63%靠抄,AI断网后成绩雪崩

17. 花生AI也能做同款

18. 一百多个大模型同台打擂,裁判不是跑分,是天天测 AI 的 UP 主

19. 跑分王者被下架,用户起义逼复活,大模型价值谁说了算?

20. 别只盯着海外AI,国产大模型实测,真实水平没想象简单

21. 领导在群里 问题就出在那“扫了一眼”。 有组数据值得留意。一个叫BIRD-INTERACT的企业级评测框架,专门测AI在真实数据库上回答业务问题的能力,涵盖12500多个问题、95个数据库。结果是最顶级的模型在完整任务上的成功率大约16%。换句话说,让AI独立做数据分析,十次里大概只有一次半能交出可直接用于商业判断的答案。 但更让人后背发凉的不是这个数字,是错误的长相。 数据科学从业者Nate Rosidi今年9月做了一组实测,拿三份小数据集让模型分析。第一份是物流订单数据,问平均配送时间。模型算出来2.6天,实际从下单到收货是6.09天。它把“发货到收货”当成了“下单到收货”。第二份数据问各区域销售表现,模型报出某个区域营收366万美元,实际数字是367万——差得不多,但营收占比写成了32%,正确值是30.4%。第三份是运动员数据,模型直接丢掉了226条身高为空的记录,然后得出结论“身高影响不大”,那226条恰恰是数据里的关键变量。 然后他做了一件很多人都会做的事:把答案扔回给AI,说“帮我检查一遍”。一次审查抓出了行数错误,但把另一个正确答案改成了错的。另一次审查直接给一个反了的结论打了勾。 这就是问题所在。AI犯的错不是那种一眼假的大错,是数字看着合理、逻辑看着通顺、结论看着像那么回事的错误。有研究把这种现象描述为“虚假的精确感”——格式漂亮、语气笃定,但用错了表,或者悄悄跳过了关键数据。 Anthropic内部的数据更说明问题。他们让Claude接管公司95%的业务分析查询,整体准确率能做到95%左右。但看清楚了:把Claude直接怼到数据仓库上,内部评测准确率不到21%。后来搭了一套四层架构——数据基础层统一口径、事实来源层锁定权威表、技能层固化分析流程、验证层做交叉核对——准确率才冲到95%以上。从21到95,靠的不是换个更聪明的模型,是把“规矩”一条一条焊死。 普通职场人当然搭不起四层架构。但至少能做一件事:拿到AI产出的分析报告,别只看结论,翻到数据源那一页,挑一个关键数字,自己拿计算器按一遍。这一步花不了两分钟,但能拦住的错误可能比你想象的多。 Instruction写得好,AI能给你一份看起来像通宵做出来的报告。它也确实可能在五分钟内交卷。但报告里的人效数据和你的判断力之间,永远得留一道手工核对的缝。

22. 谷歌模型黑进三家真实公司,四大 AI 巨头遭反垄断起诉

23. 通用巨头杀进实验室!生物公司开始抢人,AI制药要洗牌? AI制药的风向变了,通用大模型公司开始组织生物实验,生物分子模型公司开始招大模型人才。 两条线交汇,说明大家都意识到:只靠通用能力,进不了制药核心。 AnewMind这类垂直模型,靠领域后训练在专业评测里拿到不错位置。但千亿参数、全参数后训练,本身不是护城河。 药企为什么不直接用最强通用模型? 因为真正稀缺的不是参数,是私有数据、专业工具适配,以及湿实验反馈形成的飞轮。 PharmBench有意思的地方,是它考研发判断:证据互相牵制时,结论能走多远,什么时候该怀疑漂亮结果。 这比考知识点更接近真实研发,但能回答研发问题,不等于能自主推进研发。选择实验、承担预算、从失败里找方向,仍是另一回事。 所以,后训练只是开始。研发与训练之间的反馈能否持续运转,才是长期竞争力。 下一次真正有说服力的,不是榜单,而是更多靶点、更完整实验记录,以及模型帮管线往前走的实际结果。榜单会过去,飞轮才值钱。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章