Claude脑子里在想什么?终于能看见了

源自13位全网作者

07-09 00:02

内容由AI生成

精选参考来源

1. Anthropic新研究发现Claude的心里话J-space

2. Anthropic挖出Claude内部J-space 占量不到一成 推理逻辑彻底变了

3. Claude 的 J-space 是什么

4. Anthropic发现Claude的"内心世界":J-Space

5. Anthropic J-Lens 可解释性突破 · 深度分析

6. Anthropic 在 Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法

7. Claude 的大脑里有个"小黑屋"——Anthropic 最新发现让科学家炸了

8. Claude没有说出口的那些话,被Anthropic看见了

9. Anthropic 这篇论文,说Claude 大脑里长出了类似人类意识的器官?

10. Anthropic 在 Claude 内部发现了一个「内心世界」

11. Anthropic 发现 Claude 具备潜意识?

12. Claude「长出意识」刷屏,Anthropic原文说的是另一回事

13. Claude 的“内心活动”被看见了? Anthropic 最新研究,可能是理解 Claude 最重要的一步。 他们发现,Claude 内部似乎存在一个特殊区域:J-space。 你可以把它理解成 Claude 的“心理工作台”—— 有些想法不会出现在输出文字里,但会先在这里亮起来。 比如: 它在做多步推理时,中间步骤可能不会写出来,但会出现在 J-space。 它读到有问题的代码时,内部可能已经浮现出 “ERROR”。 它面对诱导、伪造、隐藏目标时,研究人员也可能从这里看到一些异常信号。 但重点不是“Claude 有意识了”。 Anthropic 自己也很谨慎: 这项研究不能证明 Claude 有体验、感受或人类意义上的意识。 真正重要的是另一件事: 以前我们只能看模型“说了什么”。 现在研究人员开始尝试看到模型“正在想什么但没说”。 这对 AI 安全非常关键。 因为未来越强的模型,未必会把真实推理全部写出来。 如果我们只看输出,就可能错过它内部已经形成的判断、计划和风险信号。 #Claude #Anthropic #人工智能 #大模型 #AI安全

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章