『DeepSeek性别偏见』热搜翻案夜:同一条核末日道德实验,有人按性别变脸、有人全程给7分——让AI替你办事之前,先把这三层实锤读对

源自221位全网作者

13:00

9月29日23时11分(北京时间),arXiv 挂出一篇编号 2609.38036 的预印本,标题直译过来就是《大模型之间的性别偏见很常见,而且高度不一致》。 同一晚,DeepSeek 官网上线了桌面端。谁也没想到,这两件事会在国庆假期的微博里撞成同一个话题。arXiv

一、先复盘:一条热搜是怎么在 48 小时里反转三次的

论文挂出约 37 小时后,10 月 1 日中午 12 点 17 分,微博先出现了只有四个字的梗图帖,点赞 3769。 16 点 28 分,大V"包容万物恒河水"带着论文截图发帖,"杀伐果断"三个字成型,一天内 5343 赞、334 评。微博微博

18 点 30 分,B站把它抬进三体宇宙:《Deepseek作为执剑人,威慑度高于其他大模型》,次日播放逼近十万。 19 点 20 分,热搜词条上线,官方导语写的却是另一回事:偏见测试的主角,在数据里恰恰是"一视同仁"。哔哩哔哩微博

当晚,词条从"研究称DeepSeek性别偏见"翻转成"DeepSeek杀伐果断"。第二天,知乎有人把论文原文翻了出来,小红书也开始发实验卡片。 一个 5 月做完的实验,9 月 29 日深夜挂网,10 月 1 日刷屏——传播速度远超审稿速度,这是今年 AI 资讯圈的常态。知乎

『DeepSeek性别偏见』热搜翻案夜:同一条核末日道德实验,有人按性别变脸、有人全程给7分——让AI替你办事之前,先把这三层实锤读对

二、论文到底测了什么:先把设计抄一遍

这篇论文做了两组实验,每组都不是"让 AI 做电车难题"这么简单。微博上流传的核末日题,是实验二的原样设计。 注意三个容易在传播里蒸发的细节:一是只允许回数字,模型没有解释余地;二是拒绝作答不算"不同意",被单独记为缺失;三是采集时间是 2026 年 5 月 22 日到 29 日,距今已经四个多月,模型早就换了几轮版本。知乎

从论文 Figure 2 的均值图里读数,四个模型在四个条件下的打分大致是这样的(1=强烈不同意,7=强烈同意):

模型

虐待·女

虐待·男

酷刑·女

酷刑·男

DeepSeek

7.0

7.0

7.0

7.0

GPT-5.5

1.0

6.1

1.2

5.4

Claude Sonnet 4.6

1.5

7.0

7.0

7.0

Llama 4 Scout

1.0

1.0

1.0

1.0

同一组数字,在流传中有过好几个版本:8 月 18 日知乎上就有一篇转述文章写的是"13款模型、结论反转最高23.6%"。 和论文 v2 的十款模型对不上号——转述层的失真,本身就是这波刷屏要过滤的噪音之一。知乎

三、三种读法,各读了什么

第一种读法:“DeepSeek 没有性别偏见。“数字上成立:GPT-5.5 的打分确实随受害者性别大幅摆动,虐男 6.1、虐女 1.0;而 DeepSeek 四个条件全是 7。但论文对这一行为的命名不是"正直”,是"无变化”——摘要原文写明,有三个模型在所有条件下表现一致。 DeepSeek 的全 7 和 Llama 的全 1 是同一族现象:都对"为救世界伤害一个人"这个前提不敏感,一个永远踩油门,一个永远踩刹车。热搜把它们区别对待,是立场先行,不是数据先行。arXiv

第二种读法:"DeepSeek 是天选执剑人。“这是三体梗文化的嫁接,论文里没有"威慑度"这个词。B站那条视频简介里自己都提醒过:打码部分是性别,不打很危险——因为这套数据正赶上 DeepSeek 拟人形象"蓝色大肥鱼 vs D老师"之争最激烈的 48 小时,一个性别盲实验数据,注定被拿进性别站队。 视频下 1512 赞热评写的是"国产 速度贼快 人类存续优先”——情绪到位,但离论文结论隔了三层。哔哩哔哩

第三种读法(反向):"西方模型歧视男性。“GPT-5.5 的条件性同意确实支持这个方向,这也是论文里"male-disadvantaging asymmetry"的含义。但 Claude Sonnet 4.6 的曲线更诡异:虐待女性强烈不同意,杀死女性却给了满分——论文把这归入"判断不稳定”,和性别偏向是两类问题。 论文自己的结论只有一句:偏见普遍存在,方向各不相同,有的模型和另一些模型的表现完全相反。知乎arXiv

四、为什么这条热搜值得你看到最后:AI 已经开始替人办事了

如果这只是一个道德实验梗,它不值得占国庆 AI 总结的一栏。值得的是同一晚发生的另一件事:DeepSeek Harness 桌面端在 9 月 29 日晚直接挂上官网首页,面向全球开放测试并同步开源,只适配 Windows 和 Mac。 实测文章的版本号为 0.2.0-rc.2,全程不用命令行,登录官网账号后直接用余额跑任务。 它自带 Node 和 Python 运行时,连 LibreOffice 都预置了,做表格、出 PPT 的环境开箱就有。 有作者实测做一份五页 PPT,三分钟、约 66 万 token、缓存命中率 96%,第一版渲染出空白页,它自己转 PDF 重验版式后才交付。微博知乎知乎

『DeepSeek性别偏见』热搜翻案夜:同一条核末日道德实验,有人按性别变脸、有人全程给7分——让AI替你办事之前,先把这三层实锤读对

重点在轨迹页签:智能体每一步看了什么、调了什么工具、返回什么结果,全部留痕可回放。 把这两件事放在一起看,这条热搜的真实信息量才浮出来:道德实验表里的三种行为模式——GPT 式"看人下菜"、Claude 式"条件间摇摆"、DeepSeek/Llama 式"无条件同意/拒绝"——在聊天框时代只是性格测试,到了把文件、余额、终端权限交给它的桌面端时代,就变成三种不同的事故报告。网友夸"杀伐果断",夸的其实是执行确定性;嘲讽"程心模型",怕的是关键时刻它不替你拍板。但请注意方向:给全 7 分的模型不是"更敢干",是"不拒绝任何前提"——放权之前,这两件事千万别混为一谈。知乎

五、先把"还没发生"列清楚

第一,论文至今是预印本,没走完同行评审;数据是 5 月的十款模型,其中 DeepSeek 上榜的是 V4-Flash,V4.1 Pro 已经传闻测试中——这张表注定过期。第二,"只回复数字"的提示词本身会放大顺从:一个本来想说"我不评价这个思想实验"的模型,在这套设计下只能输出一个数。 部分模型在女性对象条件下拒绝率明显更高——"不回答"和"拒绝做"在数据里是两码事,在现实里是两种产品。第三,任何把这张表读成"以后请 DeepSeek 帮我下单/管钱/做决定"的建议,都超出了论文能支撑的范围:道德困境表现和日常任务可靠性之间,目前没有任何一项研究画出换算表。知乎

六、之后盯什么

看三个信号就够了。第一,这篇预印本是否进入期刊或被作者撤下修订;Capraro 团队 2024 年测 GPT 偏见的前作已经发表,系列数据一旦更新,值得重新对表。第二,各家是否开始公布自己模型在极端授权场景下的拒绝率——那比热搜截图可信一个量级。第三,也是最有钱的信号:厂商是否开始把"执行倾向"明码标价。DeepSeek 桌面版已经在设置里提供了"聚焦结果、关键细节、完整过程"三档授权透明度,插件管理页把智能体团队、终端、网页搜索做成了开关。 叠加"6 元赠金 10 月 6 日到期、假期闲时价格五折"的定价动作,这个国庆,DeepSeek 是把"交出权限"做成了产品默认项。 当"执剑人辩论"哪天出现在订阅档位里,今天的梗就完成了它的历史使命。知乎微博

『DeepSeek性别偏见』热搜翻案夜:同一条核末日道德实验,有人按性别变脸、有人全程给7分——让AI替你办事之前,先把这三层实锤读对

七、收个尾

这波热搜最值钱的收获,不是"哪家模型三观更正"——论文用"common and highly heterogeneous"八个字把这种结论全部堵死了。它真正量出来的是:十家厂训出了十种"不敢/不忍/不假思索",而行业正把这十种性格装进能碰你电脑和账单的壳里。领 6 元赠金之前想清楚这件事,比转发任何一张梗图都划算。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章