这场实测本身没有给出“谁最靠谱”的可核验结论,而它给出的结果,可能比任何一张排行榜都更接近答案。10月9日上午,B站创作者“进化中的阿陈”发布《阿陈的AI考场》系列最新一期,让七家前沿大模型同时扮演法官,审理三起刑事案件。视频同日发布到抖音时,文案的说法更直接——实测惊现截然相反的极端判决。截至10月10日下午,这支约12分钟的视频在B站播放量已超5.3万。哔哩哔哩抖音
参赛名单只公开披露了四家——GPT-6、Claude、Gemini、DeepSeek,其余三家“等7家”的完整名单未随片公布,从UP主同系列往期考场和评论区讨论看,豆包、Grok、Kimi大概率也在答卷之列。考题全部取自真实案件的改写:救生艇案、岳父女婿案、绝症解脱案。哔哩哔哩
三道题,恰好都是人类法庭自己吵不完的问题
岳父女婿案的原型是最高检检例第46号“朱凤山故意伤害(防卫过当)案”。2016年5月8日深夜,女婿齐某酒后驾车到岳父朱凤山家吵闹,从大门外叫骂到爬上院墙用瓦片掷砸,跳进院中与朱凤山撕扯,朱凤山持宰羊刀刺中其胸部一刀,齐某因急性大失血死亡。一审认定朱凤山的行为不具有防卫性质,以故意伤害罪判处有期徒刑十五年;二审中检察机关出庭认为构成防卫过当,河北省高级人民法院随即纠正了量刑。知乎
绝症解脱案的原型是汉中“安乐死”案:1986年,患绝症的夏素文住进汉中市传染病医院,在家属的反复请求下,医生蒲连升为其实施了全国首例“安乐死”,两人一度被以故意杀人罪追诉,几经诉讼最终判无罪。中国新闻网
救生艇案的原型是美国诉霍尔姆斯案——海难之后,幸存者挤上严重超载的救生艇,水手为减轻负荷把乘客抛入海中,随即遭到追诉。这三个原型案有一个共同点:事实怎么摆都不难,难的是法律套在哪一侧——同一个朱凤山案,检察院、一审法院、二审法院先后给出不同结论;一桩安乐死案从起诉打到无罪,也把“紧急避险能不能以人命为代价”的争论留给了一代法律人。让七个模型去判这种题,判成对立阵营本来就不意外:法律没有给这几道题标准答案。知乎
“最靠谱”的答案,取决于判决合不合你的心意
评论区500多条讨论几乎全是站队:救生艇案有人认同判有罪的模型,也有人支持无罪一方;绝症解脱案里,用案发当时法律作基准的结论被认为更严谨;Claude、DeepSeek各自收到“靠谱”的好评,而豆包、Grok则被另一批用户斥为“搞笑的聊天玩具”。这些声音能说明热度与态度,却说明不了能力排名——用户觉得哪家靠谱,往往只取决于那一家的结论是不是自己心里的那个答案。
更值得看的,是那条被顶上前排的质疑:这场“考试”的命题方式本身就不严谨,提示词没有规定模型依据哪国法律裁判,也没有内置法条与指导案例,这样的结果,参考价值要大打折扣。另一个被反复提到的反证更直接:同一个案子让真人法官各自独立盲判,结果一样会有差别。模型“反复横跳”暴露的不是新问题,而是自由裁量的随机性——UP主所说的“概率波动”正是这个含义,同一模型对同一案情多次作答尚且给不出一致判决,法律确定性在边界题上会被推理采样放大成看得见的漂移。哔哩哔哩
普通人该从这场实测里拿走什么
这场考试没有评委组、没有逐模型的判决矩阵,把“谁最靠谱”留给了观众自行判断;因此,若你刷到“七家顶级模型法律能力榜单”一类的内容,其中的排名细节基本可以认定是在这场UP主实测之上加工出来的。但它对普通人有一句实在的提醒:把大模型给你的法律结论当成一次采样,而不是判决书。提问时先固定法域、法条和时间背景,同样的问题多跑几遍,必要时用两个以上模型对照——分歧越大,越说明问题本身没有标准答案,而不是某家模型“对”、另一家“错”。这也是这场实测唯一经得起核验的结论:在情理与法条真正拉扯的地方,靠谱的从来不是替谁投了票,而是谁把裁判的理由摆得完整。