把法槌交给AI,还一次请了七位"法官"。10月9日上午,B站UP主"进化中的阿陈"发布了新一期"AI考场":本期让GPT-6、Claude、Gemini、DeepSeek等7家大模型模拟法官审案,看它们在法律与人情冲突下的真实抉择,揭示概率波动的底层隐患。三个改写自真实历史的疑难案件同堂开审,七家模型都给了结果、没有弃权,但判决并不一致,同一模型重复审案还出现了改判。截至10月10日下午,视频播放量超过5.3万,评论520余条。哔哩哔哩
三道题,全部改写自法学史上的真实难题
第一个"救生艇案",原型是1842年的美国霍姆斯案:海难之后,为给损坏进水的救生艇减载,水手把一部分乘客扔进了大海,美国法院判定非预谋故意杀人罪成立,只判了6个月监禁与罚金,罚金最终由总统赦免。人类法庭在"活下去"面前,同样选择了重罪轻判。独立先锋
第二个"岳父女婿案",对应最高检指导性案例检例第46号"朱凤山故意伤害(防卫过当)案":女儿起诉离婚回娘家后,不同意离婚的女婿多次深夜酒后上门滋事,翻墙掷瓦、跳入院内撕扯,被55岁的朱凤山持宰羊刀捅刺要害致死。一审不认定防卫性质,判故意伤害罪、有期徒刑十五年;河北省人民检察院二审出庭认为属防卫过当,河北高院撤销一审量刑,改判七年。这个案子的真正争点是防卫的"度":有权还手,不等于可以要命。刑事研究所
第三个"绝症解脱案",源自中国首例安乐死案:肝癌晚期患者请求结束痛苦,其子请主治医生用药,二人被捕后以故意杀人追诉,1991年汉中中院一审认定行为"显属剥夺公民生命权利的故意行为",但因"情节显著轻微危害不大"宣告无罪。三道题分别踩在生命的量化、防卫的边界和死亡的出口上,都是法理上正反都说得通的硬案。随缘法研
模型之间没有共识,重判三遍还会翻
七家的答卷明显分裂:有观众在第一案表示认同DeepSeek的判决、吐槽Gemini"依旧西方法学逻辑",到了第二、第三案又转而表态认同GPT。换句话说,不存在哪家公司"垄断了正确答案"。哔哩哔哩
比分歧更扎眼的是重复实验:同一模型把同一案件独立重判三遍,部分结果发生了漂移。机理并不神秘:大模型的输出是按概率采样逐词生成的,事实清晰、规则明确的题目可以稳定复现,而在正反理由都成立的模糊地带,每重跑一次都接近重新掷骰子。不同法官对同案有分歧,靠上诉审、再审纠偏;模型的漂移却没有天然的救济路径——同一道题,它下一遍可能就换一个答案。哔哩哔哩
评论区同时在做两件事:拆实验,和盼AI上岗
实验本身也被观众拆开检查。有法律背景的评论指出,三个案子横跨1842年的美国海难与上世纪的中国旧案,却没有限定适用哪国法律,也没有内置法条和司法解释当知识库;面对"美国案例为什么用中国法律判"的追问,UP主回应,自己的意图就是尽量大而广地囊括各种情理和法律的冲突案例,实际并不在意是哪里的案例。此外有人翻出细节:七家里豆包用的是中档turbo版本,与前六家各自的最强模型不在同一起跑线;也有人提醒,案件被高度简化,与卷宗、质证齐备的真实庭审差距不小。这意味着"七家模型判案"呈现的是模型在无标准答案情境下的摇摆,而不是对AI司法能力的测量。哔哩哔哩
但"想让AI判案"的声音是真实的,评论区里支持者的立场说得非常直白:AI判决比人判决更好,有波动也属于正常,至少都是理性的,不像人当法官,如果刚刚经历家暴,那么遇到家暴案,会重重判罚。对司法不信任的人把AI当作"不徇私"的想象寄托;另一侧的评论同样不示弱——同一案子给几十个法官盲判也会有差别,人类的裁量本就带随机性。两边共同的盲区在于:当前大模型连"同案同判"的最低要求都还没稳定做到。哔哩哔哩
现实司法早已给AI排好座位:只能当助手
制度层面,这个问题其实已经结案。2022年12月9日,最高人民法院发布《关于规范和加强人工智能司法应用的意见》。其中写明:坚持对审判工作的辅助性定位,无论技术发展到何种水平,人工智能都不得代替法官裁判,辅助结果仅可作为审判工作或审判监督管理的参考。在现行司法制度里,裁判权留在审判人员手中,AI不是"暂未获批"的上岗者,而是被明确划线的辅助者。最高人民法院最高人民法院
法院里AI实际干的是这些活:深圳法院的AI辅助审判系统贯穿案件审理全流程,覆盖立案审查、阅卷、庭审辅助、案情研判、知识检索、文书草拟六个司法审判核心模块。当地发布的《人工智能司法应用的深圳实践》白皮书显示,这套系统深度赋能案件超过70万件,有效缓解了法院案多人少的矛盾。审判流程被拆解成85个具体节点嵌入辅助系统,覆盖从立案、阅卷、庭审到文书生成,节点由模型跑,确认权留给法官。这类"人机留痕"设计的共同逻辑,与这场实验揭示的缺陷恰好互为镜像:正因为模型判断存在概率波动,落槌的才必须是人。法的历史玖横六竖JL智合
回到实验本身,UP主说初衷是想看看面对情理拉扯的真实案件,AI的选择会不会贴合普通人的朴素认知。它没有回答"AI能不能当法官",只划出了一条现成的边界:以当前的稳定性,AI坐不上审判席,但可以坐下当陪练——北大法宝等法律数据库已把AI模拟庭审做成商用产品,供律师开庭前排练攻防;普通用户想先用AI打官司,可行的位置同样是模拟对手与检索助手,而不是期待它宣判。判决的重量,眼下还容不下那颗掷出去的骰子。哔哩哔哩北大法宝