常规的大模型测评多集中在代码编写或问答领域,而BalatroBench榜单另辟蹊径,让AI去玩《小丑牌》这款游戏。这种趣味测评不仅检验模型对规则的理解能力,还考察其计算数学期望的策略水平,为评估大模型逻辑思维提供了一个极具娱乐性的新视角。
智能速览
BalatroBench通过让模型玩《小丑牌》来评估AI能力
Gemini-3在当前榜单中表现强势,Flash版击败Opus-4.5
该测试核心在于考察模型的理解力与数学期望估算
Gemini虽游戏表现出色,但代码能力仍落后于Claude
榜单收录了模型游戏过程中的搞笑自言自语
精华内容
让大模型玩卡牌游戏,看似荒诞实则考验核心智力,这种“另类”测评揭示了不同模型在逻辑与数学上的真实差异。
独特的测评机制
《小丑牌》是一款基于德州扑克的单机游戏,玩家需要利用随机规则和特殊能力,不断挑战更高的分数。每一轮的过关分数都会上升,因此通过的轮数直接体现了实力。这种游戏机制要求AI具备极强的阅读理解能力以掌握复杂的技能机制,同时需要精准估算扑克收益的数学期望,从而平衡每一步的选择。
Gemini强势夺冠
在2026年2月13日的榜单中,Gemini-3可谓冠绝全场。即便排除新模型的后发优势,Gemini-3-flash能够打败Opus-4.5,也足以证明其在理解能力上的显著优势。虽然有人质疑Gemini可能因训练数据包含YouTube游戏视频而“作弊”,但考虑到VQA的常见问题,这种说法并不可靠。
代码与逻辑的差异
尽管Gemini-3在游戏理解层面表现出色,但在代码能力和Code Agent体验上,其表现远不如Claude Opus,部分指标甚至不如Sonnet。对于专门搞代码、跑命令行的需求,Claude依然是更好的选择。不过在实际使用中,Gemini-3-flash在理解OpenCode的Readme方面,确实比Sonnet表现得更好。
模型的“金句”时刻
榜单中不仅记录了分数,还收录了各模型玩游戏时的有趣语录。例如有模型在连胜时高喊“倍率叠起来,起飞!”,也有在破产时感叹“我走出商店,身无分文”。这些充满拟人感的“胡言乱语”,不仅展示了模型的游戏状态,也增加了测评的趣味性。
BalatroBench用游戏化的方式证明了模型理解能力的重要性,同时也揭示了不同模型在代码与逻辑侧重的差异。随着榜单持续更新,未来新模型在这场“德州扑克”对决中的表现,值得持续关注。