15个大模型各管了20年足球俱乐部:冠军花钱最少,6个人类4个中途下课,FM玩家该看看这份答卷

源自28位全网作者

03:07

这个九月的FM圈,气氛有点微妙。

《足球经理27》上周刚官宣11月发售,开发进入最后阶段,官方说具体情报九月起每周一波地放;玩家测试计划的候选名单登记入口八月中就开了,B站这周已经冒出"Alpha测试开始发放邀请"的消息视频,底下第一条留言是"我怎么没收到[大哭]"。微博微博哔哩哔哩

但空窗期里还有一拨FM玩家,比等27更投入——他们在教大模型管球队。微博上有人把DeepSeek设成助教,晒出"上任后球队5轮不败"的存档截图;小红书上有人用GPT写了一款"能跟球员对话的足球经理",自己玩得不肯放手;更早之前,《足球经理26》官方访谈里就承认,本作使用了AI协助翻译工作。微博小红书小红书

15个大模型各管了20年足球俱乐部:冠军花钱最少,6个人类4个中途下课,FM玩家该看看这份答卷

所以问题其实已经到了嘴边:大模型到底会不会管球队?会不会有一天替你把FM的档带了?

8月下旬,一篇挂在arXiv上的论文《FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents》(AnalogyAI团队,15个模型+26个工具+20个赛季)真把这事考了一遍。知乎小红书 只是考场不是FM26——作者自建了一个确定性引擎,让15个前沿大模型各经营一家俱乐部跑满20个赛季,另拉6个第一次接触这游戏的人类同场补考。

结果相当拧着来。

这场考试的规则,FM老玩家一眼就懂

每个模型接手一家起步条件完全相同的俱乐部:声誉70、38000人的球场、25人阵容、一笔预算。二十年里大约要做374次重大决策——相当于每天做一个要紧决定,连做二十年。

考题里埋了四道坎,全是FM玩家熟悉的墙:球员真实能力和潜力对谁都藏着,球探只给带永久偏差的区间估计;你对着一家俱乐部还价越狠,它把隐藏要价抬得越高;董事会同时盯着成绩和账本;青训和设施的投入,五六年后才回本。知乎

15个大模型各管了20年足球俱乐部:冠军花钱最少,6个人类4个中途下课,FM玩家该看看这份答卷

最狠的设定是记忆:每个决策点都是全新对话,模型不记得上一个停点自己干过什么,唯一能跨赛季带走的,只有它自己写的一本笔记本——而且这个写笔记的功能,恰好是26个工具里唯一不限量、完全免费的。知乎

四条反直觉结果,每条都有数字

第一,最贵的没赢,烧钱和名次根本不相关。 冠军claude-fable-5拿了90.94分,全程只烧了24M token;花得最狠的deepseek-v4-pro烧了194M,最后滑到第12名。论文把token消耗和得分做相关分析,四个口径的系数全在-0.23到+0.07之间,p值全部大于0.38——统计学上等于纯噪声。知乎 开源模型kimi-k2.6以88.49分压过两个GPT变体站在第三,而且是全场最稳的,三次重跑标准差只有0.15;垫底的haiku-4.5只有36.90分,标准差22.73。价格、体量、厂商出身,三个维度一个都预测不了名次。

第二,前五年的排名约等于猜。 deepseek-v4-pro第5年和第10年都是领头羊,大结局是第12名;冠军fable-5第5年才排第5。第5年排名和最终排名的相关系数只有0.19,要到第15年才爬到0.78。知乎 翻译成人话就是FM玩家那句老话:新开档踢三轮,好教练坏教练根本看不出来,真正的差距在第七到第十二个赛季的复利里才现形。

第三,瞎折腾比摆烂更毁档。 对照组里,什么都不做的idle脚本-0.90分,闭眼乱操作的random脚本-17.21分——乱动比不动差出近20倍。知乎 更残酷的是人类:6名新手,4人中途被董事会解雇,下课时间全卡在第7.8到第12.3个赛季,而且这4人的分数连"机械执行纪律脚本"的17.05分线都没摸到。两个活完全程的人类,最好成绩74.64,和垫底梯队的模型差不多,离冠军差16分。小红书 开局靠新鲜劲都能撑住,中段一起还债——FM玩家对这条应该最有体感。

15个大模型各管了20年足球俱乐部:冠军花钱最少,6个人类4个中途下课,FM玩家该看看这份答卷

第四,记笔记比花钱更决定成败。 笔记本年末相似度这把尺子量出了两种死法:gpt-5.6-sol只追加不删改,相似度0.91,二十年流水账把"当下该干什么"淹了个透;claude-sonnet-5(0.20)和qwen3.7-max(0.23)每季推倒重写,任何跨赛季计划都活不过一个夏天。冠军走的是0.39的中间态——策略骨架不动、状态每季更新。最扎心的是opus-4.8:它在第10季写下"闲置现金应该投入",第19季又写了一遍,最后结算时账上还攥着约2100M闲置储备,赛季末现金平均是俱乐部净值的134%,而冠军只留80%。论文管这个叫"知道-做到鸿沟"——写下正确答案和把它执行出来,是两种能力。知乎 续约习惯同理:冠军中位数提前18个月启动续约谈判,只有4%拖到最后6个月;opus-4.8只提前10个月,20%拖到火烧眉毛。

全物种的软肋:不会定价

考场里还有一位"开挂"的privileged oracle,能直接偷看每个球员的真实属性和每个卖家的心理底价,走完全程95.54分。它买人,首报价直接成交,1.0次。

而所有模型呢?全领域中位数每签一笔要报30次价,冠军fable-5也要9次,最差的gemini-3.5-flash要73次,某个种子下冲到133次。二十年、被拒几百次,模型也没学会市场价格在哪——因为每被拒一次,卖家的隐藏要价就被抬高一分,反馈本身是被自己的行为污染过的。知乎

FM玩家看到这条会直接笑出声:跟同一支俱乐部反复做买卖会越来越贵、报价被拒之后对方不降价反而抬价——这不就是存档里天天发生的事吗?论文里人类玩家的抱怨清单跟模型几乎一字不差:看不见卖家的接受价、工资账单几个赛季后才到账、出了事不知道该怪哪一步。知乎

FM玩家该从这份答卷里抄走什么

先说清楚边界:FM-Bench是自建模拟器,不是Football Manager本体,模型也没有"玩过"SI的游戏。但这场考试考的恰好是FM规则那一套管理动作,所以它对"怎么用AI帮自己玩FM"有直接的可抄项。

一,把大模型用在"不遗忘、不疲劳"的地方。 六维分析里权重最高的三个行为——终局意识(与得分相关-0.58)、资金部署(-0.50)、主动控制(+0.45)——全是纪律活:收尾季砍长线投入、别让预算躺在账上、提前18个月续约。知乎 这些恰恰是人类玩家忘东忘西、AI助教不会忘的领域。让模型当你的续约日历、预算闲置闹钟和对手转会记录员,是对的;那位DeepSeek助教带出5轮不败的玩家,晒的也是轮换思路和角色调整,不是让它直接拍板。

15个大模型各管了20年足球俱乐部:冠军花钱最少,6个人类4个中途下课,FM玩家该看看这份答卷

二,给你的AI助教建"分层笔记本"。 事实层(合同年限、周薪、伤病史)别改写,计划层(本赛季冲不冲欧、什么时候换血)稳定但可修订,意图层(为什么非要卖这个队长)单独存。绝大多数人跟AI的聊天方式,就是0.91的流水账或者0.20的推倒重来——论文用二十年、4800场模拟证明了这两种都会输。

三,别让AI当你的第一次报价。 它看不到你的球探偏差值,更看不到对面的心理底价,30次报价的教训摆在那。正确姿势是让它批量拉可比交易——近三个转会窗同年龄同位置球员的成交价分布——区间你自己判断,出价你自己拍板。定价失败不是算力问题,是信息不对称问题。

至于FM27会不会接大模型——评论区里已经有玩家喊话:新闻评价大模型就行。微博 现实世界已经跑在游戏前面:《图片报》八月底报道,英超、德甲已有俱乐部用AI系统做引援分析和无球跑动评估;而FM26自己也确实动了AI翻译这类"语言工作"。微博 从这场考试看,AI最先被FM吸收的大概率是新闻生成、发布会对话、球探报告摘要这些语言活,而不是替比赛引擎决定比分——后者恰好是模型集体翻车的定价与隐藏信息区。

这份答卷对FM玩家最顺手的收获其实是一条判断标准:以后任何AI产品拿"某某榜单高分"宣传自己,你可以像个干了二十年球的经理那样追问一句——

它是答对了几道题,还是管满了一个赛季?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章