B 站上线 AI 无限竞技场,让 UP 主给大模型打擂台
B 站 9 月 20 日上线了一个叫"AI 无限竞技场"的大模型测评榜,同步放出了首轮排行榜。和传统跑分不一样,这个榜不靠一套固定的测试题,而是把 B 站各个分区的 UP 主拉过来,让他们用真实工作流、专业应用、趣味脑洞这些自己出的题,把上百个大模型放在一起同题 PK。
首轮结果里,GPT-6 Astra 在 10 个 UP 主的测评中拿下榜首,打败 GLM-5.3 成为拿榜首次数最多的模型。前五名里,国产大模型占了 3 席。

榜单覆盖的模型挺全,DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、MiniMax 这些主流选手都在。排名实时更新,并且持续向全站 UP 主开放报名。
这套玩法的价值在于,它绕开了跑分评测的老毛病。传统 benchmark 是固定题目、固定维度,模型厂商完全可以针对性地去刷。而让不同领域的 UP 主用自己的真实任务去考,考的是代码、推理、协作、知识这些离实际使用更近的能力,同题 PK 的方式也让差异更容易被看见。一个模型在标准测试里分数漂亮,到了 UP 主手里能不能真把活干完,这才是用户更想知道的。
对普通用户,这个榜更像一个选购参考。与其看厂商自己吹参数,不如看几个你信得过的 UP 主,在真实场景里把几个模型摆一起试,谁翻车谁稳定,一眼就能看出来。
需要留个心眼的是,UP 主的题也是人出的,样本量有限,单个测评难免有主观成分,别把某一次榜首当成金标准。榜单的价值在于"多、杂、真",看得多了,每个模型的脾气自然就清楚了。少看结论,多看过程。
这半年大模型卷得厉害,用户反而越来越难判断谁更好,B 站这一步,等于用自己最大的优势,也就是真实创作者,给用户搭了一个能看热闹、也能看门道的擂台。
