张大妈

谷歌Gemini 3.1新模型深夜掀桌,每秒狂飙363 token,1/4价格暴击Claude

源自今日头条:36氪

03-05 10:19

谷歌新发布的Gemini 3.1 Flash-Lite模型,正以颠覆性的性价比重塑AI市场格局。它实现了远超同级竞品的高速度与高性能,同时将成本大幅降低,为开发者提供了一个兼顾效率与经济性的全新选择,尤其适合高频调用与大规模应用场景。

谷歌Gemini 3.1新模型深夜掀桌,每秒狂飙363 token,1/4价格暴击Claude智能速览

  • Gemini 3.1 Flash-Lite输出速度达363 tokens/s,远超GPT-5 mini和Claude 4.5 Haiku。

  • 其输出价格仅为1.50美元/百万Token,是Claude 4.5 Haiku的四分之一。

  • 在多项权威跑分中,该模型超越了GPT-5 mini和自家的上代产品。

  • 事实准确性测试中,43.3%的准确率实现对竞品的断崖式领先。

  • 支持可调节的思考深度,能根据任务复杂度优化资源分配。

谷歌Gemini 3.1新模型深夜掀桌,每秒狂飙363 token,1/4价格暴击Claude精华内容

AI模型的竞争焦点,正从单纯追求性能,转向成本与效率的极致平衡。Gemini 3.1 Flash-Lite的发布,正是这一趋势的集中体现,它试图用更低的价格实现更高的价值。

速度与价格

Gemini 3.1 Flash-Lite在速度上取得了显著优势,其输出速度达到363 tokens/s,是GPT-5 mini(71 tokens/s)的5倍以上,也是Claude 4.5 Haiku(108 tokens/s)的3.4倍。

在价格方面,其输入成本为0.25美元/百万Token,输出成本为1.50美元/百万Token。与输出价格高达5.00美元的Claude 4.5 Haiku相比,Flash-Lite的成本仅为后者的四分之一,实现了“跑得更快,价格更低”。

跑分表现

在多项基准测试中,Flash-Lite展现了“越级挑战”的实力。在考验科学推理能力的GPQA Diamond测试中,它取得86.9%的高分,超过GPT-5 mini的82.3%和Claude 4.5 Haiku的73.0%。

多模态理解能力同样突出,在MMMU-Pro测试中获得76.8%。最惊人的是在事实准确性测试SimpleQA Verified中,它以43.3%的准确率遥遥领先,而GPT-5 mini仅有9.5%,差距达到4.5倍。不过在LiveCodeBench代码测试中,其72.0%的得分低于GPT-5 mini的80.4%,显示出其在特定领域仍有提升空间。

实战能力

在真实的用户对战平台Chatbot Arena中,Flash-Lite以1432的Elo分数排名第36,与OpenAI的旗舰模型o3打平,证明了其在真实场景下的强大竞争力。

其应用潜力巨大,能够秒级生成包含数百款商品的电商原型图,实时构建天气预报数据看板,或构建SaaS智能体自动化处理工单。这些能力让开发者能以极低成本快速搭建复杂功能。

核心优势

Flash-Lite一个重要功能是“思考深度”可调。开发者可以根据任务的复杂程度,灵活设定模型的推理资源投入。

对于批量翻译、内容审核这类高频低复杂度的任务,可使用浅思考模式,将速度和成本压到极致。而对于生成UI界面、执行多步骤指令等复杂任务,则可切换到深度推理模式,确保输出质量不输给大型模型。

市场影响

Gemini 3.1 Flash-Lite的发布,标志着AI竞争进入新阶段。战火已从单纯追求“谁最强”的性能竞赛,转移到“谁能用最低成本交付最高质量”的性价比赛道。

用几分之一的价格打出旗舰级效果,用数倍的速度碾压竞品,谷歌通过Flash-Lite明确了自己的市场策略。对于全球开发者而言,这意味着在真实产品场景中,成本和速度的重要性有时甚至超过了极限跑分。

Gemini 3.1 Flash-Lite的出现,预示着AI服务平民化的加速。开发者们不再需要为顶级性能支付高昂成本,这或将催生出更多创新的应用。未来,AI的竞争将是综合价值的较量。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章