当前位置:
AIGC文章详情

同为60分,只有一双眼睛:K3涨价5倍、DeepSeek白菜价开眼,这周的多模态选型就是三笔账

源自63位全网作者

02:48

这周大概是多模态 API 用户今年最纠结的一周。

周三,Artificial Analysis 更新智能分:GLM-5.3 和 Kimi K3 双双拿到 60 分,正面打平,离榜首 GPT-5.6 Sol 只差 1 分。知乎几乎同一时间,Kimi K3 的 API 定价在社区炸了锅——输入 20 元/百万 token,输出 100 元,缓存命中 1 元,比上一代整整翻了 5 倍。知乎高盛表示,这标志中国模型正式从价格战迈向定价权争夺,而硬币另一面,智谱单日暴跌 28%、MiniMax 跌 16%。微博

然后周五,DeepSeek 上线 V4-Flash-Vision-Exp,它家第一个多模态 API 模型。价格和 V4-Flash 完全一样:输入高峰 3 元/百万 token,低谷 1.5 元,一张图最多只算 384 个 token。知乎1000 张图的输入成本,高峰期 1.15 元,低谷不到 6 毛。36氪分数在收敛,价格在劈叉。如果你正好要用模型"看图"——截图 Agent、图片打标、单据识别、多模态问答——这周的选型题其实就三笔账。

同为60分,只有一双眼睛:K3涨价5倍、DeepSeek白菜价开眼,这周的多模态选型就是三笔账

第一笔账:图量大、图便宜,DeepSeek 的账怎么算

先看一组对比。第三方横评 TokenMix 用同一张 1024×1024 的图测了各家视觉 API 的 token 消耗:Claude Sonnet 4.6 吃 1334 个 token,1000 张图约 4 美元(折合人民币近 29 元);GPT-5.4 Vision 765 个,1.9 美元;Gemini 3.1 Pro 258 个,0.5 美元。36氪DeepSeek 这边给了个封顶值:每张图最多 384 token。

最贵档和它差了 25 倍,挪到低谷时段差 50 倍。

这个设计意图很直白:大图进模型前会被等比缩到约 800×800 像素量级,单请求最多塞 600 张图,Files API 同步开放且不收费——同一张图传一次,之后用 file_id 引用。知乎它瞄准的就是 Screenshot Agent 这类场景:一条 Agent 轨迹几十上百张截图,每张图几千 token 的话,成本直接爆炸。

效果上,加了视觉的 V4-Flash-Vision-Exp 在 DeepSWE 上从 54.4 涨到 59.3,Terminal Bench 82.7 涨到 83.9,七项 Agent 评测六项超过纯文本的 V4-Flash-0731,官方放出的视觉 Agent 基准和 Opus-4.8 打成了 2 胜 2 负。知乎更关键的是文本能力没塌——很多 VLM 加视觉编码器后文本会掉,这个没掉。

同为60分,只有一双眼睛:K3涨价5倍、DeepSeek白菜价开眼,这周的多模态选型就是三笔账

但丑话说前面:384 token 封顶 + 800×800 缩放,意味着它不是为"高精度看图"做的。社区目前的共识是"多模态 Agent 能力第一梯队候选,通用视觉待验证"。知乎你要拿它做细粒度 OCR、识别大图里的小字细节,先自己测,别直接信。

一句话:图量大、容错高、靠截图驱动的场景,这笔账 DeepSeek 赢麻了。

第二笔账:要看图还得想得深,K3 的账怎么算

60 分的三个模型里,只有 Kimi K3 带原生视觉——它是总参数 2.8 万亿、激活 1040 亿的开放权重 MoE,视觉部分是 MoonViT-V2 编码器加轻量投影层,原生多模态,不是后挂的眼睛。知乎而 60 分的 GLM-5.3 到现在还不支持多模态,社区原话叫"硬伤",它是基于 GLM-5.2 基座的后训练模型,纯文本。知乎所以如果你的任务是"看懂一张图,然后基于图做深度推理",账本就只剩 K3 一个选手。但 K3 这笔账有三个地方必须先看清楚:

第一,贵,而且是明牌贵。国内平台输入 20 元/百万 token、输出 100 元/百万 token。有开发者在社区吐槽:两步的需求花了 25 块,还返工了一次。知乎高盛算出的 API 定价高达每百万 token 2.3 美元,创中国模型定价新高。微博

第二,图片计费目前是笔糊涂账。截至本文,K3 官方没有公开图片到 token 的换算规则,也没有单独的视觉计价档——它按输入价计费,但一张图到底吃多少 token,没人给出过确切数字。也就是说,在跑小样本实测之前,你根本算不清"一张图多少钱"。这对按预算立项的团队是个真实的坑。

第三,慢。K3 的生成速度大约 38 token/秒,是 GLM-5.3(85 token/秒)的一半不到,延迟也更高。知乎社区的评价很一致——k3 最强,也最慢,给个活干半天。知乎它的定位是长文档精读、深度推理,不是实时交互。

一句话:质量优先、单图深挖、能接受慢和贵的场景,K3 是 60 分档唯一能看图的选择;批量跑图,别碰。

第三笔账:等等党的账,这周恰好有三个信号

不急着上线的话,这周冒出来的三个信号值得放进观察清单:

同为60分,只有一双眼睛:K3涨价5倍、DeepSeek白菜价开眼,这周的多模态选型就是三笔账

其一,GLM 的"眼睛"可能在路上。OpenCode 预告下周推匿名模型 OxAlpha,社区已经在组团猜身份:有人做了 11 次分词器探测,OxAlpha 全部和 GLM 匹配,从错误码、Tokenizer 指纹到 CoT 指纹,都像是 GLM 5.3 的多模态变体。知乎推测归推测,但如果成真,60 分档就补齐第二双眼睛,而且是 GLM 系的价格体系——输入 0.68 美元/百万,比 K3 便宜,速度还快一倍多。知乎

其二,DeepSeek 的视觉模型还挂着 “Exp” 实验后缀。架构细节没公开,正式版什么时候来、384 token 的封顶会不会放开,都是变量。现在接入可以,但生产级依赖建议留个切换预案。

其三,K3 的 60 分本身还有一层争议。本周有论文声称破解了前沿模型的加密思维数据,Kimi K3 和 GLM-5.2 是否蒸馏过前沿模型成了社区追问的话题。知乎这事没有定论,但如果你把业务押在单一模型上,这类争议本身就是一条"别 all in"的理由。

最后,三个避坑提醒

  1. 别指望 GLM-5.3 看图。60 分归 60 分,它是纯文本,多模态需求直接排除,别等 API 报错了才发现。

  2. 别拿 V4-Flash-Vision-Exp 干精细识别。384 token 封顶 + 800×800 缩放是成本优势的来源,也是精度上限的来源,图纸、票据、小字密集的场景先实测。

  3. 接 K3 跑图之前,先用 10 张真实业务图测 token 消耗。图片计价不透明的模型,预算要按实测走,别按官网走。

分数趋同的时代,模型之间的差距正在从"谁更聪明"变成"谁看一张图更便宜、看得更清"。这三笔账算完,你的选型基本就有答案了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章