DeepSeek终于长出"眼睛"、小米MiMo开源登顶:两个月四家转向原生多模态,选型逻辑该重排了

源自41位全网作者

19:49

两个月前,"DeepSeek 为什么不做多模态"还是知乎上能吵上热榜的问题;现在这个问题已经没有讨论价值了。

把时间线拉直看:7月,月之暗面发布旗舰 Kimi K3,原生多模态是主打标签。8月下旬,DeepSeek 悄悄上线实验性的 V4-Flash-Vision-Exp,第一次开放了视觉 API。9月10日,DeepSeek V4.1 Flash 上线,官方口径直接写成"原生多模态视觉理解能力"。 9月22日,小米发布并开源 MiMo-V2.6-Pro——一个文字、图片、视频、音频全吃的全模态模型,在 Artificial Analysis 综合智能指数上以 46 分登顶全球开源第一、国产第一。知乎微博

两个月,四家,最后跟进的是 DeepSeek。这恰恰是最值得琢磨的部分。

DeepSeek 转向,信号意义大于功能意义

DeepSeek 创始人梁文锋此前公开表过态:把模型训练好,未必需要世界模型,不一定非要做多模态。 这家公司也确实长期把纯文本推理和代码做到第一梯队,"不支持多模态"一直是用户吐槽它时最常提的一条。知乎

所以当立场最坚定、对成本最敏感的纯文本派也跟进时,传递的信息不是"它支持看图了",而是:原生多模态的训练和推理成本,已经降到一家以极致性价比著称的公司都愿意接受、还能继续普惠定价的程度。官方对 V4.1 Flash 的描述是"全新非对称结构,能力更强、速度更快、价格更低"。有独立实测称,和上一代 V4 Flash 相比,这一代 API 价格最高降幅达到 57.1%。 成本下不来时宁可不做,这是 DeepSeek 一贯的行事逻辑,如今它做了,等于替整个行业确认:要不要做原生多模态的路线之争,结束了。微信公众号

先看清楚 DeepSeek 这次给的到底是什么

DeepSeek终于长出

8月那版 V4-Flash-Vision-Exp 值得单独拆开讲,因为很多人的第一反应是"直接切过去",但有几个官方细节容易被忽略。

它是视觉理解模型,不是图片生成模型。能力方向是读截图里的文字、分析图表、描述界面布局,不是画图。 名字里的 Exp(实验性)也说明:接口开放了,但官方确认的能力和社区实测口碑是两回事,现阶段别拿生产流水线直接压上去。微信公众号

官方给的基准成绩:Terminal Bench 2.1 为 83.9,Chartography 为 64.3,AutomationBench 为 25.7;纯文本能力与 V4-Flash 正式版持平,需要视觉理解的 Agent 基准相比 V4-Flash 大幅提升,官方口径是"多模态 Agent 能力接近 Opus-4.8"。 注意这个"接近"是对标旗舰的说法,落在你自己的任务上是不是成立,还得自己跑。知乎

接口层面有几个直接影响成本和稳定性的细节:

  • 图片格式按文件实际内容判断,不看后缀名,把 PNG 改名成 .jpg 骗不过去;

  • 三种传图方式各有上限:Base64 进请求体受请求体大小限制;公开 URL 要求最长 8192 字符、图片最大 32MiB、60 秒内下载完成;Files API 走 file_id 引用,单张最大 64MiB,适合同一张图反复分析;

  • 有个 detail 参数分四档,看照片内容 low 够用,读截图小字、表格数字得用 original——但保留原图不等于一定读得清,清晰度、压缩、提示词写法都影响结果;

  • 图片按尺寸换算成 token,和文本 token 一起计费。大图不一定无限涨 token,但缩图会让小字更难识别,成本和效果不是"图越大越好"那么简单;

  • 图片只能放在 user 消息里,塞进 system 或 assistant 消息直接返回 400。

DeepSeek终于长出

拼接式和原生多模态,差别不在"能不能看图"

同样叫支持图片输入,技术上有两条路。拼接式是给纯文本主模型外挂一个视觉模块,图片先被转成文字描述再喂给主模型——主模型并不真的"懂"图。原生多模态是图像和文字从预训练阶段就一起训练同一个主模型,视觉直接参与感知和决策。

看图识字这类任务上两条路差别不大,差别出现在让 AI 自己执行任务、自己检查结果的场景。过去一年最能落地赚钱的能力是写代码和智能体:模型自己生成网页、跑完看结果对不对。只会读代码的模型只能靠代码层反馈判断对错,长链条任务里误差一轮轮累积;视觉提供的是另一种反馈——截一张图,模型直接对照目标和实际效果,按钮位置对不对、排版有没有错位一眼可见。月之暗面管这叫 vision in the loop:写、跑、看、改,循环起来。Kimi K3 发布后在 LMArena 前端代码榜登顶,那个榜单是用户盲测生成网页的最终呈现效果,比的正是这双"眼睛"的实际用处。知乎

现在 Qwen3.8-Max、豆包旗舰早把视觉当核心功能,Kimi、阿里、字节、DeepSeek、小米全部就位。旗舰模型的多模态不再是差异化卖点,成了默认配置,剩下的只是各家水平高低。

MiMo 开源第一,含金量怎么看

DeepSeek终于长出

小米这次给的东西比想象中多:全模态旗舰 MiMo-V2.6-Pro(1.02T 总参数、42B 激活参数)、高效推理模型 MiMo-V2.6-Flash、超高速模式 V2.6-Pro-Ultraspeed、MiMo Desktop 桌面客户端正式版,全部开源。 46 分登顶的是 Artificial Analysis 综合智能指数,官方技术口径是"扩展强化学习规模,迈向自我提升"。微博小红书

微博话题下评论区的高赞反应很能说明开发者的关注点:“开源诚意太足了”“能一次性吃下百万字内容,这能力对开发者太友好了”“价格也很有竞争力”。 但有两句提醒:第一,"开源第一"是综合智能指数的口径,不等于每个单项都第一,你的任务恰好压在哪个单项上,得自己测;第二,从"做手机的"到开源榜第一,小米这个跃迁速度本身就说明国内训练基建的成熟度,这对选型的意义是——榜单排名的保质期越来越短,每隔一两个月重新比一次是必要动作,不是多余动作。微博

选型清单:按这个顺序过一遍

这波密集发布后,我的建议是照着四条重排选型逻辑:

  1. 别盯单一总分榜单选模型。榜单冠军未必适合你的具体任务,综合指数第一和"你的截图识别任务第一"是两回事。

  2. 看任务里有没有"看"的成分。照截图改界面、检查网页效果、读文档表格照片、分析设计稿——这类任务优先原生多模态模型,而且用截图代替大段文字描述问题,效率高得多。

  3. 纯文本任务别折腾。推理、写作、常规代码,各家旗舰差距没有榜单分数显得那么大,顺手、稳定、便宜往往更重要。

  4. 别把工作流绑死在一家。模型迭代以周计,哪个在具体任务上好用用哪个,一两个月重比一次。

对号入座:搭 Agent、做前端生成、跑文档处理的,这波原生多模态是实打实的能力增量,值得花一个下午把截图链路接上试试;主要用文本推理和写作的,看个热闹就好,成本上 DeepSeek 系还是那个价格锚点;想私有化部署的,MiMo-V2.6-Pro 开源全模态是这波里最值得跑一遍评测的标的。

最后几句实话

"视觉理解"和"视觉生成"是两回事,这次各家补的都是前者,别拿着画图的需求去切;Exp 后缀的模型进生产要慎重,等正式版;图片按 token 计费,截图密集型应用先拿自己的真实截图算一遍账,再看"价格更低"是不是真的更低。

另外一句实话:有独立实测的判断是,DeepSeek 的多模态能力不仅来得晚,和把图像、音频、视频放在一起处理的前沿模型还有明显差距,V4.1 Flash 这次也只能看图。微信公众号

海外这波也没闲着:OpenAI 9月推出的 GPT-6 Astra 同样主打更强的视觉判断与多模态,Agent 模型加视觉这条路线全球都在收敛。 方向上已经没有分歧了,接下来一年比的,是谁的"眼睛"更准、更便宜。知乎

你现在的流水线里,是甩截图多还是打字描述多?Kimi、DeepSeek、豆包、通义、MiMo 这几个,你分别用在哪类任务上?评论区聊聊,下一篇我把各家视觉 API 的真实计费账算细一点。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章