DeepSeek-V4多模态模型开源,单图仅消耗384 Token成本低40倍

源自317位全网作者

04:14

精选参考来源

1
#DeepSeekV4多模态模型正式开源#其实做产品的都知道,多模态API调用成本是个无底洞。DeepSeek今天这波开源,对小团队来说太解渴了。MIT License,商用随便改,不用交保护费。更关键的是它不只是"能看图",文本推理、Agent能力全在,等于一个模型干好几个活儿。就连我刷到脑子里已经在过场景了:电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助……之前这些想法都被API成本劝退,现在可以真正落地了。开源不是做慈善,但DeepSeek确实在给创业者铺路。#DeepSeekV4多模态模型正式开源#
2
#DeepSeekV4多模态模型正式开源#DeepSeek这波操作,够意思。8月21日刚上线API,今天就果断在Hugging Face把DeepSeek-V4-Flash-Vision-Exp权重给开源了,用的还是相当宽松的MIT License。说好的“多模态不是主线”,结果转头就给了开发者一个这么硬核的惊喜。这可不是简单给V4 Flash加了个“眼睛”。它最难能可贵的是,在补上视觉短板的同时,纯文本的Agent、推理能力丝毫没打折扣。更狠的是,多模态Agent能力直接对标顶尖闭源模型Opus-4.8,在多模态Agent评测中甚至打成了2:2平手。关键是,这“长眼”的成本几乎没涨。 一张图按token计费,上限384 tokens,价格和纯文本V4-Flash完全一致。配合新上线的免费Files API和更新后的DeepSeek Harness框架,从API调用到本地部署,DeepSeek这步棋,给开发者生态带来的想象空间巨大。当国产多模态模型开始用MIT协议开源并逼近顶级闭源模型时,AI圈的游戏规则,或许真要变一变了。网页链接
全部
来源
内容由AI生成

精选参考来源

1. #DeepSeekV4多模态模型正式开源#其实做产品的都知道,多模态API调用成本是个无底洞。DeepSeek今天这波开源,对小团队来说太解渴了。MIT License,商用随便改,不用交保护费。更关键的是它不只是"能看图",文本推理、Agent能力全在,等于一个模型干好几个活儿。就连我刷到脑子里已经在过场景了:电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助……之前这些想法都被API成本劝退,现在可以真正落地了。开源不是做慈善,但DeepSeek确实在给创业者铺路。#DeepSeekV4多模态模型正式开源#

2. #DeepSeekV4多模态模型正式开源#DeepSeek这波操作,够意思。8月21日刚上线API,今天就果断在Hugging Face把DeepSeek-V4-Flash-Vision-Exp权重给开源了,用的还是相当宽松的MIT License。说好的“多模态不是主线”,结果转头就给了开发者一个这么硬核的惊喜。这可不是简单给V4 Flash加了个“眼睛”。它最难能可贵的是,在补上视觉短板的同时,纯文本的Agent、推理能力丝毫没打折扣。更狠的是,多模态Agent能力直接对标顶尖闭源模型Opus-4.8,在多模态Agent评测中甚至打成了2:2平手。关键是,这“长眼”的成本几乎没涨。 一张图按token计费,上限384 tokens,价格和纯文本V4-Flash完全一致。配合新上线的免费Files API和更新后的DeepSeek Harness框架,从API调用到本地部署,DeepSeek这步棋,给开发者生态带来的想象空间巨大。当国产多模态模型开始用MIT协议开源并逼近顶级闭源模型时,AI圈的游戏规则,或许真要变一变了。网页链接

3. #DeepSeekV4多模态模型正式开源#DeepSeek V4家族首款多模态实验模型正式开源了,模型DeepSeek‑V4‑Flash‑Vision‑Exp上传Hugging Face,采用MIT协议,开发者可以直接拿来本地部署、二次开发。 这个模型不是简单给大模型加个看图能力,它的核心定位偏向多模态Agent。在原有V4‑Flash强悍文本推理基础上新增视觉模块,既能看懂截图、图表、软件界面,还能结合工具调用自动完成任务。 有意思的是该模型十天前就已经上线API接口对外可用,现在完整开源,相当于把这套“能看画面干活”的能力彻底交到开发者手上。从跑分数据来看,升级视觉之后,原有Agent能力不降反升,多项测试指标甚至对标海外顶尖模型。 不过也要客观看待,它目前依旧属于实验版本,并不是成熟稳定的正式版。开源不等于开箱即用,本地部署对硬件配置有门槛,普通用户很难直接体验,利好更多是面向开发者、技术团队。 现在各家大模型都在卷多模态,但是很多只停留在看图问答。DeepSeek这次重点放在Agent自动执行任务这个方向,算是差异化路线。能看懂画面还能动手干活,这才是多模态真正的价值,期待后续看到更多基于它衍生出来的应用。你们觉得带视觉能力的Agent,会是接下来大模型的主流方向吗?#DeepSeekV4多模态模型正式开源#

4. #DeepSeekV4多模态模型正式开源#当别人家多模态还在“指鹿为马”时,DeepSeek-V4已经能边看边画——描述“左侧第三个红色杯子”的同时,直接框出精确坐标,视觉定位误差肉眼难辨。更离谱的是,它看图做数学题能写出完整推导过程,连“辅助线该画在哪”都给你标得明明白白。最狠的一刀是:7B参数量级,消费级显卡就能跑。开源社区一夜之间人人都能拥有“鹰眼级”AI,中小企业再也不用被闭源API的按次计费割韭菜。这哪是开源模型?这是给全球开发者发了一把视觉智能的扳手——拧螺丝还是造火箭,全看你自己。不说了,我去跑Demo了,怕晚点服务器被挤爆。

5. DeepSeek又放大招了:多模态模型直接开源!就在刚刚,DeepSeek 在 Hugging Face 上线 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。它是 DeepSeek-V4-Flash 的多模态实验版本,重点提升视觉理解能力,让模型不仅能读文字,还能真正“看懂”图片。更关键的是,这次不是简单开放 API,而是直接开放权重。开发者可以自行部署、修改和二次开发。从文本到视觉,再到 Agent,DeepSeek 正在持续补齐多模态能力。#DeepSeekV4多模态模型正式开源#

6. #DeepSeekV4多模态模型正式开源#DeepSeek V4多模态模型官宣开源,这波可以说是把开源大模型的上限又往上推了一截。这次双版本齐发,Pro主攻高难度任务,逻辑推理、数学、Agent智能体能力都来到开源第一梯队;Flash主打高效低成本,日常问答、简单开发完全够用,兼顾性能和性价比。它最大的革新就是原生多模态架构,文本、图像、视频能够一体化处理,不再割裂,百万token上下文是全系标配,处理长篇文档的时候,信息抓取的准确率很高,还能有效节约显存资源。开源授权宽松,不管是个人开发者还是中小企业,都能自由下载权重做二次开发,不用被闭源接口限制住。AI行业的发展,离不开开源生态的助力。很多创新想法,都是在开源基座之上诞生。虽然模型还有不少打磨空间,但这次开源无疑给整个行业注入新活力,也让更多人能够参与到AI的探索之中,期待后续更多惊喜。

7. 今天,中国人工智能领域迎来又一标志性事件。DeepSeek在Hugging Face平台正式上线DeepSeek-V4-Flash-Vision-Exp多模态模型,并采用极具商业友好性的MIT License协议全面开源。紧随其后,DeepSeek Harness 0.1.1完成更新,原生支持新模型的Agent能力 #DeepSeekV4多模态模型正式开源# 从模型到生态:DeepSeek开源战略如何重塑多模态AI竞争格局

8. #DeepSeekV4多模态模型正式开源#刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。DeepSeek官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。#老张聊科技# #DeepSeekV4多模态模型正式开源#

9. #DeepSeekV4多模态模型正式开源#DeepSeek 刚刚在 Hugging Face 上线了DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。DeepSeek这次开源模型基于 DeepSeek-V4-Flash,在原有架构中加入视觉模块,并经过持续训练获得图像理解能力,同时保留原来的文本、推理和 Agent 能力。这个模型刚刚上线没几天就直接开源,而且MIT开源协议允许商用二次开发,开发者可以自由本地部署,对于AI重度使用者和需要二次开发的朋友真的是红利了!

10. 刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。#何九华曾官宣当爸未提生母#

11. DeepSeek-V4-Flash-Vision-Exp开源,背后释放了一个信号:大模型竞争正在从单纯的语言能力,走向综合智能能力。一个优秀的AI模型,不只是回答问题准确,还需要理解图片、视频,结合上下文进行推理,并且能够调用工具完成任务。这次V4-Flash-Vision-Exp在原有架构基础上加入视觉模块,同时保留文本、推理和Agent能力,本质上是在尝试把不同模态的信息融合起来。未来真正有价值的AI,不一定是聊天最像人的那个,而是能够理解更多信息、完成更多工作的那个。从文字到视觉,再到行动能力,多模态可能会成为下一阶段AI发展的关键方向。#DeepSeekV4多模态模型正式开源#

12. 我擦,DeepSeek v4 Flash Vision 开源了传送门:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp模型的正式名称是 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek-V4 系列的首个实验性多模态模型。这个模型以 DeepSeek-V4-Flash 架构为基础,引入视觉模块,并通过持续训练获得视觉理解能力。与 V4-Flash-0731 相比,V4-Flash-Vision-Exp 的多模态 Agent 能力有了显著提升,同时在纯文本 Agent 任务上保持了相当的性能。#DeepSeekV4多模态模型正式开源#

13. DeepSeek“睁眼”了!首个多模态视觉模型上线,多项能力接近Opus-4.8

14. DeepSeek不是老大了?一图拉开40倍Token成本差,视力却输给豆包

15. DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?

16. DeepSeek 终于能看图了!教你免费使用 + 8 大场景实测

17. DeepSeek V4 Flash Vision 图像理解成本解析:单图上限仅 384 token

18. DeepSeek V4 Flash 视觉版实测:效果炸裂

19. DeepSeek Harness迎rc.8更新:多模态补齐,Claude Code与Codex纳入子代理体系

20. Qwen3.8今晚开源 | ChatGPT又又重置 | 苹果发布新Mac系列产品 | DeepSeek V4 Flash Vision Exp视觉性价比高

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章