李飞飞World Labs发布Atlas,输入相机坐标直接精准运镜生成1分钟4K视频

源自554位全网作者

09-02 17:03

内容由AI生成

精选参考来源

1. 中美算力差10倍,模型为什么只差3分? #大有学问 #红衣聊AI #算力 #大模型

2. 小鹏第二代VLA发布:从智能辅助驾驶到物理AI入口的跨越

3. 8 位 AI 创业者谈世界模型:生成一切之后,还差一点常识|WRC 2026

4. 我擦,DeepSeek v4 Flash Vision 开源了传送门:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp模型的正式名称是 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek-V4 系列的首个实验性多模态模型。这个模型以 DeepSeek-V4-Flash 架构为基础,引入视觉模块,并通过持续训练获得视觉理解能力。与 V4-Flash-0731 相比,V4-Flash-Vision-Exp 的多模态 Agent 能力有了显著提升,同时在纯文本 Agent 任务上保持了相当的性能。#DeepSeekV4多模态模型正式开源#

5. 大模型的逐字生成模式,正在拖慢你的Agent,有人跑出了5倍提速

6. #DeepSeekV4多模态模型正式开源#DeepSeek这波操作,够意思。8月21日刚上线API,今天就果断在Hugging Face把DeepSeek-V4-Flash-Vision-Exp权重给开源了,用的还是相当宽松的MIT License。说好的“多模态不是主线”,结果转头就给了开发者一个这么硬核的惊喜。这可不是简单给V4 Flash加了个“眼睛”。它最难能可贵的是,在补上视觉短板的同时,纯文本的Agent、推理能力丝毫没打折扣。更狠的是,多模态Agent能力直接对标顶尖闭源模型Opus-4.8,在多模态Agent评测中甚至打成了2:2平手。关键是,这“长眼”的成本几乎没涨。 一张图按token计费,上限384 tokens,价格和纯文本V4-Flash完全一致。配合新上线的免费Files API和更新后的DeepSeek Harness框架,从API调用到本地部署,DeepSeek这步棋,给开发者生态带来的想象空间巨大。当国产多模态模型开始用MIT协议开源并逼近顶级闭源模型时,AI圈的游戏规则,或许真要变一变了。网页链接

7. AI 读过一切,却没经历过任何事:Ropedia 发布 HOMIE Gen2,给具身智能补「经验」这一课

8. 今天,中国人工智能领域迎来又一标志性事件。DeepSeek在Hugging Face平台正式上线DeepSeek-V4-Flash-Vision-Exp多模态模型,并采用极具商业友好性的MIT License协议全面开源。紧随其后,DeepSeek Harness 0.1.1完成更新,原生支持新模型的Agent能力 #DeepSeekV4多模态模型正式开源# 从模型到生态:DeepSeek开源战略如何重塑多模态AI竞争格局

9. #DeepSeekV4多模态模型正式开源#其实做产品的都知道,多模态API调用成本是个无底洞。DeepSeek今天这波开源,对小团队来说太解渴了。MIT License,商用随便改,不用交保护费。更关键的是它不只是"能看图",文本推理、Agent能力全在,等于一个模型干好几个活儿。就连我刷到脑子里已经在过场景了:电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助……之前这些想法都被API成本劝退,现在可以真正落地了。开源不是做慈善,但DeepSeek确实在给创业者铺路。#DeepSeekV4多模态模型正式开源#

10. 突破遥操瓶颈!全新无本体数据世界动作模型Noe-0发布

11. #DeepSeekV4多模态模型正式开源#从纯文本到Agent,再到视觉理解,DeepSeek V4这条路线越来越完整了。尤其这次Vision-Exp开源,意味着开发者可以直接把多模态能力拿去折腾自己的应用。AI真正开始从“会说话”往“能干活”进化了

12. 牛来大模型被认领是国产牛,打穿了Deepseek的价格线

13. “牛来”大模型身份曝光

14. 深度|从一张图片到一个可运行的世界:最强3D生成团队推出世界生成模型

15. #DeepSeekV4多模态模型正式开源#开源了,但你大概率跑不起来。DeepSeek-V4-Flash-Vision-Exp 今天在 Hugging Face 放出完整权重,MIT 协议,能商用、能二开。可仓库足足 168GB、48 个分片,官方自己都说了这是"便于理解结构的参考实现",不是开箱即用的生产引擎,普通人电脑根本装不下。这其实不是个新模型。8 月 21 号它就上了 DeepSeek 的 API,那会儿就能传图加文字,让它看截图、读图表。今天这一步是把权重交出来——开发者能脱离官方 API,自己部署、改。它是 V4 系列第一款原生支持图片输入的模型,在原来 Flash 架构上塞了视觉模块,文本和 Agent 能力没掉。官方说多模态 Agent 水平已经接近 Opus-4.8。我看法很直接:DeepSeek 这几个月从 V4-Flash、Harness 到 Vision,明显在搭一套能自己看屏幕、调工具、跑任务的 Agent 技术栈。显存够,才谈得上本地折腾。

16. 世界模型没那么热了,我们却看到了最好的一个

17. Seedance 2.5 还能这么玩?只要一张图, 生成一个可随意摆弄的 3D 世界

18. 「牛来」20秒批量产!杭州黑马发布3D模型,世界模型底牌亮出

19. 刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。#何九华曾官宣当爸未提生母#

20. 李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

21. 盛大创始人再出手,上海本土AI公司StartLux打赢万亿大模型

22. #DeepSeekV4多模态模型正式开源#DeepSeek V4家族首款多模态实验模型正式开源了,模型DeepSeek‑V4‑Flash‑Vision‑Exp上传Hugging Face,采用MIT协议,开发者可以直接拿来本地部署、二次开发。 这个模型不是简单给大模型加个看图能力,它的核心定位偏向多模态Agent。在原有V4‑Flash强悍文本推理基础上新增视觉模块,既能看懂截图、图表、软件界面,还能结合工具调用自动完成任务。 有意思的是该模型十天前就已经上线API接口对外可用,现在完整开源,相当于把这套“能看画面干活”的能力彻底交到开发者手上。从跑分数据来看,升级视觉之后,原有Agent能力不降反升,多项测试指标甚至对标海外顶尖模型。 不过也要客观看待,它目前依旧属于实验版本,并不是成熟稳定的正式版。开源不等于开箱即用,本地部署对硬件配置有门槛,普通用户很难直接体验,利好更多是面向开发者、技术团队。 现在各家大模型都在卷多模态,但是很多只停留在看图问答。DeepSeek这次重点放在Agent自动执行任务这个方向,算是差异化路线。能看懂画面还能动手干活,这才是多模态真正的价值,期待后续看到更多基于它衍生出来的应用。你们觉得带视觉能力的Agent,会是接下来大模型的主流方向吗?#DeepSeekV4多模态模型正式开源#

23. #DeepSeekV4多模态模型正式开源#DeepSeek这次直接把自家最新的V4多模态大模型给开源了,已经传到Hugging Face上了,用的是MIT协议,基本放开给大家免费用,限制很少。这是他们V4系列第一款带看图能力的版本,在原来文字能力的底子上加了视觉理解的本事,之前擅长的推理,写东西这些能力也都完整留着。DeepSeek模型现在格局是真的大,这么新的模型直接放出来给所有人用。

24. #Anthropic首款在物理世界运行的AI工具问世#机器人、智驾、智能座舱的大脑,未来非常有可能是属于 Anthropic、Kimi 这类多模态通用大模型公司的;机器人创业公司和车企,做好本体、车体的制造,以及当好数据供应商。我预测会是这样的分工,几年后回头再看看准不准~

25. 全球首个「虚拟细胞+世界模型」来了,David Baker领衔!

26. 世界模型热了这么久,光象科技想让它变为生产力

27. 马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

28. Code World Model:Coding Agent 作为世界模型的大脑

29. 创业融资|上科大团队做具身世界模型基础设施,完成千万美元种子轮融资

30. 上科大团队创业具身世界模型,瞬适科技获千万美元融资

31. AI世界模型落地虽多,但物理一致性仅几分钟,商用还差多远?

32. 世界模型:AI走进物理世界的新起点

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章