实时视频理解:多模态模型的新门槛
06-10 10:40
精选参考来源
抖音 2026-05-04
新浪微博 2026-02-28
来源
精选参考来源
1. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
2. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
3. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-29 00:00:00
4. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-17 00:00:00
5. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC
抖音 2025-12-14 00:00:00
6. #小米发布自动驾驶模型##小米自动驾驶模型XiaomiOneVL发布# 小米发布并全面开源自动驾驶模型Xiaomi OneVL:一步式潜空间语言视觉推理框架,将VLA、世界模型和潜空间推理三大技术路线统一到同一框架中,让大模型推理“又快又准”:精度上超越显式思维链,速度上对齐“仅答案”预测,推理延迟最低仅0.24秒,为传统VLA自回归推理的5.4%,为量产车端实时部署提供了可行路径
新浪微博 2026-05-13 00:00:00
7. 头部车企AIGC全域营销革新:全链路即兴多模态渲染短视频,刷屏全网社交阵地 恰逢2026北京车展流量窗口期,一套轻量化、高互动、强转化的AIGC全新车企营销玩法快速走红全域社交媒体平台,刷屏各大流量阵地。奥迪、蔚来等主流车企头部品牌率先试水规模化落地,依托Sora 2.0同级高阶多模态生成式大模型,重磅上线全民可参与、实时可生成的新车即兴广告定制生成专属服务。现场用户仅需极简输入个人日常出行习惯、用车场景偏好、审美风格倾向等基础轻量化信息,后台AI即可秒级联动多模态渲染算力,实时生成专属定制化超写实高清短视频,画面可自由适配火星星际、深海秘境、赛博朋克都市等多元个性化沉浸式场景,实景呈现用户专属座驾全域驾乘动态效果。五一假期车展流量高峰叠加社交传播红利,这套AIGC交互式沉浸式创新营销模式,全域用户停留时长、主动互动率、线下到店转化量均遥遥高于传统营销,商业落地成效直观凸显。行业前瞻预判,传统静态平面海报、标准化量产TVC汽车广告将加速退场,千人千面、一人一景、实时定制的AIGC原生生成内容,将全面接管车企全域营销主阵地,AI彻底抹平专业视觉内容创作门槛,重构汽车行业全域营销生态。
新浪微博 2026-05-02 00:00:00
8. Coding 能力,正在颠覆大模型的估值逻辑
微信公众号 2026-06-04 00:00:00
9. 世界模型VLA SOTA!DriveWorld-VLA:自驾VLA的统一潜在空间世界建模(小米&北交)
微信公众号 2026-02-10 00:00:00
10. 🧠第二代 VLA 物理 AI 大模型原生多模态赋能,重构智驾决策核心✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层⚡第二代VLA有效算力1 颗顶 10 颗,车端实时跑大模型无压力✅ 全栈自研图灵芯片,算力利用率高达 82.5%,模型推理仅需 80ms✅ 1 颗图灵芯片实际有效算力≈10 颗 Orin-X,车端流畅运行大模型✅ 车端视觉数据信息密度超其他传感器 300 倍,累计 50PB 训练数据筑牢基础✅ 日消耗 token 达 58.8 万亿,是全国数字 AI 调用量的 80 倍,算力支撑超强#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#
新浪微博 2026-03-02 00:00:00
11. ICLR 2026 | 北航上交智源清华全面评估在线建图的「时序稳定性」
微信公众号 2026-02-12 00:00:00
12. 两个200亿美元:OpenAI和英伟达在打一场“推理之战”
知乎 2026-04-18 00:00:00
13. #Seedance和谷歌Omni谁更强#今日凌晨谷歌I/O 2026正式推出Gemini Omni Flash全模态视频模型,可实现全类型输入创作内容,主打多模态融合与智能交互编辑,综合适配性极强。字节Seedance凭借超高写实画质出圈,实测文生、图生视频评分稳居前列,画面流畅度与物理真实表现突出,量产良品率表现亮眼。两款模型技术路线各有侧重,适配不同创作场景。AI视频行业市场体量庞大,受众需求细分明确,加之各方技术持续迭代,赛道不会出现一家独大局面,未来势必走向多强并立、良性竞争的发展格局。#ai#
新浪微博 2026-05-20 00:00:00
14. Seedance 2.0之后,又一国产全模态视频大模型杀入Artificial Analysis榜单Top 2
微信公众号 2026-02-27 00:00:00
15. #全球首个实时生成世界模型##无限流AI真的来了#AI视频生成目前已经进化到什么地步了?1月14日,爱诗科技发布全球首个实时生成的世界模型PixVerse R1,就是那个打造了全球一亿用户的拍我AI的公司。该模型有什么牛的地方呢?首先,PixVerse R1是全球首个支持最高1080P分辨率通用实时世界模型,通过瞬时响应引擎,可以实现实时交互。需要特别指出的是,它不是简单的快,而是没有等待感的那种Real-time。比如用户的指令改变,生成画面就会连续、即时地变化。目前我们常见的AI视频生成遇到这种情况,会直接“重新生成”,这种断裂很明显。其次,生成视频不再是结果,不再是导出一个MP4那么简单,通过Omni原生多模态基础模型与自回归流式生成机制,形成了一个持续存在的流式视觉世界。同时,它也是一种新的媒体形态,可玩的现实,你可以把它理解成是介于视频、游戏、虚拟世界之间的一种形态。R1的出现,重新划定了生成的边界。它把“视频”从一个导出即结束的静态文件,变成了一个可进入、可互动、可无限演化的动态世界。这意味着,内容创作正从“制作成品”迈向“互动生态”,而每个人都拥有了成为这个生态共建者的可能——技术终于不再是门槛,想象力才是真正的起点。
新浪微博 2026-01-14 00:00:00
16. Seedance 2.0:说中国话的最强AI视频模型!
哔哩哔哩 2026-02-17 00:00:00
17. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
18. 3亿美元巨额融资,AI视频新独角兽爱诗科技,正在抢跑「实时世界模型」
微信公众号 2026-03-13 00:00:00
19. 如何看待 Minimax 新的 M3 多模态模型以及更新的 Token Plan?
知乎 2026-06-02 00:00:00
20. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#
新浪微博 2026-04-02 00:00:00
21. 李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
知乎 2026-03-04 00:00:00
22. 科技巨头集体押注自研芯,AI芯片战场正加速向推理端迁移
知乎 2026-04-07 00:00:00
23. 比AI视频还离谱,一句话生成一个可探索的三维世界
哔哩哔哩 2026-04-18 00:00:00
24. 多模态大模型这条赛道,阿里云开始拉速度了
微信公众号 2025-12-22 00:00:00
25. #即梦Seedance2.0怎么玩#即梦Seedance2.0内测刷屏海内外,成为AI创作领域的现象级存在,核心在于让视频创作彻底从技术桎梏中解放,回归创意本身。其电影级4K画质、跨镜头角色一致性,搭配多模态输入能力,让用户仅凭想法就能落地优质内容,大幅拉快内容生产节奏。这款模型实现了从“片段生成”到“导演级叙事”的跨越,音画同步、自动分镜运镜、多素材精准参考等功能,消解了专业制作门槛,个人创作者也能轻松产出有电影感的视频。它不仅重构了内容生产逻辑,更让文生视频大模型的落地场景愈发清晰,短剧、广告、动漫、自媒体创作等领域都能借其实现效率升级。Seedance2.0的到来,标志着AI视频创作进入“创意为王”的新阶段,也让行业看到了AI赋能内容产业的无限可能。#过个有AI年##HOW I AI#
新浪微博 2026-02-09 00:00:00
26. 一分钟学会用AI拍大片,做音画同出的长视频
哔哩哔哩 2026-02-05 00:00:00
27. 深度|打破次元边界,Xmax AI发布世界首个虚实融合的实时交互视频模型X1,开启视频交互新范式
微信公众号 2026-02-09 00:00:00
28. AI 推理精细化流量治理实战:RocketMQ LiteTopic 的“千人千面”流控方案
知乎 2026-03-24 00:00:00
29. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC
抖音 2026-02-01 00:00:00
30. #科技先锋官# 时空竟能被看穿?DeepMind新模型藏狠活,新一轮的AI视觉革命来了!Google DeepMind 重磅推出 D4RT 模型,凭 4D 时空理解能力引爆视觉 AI 革命!D4RT 模型将 3D 空间与时间维度融合,让 AI 精准捕捉物体空间形态与动态轨迹,彻底打破传统视觉处理的桎梏。传统方法靠多模型串行运算,处理动态场景易出纰漏,一分钟视频竟要数小时,效率极低。 D4RT 以单一时空查询接口实现任务统一,压缩视频为全局场景记忆后并行计算,速度提 18-300 倍,一分钟视频仅需 5 秒,还破解了纹理相似区域识别难题。D4RT 模型为机器人、AR 等领域赋能,更突破具身智能感知瓶颈,推动 AI 从逐帧观看升级为全局时空理解。视觉 AI 的时空感知能力突飞猛进,是否意味着其离真正的 类人视觉 仅一步之遥?当 AI 能实时全局理解动态时空,自动驾驶、智能交互的终极形态将如何被改写?这场视觉 AI 的技术飞跃,又会为人类生活带来哪些颠覆性改变,值得每一个人深思。#微博超有用视频大赛##上微博涨知识##AI生活指南# 种斌Marco的微博视频
新浪微博 2026-01-25 00:00:00
31. 14B规模竟也能单卡实时生成视频?多亏这个强大的开源底座
微信公众号 2026-03-07 00:00:00
32. 在线人体姿态估计新秀来了!🎉 WiFi DensePose 这个开源项目基于WiFi信号中的通道状态信息(CSI)和先进的机器学习技术,实现了无需摄像头、通过普通Mesh路由器即可实时全身姿态估计,甚至能穿墙追踪! 主要亮点: - 完全隐私保护:无须摄像头,保护用户隐私; - 实时高效:低于50ms延迟,支持30 FPS; - 多人追踪:同时跟踪最多10人; - 多领域适配:适合医疗健康、智能家居、安全监控等; - 企业级API:支持认证、限流和监控; - 硬件无门槛:支持市面主流WiFi路由器和网卡; - 丰富分析:含跌倒检测、活动识别、占用监控; - WebSocket流媒体:实时数据推送,方便开发互动应用; - 高性能Rust版本:速度较Python版本提升数百倍,资源占用更低。 安装简单: ``` pip install wifi-densepose ``` 启动即用,支持Docker和多平台,适合科研、行业及开发者体验。 开源链接👇 github.com/ruvnet/wifi-densepose 想体验黑科技穿墙人体追踪,WiFi DensePose绝对不能错过!🚀 #AI创造营##人工智能#
新浪微博 2026-03-01 00:00:00
33. ICML'26开源 | 华科&酷睿程提出GemDepth:首个几何引导视频深度估计框架,远超VGGT/VDA,精度全面SOTA!
知乎 2026-05-25 00:00:00
34. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-30 00:00:00
35. 自动驾驶从感知、模仿进入认知推理阶段,小米发布的 OneVL 核心解决 “看清后如何快速精准决策” 难题。它采用 XLA 路线,创新 Latent CoT,将推理载体从语言转向视觉时空结构。通过双模态 latent token、双解码器监督、一步式推理三大设计,推理延迟压至 0.24 秒,速度较显式 CoT 最高提升 2.3 倍,精度更优。OneVL 统一 VLA、世界模型与潜空间推理,还具备语言 + 视觉双维可解释性,已在多项基准达 SOTA。虽面临算力、长尾场景等挑战,但为自动驾驶落地提供关键方案,且可拓展至机器人等领域。
新浪微博 2026-05-14 00:00:00
36. 一条视频教会你如何用AI做3D建模,甚至还能发展成副业...
哔哩哔哩 2026-04-27 00:00:00
37. #小米开源首代机器人VLA大模型#小米刚放出一个大消息:开源了自家第一代机器人 VLA 大模型 ——Xiaomi-Robotics-0。这款模型有 47 亿参数,主打视觉语言理解 + 高性能实时执行,不仅在三大主流仿真测试里表现亮眼,在真实机器人身上也很能打,动作流畅、反应灵敏,物理智能的通用性很强,而且在消费级显卡上就能跑实时推理。更关键的是,小米这个 VLA 大模型很快就要实际搭载上车,高性能、实时执行都安排上了,XLA 这块真的可以狠狠期待一波!
新浪微博 2026-02-12 00:00:00
38. #豆包大模型2.0将发布#2月12日,字节跳动火山引擎宣布,将于2月14日推出豆包大模型2.0、Seedance 2.0、Seedream 5.0 Preview三大升级,标志着国产大模型向实用化、工业化迈进关键一步。豆包大模型2.0大幅提升基础能力与企业级Agent智能,更适配复杂任务与商业场景。Seedance 2.0聚焦音视频创作,复杂动作生成稳定、多模态输入全面、指令遵循精准,可直接满足影视、广告工业级交付。Seedream 5.0新增实时检索,紧跟热点资讯,知识与多语种能力增强,模糊指令也能精准理解,图文一致性显著提升。此次升级不只是技术迭代,更是从“能用”到“好用”的跨越。模型更懂创作、更贴产业、更接时效需求,将大幅降低内容生产与企业数字化门槛,为行业带来更高效、更可靠的AI生产力工具。#how i ai# 豆包大模型2.0将发布
新浪微博 2026-02-12 00:00:00
39. 把“实时生成世界模型”这种最烧钱、最烧算力、最难做成产品的方向,往大众创作和大众认知里推,一旦做成了,这将彻底改变人类的媒介形态。 #AI视频##PixVerse# 动动枪DongDongGun的微博视频
新浪微博 2026-01-16 00:00:00
40. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。
知乎 2026-06-02 00:00:00
41. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#
新浪微博 2026-03-31 00:00:00
42. 商汤SenseNova U1:原生多模态统一模型的范式革命
知乎 2026-05-05 00:00:00
43. 登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界
微信公众号 2026-03-20 00:00:00
44. 腾讯混元推出了UniRL ,一个面向统一多模态生成模型的分布式强化学习框架。地址:github.com/Tencent-Hunyuan/UniRLUniRL 对多模态模型家族应用一次强化学习后训练循环——生成样本、评分、计算优势、更新策略,并将权重同步回 rollout 工作器。
新浪微博 2026-06-09 00:00:00
45. 阿里发布了Qwen3.5-Omni,这可能是林俊旸离职后的首个重量级发布了,看来通义团队确实顶住了压力,而且节奏非常紧凑。这个版本在音频、语音、视频 215项SOTA,属于行业第一。在音频理解上超过了gemini3.1 pro,视频理解上和它差不多。阿里出的这个版本主要是针对“实时语音交互”这个赛道,估计是为以后的千问AI眼镜、各种AI耳机、汽车智能座驾铺路。
新浪微博 2026-03-31 00:00:00
46. 【乐奇 Rokid 海外版宣布升级,首发支持 Gemini】乐奇 Rokid 旗下 AI 眼镜 Rokid Glasses 海外版升级,接入谷歌 Gemini、ChatGPT、DeepSeek 及阿里通义千问四大主流 AI 大模型,成为行业首款支持 Gemini 的 AI 眼镜,可在端云协同架构下实现跨模型自由切换、多模态交互与实时翻译等功能。
新浪微博 2026-03-03 00:00:00
47. 边看边创造,在 PixVerse R1 的实时世界模型里,你真是上帝
微信公众号 2026-01-14 00:00:00
48. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”
新浪微博 2026-03-19 00:00:00
49. #马斯克感慨Seedance2.0发展快#马斯克对字节跳动Seedance 2.0的发展速度公开感慨,标志着中国自研AI视频生成模型已跻身全球第一梯队,折射出全球AI视频赛道进入加速迭代期,也印证了中国在多模态AI领域的工程化落地能力实现关键突破。 这一现象说明,中国AI企业在算法架构、多模态融合、时序一致性控制等核心环节已形成自主能力,Seedance 2.0凭借多镜头叙事、音画同步、混合模态输入等特性,实现从“片段生成”到“完整作品创作”的跨越,获得国际科技界认可。 与OpenAI Sora、Google Veo 3等海外同类模型相比,Seedance 2.0优势突出:多镜头连贯性与角色一致性表现优异,生成效率与商用适配性更强,贴合短视频、短剧等场景落地;劣势在于单段生成时长、极端物理场景还原度仍有提升空间,算力依赖度较高,全球生态开放与适配性有待完善。 后续发展上,Seedance 2.0将持续向更长时长、更高画质、更强物理仿真方向迭代,加速在内容创作、影视工业化、数字营销等领域落地。全球AI视频模型将呈现技术竞争与场景互补格局,中国模型依托场景优势快速迭代,海外模型聚焦基础研发,共同推动行业走向成熟。同时,合规治理与技术创新协同推进,将成为AI视频产业健康发展的核心方向。 马斯克感慨seedance2.0发展快
新浪微博 2026-02-12 00:00:00
50. 手机的AI可以多强大?联发科用他们的旗舰天玑芯片告诉你:不用联网,在手机本地就能直接运行复杂的多模态大模型!现场他们演示了用智能眼镜配合手机,实现实时的视觉识别和语音对话,反应迅速,而且所有数据都在本地处理,隐私性大大增强。随身AI助手真的要来了。
新浪微博 2026-03-02 00:00:00
51. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
52. “世界模型”竞赛升级:Runway推出GWM-1,实时交互可持续数分钟之久
知乎 2025-12-13 00:00:00
53. 3.7-5|实时交互式视频理解与AI伴侣
微信公众号 2026-03-07 00:00:00
54. Think While Watching:流媒体视频实现边看边想实时理解能力突破
今日头条 2026-03-25 00:00:00
55. 视频理解不再“慢半拍”?详解实时多模态模型 MOSS-Video-Preview
知乎 2026-03-25 00:00:00
56. 告别“马后炮”式分析!实时视频理解大模型颠覆自动驾驶与机器人交互
知乎 2026-01-27 00:00:00
57. 记得住、答得快、用得省
知乎 2026-04-25 00:00:00
58. AIR科研 | 新范式搭建视觉感知的“快速路”
微信公众号 2026-04-14 00:00:00
59. 如何评价GPT-5o正式开放4K实时视频理解功能?
知乎 2026-03-14 00:00:00
60. 香港浸会大学团队让AI实时看懂直播视频 - 哔哩哔哩
哔哩哔哩 2025-12-27 00:00:00
61. MiniCPM实时视频理解,超级ocr,端侧可用的 Gemini 2.5 Flash 级视觉、语音、全双工多模态实时流式大模型,现在开源了!
微信公众号 2026-02-04 00:00:00
62. 力合资本Family|「视启未来」在拉斯维加斯 CES 2026 发布首个实时视频理解端侧 AI,携手九安智能打造“万物理解”摄像头
微信公众号 2026-01-08 00:00:00
63. ICLR 2026 | 视频与时序理解30篇相关论文整理三(内附源码)
微信公众号 2026-05-23 00:00:00
64. CVPR 2026 | 火山引擎多媒体实验室提出TempR1,显著增强多模态大模型视频时序理解能力
今日头条 2026-04-14 00:00:00
65. 华科&小米提出VST
知乎 2026-03-19 00:00:00
66. [ICLR 2026] RIVER实时交互基准
知乎 2026-04-18 00:00:00
67. 流式视频理解的简单基线
微信公众号 2026-04-06 00:00:00
68. 中科院ThinkStream
微信公众号 2026-03-20 00:00:00
69. 5分钟AI小课堂 | 如何评估AI的“视频理解力”?英特尔研究指出关键路径
微信公众号 2025-12-12 00:00:00
70. CVPR 2026 | 北大提出 Conan
微信公众号 2026-03-14 00:00:00
71. 北大&腾讯微信AI联合提出Conan
微信公众号 2026-03-17 00:00:00
72. 视频理解新范式
微信公众号 2026-04-11 00:00:00
73. CVPR2025 | 突破二维局限! Change3D从三维视频建模视角重塑遥感影像变化检测和描述任务
微信公众号 2026-03-30 00:00:00
74. 计算专题 | RDVFI
微信公众号 2026-03-13 00:00:00
75. 把KV缓存压缩92.7%!几分钟长视频生成显存砍到1/13,速度还涨了1.23倍【AI视频生成论文解读】
哔哩哔哩 2026-06-03 00:00:00
76. VideoAuto-R1: 自适应高效视频推理框架
小红书 2026-01-27 00:00:00
77. 【61】论文泛读
知乎 2026-04-23 00:00:00
78. 告别调参噩梦
微信公众号 2026-05-13 00:00:00
79. 长时遮挡不再慌!UMOT
微信公众号 2026-05-27 00:00:00
80. 字节跳动的 StoryMem 为 AI 视频模型提供记忆功能,从而防止角色在不同场景间发生变形
微信公众号 2026-01-04 00:00:00
81. AI 不只是“看见”视频, 而是开始真正“理解”视频了。 以前多模态模型看视频,很多时候像是在看一堆截图。 但 KS 开源的 Keye-VL-2.0,重点放在了长视频理解上。 它想解决的问题是
抖音 2026-06-01 00:00:00
82. 南加州大学AI研究团队开发游戏视频理解新基准 - 哔哩哔哩
哔哩哔哩 2026-04-03 00:00:00
83. 下一站
今日头条 2026-01-28 00:00:00
84. AI全景之第七章第五节
今日头条 2026-01-09 00:00:00
85. Gemini视频理解能力首测
知乎 2026-05-13 00:00:00
86. NeurIPS 2025|RTV-Bench
微信公众号 2025-12-26 00:00:00
87. Paper Daily!视频大模型评测新基准,挤干性能注水
微信公众号 2026-04-09 00:00:00
88. ICCV 2025 | 引入树状GRPO强化学习,多模态大模型轻松破解小时级长视频定位难题
知乎 2026-02-04 00:00:00
89. 3分钟搞懂多模态AI
微信公众号 2026-04-11 00:00:00
90. 多模态(Multimodal)开发经验
今日头条 2026-04-04 00:00:00
91. 做视频理解的都应该看看这篇
知乎 2026-03-13 00:00:00
92. 打破视频推理「先看后想」惯性,实现真正的「边看边想」
今日头条 2026-03-18 00:00:00
93. 迈向深层推理与超长序列
知乎 2026-05-08 00:00:00
94. MOSS-VL 开源发布
知乎 2026-04-09 00:00:00
95. 海量视频分析难?英伟达开源VSS解锁视频全能玩法
知乎 2026-05-19 00:00:00
96. Video-MME Team打造最严格AI视频理解评测基准
今日头条 2026-04-15 00:00:00
97. 论文解读|InternVideo2重塑视频理解新标杆,多模态学习引领行业风向
CSDN
98. GPT-4o不敌Qwen,无一模型及格!UC伯克利港大等提出多模态新基准
今日头条
99. 多模态新旗舰MiniCPM-V 4.5:8B 性能超越 72B,高刷视频理解又准又快
PHP中文网
100. 北大王选所彭宇新团队
网易
101. 大模型如何做视频理解?最新《多模态大语言模型在全面长视频理解》综述
None
102. 视频理解与多模态搜索.pptx
None
103. 空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
网易
104. [CVPR2024 Highlight] MVBench多模态视频理解能力的全面评测
知乎
105. Thinking Machines 发布原生多模态实时互动模型 - 哔哩哔哩
哔哩哔哩 2026-05-14 00:00:00
106. 最新!OpenAI GPT-5下周发布,支持实时视频理解,多模态能力再升级
知乎 2026-03-14 00:00:00
107. ICCV 2025 | 2分钟长视频、20Hz实时规划、8%理解提升:三大世界模型,开启自动驾驶全栈进化
知乎 2026-05-23 00:00:00
108. 多模态AI的起源、演进与深度思考
微信公众号 2026-03-31 00:00:00
109. 多模态AI模型最新发展趋势
微信公众号 2026-05-11 00:00:00
110. 打破视频推理「先看后想」惯性,实现真正的「边看边想」CVPR'26丨【卓戴资讯】
微信公众号 2026-03-19 00:00:00
111. 消费级显卡跑通 MiniCPM-o 实时视频理解!
今日头条 2026-05-06 00:00:00
112. 速度拉满!TurboDiffusion:实时生视频
小红书 2025-12-17 00:00:00
113. 【完结】多模态与视觉大模型开发实战 - 2026必会
知乎 2026-01-14 00:00:00
114. Omni Model vs Pipeline 多模态实现方式优劣对比报告 - 哔哩哔哩
哔哩哔哩 2026-05-16 00:00:00
115. 视频理解:从几何与语义表征到统一模型架构
微信公众号 2026-03-22 00:00:00
116. 流式视频理解 - MOSS-VL
小红书 2026-04-28 00:00:00
117. 从“跨模态炫技”到“产业实用”多模态大模型真的能落地见效吗?
今日头条 2025-12-28 00:00:00
118. 从双流网络到InternVideo:视频理解技术发展全景
微信公众号 2026-03-10 00:00:00
119. 多模态(Multimodal)开发经验:2026年的求职分水岭——你是否具备处理图像、音频与文本融合交互的开发经验?
知乎 2026-04-04 00:00:00
120. 原生多模态模型技术全景
知乎 2026-05-10 00:00:00
121. Frigate:AI 驱动的本地视频监控智能分析平台
今日头条 2026-05-20 00:00:00
122. CVPR 2026 | 上交 EPIC Lab 提出 Token 级流式视频即插即用 2 倍无损加速方案!
知乎 2026-03-16 00:00:00
123. 提速24倍!安心・实时侦察智能体,5秒定位全域监控
微信公众号 2026-05-11 00:00:00
124. 监控只会录像?这个开源系统能主动报警!BXC_VideoAnalyzer部署只需5分钟
哔哩哔哩 2026-03-25 00:00:00
125. 【更新中】多模态大模型 前沿算法与实战应用
今日头条 2026-05-01 00:00:00
126. 加速流式视频理解!上交团队实现ViT编码与LLM预填充双重加速
微信公众号 2025-12-27 00:00:00
127. 谷歌推出全新Gemini Omni模型,主打多模态无缝交互
今日头条 2026-05-20 00:00:00
128. 智能视频分析系统
微信公众号 2026-04-24 00:00:00
129. 2026监控智能分析系统优质厂家推荐榜
今日头条 2026-04-05 00:00:00
130. 优博微享2024 | 王蒙蒙:基于时序建模的视频内容分析
微信公众号 2025-12-18 00:00:00
131. 2025年多模态模型行业深度剖析:现状洞察、前景展望与趋势前瞻
微信公众号 2026-03-01 00:00:00
132. 论文速递:视频时间流学习新方法
微信公众号 2026-04-25 00:00:00
-
性价比到顶配:我的电脑升级之路0 0
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!232 71 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400191 360 -
iPhone 16 Pro 只要 2550 元,太离谱了!110 300
已收藏
去我的收藏夹