多模态大模型已远超“聪明聊天机器人”,这些真实落地场景你用上了吗?
05-14 11:00
精选参考来源
精选参考来源
1. 顶级教育资源入场券,谷歌联手斯坦福给全球孩子做的免费AI启蒙神器,带孩子零代码做数据清洗、模型训练、偏见消除 #ai #学习 #谷歌 #斯坦福 #教育
抖音 2026-04-28 00:00:00
2. 比AI视频还离谱,一句话生成一个可探索的三维世界
哔哩哔哩 2026-04-18 00:00:00
3. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
4. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC
抖音 2026-02-01 00:00:00
5. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌
抖音 2025-12-30 00:00:00
6. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC
抖音 2026-04-05 00:00:00
7. 阿里千问横扫硅谷,美国正面临“千问恐慌”! 阿里千问横扫硅谷,白宫深夜对阿里出手,美国正面临“千问恐慌”!#阿里 #千问 #大模型
抖音 2025-11-17 00:00:00
8. 构建多模态AI应用通常需要整合数据库、文件存储、向量检索和各种模型服务,流程复杂且难以维护。Pixeltable 是一个开源的Python库,提供声明式的数据基础设施,统一管理图像、视频、音频、文档等多模态数据,支持增量存储、转换、索引和检索,简化了AI应用的数据管道搭建。它通过“表+计算列”的方式,让你用Python代码定义数据处理和AI推理流程,自动增量计算,支持内置的模型集成(如OpenAI、Hugging Face、YOLOX等),还具备内置向量搜索和版本控制功能。主要特点:- 统一多模态数据接口,轻松管理图片、视频、音频、文档等多种类型;- 声明式计算列,数据更新时自动增量执行,节省计算成本;- 内置多种AI模型推理接口,支持对象检测、文本生成、图像分类等;- 支持向量索引和语义搜索,结合结构化查询强大灵活;- 完整的数据版本管理,支持时间旅行查询;- 集成多种格式导出和机器学习工具链对接。适合需要快速搭建多模态AI数据处理和推理流水线的开发者和团队,安装简单,只需`pip install pixeltable`即可开始使用。GitHub仓库:github.com/pixeltable/pixeltable 官方文档:docs.pixeltable.com用Pixeltable,专注AI模型和业务逻辑,告别复杂繁琐的数据架构。
新浪微博 2025-11-21 00:00:00
9. GPT-Image-2 正式发布:AI 生成图片的 "Vibe Design" 时代来了
知乎 2026-04-22 00:00:00
10. 面向实战的多模态数据生成与表征技术创新
知乎 2026-01-07 00:00:00
11. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行 豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA 视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖 Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级 Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#
新浪微博 2026-02-14 00:00:00
12. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
13. 阿里云发布多模态交互开发套件
微信公众号 2026-01-09 00:00:00
14. 太震撼了!这个AI绘画模型生成的图片太牛了(GPT Image 2,附提示词和案例)
微信公众号 2026-04-22 00:00:00
15. 【#阿里千问登顶空间推理全球冠军#,超Gemini3、GPT5.1】今日,空间推理基准测试SpatialBench更新了最新一期榜单,阿里千问的视觉理解模型Qwen3-VL、Qwen2.5-VL位列头两名,超越Gemini 3、GPT-5.1、Claude Sonnet4.5等国际顶尖模型。SpatialBench榜单显示,Qwen3-VL-235B和Qwen2.5-VL-72B分别斩获13.5和12.9分,领先于Gemini 3.0 Pro Preview(9.6) 、GPT-5.1(7.5)、Claude Sonnet 4.5等海外顶尖模型。然而,AI大模型的整体表现距离人类仍有差距,人类基准线约为80分左右,可专业处理电路分析、CAD 工程和分子生物学等复杂空间推理任务,目前大模型还无法完全自动化完成此类工作。(快科技)
新浪微博 2025-11-26 00:00:00
16. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
17. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生
抖音 2026-01-08 00:00:00
18. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月
抖音 2025-12-21 00:00:00
19. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”
新浪微博 2026-03-19 00:00:00
20. 谷歌论文,干崩存储?#谷歌 #存储芯片 #Google #Deepseek #AI推理
抖音 2026-03-27 00:00:00
21. GPT-5.5 Instant 正式发布!免费可用,实测到底强多少?OpenAI 五大升级一次看懂! | 零度解说
哔哩哔哩 2026-05-08 00:00:00
22. 千问 vs ChatGPT:4大功能实测!到是更好用的AI助手!Qwen3能否战胜GPT-5.1?
哔哩哔哩 2025-11-19 00:00:00
23. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
24. 自动化所 × 小米!MeanFuser:极速单步多模态轨迹生成,纯规划434FPS(CVPR'26)
微信公众号 2026-02-27 00:00:00
25. Hologres 4.0:面向 AI 时代的一站式多模态分析检索平台
知乎 2026-04-12 00:00:00
26. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人
抖音 2025-12-07 00:00:00
27. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC
抖音 2025-12-14 00:00:00
28. 多模态大模型这条赛道,阿里云开始拉速度了
微信公众号 2025-12-22 00:00:00
29. Qwen3.6-Plus 太猛了!免费 + 百万上下文 + Agent + 视觉多模态AI能力拉满! 零度解说
哔哩哔哩 2026-04-09 00:00:00
30. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说
哔哩哔哩 2026-04-10 00:00:00
31. 千问APP正式上线国内最强视频生成模型通义万相 Wan2.5 和全球最强开源模型 Qwen-Image 的独家满血特供版,现在已经可以在新升级的千问APP中免费体验了。#千问上线阿里最强AI生图模型满血版#通义万相 Wan2.5是目前业界少数具备音画同步能力的视频模型之一,能生成和画面匹配的人声、音效和音乐 BGM。该模型首次采用原生多模态架构,只需一张照片和一段文字,无需模板,即可生成一段肢体动作自然、口型匹配准确的 1080P 高清唱跳视频,最长支持 10S。测试显示,无论是真人照片、萌宠、二次元角色,还是文物、卡通形象,千问 App 都支持。Qwen-Image该模型在图像编辑中维持了更高的一致性,并在多视角转换、多图像融合、多模态推理等方面取得突破进展。此次在千问 App 内上线的 Qwen-Image 新模型,可精准编辑、修改图片中的文字。支持双图“拼贴”与“融合”、基于参考图进行编辑。生成亚洲人像更真实,中文更稳定,海报设计达商用级别。我自己也尝试了一下,确实非常好用,而且理解能力非常强,不需要非常繁琐的说明即可达到想要的效果。比如说“把图片中人物的墨镜换成透明的”“把这张图变成漫画风格”“把月光宝盒换成太阳宝盒,字体不变”。因为平时拍图修图比较多,就我的使用来看,“AI修图”已经是非常好用了,AI生成视频、AI生图也挺好玩,大家可以亲自去尝试下。
新浪微博 2025-12-02 00:00:00
32. GPT-5.3 正式发布!完全免费开放,实测代码能力、推理、文本理解与响应速度 | 零度解说
哔哩哔哩 2026-03-06 00:00:00
33. 如何用上业界最厉害的视频模型?教你轻松创作出电影级画面
哔哩哔哩 2025-12-10 00:00:00
34. #这届春晚大家都在找豆包帮忙#今年春晚,豆包成了全民“春节搭子”!不管是年夜饭的菜谱难题,还是写春联时的典故困惑,甚至春晚节目里的冷知识,观众的海量问题如潮水般涌来,而豆包凭借豆包大模型的超强语义理解能力,一一精准解答,让年味更浓、互动更暖。面对临场不确定性,豆包与火山引擎深度合作,基于业界领先的AI云原生架构,支撑起每秒数十万次的并发请求,确保实时交互零卡顿。无论是方言翻译、魔术揭秘,还是无障碍手语支持,豆包都以毫秒级响应和99.9%的内容准确率,让14亿观众无障碍共情春晚。这个除夕有豆包相伴,春晚更热闹,年味也更浓!
新浪微博 2026-02-16 00:00:00
35. Agent时代,为什么多模态数据湖是必选项?
微信公众号 2026-01-15 00:00:00
36. #马云现身蚂蚁园区#佩戴工牌与鸭舌帽尽显低调 今日上午,蚂蚁集团正式发布了全模态通用AI助手“灵光”,能够在移动端实现“自然语言30秒生成小应用”,并且可编辑可交互可分享。同时,灵光也是业内首个全代码生成多模态内容的AI助手,支持3D、音视频、图表、动画、地图等全模态信息输出。而就在昨天,阿里巴巴正式宣布“千问”项目,全力进军AI to C市场。当天,千问App公测版上线,基于全球性能第一的开源模型Qwen3,凭借免费,以及与各类生活场景生态的结合,与ChatGPT展开全面竞争。
新浪微博 2025-11-18 00:00:00
37. 美团开源 longcat-image 图像生成模型,将对 AI 领域带来哪些影响?
知乎 2025-12-09 00:00:00
38. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#
新浪微博 2026-04-02 00:00:00
39. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-29 00:00:00
40. image2惊艳登场,AI生成图让“眼见为实”变“眼见为疑”!
微信公众号 2026-04-25 00:00:00
41. 最强多模态大模型Gemini 3 Pro强在哪里?
知乎 2025-12-07 00:00:00
42. 阿里云 OpenLake:AI 时代的全模态、多引擎、一体化解决方案深度解析
知乎 2025-11-14 00:00:00
43. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
44. 盘点一周AI大事(11月30日)|AI自己剪片子 奥特曼预告下一代大模型Shallotpeat Anthropic发布最强编码模型Claude Opus 4.5 DeepSeek发布最强开源推理模型DeepSeek-Math-V2 微软开源最强行动智能体Fara-7B Black Forest推出最强开源图像模型Flux.2 阿里发布开源版小香蕉平替Z-Image 腾讯发布开源版Veo 3平替Tencent Harmony 字节开源AI剪辑大模型Vidi2 腾讯开源最强OCR模型HunyuanOCR 1B 科学家研发出最强数据分析智能体Edison Analysis RAI研发棒球陪练机器人 港科大训练出首个会打篮球的机器人 工程师开源家用机器人Aloha mini #AI新星计划 #人工智能 #AIGC #OpenAI #机器人
抖音 2025-11-30 00:00:00
45. 阿里全家桶全面Agent化!千问“任务助理”全面公测,从此AI不再只是动嘴出主意的狗头军师!
哔哩哔哩 2026-01-21 00:00:00
46. Meta的秘密项目居然偷师千问?偷早啦!千问发布旗舰推理模型Qwen3-Max-Thinking#Qwen3 #千问 #科技改变生活 #AI新星计划 #玩个很新的东西
抖音 2026-01-29 00:00:00
47. #雷军公布小米机器人最新进展##小米发布机器人基座模型#就在刚刚,我米技术对外发布开源VLA模型Xiaomi-Robotics-0,该模型有47亿参数,兼具视觉语言理解与高性能实时执行能力,刷新多项SOTA。采用MoT架构,大脑VLM理解人类指令、捕捉空间关系,小脑Action Expert生成平滑动作,训练上采用两阶段法,先跨模态预训练,再后训练,解决真机动作断层等问题。在测试中,在仿真测试和现实真机任务中表现优异,保持了VLM多模态理解能力,将模型开源,有望推动机器人在工业、服务业、家庭等场景的应用,加速具身智能落地,相信很快就会运用在更多的生态产品上。 而Xiaomi-Robotics-0机器人基座模型,Benchmark全面超越OpenVLA和Pi,跻身行业第一梯队,结合近期Mimo等成果,我米AI成长迅猛,且开源VLA与触觉模型,构建完整手脑技术栈,务实推进,为机器人商用铺路。
新浪微博 2026-02-12 00:00:00
48. 国产AI生图又变强了!表情包、信息图、电影海报...一键生成!
哔哩哔哩 2026-03-06 00:00:00
49. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
微信公众号 2026-01-13 00:00:00
50. 阿里推出千问AI助手,集成最新Qwen大模型,支持多端使用,终于踏上了自己的“Ch(ina)at GPT”之旅;阿里在开源模型领域已经是世界T1的存在了,这次推出的千问则具备深度研究、多语言翻译等功能,与ChatGPT、豆包对比表现全面,这也标志着标志国产AI正在从“能用”到“好用”,然后开始“引领”。[不愧是你] #Qwen##千问##千问AI# http://t.cn/AX2rDgci
新浪微博 2025-11-17 00:00:00
51. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
52. 我们是否正进入「家庭教育 AI 化」时代?AI 学习机扮演什么角色?它真能缓解父母的辅导焦虑吗?
知乎 2025-12-30 00:00:00
53. 如何看待最新发布的国产统一多模态大模型让P视频像P图一样简单?未来的视频制作产业会发生什么变化?
知乎 2025-12-07 00:00:00
54. 今夜,OpenAI杀死了GPT-4o
知乎 2026-02-14 00:00:00
55. 灵光一夜爆火,一句话就能做出小应用,当AI发展得越来越快——你就知道,孩子真正要练的,从来不是技能本身#近6成程序员称不会给孩子报AI编程课 #AI时代教育 #灵光#孩子要学什么
抖音 2025-11-19 00:00:00
56. 一个视频带你快速盘点2025年GitHub热点项目
哔哩哔哩 2025-12-28 00:00:00
57. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何
哔哩哔哩 2026-02-19 00:00:00
58. 蓝色起源成为全球第二个实现火箭回收的公司 追上SpaceX,成功的秘诀居然是这个#亚马逊云科技 #生成式AI #出海 #reInvent2025 #AI
抖音 2025-12-08 00:00:00
59. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
60. 【直播回放】解析谷歌Gemini 3:“AI 全模态”时代与Scaling Law的极致执行
哔哩哔哩 2025-11-21 00:00:00
61. 停止低效创作!这套爆款内容系统,正在重新定义内容工业化生产! 今天我给你彻底拆解:为什么你的内容创作效率低下,而头部品牌却能批量产出爆款? 因为你们之间,隔着一套"AI时代的内容生成工具"。 给你看个国内某头部公司的爆款内容采集分析&二创系统,这套系统不是简单的工具,而是完整的"内容工厂"解决方案。 它解决的不是单点问题,而是整个内容生产流程的数字化转型。 #飞书 #短视频运营 #小红书运营 #内容创作 #ai内容创作
抖音 2026-04-19 00:00:00
62. 海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
微信公众号 2026-03-06 00:00:00
63. 元戎启行这次在北京车展不仅仅是发布技术,而是直接宣布跳出单一智驾赛道,全面进军物理 AI 全新领域。随着前 DeepSeek 多模态技术核心大牛阮翀的加入与北京车展首秀,元戎正在用 40B 基座大模型重塑智驾的底层逻辑,不再依赖传统的规则代码,而是打通多模态感知与舱驾一体驱动,让智驾从执行工具进化为具备认知的 AI 大脑。现场更值得关注的是一场主题为"AI for What"的跨界 AI Talk,雨果奖得主郝景芳将与阮翀以及多位高校学者、产业大咖共同激辩多模态如何落地物理世界,以及物理 AI 将如何重塑未来出行。个人觉得智驾的下半场,核心在于 AI 在物理世界的具身化。当大模型从屏幕里的对话框走向控制底盘的执行器,汽车就不再是冰冷的交通工具,而是能理解、能推理、能决策的智能体。元戎跳出单一智驾探索物理 AI,这一步走得好,同时天花板也极高。4 月 25 日北京车展 A4 馆,来见证元戎交出的答卷。 深圳
新浪微博 2026-04-23 00:00:00
64. Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
微信公众号 2025-12-15 00:00:00
65. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#
新浪微博 2026-02-16 00:00:00
66. 把手教你用上开源版Claude Code,Windows系统接入保姆级教程!
哔哩哔哩 2026-02-03 00:00:00
67. 华为乾崑技术大会上首发舱内 AI 多模态感知系统,行业唯一的三合一舱内AI多模态感知,摄像头、红外摄像头加星闪传感器,鸿蒙座舱可识别后排乘客胸腔起伏,这样就不用再开车时时刻关注儿童情况了。#华为乾崑开启内外双融合感知时代#
新浪微博 2026-04-25 00:00:00
68. 深扒GPT Image 2:疑似“吞”下了GPT-4o,OpenAI没把它当“生图”模型训练
微信公众号 2026-05-03 00:00:00
69. 【首发】GPT-5.5重磅上线!能自己搞定复杂任务的AI来了
哔哩哔哩 2026-04-26 00:00:00
70. 深圳AI助阵,让赛场无障碍
微信公众号 2025-12-10 00:00:00
71. 大型多语言代码库的文档生成一直是个难题,如何自动产出结构化、体系化的仓库级文档,涵盖跨文件、跨模块乃至系统层面的架构关系?CodeWiki 是一个开源框架,专注于自动化生成大规模代码库的全局文档。它支持 Python、Java、JavaScript、TypeScript、C、C++、C# 七种主流语言,结合层级分解、递归多智能体处理和多模态合成技术,不仅生成文字说明,还能产出架构图和数据流图,帮助开发者全面理解复杂项目。主要特点:- 层级分解策略,保持架构上下文,适配超大代码库;- 递归多智能体系统,动态任务分配,保证文档质量和扩展性;- 多模态合成,集成文本与视觉化架构图、数据流图等多种表达;- 支持主流编程语言,覆盖广泛开发场景;- 提供命令行工具,方便快速生成和部署文档;- 支持生成 GitHub Pages 网页文档,方便浏览和分享。适合需要对大型、多语言项目进行系统化文档管理的开发团队和开源社区。项目地址:github.com/FSoft-AI4Code/CodeWiki 在线演示:fsoft-ai4code.github.io/CodeWiki/
新浪微博 2025-11-23 00:00:00
72. 阿里系连发两个重磅AI产品,暗藏了一个巨大的机会#灵光 #蚂蚁灵光 #阿里巴巴 #全模态通用AI助手 #AI工具
抖音 2025-11-20 00:00:00
73. 「Github一周热点105期」Rust 版openclaw,本地语音克隆工具,Qwen3.5, AI 渗透测试系统和精美源码图片生成工具
哔哩哔哩 2026-02-28 00:00:00
74. #DeepSeek是国产识图最强AI吗# 鑫人觉得谈不上最强,DeepSeek识图开放确实搅动了国产多模态格局。目前国产第一梯队是通义千问Qwen2‑VL、智谱GLM‑4V、DeepSeek V4,各有长板。通义视觉精度强、开源生态全;智谱中文复杂理解深;DeepSeek胜在图文联动推理强,能看图做逻辑推导,不只是描述画面。DeepSeek识图能搞定日常物体、图表、错题解析,但手写体、极端密集场景仍有误差。国产整体水平:中文场景不输国际顶尖,本地化理解招牌、菜单、国潮设计甚至更优;短板在幻觉控制、超高精度识别、复杂3D空间推理。DeepSeek入场后,国产多模态从“拼识别”转向“拼理解+推理”,竞争更激烈,对普通用户来说,实用选择更多了。#人工智能##ai#
新浪微博 2026-05-11 00:00:00
75. #千问发布QwenImage2.0#重磅消息!千问今天发布了新一代图像生成模型Qwen-Image-2.0,这是千问首次将图像生成与编辑功能统一到一个模型中,生成的图更加质感细腻、文字写作理解能力也更强,用户用起来也更加便捷高效!那么你肯定会问Qwen-Image-2.0到底强不强?在权威第三方评测AI Arena中:Qwen-Image-2.0文生图得分1029,排名第三!图像编辑得分1034分,全球第二,仅次于Nano Banana Pro。强烈建议大家去体验其强大的多场景创作能力,一定会发现很多惊喜的!
新浪微博 2026-02-10 00:00:00
76. 小米端到端辅助驾驶HAD增强版「小米汽车广州车展发布会」
哔哩哔哩 2025-11-21 00:00:00
77. 万亿赛道!AI生成视频零门槛变现
抖音 2025-11-27 00:00:00
78. 一学就会,1招去除图片的AI味儿,超绝真实感 你用关键词生成的图片是不是看起来一眼假?原来不用关键词才是去掉AI味的关键!#设计 #ai #AI生图 #ai新星计划 #抖音知识年终大赏
抖音 2026-01-26 00:00:00
79. 百度上线文心5.0,模型参数2.4万亿,采用原生全模态统一建模技术,具备全模态理解与生成能力,支持文本、图像、音频、视频等多种信息的输入与输出。这是老罗数字人的表现。文心5.0以1460分位列LMArena文本榜国内第一、全球第八,超过GPT-5.1-High、Gemini-2.5-Pro等多款国内外主流模型。 兔撕鸡大老爷的微博视频
新浪微博 2026-01-22 00:00:00
80. #电视搭载AI能做什么# 作为家里的间接中控屏,能做的事,其实还挺多的。比如,作为智能家居,可以联动家里的各种摄像头,根据人物动作AI分析,门外是否有人鬼鬼祟祟等。这类功能,对于独居女性,家里有老人小孩的家庭来说,还挺重要的。还有,现在电视大多数也就老人和小孩还在看,无障碍相关的AI功能,对于这部分人群,用处也挺大的。至于其他的,大多数估计用的不算多,要么在电脑上用AI,要么在手机上用AI,毕竟年轻人已经很少看电视,且基本不会用电视办公。所以,电视的AI功能,尽量偏向智能家居联动方面,与老人小孩无障碍交互方面更好,其他臃肿的系统功能,还是别堆了。
新浪微博 2026-04-23 00:00:00
81. 亚秒级图像生成:Black Forest Labs 开源全新 FLUX.2 [klein] 模型
知乎 2026-01-16 00:00:00
82. OpenAI大溃败!GPT-5「换皮」GPT-4o,两年半预训练0突破
知乎 2025-12-01 00:00:00
83. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!
知乎 2026-05-11 00:00:00
84. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent
抖音 2026-04-12 00:00:00
85. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC
抖音 2026-01-04 00:00:00
86. 「Github一周热点96期」Flux2绘图模型、腾讯的视频生成模型、AI记忆、开源Launchpad、笔记和知识库,Nginx可视化工具
哔哩哔哩 2025-12-06 00:00:00
87. 美国大学毕业季最诚实的一次演讲 天才教授安杰拉•达克沃思公开承认用AI写稿,但就是这份人机协作的演讲稿,解开了AI时代教育最大的两个困惑 #ai #教育 #AI学习
抖音 2026-02-24 00:00:00
88. 2025最夯的自媒体玩法❗1个免费神器就能解锁!
哔哩哔哩 2025-12-16 00:00:00
89. 狙击推理时代!英伟达200亿美元收购Groq,能否巩固AI帝国护城河?
哔哩哔哩 2025-12-31 00:00:00
90. #学校已经发展成这样了吗#AI智能批改、课堂数据分析等工具已走进部分校园,成为教师的辅助帮手。教育部已设立509所人工智能教育基地校,推动AI与教学深度融合,清华、复旦等高校也在探索师—机—生三元教学模式,AI落地教育已初见成效,但全面普及仍需时日。AI要真正成为教师得力助手,需先跨越多重现实阻碍。技术与教育目标的错配首当其冲,现有AI多聚焦知识点训练与分数提升,难以兼顾学生创造力、合作意识等软技能培养,易陷入功利化教育误区。教师的角色焦虑与能力短板也不容忽视。部分教师对算法逻辑不熟悉,既担心被替代,又易过度依赖系统推荐。而现有评价体系仍以成绩为核心,难以激励教师向学习设计”转型,专业培训与评价改革的滞后制约了AI价值发挥。资源失衡与伦理风险进一步添堵。发达地区与重点学校优先享受AI资源,偏远地区面临智能鸿沟;算法偏见、未成年人隐私泄露等问题,也因伦理治理滞后而频发。企业产品与教学实际脱节、数据壁垒等碎片化问题,让AI应用多停留在试点层面。AI落地教育的关键,在于坚守教育主导、技术支撑原则。随着政策完善、跨部门协同机制构建及教师能力升级,AI终将精准对接教学需求。当技术真正服务于立德树人初心,AI才能成为让教育更公平、更有温度的助力。#秒懂热点就用智搜# 学校已经发展成这样了吗
新浪微博 2026-01-19 00:00:00
91. #DeepSeek新模型有多猛# DeepSeek V3.1发布,6850亿参数量仅激活370亿,计算成本降90%。性能超GPT-4o,中文问答准度89.3%。岚图汽车、江苏银行已应用,未来将突破多模态,推理成本再降50%。#微博声浪计划##听见微博# 凯文思考的微博音频
新浪微博 2025-11-28 00:00:00
92. 养虾省91%词元!这家AI记忆公司用1亿个多模态文件验证了!
微信公众号 2026-03-25 00:00:00
93. 【2026 AI 开源第一枪!】Qwen Multiangle 多角度一致性,ComfyUI 可控度+1!
哔哩哔哩 2026-01-12 00:00:00
94. DeepSeek发布多模态论文又连夜删除
微信公众号 2026-05-01 00:00:00
95. 第二代 VLA 物理 AI 大模型 原生多模态赋能,重构智驾决策核心✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#
新浪微博 2026-03-02 00:00:00
96. 豆包手机自动化操作手机的思路跟荣耀不太一样,荣耀是在主屏操作,本地模型快速区分识别当前页面,然后执行预先写好的无障碍脚本;而豆包手机则是在后台创建了一个虚拟屏幕,将需要AI操作的应用启动到虚拟屏幕,将屏幕数据传到云端模型进行识别操作,相比荣耀来说速度慢一些但是功能更强,且不影响用户使用手机。这种通过安卓虚拟屏幕利用无障碍操作手机的方案安卓原生系统就有接口,实现难度不大,但问题在于用户对隐私的担忧、互联网厂商的封杀,以及交互上如何设计更具有可用性,例如我让它清理私信,但是这种操作涉及到删除,就需要频繁接管。
新浪微博 2025-12-03 00:00:00
97. #小米新SU7辅助驾驶升级XLA大模型# 小米辅助驾驶的进步也太快了,新SU7的HAD辅助驾驶升级了XLA认知大模型,这就是近2000人团队+首期几十亿预算的恐怖效率…… 升级XLA认知大模型、融入MiMo-Embodied具身基座模型之后,小米辅助驾驶能够实现更深度的多模态信息输入,视觉模态+雷达模态+车身模态会经由自研大模型统一处理、直接决策。车辆还将获得自然语言的理解能力,辅助驾驶变得更聪明了 具体表现怎么样,就等明天发布会上雷总再做详细介绍了[柯基]
新浪微博 2026-03-18 00:00:00
98. #DeepSeekV4发布# DeepSeek V4预览版终于来了!这次更新主要有三大亮点:产品分层:网页端上线了“快速模式”和“专家模式”。日常聊天用快速版,写代码、搞科研等复杂任务就切到专家版,虽然可能要排队,但逻辑和精度强很多。超长上下文:支持100万Token上下文,相当于能一次性吃透75万字的内容,处理整本小说或大型代码库毫无压力。原生多模态:虽然“视觉模式”还在灰度测试,但V4已经具备了原生看图、理解视频的能力,不再只是简单的“看图识字”,跨模态理解能力有了质的飞跃。今年大模型的进步绝对是突飞猛进,AI能力会呈现指数级提升。
新浪微博 2026-04-24 00:00:00
99. 讲几个我猜到有趣的地方: G-ASD 如果去比较严谨的描述,确实是一个原生的多模态大模型的能力 这里我并非想去提世界模型ORVLA 这个描述,而是把他定义成原生多模态大模型 WHY? 1️⃣:浩瀚千里有做多模态模型的研发资源【牛马】 2️⃣:吉利自己有基座模型【这个优势很大】,已经验证了有自己的基座模型后优势非常的大 3️⃣:大算力芯片能支持原生多模态大模型在车端跑推理。 所以,Q1 能看到一些G-ASD有趣的进展 @极氪大白 浩瀚千里的工程能力还是相当扎实的,这个没得黑 @KerryMrX 一方面是能力上限的提升【芯片的构架迭代】 另一方面是场景的扩展【对于语义信息的理解】大幅度提升了驾驶场景的理解能力 @影总Tim @叫海啸的猫 @首席线索官 @碳粉说电池不胖 @40在跑车 @july再发呆 @本诺__ #极氪8X将首发新一代辅助驾驶技术##极氪[超话]##懒博小课堂##听不懂的汽车黑话#
新浪微博 2026-02-25 00:00:00
100. 北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
微信公众号 2026-03-07 00:00:00
101. 在线设计创作要用多工具切换,既麻烦又效率低。开源项目 MeiGen-AI-Design-MCP,让 Claude Code / OpenClaw 变身为本地顶级设计助手,整合 Local ComfyUI,本地离线生成,拥有 1,400+ 专业提示库,支持多方向并行批量创作。主要亮点:- 本地 ComfyUI 支持,数据和计算全部自己掌控,无需外部 API;- 丰富的 1,300+ 优化提示模板,自动将需求转化为高质量图像指令;- 并行批量生成,最高效产出多张风格迥异的设计图;- 支持参考图像上传,结合图像与提示实现精细定制;- 配合 Claude Code、OpenClaw 一键集成,使用极简;- 云端与本地多接口支持,覆盖多种生成引擎选择;- 免费且 MIT 开源,可商用无忧。GitHub:github.com/jau123/MeiGen-AI-Design-MCP适合 AI 设计师、数字艺术创作者和开发者,想自定义高效生成工作流的必备神器!#AI创造营##人工智能#
新浪微博 2026-03-01 00:00:00
102. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI
抖音 2026-04-27 00:00:00
103. #千问Qwen3.5大模型发布#刚刚阿里正式发布全新一代大模型千问Qwen3.5-Plus。用户可在千问APP、千问PC端体验,点击页面顶部千问图标,即可切换模型,体验Qwen3.5-Plus。Qwen3.5已经从纯文本模型进化到原生多模态模型,不管是推理能力,还是多模态理解与更高效的运行体验#how i ai##过个有ai年#
新浪微博 2026-02-16 00:00:00
104. AI视频模型遍地开花,曝光割韭菜的食物链,真正赚钱的只有一类人|行业风口|数据差距|爆款路径|变现实操|盈利闭环|流量红利|SORA|通义千问|腾讯混元|即梦
哔哩哔哩 2025-11-23 00:00:00
105. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能
抖音 2026-02-15 00:00:00
106. 元戎不止智驾,全面探索物理AI全新赛道。北京车展重磅消息,元戎不但迎来前DeepSeek多模态技术核心大牛阮翀,展示基座模型在智能驾驶领域的最新成果。元戎还跳出单一智驾赛道,在后大模型时代全面布局以基座大模型为内核、多模态感知、舱驾一体驱动等物理AI场景,探索未来出行智能。4月25日北京车展,来一起见证元戎交出的答卷。
新浪微博 2026-04-23 00:00:00
107. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?
知乎 2026-01-09 00:00:00
108. 周报049 | 答投资者问——2025年报解读及展望,聊聊背后的故事: FF已经和加州政府有关部门展开对话,希望能够以加州为起点,联合所有学区,在K12教育和包括UCLA,UC Berkely在内的UC系公立高校,打造AI机器人试验室和全美首个规模化的EAI教育体系。 2026目标交付1000+机器人,家庭教育将成为To C领域第一核心场景,重点聚焦AI时代下的教育、学习与成长陪伴,希望能为家长和孩子们在学校和家庭教育方面进一步创造AI和EAI的教育环境和实践机遇;很快我会给孩子们购买几台FF机器人,用于学习、高校二次开发,和K12教育场景的探索。 净资产转正意义重大,背后是供应商等债权人的大力支持,最终顺利完成了约1亿美元的债务优化和减免,才最终实现了这次的由负转正。 http://t.cn/AXIkOJ3T
新浪微博 2026-04-06 00:00:00
109. 4款AI同台竞技,谁是装机高手,谁在胡言乱语,AI装机大乱斗
哔哩哔哩 2026-05-08 00:00:00
110. 再见,白月光 GPT-4o
微信公众号 2026-01-30 00:00:00
111. 韩国三星电子与本土 AI 公司 Nota(노타)合作开发了一项新的 AI 功能,名为 EdgeFusion。这个功能可以根据用户输入的文字指令,在 不到 1 秒 的时间内直接在手机本地生成图像。三星计划把 EdgeFusion 技术集成到即将在 本月下旬发布的 Galaxy S26 系列旗舰手机 中。借助这种本地实时生成能力,用户无需依赖云处理,就能快速用文字创建图像,提升拍照和创作体验。文章指出,这是三星加强本地 AI 图像处理能力的一部分,也是 Galaxy S 系列在 AI 功能方面继续进化的例证。新功能属于 Galaxy AI 生态的一环,目标在于让 S26 系列在用户体验上更具吸引力。
新浪微博 2026-02-05 00:00:00
112. 2026年了,还没试过AI拍片?通义万相带你实现“出片自由”
哔哩哔哩 2026-01-15 00:00:00
113. #DeepSeek开源OCR2新模型#DeepSeek-OCR2这个新模型最近很亮眼,它用了个巧妙的思路:把传统视觉编码换成类似大语言模型的结构,让AI可以像读文字一样“理解”图片里的信息。那这样一来,处理文档、表格的准确率明显提升,识别重复内容更少,对扫描文件和网页的适配也更好了。这背后其实反映出一个趋势:AI和视觉处理技术正在深度融合。未来在手机、工业检测、文档数字化这些领域,能做好“视觉+AI”落地的公司,机会可能会越来越多。
新浪微博 2026-01-27 00:00:00
114. 跨设备文件互传神器,告别数据线!让安卓/Windows/Mac OS/iOS实现“苹果级”互传,跑满带宽,比AirDrop快10倍的神级传输工具!
哔哩哔哩 2026-05-07 00:00:00
115. AI生成图像的技术毫无疑问已经领先见习画师的画技了。那为什么单稿2k以下的约稿市场依然存在?
知乎 2026-01-12 00:00:00
116. 美团LongCat-Image:6B参数的图像生成新标杆美团LongCat团队开源的LongCat-Image图像生成模型,以6B(60亿)的紧凑参数规模,在文生图与图像编辑领域实现了性能突破,为中文场景AI创作带来新选择。#科技先锋官##AI生活指南##AI创造营# 种斌Marco的微博视频
新浪微博 2025-12-08 00:00:00
117. AI大模型 — 多模态大模型介绍
今日头条 2026-04-12 00:00:00
118. 多模态大模型- AIGC 应用探究
今日头条 2026-04-24 00:00:00
119. 【更新中】多模态大模型 前沿算法与实战应用
今日头条 2026-05-01 00:00:00
120. 【完结】多模态与视觉大模型开发实战 - 2026必会
知乎 2026-01-14 00:00:00
121. 【B站强推】多模态大模型的神级课堂!入门级干货教程!小白必看——机器学习丨人工智能丨多模态
哔哩哔哩 2026-01-26 00:00:00
122. 3分钟学习大模型(LLM)基础 - 8 | 多模态大模型(Multimodal)
今日头条 2026-02-27 00:00:00
123. 多模态AI到底是什么?一文读懂文本、语音、图片的融合技术
今日头条 2026-05-07 00:00:00
124. 每天一个AI小知识
微信公众号 2026-04-10 00:00:00
125. 【2025最新】多模态视觉大模型入门到实战精通教程!全程干货!通俗易懂!大模型部署与微调/提示词工程
哔哩哔哩 2025-12-13 00:00:00
126. 多模态DeepResearch,成了!
今日头条 2026-02-24 00:00:00
127. AI学习Day29丨多模态
小红书 2026-04-28 00:00:00
128. 大多数人不了解
今日头条 2026-04-24 00:00:00
129. 你真的会用 AI 吗?MCP、Skill、多模态一文讲透!
今日头条 2026-04-12 00:00:00
130. 3分钟搞懂多模态AI
微信公众号 2026-04-11 00:00:00
131. 智慧谷企链通的AI多模态引擎
微信公众号 2026-04-10 00:00:00
132. 多模态AI模型最新发展趋势
微信公众号 2026-05-11 00:00:00
133. AI是怎么学会”看图说话”的?
知乎 2026-05-09 00:00:00
134. ChatGPT多模态技术拆解
什么值得买 2026-03-22 00:00:00
135. GPT-4o推理能力深度拆解
什么值得买 2026-03-16 00:00:00
136. GPT-4o的单模型多模态集成对智能体交互体验有何提升?
今日头条 2026-03-27 00:00:00
137. GPT-4o实战指南
什么值得买 2026-04-13 00:00:00
138. GPT-4o如何通过端到端训练实现多模态交互低延迟?
今日头条 2026-03-27 00:00:00
139. GPT-4o多模态整合 如何革新AI交互?
今日头条 2026-03-29 00:00:00
140. 实时情境推理的多模态大语言模型研究 - 哔哩哔哩
哔哩哔哩 2026-02-07 00:00:00
141. GPT-4o之后
今日头条 2026-03-20 00:00:00
142. 通义千问Qwen3-VL技术报告发布,256K超长多模态上下文,性能全面领先!
微信公众号 2026-01-05 00:00:00
143. 阿里通义千问重磅发布Qwen3-VL
微信公众号 2026-01-18 00:00:00
144. Qwen3-VL技术报告解读:不止看图,更能思考
小红书 2026-01-18 00:00:00
145. Qwen3-VL 重磅来袭!通义千问最新视觉大模型,普通人也能玩转AI看图说话
微信公众号 2025-11-17 00:00:00
146. VLM
知乎 2026-04-21 00:00:00
147. AI好工具
今日头条 2026-03-24 00:00:00
148. AI生成视频与图像技术的突破
今日头条 2025-12-24 00:00:00
149. Aiuni AI - AI 3D图像生成工具
微信公众号 2026-01-21 00:00:00
150. Krea AI - AI图像生成工具
微信公众号 2026-02-06 00:00:00
151. 腾讯混元图像开源,推动 AI 图像生成普及
微信公众号 2026-05-12 00:00:00
152. OpenAI 发布图像模型挑战谷歌,AI 图像生成赛道再起波澜
微信公众号 2025-12-22 00:00:00
153. 【AI图像】Seedream 5.0 - 字节跳动国产AI图像生成
微信公众号 2026-03-23 00:00:00
154. HL-CMR: 跨模态检索的超图学习
微信公众号 2026-05-07 00:00:00
155. 2025年多模态模型行业深度剖析
微信公众号 2026-03-01 00:00:00
156. 多模态AI爆发元年
微信公众号 2026-03-31 00:00:00
157. 多模态
今日头条 2026-01-11 00:00:00
158. DeepSeek重构多模态推理 边指边想破解指代难题
今日头条 2026-05-06 00:00:00
159. AI架构深度解析
微信公众号 2026-02-14 00:00:00
160. 跨越感官的智能
微信公众号 2025-12-09 00:00:00
161. AIGC 跨模态工具怎么选?跨模态生成是 AIGC 的 “全能形态”—— 能同时处理文本、图像、音频、视频等多种形式。这篇帮你理清主流跨模态工具的特点,精准匹配创作需求!
抖音 2025-11-28 00:00:00
162. 如何有效整合文本、图像等不同模态信息,提升模型跨模态理解与生成能力
微信公众号 2025-12-31 00:00:00
163. 南大一篇84页的统一多模态理解和生成综述,700+文献梳理!
知乎 2025-12-11 00:00:00
164. (2025|上海 AI Lab & 南大,图像到图像生成,赋予 DiT“推理”能力,流匹配)DiffThinker
知乎 2026-01-06 00:00:00
165. 全能多模态大模型Omni
哔哩哔哩 2026-04-28 00:00:00
166. PRCO-为多模态推理提供一条更清晰优化路径
小红书 2026-04-05 00:00:00
167. 视觉推理新突破!Omni-R1
知乎 2026-02-04 00:00:00
168. 南洋理工大学Uni-MMMU
今日头条 2025-11-24 00:00:00
169. 让 AI "看懂"世界!一文搞懂视觉语言模型(VLM)
微信公众号 2026-02-15 00:00:00
170. 如何使用前沿视觉语言大模型
知乎 2025-12-01 00:00:00
171. VLM+Agent
小红书 2026-03-17 00:00:00
172. 大模型画流程图、轻量训练、视频推理、智能体、推理框架
微信公众号 2026-01-03 00:00:00
173. AI小说创作工具全解析
微信公众号 2025-12-18 00:00:00
174. 基于 NVIDIA Jetson 的边缘 AI 入门指南
知乎 2025-12-17 00:00:00
175. 从文本到视觉
哔哩哔哩 2025-12-16 00:00:00
176. CASBOT PAPER丨QDepth-VLA: 基于量化深度辅助监督的视觉-语言-动作模型,获AAMAS官方正式录用
微信公众号 2026-01-06 00:00:00
177. 豆包音画同出的视频来啦!seedance1.5 pro发布!
哔哩哔哩 2025-12-17 00:00:00
178. 语言模型与视觉语言模型及动作模型三大模型的定义、关系、区别?
知乎 2026-01-21 00:00:00
179. AI视频生成模型Seedance2.0走红 国产技术赋能内容创作
今日头条 2026-02-15 00:00:00
180. ROI手动标注费时?快来试试这个多模态视觉语言模型,有效辅助识别和分割!欢迎试用(文末福利)
微信公众号 2026-01-21 00:00:00
181. Nat Biomed Eng | 当大语言模型“看懂”超声,香港浸会大学研究团队首次实现视觉语言模型提供实时、精准的胎儿超声解读辅助
微信公众号 2026-01-17 00:00:00
182. 【AI工具推荐】国家中小学智慧教育平台·星火教师助手,找资料-备课-上公开课
微信公众号 2026-03-13 00:00:00
183. 【E彩·平台应用】利用国家中小学智慧教育平台AI组卷助手,轻松提升教学效率
微信公众号 2026-01-05 00:00:00
184. 【培训感悟】学习AI,助力乡村教育——滑县留固镇东街小学 胡莎莎
微信公众号 2026-05-04 00:00:00
185. 拥抱AI,赋能教育|我校成功举办人工智能教师助手使用专题培训
微信公众号 2025-12-27 00:00:00
186. AI赋能教育,智慧引领未来——徐泾第一小学开展“三个助手”平台专题培训
微信公众号 2026-04-21 00:00:00
187. AI教育新突破
知乎 2026-04-11 00:00:00
188. 国家智慧教育公共服务平台
微信公众号 2026-05-08 00:00:00
189. 国家智慧教育公共服务平台
微信公众号 2026-04-13 00:00:00
190. 小AI助教——AI驱动的全场景智能教育服务平台
知乎 2025-12-03 00:00:00
191. 【深化能力作风建设】以AI赋能教学 以智慧润泽心灵——牡丹江市第十五中学成功举办“AI赋能﹒启智润心”课堂教学展示活动
微信公众号 2025-12-18 00:00:00
192. 无障碍AI | 打破数字壁垒
微信公众号 2026-03-13 00:00:00
193. 基于AI多模态智能引擎,残疾人无障碍出行导航,推动城市无障碍环境建设
知乎 2025-12-26 00:00:00
194. 无障碍经济 | 无障碍设计正在重塑AI的商业价值
微信公众号 2026-03-17 00:00:00
195. 从“被忽略”到“被看见”
今日头条 2025-12-03 00:00:00
196. 科技向善
微信公众号 2025-12-29 00:00:00
197. 上海举办科技无障碍影视主题活动,探索“AI+无障碍影视”助残新模式
微信公众号 2025-12-06 00:00:00
198. 让每一种需求都被回应
今日头条 2025-12-05 00:00:00
199. AI关怀|在代码里重筑“看见”、“听见”与“被理解”的世界
微信公众号 2026-02-13 00:00:00
200. 科技向善,上海AI创新项目照亮残障人士梦想
微信公众号 2025-11-17 00:00:00
201. MiniMind-O 技术解析:0.1B 小模型单挑 GPT-4o 全套技能,能看能听能说还能打断,训练数据全开源
微信公众号 2026-05-09 00:00:00
202. 通义千问发布最强多模态检索模型 Qwen3-VL-Embedding/Reranker
微信公众号 2026-01-14 00:00:00
203. AI技术 08|多模态到底是什么?
小红书 2026-05-09 00:00:00
204. AI图像十问:2026年AI图像生成赛道总结与展望
微信公众号 2026-05-06 00:00:00
205. 动态分辨率与三维位置编码:Qwen2-VL 的范式革新
知乎 2026-04-19 00:00:00
206. AI产品一图流:多模态AI全流程搭建怎么做?
小红书 2026-04-11 00:00:00
207. 手撕大模型Day 12:多模态大模型主流架构详解
微信公众号 2026-03-25 00:00:00
208. 美媒评出2025最佳AI图像生成大模型
微信公众号 2026-01-10 00:00:00
209. ICLR2026多模态推理大模型早期工作。📚arXiv: 2503.06749 ✏️标题: Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models 📄一句话介绍:通过模态桥接数据集构建与渐进式思维抑制训练,系统激发多模态大模型的数学推理潜力 🎯动机 多模态大语言模型(MLLM)在视觉数学推理任务中仍显著落后于纯文本推理系统。DeepSeek-R1等工作证明,强化学习能有效激发文本模型的推理能力,但直接将这一范式迁移至多模态场景时面临两大障碍:其一,高质量多模态链式思维(CoT)数据极度稀缺,人工标注成本高且难以规模化;其二,缺少冷启动数据时直接进行强化学习训练,模型倾向于生成冗长但错误的推理链,陷入"过度思考"困境。这两大问题相互制约,共同阻碍了多模态推理能力的突破。 💡方法与创新 本文提出 Vision-R1,采用冷启动初始化与强化学习微调的两阶段策略。 数据构建(模态桥接):将图像信息先转化为文字描述,再调用 DeepSeek-R1 生成高质量推理过程,无需人工标注即可构建 20 万条多模态 CoT 数据集。该策略打通了文本推理数据向视觉模态的迁移通路,以极低成本解决数据稀缺问题。 训练策略(PTST):提出渐进式思维抑制训练,在 GRPO 强化学习框架下分阶段逐步放宽输出长度限制(4K→8K token),抑制早期训练中模型对简短答案的过度偏好,引导其发展出完整清晰的推理链路。同时设计硬格式奖励函数,同步约束输出格式与答案正确性。 📊实验设计 基于 Qwen2.5-VL(7B/32B/72B)进行实验,在 MathVista、MathVerse、MM-Math、DynaMath 等多模态数学基准及 MMStar、ChartQA 等通用基准上系统评测。Vision-R1-7B 在 MathVista 上达 73.5%,仅低于 OpenAI O1 0.4%;MathVerse 达 79.0%,MM-Math 达 83.2%,较基础模型平均提升约 6%,几何与代数子任务提升超 10%。32B 和 72B 版本分别达 76.4% 和 78.2%。 #智能体 #大模型 #科研 #AI #知识前沿派对
抖音 2026-02-21 00:00:00
210. AI面试题:如何设计多模态AI产品的交互?
微信公众号 2026-03-10 00:00:00
211. DMLR: 动态多模态潜在推理
小红书 2026-01-01 00:00:00
212. AI训练营——Day 7: 什么是多模态AI
微信公众号 2026-04-07 00:00:00
213. 一文讲清:多模态学习:多模态融合 + 跨模态对齐
今日头条 2025-11-22 00:00:00
214. 35+程序员从零开始学AI——多模态AI到底是个啥
微信公众号 2026-03-21 00:00:00
215. 涂鸦On-App AI像素屏图像生成方案,移动端本地图像秒级生成!
微信公众号 2025-12-19 00:00:00
216. 国产多模态AI再开源!实测截图转网页、搜图购物,价格减半
今日头条 2025-12-09 00:00:00
217. 我国首个无障碍AI伴读系统上线
微信公众号 2025-12-17 00:00:00
218. 一文看完多模态:从视觉表征到多模态大模型
微信公众号 2026-04-16 00:00:00
219. OpenMMReasoner开源多模态推理“通用配方”
小红书 2025-11-24 00:00:00
220. DeepSeek V4计算量降27%,GPT-4o多模态统一:架构差异有多大
今日头条 2026-04-29 00:00:00
221. InternVL-U:生成和理解一体的多模态大模型
小红书 2026-03-15 00:00:00
222. 北大:多模态关系推理新SOTA
小红书 2026-03-22 00:00:00
223. LLAMA-OMNI:与大型语言模型的无缝语音交互
知乎 2026-03-21 00:00:00
224. 是的,我们进化到Qwen-Image 2.0了
微信公众号 2026-03-13 00:00:00
225. 【DeepSeek首款多模态大模型】基于视觉原语的思考封神!重磅拆解:数据创新 + 强化学习 + 蒸馏学习在多模态应用详解!
哔哩哔哩 2026-05-03 00:00:00
226. AI算力大变局!多模态突破,推理风暴来袭
今日头条 2026-05-01 00:00:00
227. CVPR 2026 | 多模态图推理新SOTA:Mario让LLM动态选择最佳模态
知乎 2026-03-15 00:00:00
228. 2026年AI图像生成巡礼·合集
微信公众号 2026-05-07 00:00:00
229. 多模态AI实战指南
微信公众号 2026-04-06 00:00:00
230. 多模态AI:文本、图像与音频的融合
今日头条 2026-03-25 00:00:00
231. 多模态大模型研究方向 多模态大模型创新点
小红书 2026-05-07 00:00:00
232. 带你秒懂多模态AI大模型原理🤯不看亏了!
小红书 2026-02-14 00:00:00
233. 7个顶级图像生成AI工具对比
今日头条 2026-03-22 00:00:00
234. 大模型应用:轻量化视觉语言模型(VLM):基于Qwen2-VL多模态模型实践.87
知乎 2026-04-28 00:00:00
235. Spring AI:接入云百炼之【多模态→图片/音频理解】
微信公众号 2025-11-20 00:00:00
236. MCR新框架:MLLM跨模态推理
小红书 2026-02-06 00:00:00
237. 端到端大模型:多模态大模型与自动驾驶实战课程教程资料 - 哔哩哔哩
哔哩哔哩 2026-04-02 00:00:00
238. 无障碍交互进阶手册:从视障游戏方案到智能家居控制的全维度实践
微信公众号 2025-11-16 00:00:00
239. 多模态模型之——文搜图和图搜图
知乎 2025-12-22 00:00:00
240. 多模态基础介绍
知乎 2026-02-14 00:00:00
241. spring-ai 第四多模态API
知乎 2026-04-06 00:00:00
242. 普林斯顿团队:无需真实图像的视觉感知训练
小红书 2026-04-16 00:00:00
243. 多模态大模型救命笔记
小红书 2026-05-08 00:00:00
244. 多模态大模型方向 最近整理实验室多模态对齐与生成工具链,顺带回顾了上一阶段的工作。在多模态大模型与跨模态理解的几个方向上(主要是 vision-language alignment 与 multimodal generation)团队有了些扎实的积累,部分工作有幸被CVPR、ICML 等会议收录。 进入新周期,方向会更聚焦。今年我们明确在两个路径上推进: 1. 统一多模态预训练:设计融合文本、图像、音频的统一预训练框架,关键在cross-modal attention与modality-agnostic representation。 2. 多模态生成与创作:面向图文视频生成任务,重点在text-to-3D与video generation。 我个人带的学生不多,更倾向于和少量合作者进行深度、长期的推进。希望你具备以下条件: • 有扎实的 Python / PyTorch / HuggingFace 编码能力和阅读 paper 的习惯。 • 在计算机视觉、自然语言处理或深度学习任一方向有过实际项目经验。 • 每周能有稳定时间投入,具备较强的自主推进力。 欢迎有科研热情的同学们加入! #多模态大模型 #跨模态学习 #图文生成 #CVPR #ICML #科研 #深度学习
抖音 2026-02-22 00:00:00
245. UCSB推出「动态多模态潜在推理」框架DMLR
小红书 2025-12-29 00:00:00
246. 视觉语言模型
小红书 2026-02-07 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!415 107 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400275 448 -
40岁再就业,年薪20万有社保还能干到65:房地产估价师(下)146 174
已收藏
去我的收藏夹