不用训练也能调用多模态大模型?关键在输入构造与任务拆解
06-08 09:43
精选参考来源
精选参考来源
1. Agent时代,为什么多模态数据湖是必选项?
微信公众号 2026-01-15 00:00:00
2. 跨设备文件互传神器,告别数据线!让安卓/Windows/Mac OS/iOS实现“苹果级”互传,跑满带宽,比AirDrop快10倍的神级传输工具!
哔哩哔哩 2026-05-07 00:00:00
3. AI都能自己操作3D打印机了!钉钉悟空 接入3D打印工作流测试
哔哩哔哩 2026-03-25 00:00:00
4. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?
知乎 2026-01-09 00:00:00
5. 顶级教育资源入场券,谷歌联手斯坦福给全球孩子做的免费AI启蒙神器,带孩子零代码做数据清洗、模型训练、偏见消除 #ai #学习 #谷歌 #斯坦福 #教育
抖音 2026-04-28 00:00:00
6. 市值近600亿,大模型公司上市了! #AI #智谱ai
抖音 2026-01-10 00:00:00
7. 北交&地平线提出DIVER:扩散+强化的多模态规划新框架
微信公众号 2025-12-17 00:00:00
8. 小小的也很厉害?这个只有6B参数的开源图像模型把我看傻了
哔哩哔哩 2025-12-18 00:00:00
9. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
10. 80多度大电池、800V带快充,只卖20多万的零跑D19值吗 #零跑D19 #零跑汽车 #买车 #电车
抖音 2026-04-17 00:00:00
11. openai经常把工程范式做进模型颠覆调用范式 导致别人的工程要拆掉重写。 几次历史节点:1 toolcall 2 多模态 3thinking 这些以前都是可以通过pipeline 和小模型穿起来编排的 现在这一代颠覆的恐怕是“多轮对话”这个行为本身
新浪微博 2026-05-01 00:00:00
12. #小米大模型#啥?小米大半夜发了3个模型~小米放大招,连发三个模型Xiaomi MiMo-V2-Pro & Omni & TTSXiaomi MiMo-V2-Pro 超1T参数,激活参数42B,上下文1M,混合注意力,混合比例7:1,专为agent而生,Claw榜单上,国内模型第一,见图2。MiMo-V2-Omni 全模态模型,对音频理解,图像理解,视频理解有较高的提升,同时具备了多模态感知、工具调用、函数执行及 GUI 操作能力。可直接接入现有agent框架,限时免费使用一周。Xiaomi MiMo-V2-TTS 语音合成模型,经过上亿小时语音数据的预训练与多维度强化学习,可以进行多粒度语音风格控制。
新浪微博 2026-03-19 00:00:00
13. 元戎不止智驾,全面探索物理AI全新赛道。北京车展重磅消息,元戎不但迎来前DeepSeek多模态技术核心大牛阮翀,展示基座模型在智能驾驶领域的最新成果。元戎还跳出单一智驾赛道,在后大模型时代全面布局以基座大模型为内核、多模态感知、舱驾一体驱动等物理AI场景,探索未来出行智能。4月25日北京车展,来一起见证元戎交出的答卷。
新浪微博 2026-04-23 00:00:00
14. 在线自动化操作手机和电脑界面太繁琐?试试阿里巴巴的开源项目 Mobile-Agent,一个强大且多平台支持的 GUI 智能体系列。Mobile-Agent 集成了多模态视觉感知与跨平台操作能力,覆盖手机、PC、浏览器等环境。最新的 GUI-Owl 1.5 系列基于 Qwen3-VL 打造,支持桌面和移动端 GUI 自动化,达到 20+ GUI 基准测试的 SOTA 性能,具备高级的上下文记忆、工具调用和长程任务执行能力。项目亮点:- 支持多模态(视觉+语言)输入,理解复杂界面元素;- 跨平台操作涵盖安卓手机、Windows PC及网页版;- 多智能体协同,支持规划、任务管理和动态反思;- 开源模型权重已发布于 HuggingFace,方便试用和二次开发;- 丰富的演示视频覆盖股票查询、文档编辑、机票火车票比价等真实场景;- 提供在线 Demo,无需本地部署即可体验;适合研发人员、AI爱好者、自动化测试工程师使用,助力构建智能交互式自动化系统。GitHub:github.com/X-PLUG/MobileAgent 让 Mobile-Agent 帮你智能操控手机与电脑界面,实现真正意义上的多模态 GUI 自动化!#AI创造营##人工智能#
新浪微博 2026-03-02 00:00:00
15. 人工智能通识课:多模态大模型
微信公众号 2026-05-26 00:00:00
16. 【#千问上线新模型#】3月30日,阿里千问宣布全模态大模型Qwen3.5-Omni上线。Qwen3.5-Omni系列包含Plus、Flash、Light三种尺寸的Instruct版本,支持256k长上下文,模型支持超过10小时的音频输入及超过400秒的720P(1FPS)音视频输入。模型在海量文本、视觉以及超过1亿小时的音视频数据上进行原生多模态预训练,该模型展现出卓越的全模态感知与生成能力。相比Qwen3-Omni,Qwen3.5-Omni多语言能力大大增强,能够支持113种语种和方言的语音识别和36种语种和方言的语音生成。(财联社)
新浪微博 2026-03-30 00:00:00
17. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生
抖音 2026-01-08 00:00:00
18. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】
哔哩哔哩 2026-03-24 00:00:00
19. 模型一换 帧率减半!2026年零售机性能大横评【新评科技】
哔哩哔哩 2026-04-15 00:00:00
20. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能
抖音 2026-02-15 00:00:00
21. #科技先锋官# GPT、Claude 的优势,要被马斯克彻底颠覆! xAI 发布 Grok-3,直接向主流大模型宣战!算力暴涨 10 倍、20 万块 GPU 加持,推理速度狂飙 2.5 倍,效率碾压同级!新增图像多模态、思维链推理,幻觉率大降 40%,数学编程精准度直线拉满。实时联网、幽默交互,体验感直接甩开对手。一周内还将上线语音交互!自然对话、情绪识别、上下文记忆,彻底告别僵硬指令交互,未来还能打通特斯拉、脑机接口。Grok-3 究竟是王炸还是炒作?看完视频一起聊聊?#过个有AI年##HOW I AI##微博超有用视频大赛##上微博涨知识# 种斌Marco的微博视频
新浪微博 2026-02-20 00:00:00
22. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型
抖音 2025-12-14 00:00:00
23. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-17 00:00:00
24. 盘点一周AI大事(3月22日)|OpenAI红色警报 字节开源AI超级员工DeerFlow 2.0 英伟达开源Agent安全补丁NemoClaw Okara发布AI CMO Junior开源能雇佣的AI员工Junior 清华开源Agent课堂OpenMAIC MiniMax发布最强开源大模型M2.7 Miro开源最强深度研究模型Miro Thinker H1 Unsloth开源AI训练工具Unsloth Studio Google升级AI Studio和Stitch 阿里开源最强影视配音模型Fun-CineForge Google开源最强视频超分模型Spark VSSR 研究员开源最强数字人模型ID-LoRA 研究员开源首个城市级别的世界模型Seoul World Model #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #OpenAI
抖音 2026-03-22 00:00:00
25. 「Github一周热点109期」Claude Code被开源, Pretext文本排版引擎, 谷歌最新开源模型和3D建筑编辑器
哔哩哔哩 2026-04-04 00:00:00
26. 【2026 AI 开源第一枪!】Qwen Multiangle 多角度一致性,ComfyUI 可控度+1!
哔哩哔哩 2026-01-12 00:00:00
27. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-29 00:00:00
28. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-30 00:00:00
29. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
30. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
哔哩哔哩 2025-12-17 00:00:00
31. MiniMax是家什么样的公司 #人均95后的大模型公司上了新闻联播 #minimax #人均95后公司MiniMax登上央视
抖音 2026-01-20 00:00:00
32. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
33. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI
抖音 2026-04-27 00:00:00
34. 第二代 VLA 物理 AI 大模型 原生多模态赋能,重构智驾决策核心✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#
新浪微博 2026-03-02 00:00:00
35. 手机的AI可以多强大?联发科用他们的旗舰天玑芯片告诉你:不用联网,在手机本地就能直接运行复杂的多模态大模型!现场他们演示了用智能眼镜配合手机,实现实时的视觉识别和语音对话,反应迅速,而且所有数据都在本地处理,隐私性大大增强。随身AI助手真的要来了。
新浪微博 2026-03-02 00:00:00
36. 全网求码的updream,赢在创作者本位
微信公众号 2026-04-03 00:00:00
37. 谷歌 Nano Banana 2 发布,标志图像生成从「艺术创作」到「工业化生产」,这将带来哪些变革?
知乎 2026-02-28 00:00:00
38. 是的,我开发了一个插件,每个知乎创作者都能大幅度提高创作效率拥有无限灵感的插件!
知乎 2026-05-13 00:00:00
39. 面向实战的多模态数据生成与表征技术创新
知乎 2026-01-07 00:00:00
40. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!
知乎 2026-05-11 00:00:00
41. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代
抖音 2026-01-09 00:00:00
42. Qwen3.6“越狱”了!目前最强无审查开源模型!支持本地 Agent,6G 显存都能跑!附部署教程|零度解说
哔哩哔哩 2026-05-28 00:00:00
43. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
44. 你现在最头疼的AI创业问题是啥? #大咖观察 #创业项目 #红衣聊AI #人工智能
抖音 2025-12-09 00:00:00
45. 没有API,你在AI世界就不存在? #大有学问 #红衣聊AI #智能体
抖音 2026-04-09 00:00:00
46. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC
抖音 2026-01-04 00:00:00
47. 高效提示词(prompt)工程指南
知乎 2026-02-22 00:00:00
48. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!
微信公众号 2026-02-16 00:00:00
49. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。
知乎 2026-06-02 00:00:00
50. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。
新浪微博 2026-03-31 00:00:00
51. 亚历山大王终于发版了Muse Spark,这是Meta Superintelligence Labs(MSL)的首个模型,通过九个月从头重构AI基础设施、架构和数据管道实现,现已全面驱动Meta AI。Muse Spark为原生多模态推理模型,支持工具使用、视觉思维链和多代理编排;新增Contemplating模式可并行多代理推理,处理复杂科学问题时性能与Gemini Deep Think、GPT Pro相当。模型在预训练、强化学习和测试时推理上展现可预测扩展规律,经过前沿风险、安全对齐和对抗鲁棒性评估,未来将开放私人API预览并计划开源后续版本。
新浪微博 2026-04-09 00:00:00
52. B 站下一代多模态数据工程架构的落地实践
知乎 2026-03-09 00:00:00
53. 【华为昇腾 0 Day 适配阿里 Qwen3.5,MindSpeed MM 框架实现 " 开箱即用、快速迭代 "】阿里在 chat.qwen.ai 页面低调上线了 Qwen3.5-Plus 和 Qwen3.5-397B-A17B 两款新模型(均支持文本和多模态任务)。Qwen3.5 Plus 定位为 Qwen 3.5 系列最新大语言模型;Qwen3.5-397B-A17B 定位则是 Qwen3.5 开源系列旗舰大语言模型。华为计算官方昨晚宣布,Qwen3.5 模型一经开源发布,昇腾 0 day 实现基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3SuperPoD 上的训练复现,同时也支持基于 vLLM-Ascend 和 SGLang 在 Atlas 800 A2、Atlas 800 A3 上的高效推理部署。据介绍,基于 FSDP 训练后端的设计,MindSpeed MM 框架大幅缩短了新模型的适配周期,实现了 " 开箱即用、快速迭代 " 的开发体验,为多模态大模型的研究与应用提供了技术支撑。另据阿里云介绍,Qwen3.5 实现了底层模型架构的全面革新,其中,Qwen3.5-Plus 版本总参数为 3970 亿,激活仅 170 亿,性能超过万亿参数的 Qwen3-Max 模型,部署显存占用降低 60%,推理效率大幅提升,最大推理吞吐量可提升至 19 倍。Qwen3.5 在能力、效率与通用性三个维度上推进预训练:能力(Power):在更大规模的视觉-文本语料上训练,并加强中英文、多语言、STEM 与推理数据,采用更严格的过滤,实现跨代持平:Qwen3.5-397B-A17B 与参数量超过 1T 的 Qwen3-Max-Base 表现相当。效率(Efficiency):基于 Qwen3-Next 架构 —— 更高稀疏度的 MoE、Gated DeltaNet + Gated Attention 混合注意力、稳定性优化与多 token 预测。在 32k/256k 上下文长度下,Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-Max 的 8.6 倍 / 19.0 倍,且性能相当。Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-235B-A22B 的 3.5 倍 / 7.2 倍。通用性(Versatility):通过早期文本-视觉融合与扩展的视觉 / STEM / 视频数据实现原生多模态,在相近规模下优于 Qwen3-VL。多语言覆盖从 119 增至 201 种语言 / 方言;25 万词表(vs. 15 万)在多数语言上带来约 10–60% 的编码 / 解码效率提升。vllm 部署指导可参见魔乐社区和 gitcode 社区链接:网页链接网页链接SGLang 部署指导可参见 SGLang 社区链接:网页链接
新浪微博 2026-02-17 00:00:00
54. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体
抖音 2026-02-22 00:00:00
55. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token
抖音 2026-04-29 00:00:00
56. llama.cpp 最新版太强了!本地跑 “无审查模型” 速度暴涨!N卡/A卡/Intel 全支持|零度解说
哔哩哔哩 2026-05-19 00:00:00
57. 用AI手搓西部世界手机版?能一键生成冒险岛的AI,被我体验到了
哔哩哔哩 2025-12-10 00:00:00
58. 史上最离谱AI建筑大赛!豆包直接杀疯了?
哔哩哔哩 2026-05-01 00:00:00
59. LeCun的JEPA已进化为视觉-语言模型,1.6B参数比肩72B Qwen-VL
微信公众号 2025-12-20 00:00:00
60. 试了下小米的miclaw,目前的表现确实可以,支持直接调用手机系统功能,比如自主发短信、分析手机内的文本,另外还可以根据指令调用已连接的智能家居。大家对它的表现满意不?#小米miclaw开启封测# #小米发布国内第一个手机版龙虾# Eva的科技生活的微博视频
新浪微博 2026-03-06 00:00:00
61. DeepSeek多模态能力为零这件事,很多人觉得是短板。我反而觉得这是一个极其清醒的战略选择。你看字节、阿里、月之暗面,都在往“什么都能干”的方向堆功能,恨不得一个模型又能写诗又能剪视频又能读PDF。这很合理,因为C端用户确实需要一站式体验,这个逻辑完全可以理解。但DeepSeek选择把所有资源砸在推理深度上,不碰图像,不碰视频,就死磕逻辑链条的纯度。这让我想到一句话:当所有人都在比谁的瑞士军刀功能多的时候,手术刀的价值反而凸显了。 多模态是锦上添花,但推理能力是地基。地基打到全球第一梯队,上面想盖什么楼都来得及。反过来,地基不行的多模态,想要补起来可不那么容易。 #DeepSeek还是最强国产AI吗# deepseek还是最强国产ai吗
新浪微博 2026-04-28 00:00:00
62. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
63. Lance 把图像与视频的理解、生成和编辑全部融合进一个 3B 活跃参数的原生统一多模态模型,真正做到「一套框架」搞定。不仅支持高质量文生图、文生视频,还能进行图像/视频编辑与多模态理解,性能直逼更大模型。GitHub:github.com/bytedance/Lance Hugging Face:huggingface.co/bytedance-research/Lance主要功能:- 3B 活跃参数,原生统一框架,支持图像/视频理解、生成、编辑- 文生图、文生视频、图像编辑、视频编辑一键完成- 多轮一致性编辑与智能视频生成,效果出色- 支持图像/视频问答、详细描述等理解任务- 提供 Gradio Demo 与完整推理脚本,开箱即用支持本地运行(需 ≥40GB VRAM),同时已有 MLX 社区移植版本可在 Apple Silicon 上运行。
新浪微博 2026-05-20 00:00:00
64. 【#免费DeepSeek和收费豆包你选哪个#】一句话总结:豆包像个“全能保姆”,贴心顺手但开始谈钱;DeepSeek像个“理科家教”,免费硬核但有点偏科。🌱 豆包优缺点:优点: 极度贴合国人习惯,网感好、会唠嗑;多模态全能(图文音视频通吃),文档解析强;服务器稳,极少崩溃。缺点: 复杂逻辑和代码能力稍弱;近期开始试探性收费(基础仍免费),让不少用户觉得“失去了性价比”。🧠 DeepSeek优缺点:优点: 逻辑推理和代码能力顶尖,堪称“理科学霸”;基础功能全免费,API成本低到感人,绝对良心。缺点: 偏科严重,多模态能力薄弱;文本输出偶尔太干太硬;高峰期容易服务器繁忙或卡顿。💡 怎么选?日常唠嗑、做图、写个生活感悟,选豆包;写代码、拆逻辑、搞学术研究,选DeepSeek。成年人不做选择,两个都装上,搭配干活才是真香! 网页链接
新浪微博 2026-05-11 00:00:00
65. 8G 显存逆天了!竟能跑 35B AI 大模型!多模态 + N/A/Intel 全适配,附最新部署教程!|零度解说
哔哩哔哩 2026-05-23 00:00:00
66. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent
抖音 2026-04-12 00:00:00
67. 这就是AI眼镜的元年时刻?千问AI眼镜S1多场景实测!
哔哩哔哩 2026-04-27 00:00:00
68. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月
抖音 2025-12-21 00:00:00
69. 把手教你用上开源版Claude Code,Windows系统接入保姆级教程!
哔哩哔哩 2026-02-03 00:00:00
70. 阿里云发布多模态交互开发套件
微信公众号 2026-01-09 00:00:00
71. 当下最强开源图像编辑模型:FLUX.2 [klein] 克莱因
知乎 2026-01-21 00:00:00
72. 1. 卓驭的新方案是原生多模态大模型,这个思路跟小鹏挺像的,用做多模态大模型的思路做智驾模型,2. 在预训练里,有一些互联网信息让模型具备一定的通识能力,也有驾驶相关的视频让模型变得专精,3. 卓驭依托着一汽,开辟了一个新战场,重卡、也包括大巴。这个事儿推起来真的功德无量,驾驶最累的就是这些司机朋友了。
新浪微博 2026-04-24 00:00:00
73. 真正的 AI 上车!主动起来能多主动?【X.PIN】
哔哩哔哩 2026-04-27 00:00:00
74. 我做了个创作工具之间的传送门,专治"我存哪了来着?" | Build in Public#0【B站AI创造公开赛】
哔哩哔哩 2026-06-05 00:00:00
75. 如何看待 Minimax 新的 M3 多模态模型以及更新的 Token Plan?
知乎 2026-06-02 00:00:00
76. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#
新浪微博 2026-04-02 00:00:00
77. #微博声浪计划##听见微博# 小米以“静默伏击”策略发布三款自研大模型,旗舰MiMo-V2-Pro跻身全球AI第一梯队,API定价仅为Claude Opus 4.6的1/5。全模态模型适配多场景,语音模型实现情感渐变控制,已接入人车家全生态。小米2026年AI研发投入超160亿元,构建硬件生态+AI底座闭环。 科技星辰说的微博音频
新浪微博 2026-03-19 00:00:00
78. #阿里除夕夜开源千问Qwen3.5# 继Qwen2.5-Max后,阿里再以“开源”打响AI开年第一枪 🧨该模型实现了模型架构的创新 。据悉,Qwen3.5采用全新的混合注意力机制,极有可能是原生支持视觉理解的视觉语言模型(VLM),将开源至少2B密集模型及35B-A3B的MoE模型 。去年除夕,阿里曾抛出Qwen2.5-Max。【评论】阿里选择除夕夜开源,是以“技术春晚”卡位AI竞争新周期继去年除夕夜开源Qwen2.5-Max后,阿里再次选择在这个阖家团圆的时刻“放猛料”,其战略意图愈发清晰:用最高规格的开源动作,抢占全球开发者春节档的技术注意力。Qwen3.5的原生多模态能力与架构创新,直指2026年AI竞争的核心——从“对话”向“视觉理解、智能体执行”的全面升级。当同行忙于发红包、抢用户时,阿里选择用开源模型“围猎”开发者心智,这是一场关于生态根基的暗战。
新浪微博 2026-02-16 00:00:00
79. 权威评测平台SuperCLUE-VLM发布2025年12月多模态视觉语言模型综合榜单,谷歌 Gemini-3-Pro 以83.64分“断层式”领跑,看来多模态这块依然是谷歌的绝对统治区。但国产模型的追赶速度肉眼可见:商汤SenseNova拿下第二,字节豆包冲进前三,基础认知能力甚至不输国际巨头。特别值得一提的是阿里的 Qwen3-VL,作为首个总分破70的开源模型,绝对是国内开发者的福音。反倒是 GPT-5.2 这次表现平平,竟然没上70分。#AI#
新浪微博 2025-12-31 00:00:00
80. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#
新浪微博 2026-02-16 00:00:00
81. 使用AI聊天助手经常需要联网、登录账号,还担心隐私泄露和数据被收集,体验总是不够安心。Locally AI 把本地AI运行所需的功能全部集成到iPhone/iPad/Mac上,提供了完全离线的私人AI解决方案。不仅支持Llama 3.2、Gemma 4、Qwen 3等多款大模型,还能图像分析、文本生成,支持Shortcuts自动化,完全无网络、无登录、无数据收集,纯设备本地运行。App Store:网页链接主要功能:- 100%离线运行,无需网络随时随地使用;- 完全隐私保护,无登录、无数据收集,数据永不离开设备;- Apple MLX框架优化,支持M系列芯片超快响应速度;- 多模型支持,包括Llama、Gemma、Qwen、DeepSeek等热门模型;- 智能聊天、图像分析、文本生成,支持复杂问题解答;- 文件附件分析,支持CSV、TXT、代码文件等格式;- Shortcuts集成,可创建强大自动化工作流;- 支持视觉模型,具备图像理解能力。支持iPhone、iPad、Mac多平台,免费下载,881个评价4.8分,适合隐私敏感用户和AI爱好者。#本地AI##离线AI##隐私保护##AppleMLX# 爱可可-爱生活的微博视频
新浪微博 2026-04-16 00:00:00
82. NVIDIA 在 GTC 发布 Cosmos 3🔥作为世界模型,距离 AGI 最近的万能 AI。图像·图像·动作·文本的理解和生成、物理推理全部由一个模型处理。在全部 8 个基准测试中创下 SOTA!有 16B 和 65B 两种规模,数据集也在 HF 上完全开源🤗
新浪微博 2026-06-03 00:00:00
83. 数据邪修大法好
知乎 2026-03-05 00:00:00
84. MM-Zero: VLM零数据自我进化
小红书 2026-03-19 00:00:00
85. ICML2026-omni 新范式
小红书 2026-05-16 00:00:00
86. 无需训练、即插即用,这个解码方法让模型学会谨慎思考
今日头条 2026-02-23 00:00:00
87. (2026|湾大 & 北航杭研院,生成-选择-精炼-分割,MLLM,思维链)Seg-Agent
微信公众号 2026-05-26 00:00:00
88. 腾讯的Training-Free GRPO
知乎 2026-03-28 00:00:00
89. [ICML'26]不训练、不微调,多模态大模型也能当检索专家?我们提出了 FreeRet
知乎 2026-06-05 00:00:00
90. 高分辨率图像感知难题有解了!CVSearch
哔哩哔哩 2026-05-25 00:00:00
91. 让MLLM成为检索专家
微信公众号 2026-02-18 00:00:00
92. Google DeepMind
微信公众号 2026-04-29 00:00:00
93. 视觉理解和视觉回答 - 乐高积木AI拼搭 - 多模态RAG
什么值得买 2026-05-06 00:00:00
94. 人工智能顶会CVPR论文分享|DyFo
微信公众号 2026-04-10 00:00:00
95. 保留原文本嵌入几何不变性!支持文本/图像/视频/音频的全模态开源嵌入模型【多模态RAG】【向量检索】
哔哩哔哩 2026-05-15 00:00:00
96. VimRAG图文视频知识库的统一多模态RAG框架
小红书 2026-04-18 00:00:00
97. MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action无需训练使LLM看懂图片
知乎 2025-12-25 00:00:00
98. OpenAI CLIP
今日头条 2026-01-02 00:00:00
99. 不用微调也能编辑任意高分辨率图片!基于预训练扩散模型的免调图像编辑新方法 【AI图像生成论文解读】
哔哩哔哩 2026-04-28 00:00:00
100. 谷歌VisionBanana: 图像生成即可图像理解
小红书 2026-04-23 00:00:00
101. Vision Banana-Image Generators are Generalist Vision Learners:图像生成模型可通过轻量微调成为通用视觉模型
知乎 2026-04-25 00:00:00
102. 16GB笔记本直接跑多模态大模型
微信公众号 2026-06-05 00:00:00
103. 【知客笔记】当多模态大模型遇上工业视觉
知乎 2026-04-21 00:00:00
104. 大模型应用
知乎 2026-04-28 00:00:00
105. 基于多模态大型视觉语言模型的目标检测
微信公众号 2026-05-09 00:00:00
106. 万字长文拆解
微信公众号 2026-04-20 00:00:00
107. 2026 AI多模态创作实测
今日头条 2026-05-16 00:00:00
108. 颠覆 MLLM!DeepSeek 视觉原语推理封神:把坐标变成思维原子,90 个 Token 碾压 GPT-5.4,多模态推理终于不瞎说了
微信公众号 2026-05-05 00:00:00
109. 免费大模型API接口怎么用?DMXAPI聚合300+款大模型,deepseek还能这么玩?
百度 2026-04-01 00:00:00
110. 解锁 MLLM 跨模态潜力!多模态RAG再超神,性能狂飙 33%+!高区热门!
微信公众号 2025-12-29 00:00:00
111. 剑指世界模型!商汤发多模态理解生成一体化架构,无需编码器“玩转”图像
今日头条 2026-03-06 00:00:00
112. 混元大模型API免费资源分享DMXAPI免复杂配置实测好用
今日头条 2026-04-07 00:00:00
113. 视觉推理新突破!Omni-R1:定义多模态推理的「统一生成式思考」
知乎 2026-02-04 00:00:00
114. 重磅发布|AI多模态研判主机:多模态大模型加持,看“懂”复杂场景
微信公众号 2026-03-30 00:00:00
115. CVPR 2026 | MLLM逆袭传统检测器!Rex-Omni:首个比肩DINO的通用视觉感知模型
微信公众号 2026-04-07 00:00:00
116. spring-ai 第四多模态API
知乎 2026-04-07 00:00:00
117. MLLM架构演进深度解析:从 LLaVA 到 Qwen3-VL
微信公众号 2026-04-21 00:00:00
118. Meta 新作:多模态模型终于会查资料了
小红书 2026-01-28 00:00:00
119. 多模态大模型赋能机器视觉:技术原理与典型应用场景
知乎 2026-04-06 00:00:00
120. n8n实战012,多模态大模型全自动同行分析,闲鱼为例,其他平台通用
知乎 2025-12-21 00:00:00
121. V-RAG 增强基于视觉感知的 RAG,实现对视觉丰富信息的理解通过强化学习的迭代推理实现理解
知乎 2026-03-03 00:00:00
122. 工具调用AI智能体如何与现实世界交互
知乎 2026-02-12 00:00:00
123. 解锁统一多模态模型自反思生成能力!把GRPO引入AR-Diffusion多模态大模型 【多模态大模型】【AI生成】
哔哩哔哩 2026-05-15 00:00:00
124. Meta 放出“多模态推理王牌”:Muse Spark 正式登场
今日头条 2026-04-09 00:00:00
125. 【AI论文解读】走出语言建模!Meta&NYU从零训练真正的统一多模态大模型 | 4大核心发现重塑多模态预训练
哔哩哔哩 2026-04-01 00:00:00
126. 【更新中】多模态大模型 前沿算法与实战应用
今日头条 2026-05-01 00:00:00
127. LLM推理时计算技术详解:四种提升大模型推理能力的方法
知乎 2026-02-06 00:00:00
128. 多模态自适应推理Benchmark代码与数据公布
小红书 2026-04-13 00:00:00
129. 一文解锁AI开发神器:DMXAPI多模态大模型API聚合平台
知乎 2026-04-18 00:00:00
130. 从零实现一个问答机器人:从文本版到多模态版的工程实现
知乎 2026-01-22 00:00:00
131. 英伟达开源多模态模型!Agent效率狂飙9倍
微信公众号 2026-04-29 00:00:00
132. Qwen2.5-VL 深度解析:当多模态大模型遇上“效率革命”
知乎 2026-05-26 00:00:00
133. CVPR 2026 专题|从 MLLM、模糊对齐到时空建模:多/跨模态检索如何突破“意图理解”的天花板?
微信公众号 2026-03-29 00:00:00
134. 上海交大:MLLM的「代码理解」有效性研究
小红书 2026-02-12 00:00:00
135. 多模态数据处理-跨模态检索:支持文本检索图片/音频/视频(如通过CLIP模型实现图文匹配)
微信公众号 2026-01-10 00:00:00
136. 视觉语言大模型Qwen2.5-VL
知乎 2026-04-30 00:00:00
137. 32页终极指南!RAG 技术应用与实践突破传统,大模型文档 / 多模态落地秘籍(附下载)
知乎 2026-01-16 00:00:00
138. 🔧 提示工程:释放大语言模型潜力的艺术
今日头条 2026-03-24 00:00:00
139. 多模态RAG:打破模态壁垒,重塑AI知识服务新模式
微信公众号 2026-05-25 00:00:00
140. 告别无脑编码!UME-R1 开启多模态 Embedding 的“推理时代”
知乎 2026-05-04 00:00:00
141. 人人都能懂的大语言模型“使用说明书”——提示词工程
今日头条 2026-01-26 00:00:00
142. Rubick: Mac原生多模态搜索APP
小红书 2026-05-20 00:00:00
143. 从零开始学习多模态大模型的学习路径
微信公众号 2026-05-09 00:00:00
144. Qwen2.5-VL的关键技术设计
知乎 2026-03-25 00:00:00
145. 让ViT直接开口说话!极简架构生成式图文预训练GenLIP,性能超越CLIP\u002FSigLIP 【多模态大模型】
哔哩哔哩 2026-05-05 00:00:00
146. Day21 多模态大模型
小红书 2026-05-26 00:00:00
147. 46、视觉语言多模态基础模型
知乎 2026-02-22 00:00:00
148. 从“跨模态炫技”到“产业实用”多模态大模型真的能落地见效吗?
今日头条 2025-12-28 00:00:00
149. DeepSeek的系列工作之一:多模态推理框架
小红书 2026-05-01 00:00:00
150. 腾讯发布OpenSearch-VL:开源多模态深度搜索 agent 的“全家桶”方案
微信公众号 2026-05-07 00:00:00
151. 2026年4月16日 | VimRAG架构解析:阿里通义如何用动态记忆图革新多模态RAG
微信公众号 2026-04-17 00:00:00
152. PaLMR:通过过程对齐解决MLLM推理幻觉!
小红书 2026-05-02 00:00:00
153. 阿里刚开源下一代RAG王炸框架,AI学会自己翻图、看视频、找资料了
微信公众号 2026-04-10 00:00:00
154. 蚂蚁大模型一面:Tool Use是扩展Agent能力的有效途径,请解释LLM是如何学会调用外部API或工具的?
知乎 2026-03-19 00:00:00
155. 商汤日日新免费API实操:零成本调用多模态大模型,搭建你的AI工作流
知乎 2026-05-09 00:00:00
156. GPT-4 开启多模态时代!DMXAPI 免费大模型 API,国产顶配零成本畅用
知乎 2026-03-30 00:00:00
157. Nvidia 免费API指南:零成本、不绑卡,稳定调用国产与国际大模型
今日头条 2026-05-30 00:00:00
已收藏
去我的收藏夹