张大妈

不用训练也能调用多模态大模型?关键在输入构造与任务拆解

源自157位全网作者

06-08 09:43

内容由AI生成

精选参考来源

1. Agent时代,为什么多模态数据湖是必选项?

2. 跨设备文件互传神器,告别数据线!让安卓/Windows/Mac OS/iOS实现“苹果级”互传,跑满带宽,比AirDrop快10倍的神级传输工具!

3. AI都能自己操作3D打印机了!钉钉悟空 接入3D打印工作流测试

4. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?

5. 顶级教育资源入场券,谷歌联手斯坦福给全球孩子做的免费AI启蒙神器,带孩子零代码做数据清洗、模型训练、偏见消除 #ai #学习 #谷歌 #斯坦福 #教育

6. 市值近600亿,大模型公司上市了! #AI #智谱ai

7. 北交&地平线提出DIVER:扩散+强化的多模态规划新框架

8. 小小的也很厉害?这个只有6B参数的开源图像模型把我看傻了

9. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

10. 80多度大电池、800V带快充,只卖20多万的零跑D19值吗 #零跑D19 #零跑汽车 #买车 #电车

11. openai经常把工程范式做进模型颠覆调用范式 导致别人的工程要拆掉重写。 几次历史节点:1 toolcall 2 多模态 3thinking 这些以前都是可以通过pipeline 和小模型穿起来编排的 现在这一代颠覆的恐怕是“多轮对话”这个行为本身

12. #小米大模型#啥?小米大半夜发了3个模型~小米放大招,连发三个模型Xiaomi MiMo-V2-Pro & Omni & TTSXiaomi MiMo-V2-Pro 超1T参数,激活参数42B,上下文1M,混合注意力,混合比例7:1,专为agent而生,Claw榜单上,国内模型第一,见图2。MiMo-V2-Omni 全模态模型,对音频理解,图像理解,视频理解有较高的提升,同时具备了多模态感知、工具调用、函数执行及 GUI 操作能力。可直接接入现有agent框架,限时免费使用一周。Xiaomi MiMo-V2-TTS 语音合成模型,经过上亿小时语音数据的预训练与多维度强化学习,可以进行多粒度语音风格控制。

13. 元戎不止智驾,全面探索物理AI全新赛道。北京车展重磅消息,元戎不但迎来前DeepSeek多模态技术核心大牛阮翀,展示基座模型在智能驾驶领域的最新成果。元戎还跳出单一智驾赛道,在后大模型时代全面布局以基座大模型为内核、多模态感知、舱驾一体驱动等物理AI场景,探索未来出行智能。4月25日北京车展,来一起见证元戎交出的答卷。

14. 在线自动化操作手机和电脑界面太繁琐?试试阿里巴巴的开源项目 Mobile-Agent,一个强大且多平台支持的 GUI 智能体系列。Mobile-Agent 集成了多模态视觉感知与跨平台操作能力,覆盖手机、PC、浏览器等环境。最新的 GUI-Owl 1.5 系列基于 Qwen3-VL 打造,支持桌面和移动端 GUI 自动化,达到 20+ GUI 基准测试的 SOTA 性能,具备高级的上下文记忆、工具调用和长程任务执行能力。项目亮点:- 支持多模态(视觉+语言)输入,理解复杂界面元素;- 跨平台操作涵盖安卓手机、Windows PC及网页版;- 多智能体协同,支持规划、任务管理和动态反思;- 开源模型权重已发布于 HuggingFace,方便试用和二次开发;- 丰富的演示视频覆盖股票查询、文档编辑、机票火车票比价等真实场景;- 提供在线 Demo,无需本地部署即可体验;适合研发人员、AI爱好者、自动化测试工程师使用,助力构建智能交互式自动化系统。GitHub:github.com/X-PLUG/MobileAgent 让 Mobile-Agent 帮你智能操控手机与电脑界面,实现真正意义上的多模态 GUI 自动化!#AI创造营##人工智能#

15. 人工智能通识课:多模态大模型

16. 【#千问上线新模型#】3月30日,阿里千问宣布全模态大模型Qwen3.5-Omni上线。Qwen3.5-Omni系列包含Plus、Flash、Light三种尺寸的Instruct版本,支持256k长上下文,模型支持超过10小时的音频输入及超过400秒的720P(1FPS)音视频输入。模型在海量文本、视觉以及超过1亿小时的音视频数据上进行原生多模态预训练,该模型展现出卓越的全模态感知与生成能力。相比Qwen3-Omni,Qwen3.5-Omni多语言能力大大增强,能够支持113种语种和方言的语音识别和36种语种和方言的语音生成。(财联社)

17. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

18. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

19. 模型一换 帧率减半!2026年零售机性能大横评【新评科技】

20. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能

21. #科技先锋官# GPT、Claude 的优势,要被马斯克彻底颠覆! xAI 发布 Grok-3,直接向主流大模型宣战!算力暴涨 10 倍、20 万块 GPU 加持,推理速度狂飙 2.5 倍,效率碾压同级!新增图像多模态、思维链推理,幻觉率大降 40%,数学编程精准度直线拉满。实时联网、幽默交互,体验感直接甩开对手。一周内还将上线语音交互!自然对话、情绪识别、上下文记忆,彻底告别僵硬指令交互,未来还能打通特斯拉、脑机接口。Grok-3 究竟是王炸还是炒作?看完视频一起聊聊?#过个有AI年##HOW I AI##微博超有用视频大赛##上微博涨知识# 种斌Marco的微博视频

22. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

23. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

24. 盘点一周AI大事(3月22日)|OpenAI红色警报 字节开源AI超级员工DeerFlow 2.0 英伟达开源Agent安全补丁NemoClaw Okara发布AI CMO Junior开源能雇佣的AI员工Junior 清华开源Agent课堂OpenMAIC MiniMax发布最强开源大模型M2.7 Miro开源最强深度研究模型Miro Thinker H1 Unsloth开源AI训练工具Unsloth Studio Google升级AI Studio和Stitch 阿里开源最强影视配音模型Fun-CineForge Google开源最强视频超分模型Spark VSSR 研究员开源最强数字人模型ID-LoRA 研究员开源首个城市级别的世界模型Seoul World Model #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #OpenAI

25. 「Github一周热点109期」Claude Code被开源, Pretext文本排版引擎, 谷歌最新开源模型和3D建筑编辑器

26. 【2026 AI 开源第一枪!】Qwen Multiangle 多角度一致性,ComfyUI 可控度+1!

27. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

28. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

29. SenseNova U1开源:8B参数原生统一多模态模型

30. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

31. MiniMax是家什么样的公司 #人均95后的大模型公司上了新闻联播 #minimax #人均95后公司MiniMax登上央视

32. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

33. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI

34. 第二代 VLA 物理 AI 大模型 原生多模态赋能,重构智驾决策核心✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#

35. 手机的AI可以多强大?联发科用他们的旗舰天玑芯片告诉你:不用联网,在手机本地就能直接运行复杂的多模态大模型!现场他们演示了用智能眼镜配合手机,实现实时的视觉识别和语音对话,反应迅速,而且所有数据都在本地处理,隐私性大大增强。随身AI助手真的要来了。

36. 全网求码的updream,赢在创作者本位

37. 谷歌 Nano Banana 2 发布,标志图像生成从「艺术创作」到「工业化生产」,这将带来哪些变革?

38. 是的,我开发了一个插件,每个知乎创作者都能大幅度提高创作效率拥有无限灵感的插件!

39. 面向实战的多模态数据生成与表征技术创新

40. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!

41. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

42. Qwen3.6“越狱”了!目前最强无审查开源模型!支持本地 Agent,6G 显存都能跑!附部署教程|零度解说

43. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

44. 你现在最头疼的AI创业问题是啥? #大咖观察 #创业项目 #红衣聊AI #人工智能

45. 没有API,你在AI世界就不存在? #大有学问 #红衣聊AI #智能体

46. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

47. 高效提示词(prompt)工程指南

48. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!

49. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。

50. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。

51. 亚历山大王终于发版了Muse Spark,这是Meta Superintelligence Labs(MSL)的首个模型,通过九个月从头重构AI基础设施、架构和数据管道实现,现已全面驱动Meta AI。Muse Spark为原生多模态推理模型,支持工具使用、视觉思维链和多代理编排;新增Contemplating模式可并行多代理推理,处理复杂科学问题时性能与Gemini Deep Think、GPT Pro相当。模型在预训练、强化学习和测试时推理上展现可预测扩展规律,经过前沿风险、安全对齐和对抗鲁棒性评估,未来将开放私人API预览并计划开源后续版本。

52. B 站下一代多模态数据工程架构的落地实践

53. 【华为昇腾 0 Day 适配阿里 Qwen3.5,MindSpeed MM 框架实现 " 开箱即用、快速迭代 "】阿里在 chat.qwen.ai 页面低调上线了 Qwen3.5-Plus 和 Qwen3.5-397B-A17B 两款新模型(均支持文本和多模态任务)。Qwen3.5 Plus 定位为 Qwen 3.5 系列最新大语言模型;Qwen3.5-397B-A17B 定位则是 Qwen3.5 开源系列旗舰大语言模型。华为计算官方昨晚宣布,Qwen3.5 模型一经开源发布,昇腾 0 day 实现基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3SuperPoD 上的训练复现,同时也支持基于 vLLM-Ascend 和 SGLang 在 Atlas 800 A2、Atlas 800 A3 上的高效推理部署。据介绍,基于 FSDP 训练后端的设计,MindSpeed MM 框架大幅缩短了新模型的适配周期,实现了 " 开箱即用、快速迭代 " 的开发体验,为多模态大模型的研究与应用提供了技术支撑。另据阿里云介绍,Qwen3.5 实现了底层模型架构的全面革新,其中,Qwen3.5-Plus 版本总参数为 3970 亿,激活仅 170 亿,性能超过万亿参数的 Qwen3-Max 模型,部署显存占用降低 60%,推理效率大幅提升,最大推理吞吐量可提升至 19 倍。Qwen3.5 在能力、效率与通用性三个维度上推进预训练:能力(Power):在更大规模的视觉-文本语料上训练,并加强中英文、多语言、STEM 与推理数据,采用更严格的过滤,实现跨代持平:Qwen3.5-397B-A17B 与参数量超过 1T 的 Qwen3-Max-Base 表现相当。效率(Efficiency):基于 Qwen3-Next 架构 —— 更高稀疏度的 MoE、Gated DeltaNet + Gated Attention 混合注意力、稳定性优化与多 token 预测。在 32k/256k 上下文长度下,Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-Max 的 8.6 倍 / 19.0 倍,且性能相当。Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-235B-A22B 的 3.5 倍 / 7.2 倍。通用性(Versatility):通过早期文本-视觉融合与扩展的视觉 / STEM / 视频数据实现原生多模态,在相近规模下优于 Qwen3-VL。多语言覆盖从 119 增至 201 种语言 / 方言;25 万词表(vs. 15 万)在多数语言上带来约 10–60% 的编码 / 解码效率提升。vllm 部署指导可参见魔乐社区和 gitcode 社区链接:网页链接网页链接SGLang 部署指导可参见 SGLang 社区链接:网页链接

54. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

55. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token

56. llama.cpp 最新版太强了!本地跑 “无审查模型” 速度暴涨!N卡/A卡/Intel 全支持|零度解说

57. 用AI手搓西部世界手机版?能一键生成冒险岛的AI,被我体验到了

58. 史上最离谱AI建筑大赛!豆包直接杀疯了?

59. LeCun的JEPA已进化为视觉-语言模型,1.6B参数比肩72B Qwen-VL

60. 试了下小米的miclaw,目前的表现确实可以,支持直接调用手机系统功能,比如自主发短信、分析手机内的文本,另外还可以根据指令调用已连接的智能家居。大家对它的表现满意不?#小米miclaw开启封测# #小米发布国内第一个手机版龙虾# Eva的科技生活的微博视频

61. DeepSeek多模态能力为零这件事,很多人觉得是短板。我反而觉得这是一个极其清醒的战略选择。你看字节、阿里、月之暗面,都在往“什么都能干”的方向堆功能,恨不得一个模型又能写诗又能剪视频又能读PDF。这很合理,因为C端用户确实需要一站式体验,这个逻辑完全可以理解。但DeepSeek选择把所有资源砸在推理深度上,不碰图像,不碰视频,就死磕逻辑链条的纯度。这让我想到一句话:当所有人都在比谁的瑞士军刀功能多的时候,手术刀的价值反而凸显了。 多模态是锦上添花,但推理能力是地基。地基打到全球第一梯队,上面想盖什么楼都来得及。反过来,地基不行的多模态,想要补起来可不那么容易。 #DeepSeek还是最强国产AI吗# deepseek还是最强国产ai吗

62. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!

63. Lance 把图像与视频的理解、生成和编辑全部融合进一个 3B 活跃参数的原生统一多模态模型,真正做到「一套框架」搞定。不仅支持高质量文生图、文生视频,还能进行图像/视频编辑与多模态理解,性能直逼更大模型。GitHub:github.com/bytedance/Lance Hugging Face:huggingface.co/bytedance-research/Lance主要功能:- 3B 活跃参数,原生统一框架,支持图像/视频理解、生成、编辑- 文生图、文生视频、图像编辑、视频编辑一键完成- 多轮一致性编辑与智能视频生成,效果出色- 支持图像/视频问答、详细描述等理解任务- 提供 Gradio Demo 与完整推理脚本,开箱即用支持本地运行(需 ≥40GB VRAM),同时已有 MLX 社区移植版本可在 Apple Silicon 上运行。

64. 【#免费DeepSeek和收费豆包你选哪个#】一句话总结:豆包像个“全能保姆”,贴心顺手但开始谈钱;DeepSeek像个“理科家教”,免费硬核但有点偏科。🌱 豆包优缺点:优点: 极度贴合国人习惯,网感好、会唠嗑;多模态全能(图文音视频通吃),文档解析强;服务器稳,极少崩溃。缺点: 复杂逻辑和代码能力稍弱;近期开始试探性收费(基础仍免费),让不少用户觉得“失去了性价比”。🧠 DeepSeek优缺点:优点: 逻辑推理和代码能力顶尖,堪称“理科学霸”;基础功能全免费,API成本低到感人,绝对良心。缺点: 偏科严重,多模态能力薄弱;文本输出偶尔太干太硬;高峰期容易服务器繁忙或卡顿。💡 怎么选?日常唠嗑、做图、写个生活感悟,选豆包;写代码、拆逻辑、搞学术研究,选DeepSeek。成年人不做选择,两个都装上,搭配干活才是真香! 网页链接

65. 8G 显存逆天了!竟能跑 35B AI 大模型!多模态 + N/A/Intel 全适配,附最新部署教程!|零度解说

66. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent

67. 这就是AI眼镜的元年时刻?千问AI眼镜S1多场景实测!

68. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

69. 把手教你用上开源版Claude Code,Windows系统接入保姆级教程!

70. 阿里云发布多模态交互开发套件

71. 当下最强开源图像编辑模型:FLUX.2 [klein] 克莱因

72. 1. 卓驭的新方案是原生多模态大模型,这个思路跟小鹏挺像的,用做多模态大模型的思路做智驾模型,2. 在预训练里,有一些互联网信息让模型具备一定的通识能力,也有驾驶相关的视频让模型变得专精,3. 卓驭依托着一汽,开辟了一个新战场,重卡、也包括大巴。这个事儿推起来真的功德无量,驾驶最累的就是这些司机朋友了。

73. 真正的 AI 上车!主动起来能多主动?【X.PIN】

74. 我做了个创作工具之间的传送门,专治"我存哪了来着?" | Build in Public#0【B站AI创造公开赛】

75. 如何看待 Minimax 新的 M3 多模态模型以及更新的 Token Plan?

76. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

77. #微博声浪计划##听见微博# 小米以“静默伏击”策略发布三款自研大模型,旗舰MiMo-V2-Pro跻身全球AI第一梯队,API定价仅为Claude Opus 4.6的1/5。全模态模型适配多场景,语音模型实现情感渐变控制,已接入人车家全生态。小米2026年AI研发投入超160亿元,构建硬件生态+AI底座闭环。 科技星辰说的微博音频

78. #阿里除夕夜开源千问Qwen3.5# 继Qwen2.5-Max后,阿里再以“开源”打响AI开年第一枪 🧨该模型实现了模型架构的创新 。据悉,Qwen3.5采用全新的混合注意力机制,极有可能是原生支持视觉理解的视觉语言模型(VLM),将开源至少2B密集模型及35B-A3B的MoE模型 。去年除夕,阿里曾抛出Qwen2.5-Max。【评论】阿里选择除夕夜开源,是以“技术春晚”卡位AI竞争新周期继去年除夕夜开源Qwen2.5-Max后,阿里再次选择在这个阖家团圆的时刻“放猛料”,其战略意图愈发清晰:用最高规格的开源动作,抢占全球开发者春节档的技术注意力。Qwen3.5的原生多模态能力与架构创新,直指2026年AI竞争的核心——从“对话”向“视觉理解、智能体执行”的全面升级。当同行忙于发红包、抢用户时,阿里选择用开源模型“围猎”开发者心智,这是一场关于生态根基的暗战。

79. 权威评测平台SuperCLUE-VLM发布2025年12月多模态视觉语言模型综合榜单,谷歌 Gemini-3-Pro 以83.64分“断层式”领跑,看来多模态这块依然是谷歌的绝对统治区。但国产模型的追赶速度肉眼可见:商汤SenseNova拿下第二,字节豆包冲进前三,基础认知能力甚至不输国际巨头。特别值得一提的是阿里的 Qwen3-VL,作为首个总分破70的开源模型,绝对是国内开发者的福音。反倒是 GPT-5.2 这次表现平平,竟然没上70分。#AI#

80. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

81. 使用AI聊天助手经常需要联网、登录账号,还担心隐私泄露和数据被收集,体验总是不够安心。Locally AI 把本地AI运行所需的功能全部集成到iPhone/iPad/Mac上,提供了完全离线的私人AI解决方案。不仅支持Llama 3.2、Gemma 4、Qwen 3等多款大模型,还能图像分析、文本生成,支持Shortcuts自动化,完全无网络、无登录、无数据收集,纯设备本地运行。App Store:网页链接主要功能:- 100%离线运行,无需网络随时随地使用;- 完全隐私保护,无登录、无数据收集,数据永不离开设备;- Apple MLX框架优化,支持M系列芯片超快响应速度;- 多模型支持,包括Llama、Gemma、Qwen、DeepSeek等热门模型;- 智能聊天、图像分析、文本生成,支持复杂问题解答;- 文件附件分析,支持CSV、TXT、代码文件等格式;- Shortcuts集成,可创建强大自动化工作流;- 支持视觉模型,具备图像理解能力。支持iPhone、iPad、Mac多平台,免费下载,881个评价4.8分,适合隐私敏感用户和AI爱好者。#本地AI##离线AI##隐私保护##AppleMLX# 爱可可-爱生活的微博视频

82. NVIDIA 在 GTC 发布 Cosmos 3🔥作为世界模型,距离 AGI 最近的万能 AI。图像·图像·动作·文本的理解和生成、物理推理全部由一个模型处理。在全部 8 个基准测试中创下 SOTA!有 16B 和 65B 两种规模,数据集也在 HF 上完全开源🤗

83. 数据邪修大法好

84. MM-Zero: VLM零数据自我进化

85. ICML2026-omni 新范式

86. 无需训练、即插即用,这个解码方法让模型学会谨慎思考

87. (2026|湾大 & 北航杭研院,生成-选择-精炼-分割,MLLM,思维链)Seg-Agent

88. 腾讯的Training-Free GRPO

89. [ICML'26]不训练、不微调,多模态大模型也能当检索专家?我们提出了 FreeRet

90. 高分辨率图像感知难题有解了!CVSearch

91. 让MLLM成为检索专家

92. Google DeepMind

93. 视觉理解和视觉回答 - 乐高积木AI拼搭 - 多模态RAG

94. 人工智能顶会CVPR论文分享|DyFo

95. 保留原文本嵌入几何不变性!支持文本/图像/视频/音频的全模态开源嵌入模型【多模态RAG】【向量检索】

96. VimRAG图文视频知识库的统一多模态RAG框架

97. MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action无需训练使LLM看懂图片

98. OpenAI CLIP

99. 不用微调也能编辑任意高分辨率图片!基于预训练扩散模型的免调图像编辑新方法 【AI图像生成论文解读】

100. 谷歌VisionBanana: 图像生成即可图像理解

101. Vision Banana-Image Generators are Generalist Vision Learners:图像生成模型可通过轻量微调成为通用视觉模型

102. 16GB笔记本直接跑多模态大模型

103. 【知客笔记】当多模态大模型遇上工业视觉

104. 大模型应用

105. 基于多模态大型视觉语言模型的目标检测

106. 万字长文拆解

107. 2026 AI多模态创作实测

108. 颠覆 MLLM!DeepSeek 视觉原语推理封神:把坐标变成思维原子,90 个 Token 碾压 GPT-5.4,多模态推理终于不瞎说了

109. 免费大模型API接口怎么用?DMXAPI聚合300+款大模型,deepseek还能这么玩?

110. 解锁 MLLM 跨模态潜力!多模态RAG再超神,性能狂飙 33%+!高区热门!

111. 剑指世界模型!商汤发多模态理解生成一体化架构,无需编码器“玩转”图像

112. 混元大模型API免费资源分享DMXAPI免复杂配置实测好用

113. 视觉推理新突破!Omni-R1:定义多模态推理的「统一生成式思考」

114. 重磅发布|AI多模态研判主机:多模态大模型加持,看“懂”复杂场景

115. CVPR 2026 | MLLM逆袭传统检测器!Rex-Omni:首个比肩DINO的通用视觉感知模型

116. spring-ai 第四多模态API

117. MLLM架构演进深度解析:从 LLaVA 到 Qwen3-VL

118. Meta 新作:多模态模型终于会查资料了

119. 多模态大模型赋能机器视觉:技术原理与典型应用场景

120. n8n实战012,多模态大模型全自动同行分析,闲鱼为例,其他平台通用

121. V-RAG 增强基于视觉感知的 RAG,实现对视觉丰富信息的理解通过强化学习的迭代推理实现理解

122. 工具调用AI智能体如何与现实世界交互

123. 解锁统一多模态模型自反思生成能力!把GRPO引入AR-Diffusion多模态大模型 【多模态大模型】【AI生成】

124. Meta 放出“多模态推理王牌”:Muse Spark 正式登场

125. 【AI论文解读】走出语言建模!Meta&NYU从零训练真正的统一多模态大模型 | 4大核心发现重塑多模态预训练

126. 【更新中】多模态大模型 前沿算法与实战应用

127. LLM推理时计算技术详解:四种提升大模型推理能力的方法

128. 多模态自适应推理Benchmark代码与数据公布

129. 一文解锁AI开发神器:DMXAPI多模态大模型API聚合平台

130. 从零实现一个问答机器人:从文本版到多模态版的工程实现

131. 英伟达开源多模态模型!Agent效率狂飙9倍

132. Qwen2.5-VL 深度解析:当多模态大模型遇上“效率革命”​

133. CVPR 2026 专题|从 MLLM、模糊对齐到时空建模:多/跨模态检索如何突破“意图理解”的天花板?

134. 上海交大:MLLM的「代码理解」有效性研究

135. 多模态数据处理-跨模态检索:支持文本检索图片/音频/视频(如通过CLIP模型实现图文匹配)

136. 视觉语言大模型Qwen2.5-VL

137. 32页终极指南!RAG 技术应用与实践突破传统,大模型文档 / 多模态落地秘籍(附下载)

138. 🔧 提示工程:释放大语言模型潜力的艺术

139. 多模态RAG:打破模态壁垒,重塑AI知识服务新模式

140. 告别无脑编码!UME-R1 开启多模态 Embedding 的“推理时代”

141. 人人都能懂的大语言模型“使用说明书”——提示词工程

142. Rubick: Mac原生多模态搜索APP

143. 从零开始学习多模态大模型的学习路径

144. Qwen2.5-VL的关键技术设计

145. 让ViT直接开口说话!极简架构生成式图文预训练GenLIP,性能超越CLIP\u002FSigLIP 【多模态大模型】

146. Day21 多模态大模型

147. 46、视觉语言多模态基础模型

148. 从“跨模态炫技”到“产业实用”多模态大模型真的能落地见效吗?

149. DeepSeek的系列工作之一:多模态推理框架

150. 腾讯发布OpenSearch-VL:开源多模态深度搜索 agent 的“全家桶”方案

151. 2026年4月16日 | VimRAG架构解析:阿里通义如何用动态记忆图革新多模态RAG

152. PaLMR:通过过程对齐解决MLLM推理幻觉!

153. 阿里刚开源下一代RAG王炸框架,AI学会自己翻图、看视频、找资料了

154. 蚂蚁大模型一面:Tool Use是扩展Agent能力的有效途径,请解释LLM是如何学会调用外部API或工具的?

155. 商汤日日新免费API实操:零成本调用多模态大模型,搭建你的AI工作流

156. GPT-4 开启多模态时代!DMXAPI 免费大模型 API,国产顶配零成本畅用

157. Nvidia 免费API指南:零成本、不绑卡,稳定调用国产与国际大模型

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章