张大妈

“免训练”构建全模态大模型?真相与代价

源自121位全网作者

05-19 17:47

内容由AI生成

精选参考来源

1. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型

2. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!

3. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

4. 市值近600亿,大模型公司上市了! #AI #智谱ai

5. 爆火的“无审查”AI 视频模型来了!Sulphur 2 本地部署实测:8G 显存也能跑!完全免费开源 | 零度解说

6. 中国大模型偷了老美的家,原因竟然是电多? #燃起来了大国重器 #春节世界观察 #新年囤点专业货

7. 多模态大模型这条赛道,阿里云开始拉速度了

8. #一条音频告别2025##微博声浪计划# 智谱AI与华为联合发布的GLM-Image模型,是首个基于国产升腾算力全流程训练的顶级多模态图像生成模型,完成了国产芯片+国产框架+顶级模型的全链路闭环验证,打破了此前顶级AI模型训练对英伟达GPU的依赖惯性,被视为国内AI领域去英伟达化的重要里程碑。1741851745412.topic 种斌Marco的微博音频

9. 可以用GRPO训练非reasoning模型吗?

10. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】

11. 英伟达很快会反超谷歌TPU,AI模型的竞争格局会在2026年1季度变天#英伟达 #马斯克 #算力 #Gemini3#TPU #GPU #AI模型#算力集群

12. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token

13. 戴密斯:AI最大的瓶颈是算力,AI公司的差距会拉大#谷歌 #戴密斯哈萨比斯 #DeepMind #新药研发 #算力

14. 17000 token/s,比B200快48倍!Taalas AI 芯片能否颠覆英伟达GPU?

15. 算力革命的总设计师!英伟达未来10年的AI蓝图!如何重构全栈生态?「超极氪」

16. 算力集群就应该建在太空里;这个世界500强的物流公司,已经从AI受益了#太空算力集群 #AI #云计算 #算力#马斯克 #SpaceX

17. ⚡️小米AI真的行吗?Mimo MiClaw测评:这波国产算力的“铲子”我先干为敬 |寒武纪 | 中际旭创|科技|翻墙炒股信息差最重要|A股ETF|投资美股|赚

18. Seedance 2.0之后,又一国产全模态视频大模型杀入Artificial Analysis榜单Top 2

19. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

20. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

21. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

22. 蓝色起源成为全球第二个实现火箭回收的公司 追上SpaceX,成功的秘诀居然是这个#亚马逊云科技 #生成式AI #出海 #reInvent2025 #AI

23. Chrome 被曝偷偷下载 4GB AI 模型!你电脑正在后台跑 AI?附彻底禁止方法!|零度解说

24. #Gemini3有哪些新功能#从“回答问题”到“搞定一切”,谷歌这款新模型直接把实用度拉满!原生支持文字、图像、视频、音频全模态输入,100万token超长上下文能装下700页书,不管是解析学术论文、生成交互式学习卡片,还是分析比赛视频出训练计划,都能轻松hold住。 推理力更是断层领先!GPQA Diamond 91.9%准确率+MathArena 23.4%高分,Deep Think模式连博士级难题都能拆解得明明白白,日常办公算贷款、做科研析数据都靠谱。开发者狂喜的是全新AI IDE Antigravity,一句话就能生成完整航班追踪APP,代码自动验证还能跨工具协同,SWE-bench Verified 76.2%的修复率堪比专业程序员👏

25. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与

26. 一杯咖啡成本搞定多模态微调:FC DevPod + Llama-Factory 极速实战

27. 如果明天算力不再决定胜负,你觉得你手里的哪张牌能赢? #大咖观察 #红衣聊AI #ChatGPT #算力 #AI

28. 单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s

29. 盘点一周AI大事(3月15日)|首次上传大脑成功 工程师开源龙虾办公室Claw3D 龙虾彻底出圈,,百虾大战正式开打 工程师开源一键装龙虾AlphaClaw 斯坦福开源科学家龙虾LabClaw 工程师Karpathy 开源龙虾版GitHub AgentHub Chrome上线龙虾Web协议 WebMCP 工程师开源龙虾软件协议CLI-Anything 吴恩达开源龙虾上下文工具Context Hub 研究员开源最强动漫图像模型Anima-v2 研究员开源最强视频分割模型MatAnyone 2 科学家成功上传了一只果蝇的大脑 #AI新星计划 #AI #AIGC #龙虾 #openclaw

30. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”

31. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说

32. 核心AI场景首超英伟达,一场国产算力的“破局叙事”|甲子光年

33. 小米这次的Token套餐,确实给行业立了个新标杆。 一次订阅就把全模态模型都包含进来,还直接带上了热度很高的MiMo‑V2‑Pro,计费透明、价格厚道,对养虾和开发者都很友好。#小米MiMo大模型首次推出TokenPlan# MiMo‑V2‑Pro本身就是第一梯队实力,在OpenRouter上连续霸榜,周消耗屡破纪录,是开发者用出来的口碑。这次套餐把全模态能力打包,统一计费、无使用限制,体验相当完整。 好用不贵、诚意拉满,国产大模型套餐终于有了对标国际顶级的标准,未来的路值得期待。

34. 18个月,中国Token消耗狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

35. 五种主流且高效的微调技术,助你用有限资源实现定制化:1. 传统微调对LLM不现实,因模型参数量庞大,算力成本极高。参数高效微调(PEFT)因此诞生,核心是对权重矩阵做低秩近似,显著降低训练开销。2. LoRA:在大模型权重矩阵旁添加两个低秩矩阵A和B,只训练这两个小矩阵,节省存储和计算,适合超大模型。3. LoRA-FA:冻结矩阵A,仅更新B,进一步降低显存需求,保障训练稳定。4. VeRA:将A、B设为随机且共享,改为学习层特有的缩放向量,实现更轻量的层间适配。5. Delta-LoRA:在LoRA基础上,动态将A×B的增量“叠加”到原权重W,提升微调灵活性。6. LoRA+:发现矩阵B比A更需高学习率,调整学习率策略,改善收敛效率。这些方法不仅降低算力门槛,更是微调方法论的变革——不再盲目调整全部参数,而是精准塑造“关键方向”。未来趋势是结合模型结构智能选点,支持多任务与持续学习,打造可组合、可扩展的“微调语言”。PEFT不是简单的工程优化,而是智能塑造大模型知识的设计语言,开启了人人可控大模型定制的新时代。原文链接:x.com/_avichawla/status/1996467023334039646

36. #DeepSeekV4更新了什么#DeepSeek‑V4:国产AI算力与技术双突破,以双版本架构、百万上下文、全栈国产算力三大突破,重新定义开源大模型上限。V4采用Pro+Flash双路线:Pro版1.6万亿参数、激活49亿,Agent能力超越Claude Sonnet 4.5,接近Opus 4.6非思考模式;Flash版2840亿参数、激活13亿,主打普惠,输入1元/百万tokens、输出2元/百万tokens,成本仅为GPT‑5.5的约1/20。全系标配1M上下文,依托自研DSA稀疏注意力,显存与计算量大幅下降,可一次性处理全书、大型代码库与长文档。最具行业意义的是,V4全面迁移至华为CANN框架,全流程跑在昇腾950PR,推理速度较H20提升2.87倍、能耗降40%,标志国产芯片可支撑万亿级模型训练与推理。当前Pro受产能限制高价限流,下半年量产放量后价格将下调,普惠可期。第三方测评显示,V4知识储备仅次于Gemini 3.1 Pro,与GLM‑5.1整体相当,长文本与成本优势突出;目前暂未开放原生多模态,为后续迭代重点方向。模型已深度适配OpenClaw等主流Agent,企业长文本任务成本可降约90%。从技术攻坚到算力自主,DeepSeek‑V4以长期主义推进技术普惠,不仅拉高国产AI天花板,更加速国产算力产业链商业化,为开源模型树立新标杆。#科技先锋官#

37. 有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么?

38. 英特尔掌门人警告:AI内存危机彻底爆发! 别再盯着算力了,这才是真卡点。#大咖观察 #红衣聊AI #内存 #算力 #英特尔

39. 【直播回放】解析谷歌Gemini 3:“AI 全模态”时代与Scaling Law的极致执行

40. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说

41. #阿里发布性能比肩英伟达H20的芯片#阿里平头哥推出的真武810E芯片属于全栈自研的高端AI芯片,不仅打破了国外巨头在高端算力领域的垄断,更成为国内AI发展的重要推力。真武810E是一款训推一体的高性能AI芯片,搭载平头哥自研并行计算架构与ICN片间互联技术,单卡配备96GB HBM2e内存,片间互联带宽高达700GB/s,可灵活组建万卡级集群,性能比肩英伟达H20,超越主流国产GPU及英伟达A800,已实现规模化商用。与普通芯片不同,它兼顾AI训练与推理需求,覆盖多领域应用,且软硬件全自研,彻底摆脱对外技术依赖。国内高端AI算力依赖进口,制约了大模型研发与产业落地,而这款芯片填补了国产高端AI芯片的结构性缺口,提供了高性价比的国产化算力选择,降低了企业用算成本,同时其芯云一体模式,为AI产业提供了芯片+加云加模型的一体化解决方案,加速AI技术在各行业的落地应用。阿里芯片的突破并不意味着我国芯片已能自给自足。国内芯片产业在制造工艺、部分核心零部件等领域仍有短板,真武810E的突破是重要进展,标志着国产AI芯片跻身全球第一梯队,为国内AI发展注入强劲动力。但国产芯片的前行之路仍任重道远,但全产业链自主可控仍需长期攻坚,它是国产芯片崛起的缩影,而非终点。在主流大模型适配性上,真武810E表现突出。它已大规模应用于阿里千问大模型的训推环节,深度适配主流AI框架,提供统一编程接口,开发者无需修改代码即可实现模型迁移,同时兼容多模态模型及自动驾驶等领域的主流模型,适配性与易用性大幅提升,为大模型迭代提供了强劲算力支撑。#秒懂热点就用智搜# 阿里发布性能比肩英伟达h20的芯片

42. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

43. 历史性时刻!M芯片Mac支持雷电外接GPU进行AI大模型计算!

44. 各大AI软件火了之后,大部分的收费标准都很模糊。而小米这次确实良心,小米MiMo大模型出token套餐了。一次订阅,全模态模型全包,还包含最近大火的MiMo-V2-Pro在内。价格厚道,计费透明,养龙虾再也不用担心token莫名其妙用得快了。之前,MiMo-V2-Pro连续霸榜OpenRouter,这些都是专业开发者用脚投票出来的顶级实力。跟着大哥们选模型准没错,包月套餐一出,踏实了。之前国产模型套餐大家吃得有点差。小米这次做到跟Anthropic一个标准,一次付费享受全模态全家桶。之前我一直用其他大模型的,这次的小米MiMo套餐出来真可以试试,从搭配到能力,都不落下风。#小米MiMo大模型首次推出TokenPlan#

45. Z Tech|一个词就能视觉推理?Meta 华人颠覆性提出 ATLAS 新范式

46. LoRA微调的研究还能热很久吗?

47. 1人顶1个Infra团队!OpenAI前CTO新招,让大模型训练跌成白菜价

48. #微博声浪计划##听见微博# DeepSeek正式跨入图文交互时代,5月9日开放“识图模式”,以“视觉原语思考”框架解决“指代鸿沟”,算力效率超GPT等模型10倍,适配国产昇腾芯片。实测能识别清代玉器、转化网页截图为HTML、解答立方体题等,覆盖多场景。用户反馈褒贬不一,企业版已接入金融医疗,正寻求500亿融资,推动国产AI多模态竞争升级。 科技小意的微博音频

49. CVPR 2026 | NVIDIA推出Fast-FoundationStereo:首个实时零样本立体匹配大模型,速度飙升10倍!

50. 养虾人才懂有多香!之前一直用Claude,虽然能力强但价格高,国模套餐要么模型少、要么全模态不全,体验差太多。这次小米直接比肩Anthropic,一次付费就覆盖全模态全家桶,把MiMo-V2-Pro、Omni等全系列打包,能力完全不落下风,甚至在智能体、多模态理解上还有自己的优势。可以预见,MiMo开了这个头,后续国产模型肯定也会跟进做全模态包月套餐,之前大家吐槽的用不起终于要改善了。从套餐搭配到实际能力,MiMo这波性价比算是拉满了

51. #小米大模型#啥?小米大半夜发了3个模型~小米放大招,连发三个模型Xiaomi MiMo-V2-Pro & Omni & TTSXiaomi MiMo-V2-Pro 超1T参数,激活参数42B,上下文1M,混合注意力,混合比例7:1,专为agent而生,Claw榜单上,国内模型第一,见图2。MiMo-V2-Omni 全模态模型,对音频理解,图像理解,视频理解有较高的提升,同时具备了多模态感知、工具调用、函数执行及 GUI 操作能力。可直接接入现有agent框架,限时免费使用一周。Xiaomi MiMo-V2-TTS 语音合成模型,经过上亿小时语音数据的预训练与多维度强化学习,可以进行多粒度语音风格控制。

52. 让大模型理解真实医疗视频,全球首个开源技术方案来了!

53. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

54. SenseNova U1开源:8B参数原生统一多模态模型

55. Hologres 4.0:面向 AI 时代的一站式多模态分析检索平台

56. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

57. #一条音频告别2025##微博声浪计划# 可灵AI单月收入超2000万美元,年化达2.4亿美元,海外收入占70%。技术上,其多模态模型效率高、成本低,但仍存手部细节等问题。商业化依赖订阅,面临竞争与监管挑战,未来需突破瓶颈构建护城河。 丁丁科技说的微博音频

58. 体验英伟达 AI 个人超算「核弹」DGX Spark,能微调出 DeepSeek R2 吗

59. VLA 在微调之后,能遗忘到什么程度?上交CVPR'26的工作给出了答案

60. #微博声浪计划##听见微博# DeepSeekV4发布,采用双版本架构,旗舰版V4-Pro参数达1.6万亿,轻量版V4-Flash性价比高。适配华为昇腾芯片,推理速度超英伟达H20的2.87倍,能耗降40%。推动国产算力自主,带动产业链发展,长文本处理优势显著,但暂未支持多模态。 谯华的微博音频

61. 云小二 Aivis 的架构实践——基于上下文工程与多智能体的自主服务新形态

62. 我国太空算力网建设迈入关键阶段,2800 颗卫星将打造全球太空算力底座,这到底是算力格局的彻底颠覆,还是噱头大于实际? 近地轨道建起太空数据中心,十万 P 级推理算力 + 百万 P 级训练算力实现天数天算,零成本太阳能供电、极寒高效散热,看似破解 AI 能源困局,却又无法替代地面能源,这波突破到底有多少含金量? 更被吹为低空经济救星,号称能让个人飞行从概念落地,真能打破低空算力通信瓶颈,实现全民飞行的未来吗?太空算力 VS 地面算力,谁才是未来算力的核心?#微博超有用视频大赛##上微博涨知识##AI创造营##科技先锋官# http://t.cn/AXqHvkEL

63. 还得是小米啊,把之前乱七八糟没有章法的龙虾套餐规整了一番,现在小米把全模态能力统一打包、让计费更透明,降低普通用户与开发者的使用门槛,也在规范国产大模型套餐玩法,采用的大模型是自家的MIMO-V2-Pro,整体不贵性能不错,一次订阅就能用上全模态模型,彻底解决养虾时token消耗不明、套餐零散的问题

64. Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

65. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

66. 独家丨首个「万卡国产算力集群 万亿参数大模型」开启测试邀请

67. 【#千问上线新模型#】3月30日,阿里千问宣布全模态大模型Qwen3.5-Omni上线。Qwen3.5-Omni系列包含Plus、Flash、Light三种尺寸的Instruct版本,支持256k长上下文,模型支持超过10小时的音频输入及超过400秒的720P(1FPS)音视频输入。模型在海量文本、视觉以及超过1亿小时的音视频数据上进行原生多模态预训练,该模型展现出卓越的全模态感知与生成能力。相比Qwen3-Omni,Qwen3.5-Omni多语言能力大大增强,能够支持113种语种和方言的语音识别和36种语种和方言的语音生成。(财联社)

68. 火山引擎多模态数据湖如何释放模思智能的算法生产力

69. 【Scail动作迁移】超丝滑流畅迁移真的有手就行 · 这么逼真还能看出来是AI吗?

70. #MDDC2026#2026天玑开发者大会正在进行,今年MediaTek聚焦全栈技术与全场景产品组合,以“无处不在的智能体化体验”为核心,赋能智能体化新时代,构建终端、系统、应用、AI基础设施四层技术体系,推动海量终端成为原生智能体,实现跨端协作与系统级智能进化。 全新发布天玑AI开发套件3.0,模型部署效率提升50%、压缩率高达58%,搭配开放对接工具与智能化辅助平台,大幅降低AI开发门槛。 同时推出天玑AIDV智能体座舱,实现全模态交互、主动式服务、并发任务执行与端云协同,开启AI定义汽车时代;天玑座舱平台C-X1搭载NVIDIA GPU芯片,凭借硬核图形渲染技术,打造4K60帧主机级3A游戏体验。MediaTek从底层到前沿,全面落地全场景智能体化体验,推动AI产业创新发展。#天玑开发者大会#

71. 天玑AIDV智能体座舱重磅亮相,正式开启AI定义汽车时代!它搭载全模态交互能力,精准读懂语音、视觉、情绪、健康及环境信息,真正做到与你感同身受。凭借Always-On全天候感知,实现主动式服务,提前预判需求、贴心响应。更支持多用户、多场景并发任务执行,复杂需求轻松并行处理;端云协同无缝衔接,安全、速度与智能一步到位。 MediaTek还带来三大开发捷径:更强AI座舱平台、便捷AI开发工具、全开放生态系统,携手开发者共筑主动式智能座舱新体验,让未来出行更懂你!#MDDC2026##天玑开发者大会#

72. 阿里云发布多模态交互开发套件

73. 不用任何人类语言训练,大模型反而更强了?

74. 人工智能顶会CVPR论文分享|DyFo

75. TPAMI 2026 | 无需训练即插即用!ZUMA

76. MM-Zero: VLM零数据自我进化

77. 无需标注图像即可进行文生图大模型预训练

78. 数据邪修大法好

79. AAAI 26 Outstanding Paper | LLM2CLIP: 大语言模型让 CLIP 起飞

80. AAAI 2026 | 让大语言模型给CLIP当老师

81. 同济微软斩获 AAAI 2026 杰出论文!低成本让 CLIP 性能暴涨,长文本检索提升 15%

82. EVA-CLIP 解读报告

83. LLM篇(5)

84. 谷歌 Gemini API 升级原生多模态 RAG 终结非结构化数据孤岛

85. 腾讯免训练GRPO

86. 免训练开放词汇分割范式突破!将 SAM 3 零微调适配遥感图像分析领域

87. 免训练开放词汇分割范式突破!将 SAM 3 零微调适配遥感图像分析领域,17个数据集上刷新SOTA

88. FreeFix

89. 论文解读 | 破解视觉Token冗余,“动态计算削减技术”助力多模态大模型推理“减负”

90. Omni-Diffusion:首个基于掩码扩散的全模态大模型

91. 别再部署本地大模型了!OpenClaw、Hermes完全免费使用大模型指南

92. DMXAPI一键直连,大模型api接口调用指南,小米大模型MiMo-V2-Pro多模态强

93. TPAMI 2026 | ZUMA 横空出世!跨域校准 + 动态语义交互,解锁零样本多模态异常检测新高度

94. 公开数据集,开源模型,聊天模型,首个胸部CT专用对比语言-图像预训练模型CT-CLIP实践

95. CLIP多模态里程碑模型详解

96. 告别 Token 焦虑:OpenClaw 大模型不限速免费使用,还能自动切换

97. 字节:无训练剪枝 + 动态MoE恢复满血生成

98. 不用训练、不用改权重!只让小模型“多想一层”,性能暴涨12%

99. 新场景没标注就用不了?ICLR 2026 三种方案提升大模型零样本迁移与泛化能力

100. 工业缺陷检测新王者-零样本多模态VLM模型解密

101. 免训练!使用贝叶斯去微调VLM,机器人操作任务取得SOTA!

102. LLM完成决策树知识迁移 性能超越传统模型 | KDD 2025

103. 2026 | 零样本多模态工业缺陷视频课程正式发布

104. API市场:聚合多类API,高效落地多模态研发场景

105. 多模态 即插即用 | 人人都能靠它水一篇,此时不冲,更待何时!

106. 2026多模态大语言模型技术发展报告

107. 多模态的融合方法-总结

108. 2026 最新 AI API 中转平台精选|主流服务商深度推荐

109. MatchAnything 让模型学会匹配任意两种完全不同的模态

110. TPAMI 2026 | 多模态卷积稀疏编码+ℓ0正则化:FNet为图像融合提供理论可解释新框架

111. 【AI人工智能题库】AI中零样本学习Zero-Shot Learning - 哔哩哔哩

112. CVPR 2026 | 北交大提出RL-MBA:让多模态主动学习学会平衡模态与感知难样本

113. 蚂蚁百灵开源全模态大模型

114. 多模态(Multimodal)开发经验:2026年的求职分水岭

115. LLM2CLIP:用大语言模型把 CLIP 的「文本侧」推进一步

116. CLIP的前世今生

117. AI算法面试:多模态大模型的融合方法

118. 多模态AI到底是什么?一文读懂文本、语音、图片的融合技术

119. 跨域迁移新巅峰!零样本落地不翻车太顶了!

120. 解锁AI全场景能力:OpenClaw多模态应用+部署+API配置全解析

121. 【AI术语解码局】多模态融合:将不同模态的数据(如文本、图像、时序数据)结合到一个统一的模型中,以改善预测或决策性能

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章