视觉大模型为何必须“瘦身”?轻量化技术实战指南
06-07 10:45
精选参考来源
新浪微博 2026-05-14
新浪微博 2026-05-13
来源
精选参考来源
1. #微博声浪计划##听见微博# 小米发布自动驾驶大模型“Xiaomi OneVL”,整合VLA、世界模型和潜空间推理三大技术路线,推理延迟最低0.24秒,精度达行业最优。引入语言与视觉双维度可解释性设计,解决决策不透明问题。采用Apache 2.0协议全面开源,支持商用及二次开发,推动行业技术融合,助力“人车家全生态”布局。 科技事儿的微博音频
新浪微博 2026-05-14 00:00:00
2. #小米发布自动驾驶模型##小米自动驾驶模型XiaomiOneVL发布# 小米发布并全面开源自动驾驶模型Xiaomi OneVL:一步式潜空间语言视觉推理框架,将VLA、世界模型和潜空间推理三大技术路线统一到同一框架中,让大模型推理“又快又准”:精度上超越显式思维链,速度上对齐“仅答案”预测,推理延迟最低仅0.24秒,为传统VLA自回归推理的5.4%,为量产车端实时部署提供了可行路径
新浪微博 2026-05-13 00:00:00
3. #小米发布自动驾驶模型#小米自动驾驶模型Xiaomi OneVL:一步式潜空间语言视觉推理框架,正式发布并全面开源。该模型将VLA、世界模型和潜空间推理三大技术路线统一到同一框架中,让大模型推理“既快又准”,为量产车端实时部署提供了可行路径。欢迎全球开发者与研究人员共同参与,探索自动驾驶大模型的无限可能。 小米技术新突破!Xiaomi OneVL 自动驾驶模型正式发布并全面开源
新浪微博 2026-05-13 00:00:00
4. 【#谷歌发布FunctionGemma#:把 AI 大模型能力“压缩”进手机,以后玩游戏全靠“吼”】谷歌于 12 月 18 日发布公告,宣布推出 FunctionGemma,是基于 Gemma 3 270M 微调的专用模型,目的是将强大的函数调用(Function Calling)能力引入手机等边缘设备。谷歌表示,随着行业从单纯的对话式接口转向主动式智能体(Agent),开发者对模型本地执行任务的需求日益迫切。FunctionGemma 正是为此而生,它不仅继承了 Gemma 系列的轻量化优势,更通过专项微调,让边缘设备(如智能手机和嵌入式系统)无需依赖云端算力,能够精准理解用户指令并调用相应功能。与通用大模型不同,FunctionGemma 专为“定制化”设计。它既能与人类自然对话,也能生成结构化的函数调用代码来指挥计算机。在 Google 进行的“移动操作”(Mobile Actions)测试中,该模型展现了惊人的可塑性:未经微调的基础版本准确率为 58%,而经过针对性微调后,其执行复杂指令(如“明天约午饭并添加到日历”、“帮我把昨天拍的美食发给老妈”)的准确率跃升至 85%。为了在算力和电池受限的边缘设备上流畅运行,FunctionGemma 采用了极致的轻量化设计。它利用 Gemma 的 256k 词表高效处理 JSON 数据和多语言输入,大幅降低了延迟。该模型目前已适配 NVIDIA Jetson Nano 等开发板及主流移动设备,甚至能作为“交通指挥官”,处理简单任务并将复杂逻辑路由至更大的 Gemma 3 27B 模型。为了降低开发门槛,谷歌为 FunctionGemma 构建了广泛的生态支持。开发者现在即可通过 Hugging Face、Kaggle 下载模型,并利用 Unsloth、Keras 或 NVIDIA NeMo 进行微调。在部署方面,该模型全面支持 LiteRT-LM、vLLM、Llama.cpp 和 Ollama 等工具。谷歌还同步发布了 TinyGarden 游戏演示和“移动操作”微调指南,展示了如何用自然语言控制虚拟农场或手机系统设置,帮助开发者快速构建属于自己的私有化、低延迟端侧智能体。(IT之家) 梨视频的微博视频
新浪微博 2025-12-20 00:00:00
5. 市值近600亿,大模型公司上市了! #AI #智谱ai
抖音 2026-01-10 00:00:00
6. 提速10倍!Mac Mini 本地跑 AI 大模型,OpenClaw + oMLX 加速神器实测效果惊人! | 零度解说
哔哩哔哩 2026-03-16 00:00:00
7. 如何看待2026年2月24日Anthropic公司声称中国实验室对Claude模型大规模蒸馏并点名?
知乎 2026-02-25 00:00:00
8. 「极限压缩 量化未来」Modelers GeekDay 上海站圆满落幕
知乎 2026-03-30 00:00:00
9. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI
抖音 2026-04-27 00:00:00
10. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生
抖音 2026-01-08 00:00:00
11. 全球AI开发者新宠!阶跃星辰Step 3.5 Flash,两天登顶OpenRouter趋势榜
微信公众号 2026-02-06 00:00:00
12. Together AI 发了篇技术博客,介绍了一种名为 CLLMs (Consistency Large Language Models,一致性大语言模型) 的新型模型架构,在不牺牲质量的情况下,推理速度提高最多14倍。www.together.ai/blog/consistency-diffusion-language-models该项目将图像生成领域前沿的“一致性模型(Consistency Models)”技术成功迁移到了离散的文本生成领域,基于 Llama-2-7B 训练出了一个新的模型,打破了传统大模型“逐字生成”的范式,实现并行地、一次性生成整个句子或段落。#HOW I AI#
新浪微博 2026-02-20 00:00:00
13. ICLR'26高分开源 | Depth Anything 3:新一代3D视觉模型,位姿精度超VGGT 35.7%!
知乎 2026-02-03 00:00:00
14. 模型一换 帧率减半!2026年零售机性能大横评【新评科技】
哔哩哔哩 2026-04-15 00:00:00
15. LeCun的JEPA已进化为视觉-语言模型,1.6B参数比肩72B Qwen-VL
微信公众号 2025-12-20 00:00:00
16. #美国ai攻击中国ai模型是给谁做了广告#补充一下关于AI训练的蒸馏技术:打个比方,这就像一位优秀学生向博导学习。学生不仅记住标准答案,更通过分析老师的解题逻辑,理解其深层的思考过程。在AI训练中,大模型输出的不仅是“这是一只猫”的结论,还会给出“像猫90%、像老虎8%、像狗2%”的概率分布。这种细微的“暗知识”——老虎比狗更像猫——恰恰是学生模型需要领悟的精髓。通过模仿大模型的“思考方式”,学生模型学到了比原始数据更丰富的信息。这使得蒸馏技术具备三大优势:一是实现模型压缩,将庞大模型“瘦身”后部署到手机等终端设备;二是显著提升小模型性能,使其表现超越传统训练方式;三是加快推理速度,满足实时响应的需求。 美国ai攻击中国ai模型是给谁做了广告
新浪微博 2026-02-26 00:00:00
17. 500行极简开源框架,硬刚GPT/Gemini视觉极限!
知乎 2026-03-16 00:00:00
18. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-17 00:00:00
19. 8G 显存逆天了!竟能跑 35B AI 大模型!多模态 + N/A/Intel 全适配,附最新部署教程!|零度解说
哔哩哔哩 2026-05-23 00:00:00
20. Qwen3.5即将开源的消息大家都刷到了么,对我们这些技术爱好者来说,它带来的几个价值非常具像化。首先,原生支持视觉理解是个大进步。我们以后处理图像或图文混合的任务会更方便,有可能直接用它来搭建一些轻量级的智能助手或内容分析工具,省去了额外集成视觉模块的麻烦。其次,开源阵容考虑得很周全。从2B的小模型到几十B的MoE大模型,覆盖了从本地部署到云端应用的不同需求。这样一来,无论是个人做实验,还是团队开发产品,都能找到适合自己算力与效果的版本,试错成本低了不少。最后,能快速集成进HuggingFace生态,本身就极大降低了使用门槛。我们可以更轻松地把它和现有工具链结合起来,快速验证想法或进行微调。未来我相信它的开源会直接丰富我们的工具箱,让实现AI想法变得更简单、更灵活。#阿里新一代模型Qwen3.5曝光#
新浪微博 2026-02-09 00:00:00
21. UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!
微信公众号 2026-03-16 00:00:00
22. 北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
微信公众号 2026-03-07 00:00:00
23. 3DGS压缩天花板!POTR剪枝+能量压缩+微调,全数据集RD性能霸榜!压缩比达45倍
知乎 2026-01-28 00:00:00
24. 天玑AI开发套件3.0来袭!新一代开发套件拥有“四大件”,可充分释放AI潜能,其中包括:· 模型部署更高效:LVM模型可视化部署,效率较上代产品提升50%;· 模型压缩率更高:Low Bit压缩工具包带来高达58%的模型压缩率;· 智能体对接更开放:天玑eNPU开发工具,带来Always-On感知能力;· 开发智能更简单:天玑AI Partner上线,智能化辅助,端到端部署。#天玑开发者大会# #MDDC2026#
新浪微博 2026-05-13 00:00:00
25. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
26. #小米天才少女罗福莉首次登场# 小米发布最新MiMo大模型,媲美DeepSeek V3.2 !Xiaomi MiMO大模型负责人罗福莉,被誉为“"95后AI才女"”,本科毕业于北京师范大学计算机专业、硕士就读于北京大学计算语言学研究所。曾通过阿里 “阿里星项目” 入职达摩院,主导开发多语言模型VECO,后任职幻方量化,并成为DeepSeek-V2关键开发者。2025年11月起,罗福莉担任小米MiMo大模型团队负责人。今日发布并开源的MiMo-V2-Flash,是其加入小米后领导开发的“作品”。据小米官方介绍,Xiaomi MiMo-V2-Flash总参数 309B(激活15B),采用专家混合架构 (MoE),在多个 Agent 测评基准上进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理价格仅为其 2.5% 且生成速度提升至 2 倍。
新浪微博 2025-12-17 00:00:00
27. 小米技术今日正式发布并开源 Xiaomi OneVL 一步式潜空间语言视觉推理框架官方表示,该模型在业内率先实现 VLA、世界模型、潜空间推理等多个技术路线的统一,在具备 XLA 模型强悍推理能力的基础上,大幅提升了推理的速度和精度,是行业内具备开创性的方案,在精度上超越显式 CoT、在速度上对齐“仅答案”预测的潜空间 CoT 方案
新浪微博 2026-05-13 00:00:00
28. 芜湖,更高效,更开放,更智能的天玑 AI 开发套件 3.0 来了。模型部署更高效:LVM 模型可视化部署,效率较上代产品提升 50%模型压缩率更高:Low Bit 压缩工具包带来高达 58% 的模型压缩率智能体对接更开放:天玑 eNPU 开发工具,带来 Always-On 感知能力开发智能更简单:天玑 AI Partner 上线,智能化辅助,端到端部署四大套件,充分的释放 AI 的潜能,发哥还是稳的。#MDDC2026##天玑开发者大会#
新浪微博 2026-05-13 00:00:00
29. #MDDC2026##天玑开发者大会#天玑 AI 开发套件 3.0 重磅来袭,直接把开发体验拉满!这款全新升级的套件以更高效、更开放、更智能为核心,带来四大超强能力,让 AI 开发轻松又给力。LVM 模型可视化部署,效率直接飙升 50%,调试部署快人一步;Low Bit 压缩工具包强力加持,模型压缩率最高可达 58%,轻量化效果拉满。搭配天玑 eNPU 开发工具,实现 Always-On 全天候感知,智能连接更开放。还有天玑 AI Partner 全程辅助,智能化引导、端到端部署,新手也能快速上手。四大套件协同发力,全面释放 AI 潜能,让智能体化新体验走进每一个场景,无处不在!
新浪微博 2026-05-13 00:00:00
30. 天玑的开发合作伙伴有这么多。然后天玑 AI 开发套件3.0发布,四大优势:模型部署更高效:LVM 模型可视化部署,效率较上代产品提升 50%模型压缩率更高:Low Bit 压缩工具包带来高达 58% 的模型压缩率智能体对接更开放:天玑 eNPU 开发工具,带来 Always-On 感知能力开发智能更简单:天玑 AI Partner 上线,智能化辅助,端到端部署#MDDC2026##天玑开发者大会#
新浪微博 2026-05-13 00:00:00
31. #阿里健康推出AI产品“氢离子”# 医疗大模型向“轻量化”与“精准化”演进🧬阿里健康在其“2026数智医疗生态大会”上,正式发布了全新AI产品——“氢离子”。该产品定位为 “精准循证的临床大模型” ,与集团“通义”大模型同源,但针对医疗场景进行了深度优化和轻量化设计,旨在为医生提供更精准、高效的临床决策支持。【评论】“氢离子”的命名颇具深意,它象征着产品追求 “轻量、精准、无处不在” 的特质。这标志着头部互联网医疗平台的AI竞赛,正从追求通用能力的“大而全”,进入聚焦临床核心场景的 “小而美”与“专而精” 阶段。其关键价值在于,通过模型优化降低使用门槛和计算成本,让AI工具能更广泛、更流畅地嵌入医生的实际工作流,成为随手可用的“智能听诊器”,而非庞大笨重的“外部系统”。
新浪微博 2026-01-19 00:00:00
32. Efficient Track Anything(EfficientTAM)是一款基于轻量级ViT图像编码器的高效视频和图像分割模型。通过引入高效的内存交叉注意力机制,提升了推理速度和性能,能够在iPhone 15上实现超过每秒10帧的视频分割,兼顾速度与准确性。 该项目训练于大规模图像和视频数据集(SA-1B、SA-V),表现可媲美最新的SAM 2模型,同时具有更优的效率。支持Mac MPS后端加速,适合开发者和研究者快速部署与调用。 主要特点: - 轻量级ViT编码器,兼顾性能与速度; - 高效内存交叉注意力,提升推理效率; - 支持图像和视频分割任务; - 兼容最新SAM 2代码库,持续优化更新; - 提供完整代码和模型权重,方便本地运行和二次开发; - 支持多平台,含Mac MPS加速。 GitHub 地址:github.com/yformer/EfficientTAM 安装步骤简单,支持conda环境配置,内置示例和Gradio在线演示,方便快速体验和测试。适合需要高效视觉分割方案的科研人员和工程师使用。
新浪微博 2025-12-09 00:00:00
33. 从0到1:魔乐社区贡献者丁一超的大模型量化实战指南
知乎 2026-04-11 00:00:00
34. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能
抖音 2025-12-13 00:00:00
35. Google 深夜放大招!Gemma 4 12B 开源模型发布,普通电脑也能跑?实测结果出乎意料!本地部署及下载 | 零度解说
哔哩哔哩 2026-06-06 00:00:00
36. #海外开发者惊讶小米MiMo新模型表现# 当海外开发者还在为Gemini3 Flash惊叹时,小米开源大模型MiMo-V2-Flash横空出世,直接被老外吹成“Gemini平替”!它以309B参数实现2.6倍推理加速,延迟仅为DeepSeek-V3.2的一小部分,却在通用基准测试中性能相当。最让开发者疯狂的是,它不仅免费开源,推理成本还低至闭源竞品的2.5%,中国开源大模型的实力,这次真的让海外刮目相看!
新浪微博 2025-12-27 00:00:00
37. 只要 DeepSeek 一干点啥,蒸馏的话就出来了。那分享一下,这两天马斯克和 OpenAI 干仗的庭审吧。xAI蒸馏OpenAI模型?2026年4月30日下午,OpenAI首席律师威廉·萨维特直接发问:xAI是否蒸馏了OpenAI的模型?马斯克第一反应:这是所有AI公司都会做的行业惯例。萨维特追问:所以答案是 yes?马斯克最终承认:部分是(Partly so)。马斯克庭上解释蒸馏技术:用一个AI模型训练另一个AI模型。具体操作:- 向强大的教师模型(如ChatGPT)发送大量问题- 收集其输出的高质量回答- 用这些数据训练自己的 学生模型(如Grok)。马斯克称:所有AI公司都在这么干。#新能源大牛说#
新浪微博 2026-05-04 00:00:00
38. #一条音频告别2025##微博声浪计划# 小米发布开源大模型MiMo-V2-Flash,总参数3090亿仅激活150亿实现轻量化,在数学竞赛、科学测试等位列开源前两名,软件工程测试第一,性能媲美DeepSeekV3.2。生成速度达150 tokens/秒,推理成本仅为其1/3,支持深度思考与联网搜索,融入澎湃OS,已开放体验。 科技小焱的微博音频
新浪微博 2025-12-17 00:00:00
39. 最近小米的大模型 MiMo-V2-Flash 在海外开发者社区还挺火的不少国外开发者已经把 MiMo-V2-Flash 当成 Gemini 3 Flash 的性价比替代方案了,因为它在代码能力表现不错的前提下,API 定价只有同级主流模型的 2.5%,而且现在还依然是限时免费。对开发者来说,等于多了一个性能不错、成本极低的新选择。
新浪微博 2025-12-27 00:00:00
40. Gemini 3 Flash 发布以后,在 SWE-Bench 上不仅爆杀了OpenAI 和 Anthropic 的 SOTA 模型,继续往下看,还爆杀了刚发布不久的大哥 Gemini 3 Pro...啊这GoogleDeepMind 研究科学家 Ankesh Anand 对此的解释是:Flash 模型不仅仅是 Pro 的蒸馏和剪枝,他们在 Flash 上应用了更多的强化学习,就大力出奇迹了。精彩...
新浪微博 2025-12-21 00:00:00
41. 谷歌最新发布 TurboQuant:极致压缩技术,让大模型推理速度飙升 8 倍
知乎 2026-03-26 00:00:00
42. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent
抖音 2026-04-12 00:00:00
43. #阿里新一代模型Qwen3.5曝光#中国大模型“疯狂2月”的重要一环阿里新一代大模型Qwen3.5曝光了,看了一下,Qwen3.5采用全新架构,支持原生视觉理解能力,可直接处理图像等多模态输入,并且在逻辑推理、数学计算及代码编写能力上具有显著突破,这波是国产大模型全球竞争力再次迎来强化呀。
新浪微博 2026-02-09 00:00:00
44. #小米发布最新MiMo大模型# 这个模型是由95后AI专家罗福莉领衔打造的,也意味着小米在AI大模型领域的快速研发落地。先看核心参数: 3090亿总参数、150亿活跃参数,响应时间为150 token/秒,这个水平对标的是头部开源模型 DeepSeek-V3.2,可以说性能和效率都是杠杠的。并且,这一AI深度适配了澎湃OS,可以预见,在小米人车家的生态下,其将在未来赋能如小爱同学、汽车座舱、全屋智能设备等领域,这么一看确实很让人期待了,说不定真能让小米实现AI领域轻量化突围的新方向
新浪微博 2025-12-17 00:00:00
45. #豆包大模型2.0发布# 2026开年AI行业就成了高光的行业,算力上太空,应用高效率。让我们这些用户看的是眼花缭乱的,不知道该站那边了。 豆包、GLM-5、M2.5这三款应用都采用高效架构优化推理成本,在编程、工具调用等等能力上达到行业前沿水平,以国内市场需求为主导,争取在工具的属性上满足国内的市场需求。也成为了目前市场上讨论最多AI标杆。 不过豆包作为字节跳动自研模型,主打轻量化部署与高性价比,适配短视频创作、轻量化办公等场景。GLM-5以架构革新为核心,深耕编程与智能体领域,主打技术突破与开发者生态。M2.5则聚焦极致效率与成本控制,在复杂编程、办公场景中实现高速高效,三者同源却各有专攻。 从发展的角度来说,这三者之间市场重叠度有限,反而是相互的互补会更多一些。#HOW I AI##过个有AI年#
新浪微博 2026-02-14 00:00:00
46. 北大&小鹏汽车《EvoDriveVLA》论文,作者中出现了xianming,这套训练方法有点意思,给大家做个小总结:现在的端到端VLA模型训练有个通病——视觉编码器退化。简单说就是AI学开车学久了,原来能认猫狗、辨天气的"通用视力"反而变差,变成只会看车道线的"近视眼"。同时长程规划会累积误差,规划越远越跑偏。论文提出了VLA模型的"双师教学"方案:协同感知-规划蒸馏框架,让AI同时拜两个老师。老师1:自锚定视觉蒸馏(解决眼睛退化)复制一个冻结的"原版AI"当锚点老师,用AnchorFormer模块,根据轨迹引导注意力给不同区域分配"锚定权重"。比如前方有行人,那块区域就多盯着点,确保学生AI学开车时,别忘本。老师2:Oracle引导轨迹蒸馏(解决规划跑偏)训练时让AI"偷看"未来3秒的真实画面(特权信息)由粗到精优化:先画个大概路线,再慢慢修正细节。蒙特卡洛丢弃采样:随机生成10条候选路线,选最优的教给学生,学生学的是"如果我能预知未来,我会怎么开"效果怎么样?▶nuScenes开环测试:相比OpenDriveVLA,路线误差降21%,碰撞率降40%相比DiMA,误差再降9%▶NAVSIM闭环测试:3B小模型PDM分数超8B大模型蒸馏后相对提升4.2%我的看法:这套方法论不是直接给VLA2.0用的,但思路可以迁移。核心就一句话:好老师比堆参数更重要。小鹏如果能把这个蒸馏框架落地到下一代VLA,智驾的泛化能力和稳定性应该还能再拔一截。毕竟现在各家都在卷端到端,谁能把"老师教学生"这套玩明白,谁就能省算力、提效果。图片8是一图读懂,不喜欢看文字的同学,可以看图。
新浪微博 2026-03-14 00:00:00
47. #一条音频告别2025##微博声浪计划# 小米推出在线AI聊天服务Xiaomi MiMO Studio,自研MoE模型MiMo-V2-Flash总参3090亿,激活仅150亿,生成速度比Claude 4.5 Sonnet快2倍,成本仅同类闭源模型的2.5%。代码修复成功率73.4%超开源模型,支持256K长上下文。用户期待与小爱同学、澎湃OS整合,开发者赞赏开源轻量化设计,但需关注安全防护机制。#微博兴趣创作计划# 瘦子說的微博音频
新浪微博 2025-12-18 00:00:00
48. DeepSeek 2026年4 月30 日发布几小时后删除的视觉模型技术报告,透露出哪些信息?
知乎 2026-05-01 00:00:00
49. 牛马忙于搬砖🧱,用豆包瞄了一眼小鹏汽车与北大联合完成的论文:FastDriveVLA: Efficient End-to-End Driving via Plug-and-PlayReconstruction-based Token Pruning✅论文链接:网页链接该论文提出了一个新的剪枝框架:FastDriveVLA——一种专为自动驾驶VLA模型设计的重建式视觉令牌剪枝框架,核心是解决现有注意力/相似度剪枝在自动驾驶场景中性能不佳、计算开销大的问题。🌟核心创新🌟1. ReconPruner剪枝器:轻量插拔式设计(仅0.07B参数),通过MAE风格像素重建聚焦前景信息,搭配对抗性前景-背景重建策略,避免令牌评分同质化。2. nuScenes-FG数据集:含241K图像-掩码对,标注了行人、车道、车辆等驾驶关键前景区域,为剪枝训练提供数据支撑。3. 推理适配性:无需重训即可集成到同视觉编码器的不同VLA模型,支持25%/50%/75%等灵活剪枝比例。🌟关键结果• 性能:在nuScenes开环规划基准上全面超越现有剪枝方法,50%剪枝时仍保持99.1%的L2误差性能,碰撞率仅0.25%。• 效率:剪枝75%令牌后,FLOPs降低7.5倍,预填充时间减少3.7倍,解码时间减少1.3倍,满足实时驾驶需求。🌟核心结论通过聚焦驾驶关键前景令牌,FastDriveVLA在降低计算开销的同时保障了驾驶安全性,为自动驾驶VLA模型的高效部署提供了新范式。简单说,FastDriveVLA就是给自动驾驶的“大脑”(VLA模型)装了个智能筛选器,让它反应更快还不犯错。原来自动驾驶模型看路况时,会把摄像头拍的画面拆成一大堆“信息碎片”(也就是视觉Token),里面有有用的(比如前车、红绿灯、车道线),也有没用的(比如路边的杂草、远处的广告牌),这些没用的碎片会让模型“处理变慢”,就像人开车时被无关事物分心一样。这个新方案的核心就是:加个小模块专门“挑碎片”——先学着识别哪些碎片对开车最重要,然后直接删掉没用的,只留关键信息给模型做决策。而且这个模块不用改原来的模型,插上去就能用(热插拔),不用重新训练,非常巧妙的巧思#小鹏AI大模型论文再登国际顶会##小鹏顶会论文证实L2到L4技术路径突破#
新浪微博 2025-12-28 00:00:00
50. LocateAnything 是一套统一的高性能视觉语言定位框架,它将多种定位任务整合到单一模型中,实现了快速且精准的视觉 grounding 解决方案。该框架创新性地采用 Parallel Box Decoding(PBD)技术,将每个边界框或点作为原子单元一次性预测,相比传统逐 token 解码方式大幅提升吞吐速度,同时保持几何结构的完整性。支持 Fast Mode(MTP)和 Slow Mode(NTP)混合推理模式,兼顾速度与准确率。GitHub:github.com/NVlabs/Eagle/tree/main/Embodied 论文:research.nvidia.com/labs/lpr/locate-anything/主要特性:- 统一视觉语言模型,支持文档理解、GUI 定位、密集目标检测、OCR 定位等多种任务;- Parallel Box Decoding 实现单步并行预测,吞吐量提升最高可达 2.5×;- 混合推理模式,默认使用快速模式,遇到格式或空间歧义时自动回退至稳定模式;- 提供 LocateAnything-Data 数据集,包含 1.38 亿语言查询与 7.85 亿边界框,覆盖通用检测、GUI、指代理解、文本定位等多领域;- 在 LVIS、M6Doc、ScreenSpot-Pro 等基准上实现 SOTA 定位精度,同时保持高效推理。支持多种分辨率与密集场景,适合机器人、具身智能、文档分析等高精度定位应用。
新浪微博 2026-05-29 00:00:00
51. Qwen3.5 量化:INT4 vs NVFP4 vs FP8 vs BF16我对量化的 Qwen3.5 9B、27B 和 35B 进行了全面评估——全部与 vLLM 兼容。文章:网页链接一些实用建议:- 性能优异的 4 位 Qwen3.5 27B 处理器比 Qwen3.5 9B 处理器性能强得多,而且内存预算也相近。- 注意“INT4”标签:有些 INT4 型号最终会变得几乎和 FP8 版本一样大,因为许多敏感层保持了更高的精度。量化后的 Qwen3.5 模型需要更长的思考时间。因此,虽然模型运行速度更快、内存效率更高,但生成的词元也更多。为了获得最佳质量,首先不要量化线性注意力机制。如有必要,也可以将注意力机制保持在 16 位。Qwen 在其 INT4 版本中也采用了这种策略,效果很好。对于 MoE 模型:不要量化共享专家。我在@verdacloud提供的 B200、H200 和 RTX Pro 6000 GPU 上进行了这些实验(计算赞助)。
新浪微博 2026-03-14 00:00:00
52. 12 个主流小型AI模型对比评测 本地部署的选择是Qwen3-4B?
微信公众号 2026-03-24 00:00:00
53. 多模态轻量化狂飙!视觉Token压缩成为顶会核心抓手
微信公众号 2026-05-15 00:00:00
54. 解决大模型推理瓶颈!一次训练支持任意 token 预算,兼顾效率和性能 【大模型轻量化】【多模态】
哔哩哔哩 2026-06-03 00:00:00
55. 知新研学 |LSNet
微信公众号 2026-04-07 00:00:00
56. CV被大模型解决了?腾讯开源VLM识别新范式
微信公众号 2026-01-30 00:00:00
57. NeurIPS'25|扔掉89%视觉token,性能只降4%
小红书 2026-04-05 00:00:00
58. AVG-LLaVA
小红书 2025-12-11 00:00:00
59. CVPR26 | 自动决定所需的最少视觉token数
小红书 2026-03-19 00:00:00
60. 模型压缩革命!Ascend/msmodelslim让大模型"瘦身"70%的秘密
微信公众号 2026-04-04 00:00:00
61. 中科港大突破
今日头条 2026-03-09 00:00:00
62. ViT-AdaLA 让大视觉模型“瘦身”跑得更快 | 90%计算量砍掉,精度反升2.1%!
微信公众号 2026-04-07 00:00:00
63. 什么是大模型压缩?3分钟看懂AI“瘦身”黑科技
知乎 2026-01-04 00:00:00
64. 模型压缩与量化
知乎 2026-02-28 00:00:00
65. 边缘AI——将大模型塞进微型设备的“瘦身革命”
百度 2026-05-28 00:00:00
66. 技术▏AI大模型 “轻量化” 技术对比,实现从云端到终端的场景化应用
微信公众号 2026-05-27 00:00:00
67. 模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26
微信公众号 2026-03-05 00:00:00
68. 视觉大语言模型为何迫使边缘AI硬件重新思考
网易 2026-06-01 00:00:00
69. 大模型 "遍地开花"!云边模型同步实战
微信公众号 2026-04-10 00:00:00
70. 不靠大规模预训练,小ViT如何在检测分割姿态上全面突围
知乎 2026-03-23 00:00:00
71. 大模型的能效革命,边缘计算时代的能耗管理破局之路
百度 2026-01-27 00:00:00
72. 【技术科普】: 嵌入式场景下AOV解决方案—— 低功耗智能视觉的"续航革命"
微信公众号 2026-05-13 00:00:00
73. 黑光与低功耗,正掀起AI视觉的下一场革命
微信公众号 2026-04-22 00:00:00
74. 不用高端GPU,手机就能跑AI视觉模型?SmolVLM-256M爆火
今日头条 2026-02-17 00:00:00
75. 终端 AI 功耗高?天玑 SensingClaw 技术低功耗方案解析
知乎 2026-05-15 00:00:00
76. 颠覆性相机!传感+存储+处理三合一,低功耗改写机器视觉未来
今日头条 2026-03-24 00:00:00
77. 【arXiv26-Intellindust AI Lab】EdgeCrafter
微信公众号 2026-04-03 00:00:00
78. 轻量级本地部署的VLM模型哪个好?开源OCR文档解析模型如何选?开放世界视觉大一统模型进展又如何?
微信公众号 2026-02-09 00:00:00
79. 北大提出量化感知的视觉token剪枝框架
小红书 2026-04-17 00:00:00
80. 中科大
小红书 2026-04-12 00:00:00
81. 面向大型视觉语言模型的文本条件子空间重建视觉令牌剪枝
微信公众号 2026-03-26 00:00:00
82. ICLR2026,VLM基于注意力剪枝
小红书 2026-04-30 00:00:00
83. ICLR 2026 poster 效率与系统方向36篇论文整理二(内附源码)
微信公众号 2026-05-07 00:00:00
84. ICLR 2026 poster 效率与系统方向36篇论文整理三(内附源码)
微信公众号 2026-05-08 00:00:00
85. 当生物启发碰撞极致量化
微信公众号 2026-05-09 00:00:00
86. 综述推荐 |(哈尔滨工程大学潘海为等)面向视觉算法的知识蒸馏
微信公众号 2026-01-29 00:00:00
87. 知识蒸馏简介
微信公众号 2025-12-18 00:00:00
88. 模型蒸馏路线图
知乎 2026-04-18 00:00:00
89. 《解码“网词”》第九期|知识蒸馏
微信公众号 2026-04-13 00:00:00
90. 知识蒸馏技术详解
微信公众号 2026-02-25 00:00:00
91. 理想汽车发布Switch-KD | 跨模态知识迁移新范式,精度暴涨3.6分
微信公众号 2026-04-20 00:00:00
92. ICMR2024 | 当对比学习遇上知识蒸馏
知乎 2026-05-04 00:00:00
93. 大语言模型与知识蒸馏
今日头条 2026-03-24 00:00:00
94. 人工智能之知识蒸馏 第二章 知识蒸馏的核心原理与核心架构
知乎 2026-04-14 00:00:00
95. ICLR2025 数据增强与知识蒸馏技术相结合应用于图像超分辨率重建——AugKD
知乎 2026-04-13 00:00:00
96. 知识蒸馏如何将集成智能压缩为单一可部署AI模型
微信公众号 2026-04-18 00:00:00
97. AAAI 2026 | MEDALIGN
知乎 2026-04-29 00:00:00
98. 告别DFL!YOLO26轻量化架构的底层革新与计算机视觉落地重构
知乎 2026-01-21 00:00:00
99. 清华LSNet
微信公众号 2026-03-28 00:00:00
100. 中山大学FlashVLM
微信公众号 2025-12-25 00:00:00
101. 打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
微信公众号 2026-04-09 00:00:00
102. 告别冗余视觉特征!让多模态大模型轻装上阵
小红书 2026-03-27 00:00:00
103. 一文带你了解模型量化、剪枝和蒸馏
微信公众号 2025-12-17 00:00:00
104. 大模型应用
知乎 2026-03-28 00:00:00
105. 蒸馏、剪枝与量化
知乎 2026-01-06 00:00:00
106. 大模型「蒸馏+剪枝+量化」压缩 及落地部署
微信公众号 2026-04-26 00:00:00
107. AI大模型压缩加速全攻略
知乎 2025-12-09 00:00:00
108. 剪枝与知识蒸馏深度拆解
微信公众号 2026-04-22 00:00:00
109. 一文读懂【模型压缩 3 大核心技术】
微信公众号 2025-12-11 00:00:00
110. 模型瘦身核心技术!剪枝、量化、蒸馏,拆解边缘AI轻量化三大硬核手段
微信公众号 2026-05-12 00:00:00
111. AI普惠
微信公众号 2026-01-19 00:00:00
112. 小白也能懂-AI的大脑
微信公众号 2026-03-15 00:00:00
113. VisionTrim
抖音 2026-03-09 00:00:00
114. HTC-VLM: 混合令牌压缩视觉语言模型
小红书 2026-01-15 00:00:00
115. 微软开源Phi-4-reasoning-vision-15B
微信公众号 2026-04-15 00:00:00
116. 2.4B参数碾压同类!Jina-VLM
微信公众号 2025-12-17 00:00:00
117. 3.6k stars!在 Mac 上运行视觉大模型?mlx-vlm 让这件事超简单!
今日头条 2026-04-06 00:00:00
118. 阶跃星辰开源10B视觉语言SOTA模型!
小红书 2026-01-20 00:00:00
119. GitHub 7.6k Star, MiniMind-v满血版! 大道至简,轻量多模态新标杆.
微信公众号 2026-04-20 00:00:00
120. 大模型轻量化部署算法,低配服务器也能高效推理
知乎 2026-04-25 00:00:00
121. 大模型轻量化
知乎 2026-02-26 00:00:00
122. 大模型轻量化技术攻坚
今日头条 2026-06-02 00:00:00
123. 商汤发布轻量化多模态模型 Token消耗直降六成
今日头条 2026-05-09 00:00:00
124. 百度文心 ED4.0 发布!轻量化大模型颠覆行业,手机端也能流畅运行
今日头条 2026-03-24 00:00:00
125. 浙大端边协同新解法给VLM提速
小红书 2026-05-12 00:00:00
126. AI模型太大怎么办?模型压缩四大方法了解一下
https://bthvi-leiqi.blog.csdn.net/article/details/146451797
127. 【部署优化篇一】《DeepSeek模型压缩:剪枝+量化如何让AI模型「瘦身90%」不降智?DeepSeek模型压缩:剪枝+量化如何让AI模型「瘦身90%」不降智?》
https://wukong.blog.csdn.net/article/details/145741215
128. DeepMind:大模型可实现高效无损压缩图片和音频
DoNews
129. 2024年大模型轻量化技术研究报告|附125页PDF文件下载
130. 大模型轻量化技术,让AI跑的更快更省
131. 大模型压缩量化方案怎么选?无问芯穹Qllm-Eval量化方案全面评估:多模型、多参数、多维度
132. 大模型的“成本瘦身”运动
https://www.elecfans.com/d/2301795.html
133. 大模型压缩技术:在移动端实现智能投顾的突破
http://www.apppark.cn/mobile/news_t_55334.html
134. 《C++与AI共舞:模型压缩率与预测准确率的平衡之路》
https://developer.volcengine.com/articles/7444853500049260582
135. 海报|范建平
光明网
136. 开源小模型性能直逼千亿大模型,AI轻量化时代是否已悄然来临?
CSDN
137. VisionThink提出视觉令牌压缩新范式,驱动VLM效率革命
网易
138. 大模型争霸的下一站:不仅是超越GPT-4,更是寻求模型之间的平衡应用
TechSir
139. 警惕!大模型成本倒挂:你正在为模型的多余「思考」买单
网易
140. Qwen 团队这份 MoE 剪枝蒸馏实战手册请收好
微信公众号 2026-05-14 00:00:00
141. FlashVLM:文本引导多模态视觉Token 选择
小红书 2025-12-24 00:00:00
142. 硬核实战!轻量化模型部署 2026:3 步把大模型塞进终端,体积缩 10 倍、速度提 5 倍
微信公众号 2026-04-05 00:00:00
143. 轻量化大模型优化方法,低配置也能跑通高精度
百度 2026-05-07 00:00:00
144. 解决视觉推理过度思考! token用量最高降80%+还能涨精度,自适应推理框架AVR 【多模态大模型】
哔哩哔哩 2026-04-28 00:00:00
145. 用小型视觉语言模型做智能压缩!完美解决长视频理解上下文窗口瓶颈 【多模态大模型】
哔哩哔哩 2026-04-19 00:00:00
146. AI破壁计划 第133讲:模型压缩——让大模型“瘦身”上手机
今日头条 2026-04-05 00:00:00
147. 大模型压缩与蒸馏技术拆解:GPT-4o与Gemini官网如何实现模型瘦身
什么值得买 2026-04-15 00:00:00
148. 大模型瘦身术:量化与蒸馏技术全解析
微信公众号 2026-01-31 00:00:00
149. 大模型应用:轻量化视觉语言模型(VLM):基于Qwen2-VL多模态模型实践.87
知乎 2026-04-28 00:00:00
150. 文章收藏 剪枝与蒸馏的最佳实践
知乎 2026-04-25 00:00:00
151. 视觉预训练系统讲解(四):全景对比、多模态大模型实践、世界模型与常见问题
知乎 2026-04-26 00:00:00
152. 印度团队突破99.89%准确率,一如既往的high。轻量级视觉Transformer模型革新阿尔茨海默病诊断
微信公众号 2026-01-03 00:00:00
153. GitHub 开源 SmolVLM:小体积大能量!在消费级GPU上运行的视觉语言模型
微信公众号 2025-12-23 00:00:00
154. 手机芯片就能跑的AI视觉大模型!公司基于国产算力到全球SOTA水准
今日头条 2026-04-01 00:00:00
155. MobileMamba:轻量级多感受野视觉Mamba网络(CVPR2025)
微信公众号 2025-12-21 00:00:00
156. 模型压缩 | 模型剪枝篇,ResNet50模型剪枝,使用 DepGraph 进行结构化剪枝与模型微调,几乎无损剪枝(附完整代码)
微信公众号 2026-01-31 00:00:00
157. 模型太大跑不动!端侧轻量化部署实战:剪枝、量化、蒸馏一步到位
微信公众号 2026-05-07 00:00:00
158. MetaCompress:面向多轮对话的视觉Token压缩新范式
知乎 2026-03-26 00:00:00
159. 大模型轻量化技术攻坚:从千亿参数到端侧部署,重构AI落地底层路径
百度 2026-05-29 00:00:00
160. 华科大ViTCoP: 视觉文本协同剪枝加速大模型
什么值得买 2026-02-08 00:00:00
161. Variation-aware Vision Token Dropping for Faster Large Vision-Language Models | 阅后记录
知乎 2026-04-21 00:00:00
162. 轻量化网络架构设计:从MobileNet到最新趋势
知乎 2026-04-07 00:00:00
163. 大模型必学:KV Cache压缩技术全解,显存暴减、吞吐量翻倍!
今日头条 2026-04-12 00:00:00
164. LSNet:观大局,聚焦细节(CVPR2025)
微信公众号 2026-01-02 00:00:00
165. Glance2Gaze-多模态大模型视觉增强&视觉Token压缩-美团Nips2025 poster
知乎 2025-12-16 00:00:00
166. 文章收藏 AI模型知识蒸馏
知乎 2026-04-25 00:00:00
167. 2026年AI领域你不能不知道的常识 - 大模型常用压缩技术
知乎 2026-03-07 00:00:00
168. 一文搞懂大模型三大优化技术:量化、剪枝与蒸馏,让AI模型更轻量高效!
知乎 2025-12-18 00:00:00
169. 面向边缘网络的视觉语言模型:全面综述
知乎 2026-05-11 00:00:00
170. 绿色AI风口来袭!低功耗技术破解能耗难题
今日头条 2026-01-26 00:00:00
171. AI 大模型的部署与优化:提升大规模应用的性能与效率
知乎 2026-04-28 00:00:00
172. 微软开源1比特大模型推理框架BitNet,AI模型压缩迎来新突破
今日头条 2026-03-13 00:00:00
173. Transformer模型压缩
知乎 2026-01-07 00:00:00
174. 边缘学习技术详解:在资源受限设备上部署视觉模型的最佳实践
知乎 2026-04-08 00:00:00
175. CVPR26 | 跨域语义分割新突破:GKD让蒸馏模型继承VFM泛化能力
知乎 2026-03-07 00:00:00
176. 大模型推理优化三板斧:量化、剪枝、蒸馏
小红书 2026-06-01 00:00:00
177. 【左海集团】数智左海公司自主研发“深瞳-EdgeYOLO”实时视觉感知模型,以27M轻量化AI 技术赋能施工监管创新升级
微信公众号 2026-04-08 00:00:00
178. 【1 张图读懂 1 篇土木AI文献】Expert Syst Appl:基于剪枝与知识蒸馏的轻量化YOLO模型在混凝土结构裂缝分割与量化中的应用
微信公众号 2026-03-09 00:00:00
179. 【closerAI ComfyUI】本地推理的轻量级标杆视觉模型:腾讯youtu-VL,40 亿参数开启“全能视觉”轻量化新时代
知乎 2026-02-05 00:00:00
180. (AAAI 2026) 轻量级分组注意力模块,即插即用,永远开源!
微信公众号 2025-12-14 00:00:00
181. 【完结】多模态与视觉大模型开发实战 - 2026必会\n - 哔哩哔哩
哔哩哔哩 2026-02-08 00:00:00
182. AI革命如何推动低功耗芯片设计
微信公众号 2026-05-12 00:00:00
183. 边缘AI加速器:模型量化、剪枝与蒸馏的性能秘籍
哔哩哔哩 2026-04-05 00:00:00
184. 从0到1开发轻量化私有大模型技术实战资料学习 - 哔哩哔哩
哔哩哔哩 2026-05-28 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!302 88 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400198 365 -
iPhone 16 Pro 只要 2550 元,太离谱了!110 302
已收藏
去我的收藏夹