长上下文不是万能钥匙,多模态理解的真正战场在深度
05-22 18:33
精选参考来源
抖音 2026-05-04
新浪微博 2026-03-09
来源
精选参考来源
1. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
2. #科技先锋官# 别再被 GPT-5.4、DeepSeek V4 的超长上下文洗脑了!很多人以为上下文越长,AI 就越厉害,这完全是误区!真正决定 AI 实力的,从来不是能记住多少字,而是能不能思考、推理、落地做事。超长上下文只是锦上添花,强推理和多模态融合,才是下一代 AI 的核心杀招!只会读文档、背内容的 AI,再长的上下文也只是 “复读机”;能拆解难题、看懂图像、自主执行任务,才是真进化。为什么很多大模型参数再高、上下文再长,依然不好用?答案就在视频里。看完你会彻底明白:AI 的未来,拼的不是记忆,而是真正的专业能力。#过个有AI年##HOW I AI##微博超有用视频大赛##上微博涨知识##MWC2026# 种斌Marco的微博视频
新浪微博 2026-03-09 00:00:00
3. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?
知乎 2025-11-27 00:00:00
4. 毛利率不是冷冰冰的数字,是你对用户需求的理解深度。 #大咖观察 #红衣聊AI #毛利率 #创业之路
抖音 2025-11-26 00:00:00
5. 北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
微信公众号 2026-03-07 00:00:00
6. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
7. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
哔哩哔哩 2025-12-17 00:00:00
8. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
9. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI
抖音 2026-02-08 00:00:00
10. 狙击推理时代!英伟达200亿美元收购Groq,能否巩固AI帝国护城河?
哔哩哔哩 2025-12-31 00:00:00
11. #高德正式布局世界模型##高德将发布世界模型产品#已经取得超前成绩,并且还在招才纳士,这个世界模型来势凶猛。WorldScore是由著名华裔人工智能科学家、斯坦福大学教授李飞飞团队提出,是首个支持多模态世界生成模型统一评估的开源基准测试。而看到高德的模型已在空间智能评测基准WorldScore中,并已取得多项指标第一的成绩。这个成绩估计又将引起科技界的大回响,同时在招聘平台上也看到了相关岗位招聘中,包括具身智能产品专家、数据/算法工程师等方向。全面AI化,全方位转向空间智能,这是在全力打造AI智能圈,2026年也有更精彩的呈现。
新浪微博 2026-01-06 00:00:00
12. Agent时代,为什么多模态数据湖是必选项?
微信公众号 2026-01-15 00:00:00
13. 毛利率不是冷冰冰的数字,是你对用户需求的理解深度。 红衣大叔周鸿祎的微博视频
新浪微博 2025-11-26 00:00:00
14. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-30 00:00:00
15. 为什么我说,内存暴跌只是大家的一厢情愿,根本不可能成真【X.PIN】
哔哩哔哩 2026-04-18 00:00:00
16. 深度|OpenAI产品经理及后训练负责人:决定模型真正聪明程度的不是智能水平,而是它理解你的方式
微信公众号 2026-01-16 00:00:00
17. #DeepSeekV4和GPT6谁更值得期待# 从用户需求看,两者面向不同人群。普通用户、内容创作者更期待GPT-6,主动对齐意图、长文档处理、多模态生成更省心。开发者、企业、国内用户更看好DeepSeek V4,开源可本地部署、成本极低、适配昇腾芯片,能落地私有化场景。更期待哪方还是要看谁更贴合使用场景。
新浪微博 2026-04-07 00:00:00
18. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
19. 深度机智和他们的另一条路:用人类第一视角数据训练基座模型|甲子光年
微信公众号 2026-03-27 00:00:00
20. DeepSeek首次有了视觉能力,技术论文却被它连夜删掉了
微信公众号 2026-05-01 00:00:00
21. 问:上下文(Context)和上下文窗口(Context Window)什么差别?这两个概念经常被混用,但其实指的是不同层面的东西:上下文是指 AI Agent 在执行任务时实际拥有的所有信息,包括系统提示词、用户的对话历史、检索到的文档、工具调用的结果、记忆模块注入的内容等等。你可以把它理解为“Agent 此刻脑子里装的所有东西”。上下文是一个动态的、可以被工程化管理的概念——哪些信息该放进来、什么时候放、怎么组织,这就是现在越来越多人说的 Context Engineering。上下文窗口则是模型层面的一个硬性限制,指的是模型单次推理能处理的最大 token 数量。比如 128K、200K、1M 这些数字,说的就是上下文窗口的大小。它本质上是一个“容器的容量”。打个比方:上下文窗口是你厨房操作台的面积,上下文是你实际摆在台面上的食材、调料、菜谱和工具。台面就那么大(上下文窗口有上限),但你放什么上去、怎么摆放(上下文的管理)决定了你能不能高效做菜。在 Agent 开发中,一个核心挑战就是:Agent 需要的上下文往往远超上下文窗口的容量。对话越来越长、工具调用结果越来越多、检索的文档越来越大——这些都在消耗上下文窗口的空间。所以才需要各种策略来管理:摘要压缩历史对话、选择性检索而不是全量灌入、及时清理不再需要的中间结果等等。简单总结就是:上下文(Context)是“内容”,上下文窗口(Context Window)是“装内容的容器”。做 Agent 工程的核心功夫之一,就是在有限的“上下文窗口”里塞进最有价值的“上下文”。
新浪微博 2026-05-14 00:00:00
22. 断崖第一!深度机智Z-WM再夺WorldArena冠军
微信公众号 2026-05-18 00:00:00
23. 网页链接langchain发了篇官博,探讨了智能体如何利用文件系统进行上下文工程,以提升其性能和可靠性。智能体失败的主要原因并非模型能力不足,而是缺乏正确的上下文信息。上下文工程的目标是精准地将必要信息填入模型的上下文窗口,避免信息缺失、冗余或不相关。常见的上下文工程挑战包括: 信息过多(检索内容远超所需):如网络搜索返回大量无用内容,浪费token并增加成本。 信息过少或超出上下文窗口:复杂任务需大量信息,单次无法加载全部。 难以定位小众信息:所需信息埋藏在大量文件中,语义搜索效果有限。 缺乏持续学习能力:无法从交互中积累新知识。文件系统是解决这些问题的关键工具,其优势体现在: 作为“草稿板”:将大体积工具输出(如网页内容)存入文件系统,按需通过grep等工具提取关键信息,减少上下文占用。 动态管理上下文:存储长期计划、子任务结果或复杂指令,按需调用,避免系统提示过载。 精准搜索:利用ls、glob、grep等命令在结构化目录中快速定位特定文件、行甚至字符,尤其适合代码或技术文档。 持续学习与自我更新:智能体可通过用户反馈更新自身“技能文件”,将新知识写入文件系统,实现长期记忆与能力进化。#科技先锋官#
新浪微博 2025-11-23 00:00:00
24. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能
抖音 2025-12-13 00:00:00
25. 这次春节AI大战,国产模型与国产芯片第一次,双向奔赴! #春节世界观察 #新年囤点专业货 #燃起来了大国重器 #大咖观察 #红衣聊AI
抖音 2026-02-14 00:00:00
26. 终于,学界找到了深度学习的「牛顿定律」
微信公众号 2026-04-26 00:00:00
27. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
28. 第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型
微信公众号 2026-03-27 00:00:00
29. #DeepSeekV4发布# ---## 🏆 DeepSeek V4 vs 业界主流模型横向对比(2026年4月)### 📊 一、核心 Benchmark 成绩对比| 评测维度 | DeepSeek V4-Pro | Claude Opus 4.7 | GPT-5.5 | 说明 ||----------|:-:|:-:|:-:|------|| **MMLU**(多学科综合) | 90.1% | ~90%+ | ~92%+ | 旗鼓相当 || **GPQA Diamond**(研究生科学) | 90.1% | ~88% | ~89% | V4 略优 || **LiveCodeBench**(动态代码) | **93.5%** 🥇 | ~88% | ~85% | **V4 领先** || **Codeforces Rating**(竞技编程) | **3206** 🥇 | 未公开 | 未公开 | **开源最高** || **SWE-Bench Verified**(工程代码) | 80.6% | **87.6%** 🥇 | ~75-80% | Claude 领先 || **AIME 2026**(数学竞赛) | **99.4%** 🥇 | ~95% | ~96% | **V4 接近满分** || **IMO Answer Bench**(奥数) | 88.4% | 未公开 | 未公开 | 极强 || **FrontierMath Tier 4**(前沿数学) | 23.5% | 约2% | 约2.1% | **V4 领先约11倍** || **C-Eval**(中文综合) | **93.1%** 🥇 | — | — | 明显优势 || **上下文窗口** | **1M token** 🥇 | ~200K | ~128-400K | **V4 最长** |---### 💰 二、价格对比(每百万 token)| 模型 | 输入价格 | 输出价格 | 相对 V4 倍数 ||------|:-------:|:-------:|:----------:|| **DeepSeek V4-Pro** | ~¥4 | **$3.48** | 1× 基准 || GPT-5.5 | — | ~$70+ | **约 20× 贵** || Claude Opus 4.7 | — | ~$35 | **约 7× 贵** || GPT-5.4 | — | ~$15 | **约 4.3× 贵** || Claude Opus 4.6 | — | ~$25 | **约 7.2× 贵** |---### 🎯 三、能力雷达:各模型擅长领域| 模型 | 最强项 | 相对弱项 ||------|--------|----------|| **DeepSeek V4-Pro** | 数学推理、竞技编程、超长上下文、成本 | 视频/音频多模态、创意写作 || **Claude Opus 4.7** | 工程代码(SWE-bench第一)、自我纠错、金融代码 | 价格昂贵、无开源 || **GPT-5.5** | 综合生态、全模态(音视频)、工具链 | 价格最贵、上下文较短 || **Gemini 3.1 Pro** | 超长上下文、Google生态集成 | 中文能力、推理模型待追赶 |---### 🔑 四、一句话总结| 场景 | 推荐 ||------|------|| 🧮 数学/科研推理 | **DeepSeek V4-Pro**(AIME 99.4%,FrontierMath 领先11倍)|| 💻 工程级代码修复 | **Claude Opus 4.7**(SWE-bench 87.6% 全球第一)|| 🎥 多模态(音视频) | **GPT-5.5**(原生支持音频/视频) || 📄 超长文档处理 | **DeepSeek V4**(1M 上下文,成本极低)|| 💸 性价比极致 | **DeepSeek V4-Flash**(约是 GPT-5.5 的 1/20 价格)|| 🇨🇳 中文任务 | **DeepSeek V4-Pro**(C-Eval 93.1%)|---**总体来看**:DeepSeek V4 在**数学推理和竞技编程**上已是全球最强,工程代码略输 Claude Opus,综合生态和多模态暂落后 GPT-5.5——但以约 **1/20 的价格**打出这个成绩,性价比无出其右。对于开发者来说,它是目前最值得优先考虑的开源选择。
新浪微博 2026-04-24 00:00:00
30. 大模型上下文工程指南
知乎 2026-04-12 00:00:00
31. 互联网技术 DeepSeek这次悄无声息的更新确实展现了技术上的重大突破。上下文窗口从128K直接跃升至1M,意味着模型能一次性处理《三体》三部曲级别的超长内容,这不仅是参数量的提升,更是架构稳定性和内存管理能力的质变。知识库更新至2025年5月也让模型对近一年的技术动态和行业趋势有了原生理解,显著提升了实用性。值得注意的是,新模型在保持强大推理能力的同时,交互体验更加细腻自然,被评价为可媲美Claude 3.5 Sonnet。这次更新很可能是DeepSeek-V4正式发布前的关键测试,延续了其在春节前后推出颠覆性更新的传统。虽然未包含多模态能力,但在纯文本处理上已实现对国际顶尖模型的追赶甚至超越。对于开发者而言,1M上下文窗口将彻底改变工作流程,能够直接分析完整项目代码库进行全局优化。这次更新不仅展现了DeepSeek的技术实力,也为国产大模型的商业化落地开辟了新路径。大家觉得这样的上下文长度扩展会在哪些领域产生最直接的影响呢?
新浪微博 2026-02-11 00:00:00
32. 市值近600亿,大模型公司上市了! #AI #智谱ai
抖音 2026-01-10 00:00:00
33. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
微信公众号 2026-02-03 00:00:00
34. #DeepSeekV4还有多远#之前V4一直传4月发布,现在专家模式直接用上疑似V4雏形的MoE新架构,主打深度推理解决复杂问题,和快速模式做了明确场景分层。 看DeepSeek最近节奏:1月Engram条件记忆、2月DualPath推理框架,3月还搞了V4 Lite测试,3月底宕机就是在做算力扩容。种种迹象表明V4大概率4月中下旬登场,会补齐多模态短板,整合双模式优势。
新浪微博 2026-04-09 00:00:00
35. 端到端,VLA,世界模型都是什么意思?
哔哩哔哩 2025-12-03 00:00:00
36. #科技先锋官# 谷歌 Project Genie 横空出世,文本图片一键生成可交互游戏世界,直接让游戏股集体暴跌,也让它成了科技圈最具争议的焦点! 有人说它是谷歌的王炸,丰富 AI 订阅服务、落地 Gemini 多模态能力,反哺模型迭代还打通生态闭环,让谷歌在 AI 格局中占据绝对优势。也有人骂这是市场过度恐慌,Genie 如今功能受限,既无完整游戏逻辑,也无法替代传统引擎,根本撼动不了 Take-Two、Roblox 的商业模式。 Meta、英伟达也在加紧布局世界模型,AI 造世界到底是颠覆行业的革命,还是徒有噱头的技术试水?看完这条视频,带你看清背后的真相!#微博超有用视频大赛##上微博涨知识##AI生活指南# http://t.cn/AXqrFsNg
新浪微博 2026-02-01 00:00:00
37. 神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!
微信公众号 2026-03-19 00:00:00
38. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格
微信公众号 2026-02-05 00:00:00
39. DeepSeek多模态能力为零这件事,很多人觉得是短板。我反而觉得这是一个极其清醒的战略选择。你看字节、阿里、月之暗面,都在往“什么都能干”的方向堆功能,恨不得一个模型又能写诗又能剪视频又能读PDF。这很合理,因为C端用户确实需要一站式体验,这个逻辑完全可以理解。但DeepSeek选择把所有资源砸在推理深度上,不碰图像,不碰视频,就死磕逻辑链条的纯度。这让我想到一句话:当所有人都在比谁的瑞士军刀功能多的时候,手术刀的价值反而凸显了。 多模态是锦上添花,但推理能力是地基。地基打到全球第一梯队,上面想盖什么楼都来得及。反过来,地基不行的多模态,想要补起来可不那么容易。 #DeepSeek还是最强国产AI吗# deepseek还是最强国产ai吗
新浪微博 2026-04-28 00:00:00
40. 使用 Claude Code:会话管理与 100 万上下文
知乎 2026-04-16 00:00:00
41. 面向实战的多模态数据生成与表征技术创新
知乎 2026-01-07 00:00:00
42. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代
抖音 2026-01-09 00:00:00
43. #雷军公布小米机器人最新进展##小米发布机器人基座模型#就在刚刚,我米技术对外发布开源VLA模型Xiaomi-Robotics-0,该模型有47亿参数,兼具视觉语言理解与高性能实时执行能力,刷新多项SOTA。采用MoT架构,大脑VLM理解人类指令、捕捉空间关系,小脑Action Expert生成平滑动作,训练上采用两阶段法,先跨模态预训练,再后训练,解决真机动作断层等问题。在测试中,在仿真测试和现实真机任务中表现优异,保持了VLM多模态理解能力,将模型开源,有望推动机器人在工业、服务业、家庭等场景的应用,加速具身智能落地,相信很快就会运用在更多的生态产品上。 而Xiaomi-Robotics-0机器人基座模型,Benchmark全面超越OpenVLA和Pi,跻身行业第一梯队,结合近期Mimo等成果,我米AI成长迅猛,且开源VLA与触觉模型,构建完整手脑技术栈,务实推进,为机器人商用铺路。
新浪微博 2026-02-12 00:00:00
44. 【重磅解读】谷歌Gemma 4杀疯了:小模型性能炸裂,真正实现商用自由!
哔哩哔哩 2026-04-03 00:00:00
45. 三大模态模型全部登顶后,昆仑万维正式披露了 2026 年 AGI 战略
微信公众号 2026-03-30 00:00:00
46. DeepSeek v4全面支持百万上下文 token,这意味着什么?到底有多厉害?
知乎 2026-04-26 00:00:00
47. 万能分割X2SAM:一个模型搞定任意图像+视频分割!
知乎 2026-05-15 00:00:00
48. #Google发布Gemini3.1Pro# 几乎同时马斯克旗下xAI发布Grok-3和谷歌DeepMind发布Gemini 3.1 Pro。这两款模型之间不知道新秀的乱拳厉害还是老师傅的筋骨更坚韧,不过当前AI市场格局正在悄然的变化着已经是越发明显了。谷歌凭借生态优势抢占全场景赛道,xAI则以免费策略和马斯克的影响力快速圈粉。Gemini 3.1 Pro主打多模态全能性,集成视频、音乐生成功能,深度适配移动端,交互流畅,但在专业推理场景的针对性不足。Grok-3依托十万级H100 GPU集群,思维链推理能力突出,数学、科研场景表现优于前者,且具备DeepSearch实时检索功能,不过多模态稳定性欠佳,图像处理能力有限。Gemini 3.1 Pro聚焦复杂问题解决者,主打全场景落地,兼顾消费级与专业级需求,侧重软硬件生态联动。Grok-3以追求事实真相为核心,主打免费开放的普惠路线,深度绑定X平台,侧重实时信息整合与高效推理,瞄准大众用户与科研爱好者。#过个有AI年##HOW I AI#
新浪微博 2026-02-20 00:00:00
49. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-03 00:00:00
50. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。
新浪微博 2026-03-31 00:00:00
51. #DeepSeekV4和GPT6谁更值得期待#GPT-6大概率4月14号就来,DeepSeek V4也箭在弦上最快月内有消息。两边几乎同时亮剑,这波中美大模型的较量正式进入白热化阶段。GPT-6这次据说是奔着AGI去的全新架构,代号“土豆”,性能号称暴涨40%,200万token上下文加上原生多模态,看起来就是冲着“全能旗舰”去的。而DeepSeek V4走的是另一条路——它跟华为昇腾芯片深度绑定,从CUDA迁移到国产架构,极致性价比+百万上下文多模态,明显是想用工程能力打破算力封锁。一个秀天花板,一个卷供应链和成本。不管怎么选,这波最大赢家都是用户。
新浪微博 2026-04-07 00:00:00
52. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说
哔哩哔哩 2026-04-10 00:00:00
53. 深度|2026具身智能的关键分水岭:谁将重新定义“通往物理世界的模型层”?
微信公众号 2026-03-27 00:00:00
54. 大模型上下文越长越厉害吗?agent时代,上下文长度与推理准确性的底层逻辑
知乎 2026-02-27 00:00:00
55. 大模型如何解决上下文长度问题
知乎 2026-03-06 00:00:00
56. 为什么AI大模型都在拼“上下文长度”?
微信公众号 2026-04-10 00:00:00
57. Gemini3.1Pro和GPT5.5上下文长度对比窗口差八倍体验差多少
今日头条 2026-05-16 00:00:00
58. AI 大模型领域 12 个核心概念-上下文长度 (Context Length)
今日头条 2026-05-04 00:00:00
59. 一文看完多模态
微信公众号 2026-04-16 00:00:00
60. MIBench
小红书 2026-03-19 00:00:00
61. 🧠 Omni
小红书 2026-04-29 00:00:00
62. 所有多模态模型都过时了?字节跳动 Omni 震撼发布
微信公众号 2026-04-28 00:00:00
63. 首个大视觉语言模型多模态长期记忆基准!两种方案谁更靠谱?【多模态大模型】
哔哩哔哩 2026-05-16 00:00:00
64. 多模态大模型 前沿算法与实战应用教程
知乎 2026-05-12 00:00:00
65. 第十五章 让AI学会看和听
知乎 2026-03-26 00:00:00
66. 对长上下文能力有不同要求,怎么选择合适的模型?
知乎 2025-12-17 00:00:00
67. 阿里Qwen3-VL多模态大模型
知乎 2026-01-04 00:00:00
68. 如何使用前沿视觉语言大模型
知乎 2025-12-01 00:00:00
69. VL模型的视觉推理能力 还不如 三岁小孩 ?
小红书 2026-01-15 00:00:00
70. Mirage
小红书 2026-03-27 00:00:00
71. 🤔 你知道CoT,视觉思维链COVT又是个啥?
小红书 2025-11-26 00:00:00
72. 看见的形状
哔哩哔哩 2025-12-31 00:00:00
73. CVPR 26 | 内卷终结者?复旦提出CLCR,分层解耦才是多模态学习的未来!重新定义多模态表征学习
微信公众号 2026-04-07 00:00:00
74. LLM2CLIP
微信公众号 2026-01-30 00:00:00
75. 🚀字节这模型居然能跨模态推理
小红书 2026-04-28 00:00:00
76. 多模态模型只会看图不会推理?ICLR 2026两种方案让视觉模型也能深度思考
知乎 2026-05-19 00:00:00
77. 突破多模态推理瓶颈!DeepSeek全新范式
微信公众号 2026-05-01 00:00:00
78. DMLR: 动态多模态潜在推理
小红书 2026-01-01 00:00:00
79. Vedas
小红书 2026-04-24 00:00:00
80. 拆解GPT-5.5多模态能力
知乎 2026-05-14 00:00:00
81. 多模态与视觉大模型开发实战-2026年必会(完结)
知乎 2026-05-09 00:00:00
82. "多模态"通俗易懂的理解
知乎 2026-04-08 00:00:00
83. 【AI论文解读】颠覆认知!统一多模态模型生成能力竟然通常不涨点?| 全新基准解答生成到底何时帮助理解
哔哩哔哩 2026-04-06 00:00:00
84. 破解统一多模态模型理解强生成弱。近年来,统一多模态模型(UMM)在整合视觉理解和生成方面取得了显著进展,展现出在复杂文本到图像(T2I)任务中的巨大潜力。
抖音 2026-03-11 00:00:00
85. 统一多模态模型理解能力能否指导视觉生成?
小红书 2026-01-25 00:00:00
86. 【完结】多模态与视觉大模型开发实战 - 2026必会
知乎 2026-01-14 00:00:00
87. 剑指世界模型!商汤发多模态理解生成一体化架构,无需编码器“玩转”图像
今日头条 2026-03-07 00:00:00
88. 要理解深度学习,必须突破常规视角去理解优化
知乎 2025-12-25 00:00:00
89. 全能多模态大模型Omni:全新上下文展开机制,单模型统一图文视频3D推理生成 【多模态大模型论文解读】
哔哩哔哩 2026-04-28 00:00:00
90. 《理解深度学习》第1课讲义-深度学习的核心与伦理
知乎 2026-01-05 00:00:00
91. 深度学习在自然语言中的自然语言理解
知乎 2025-12-25 00:00:00
92. 大型多模态模型新思路:上下文分类新思路
小红书 2026-03-06 00:00:00
93. 多模态模型只会看图不会推理?ICLR 2026一种方案让Vision模型学会深度思考
知乎 2026-05-14 00:00:00
94. 【博士论文】基于多模态基础模型的上下文学习
微信公众号 2025-12-18 00:00:00
95. 动手学深度学习(四十四)PyTorch 实现深度循环神经网络:从记忆到分层理解
微信公众号 2026-04-17 00:00:00
96. 2026年,多模态模型的研究会走到哪一步?
小红书 2026-01-02 00:00:00
97. 多模态DeepResearch,成了!
今日头条 2026-02-24 00:00:00
98. LLMind:视觉-语言模型的生物启发式无训练自适应视觉表示(CVPR2026)
微信公众号 2026-04-25 00:00:00
99. 12.1-3|多模态多标准评判基准;多模态迭代推理图像编辑;语义记忆持续学习训练
微信公众号 2025-12-01 00:00:00
100. 预训练长度不够用?ICLR 2026四种位置编码扩展方案搞定长上下文外推
知乎 2026-05-10 00:00:00
101. 科研进展 | 创艺学院田政课题组联合生医工学院张寒课题组提出多模态大语言模型动态交互评测基准KidGym
微信公众号 2026-04-01 00:00:00
102. 中科算网算泥社区:2026多模态大语言模型技术发展报告(可下载)
微信公众号 2026-03-07 00:00:00
103. 学术报告|从现象理解深度学习
微信公众号 2026-03-23 00:00:00
104. 通过去除位置嵌入扩展预训练大语言模型的上下文长度
哔哩哔哩 2026-02-22 00:00:00
105. 北京大学袁粒:多模态统一建模:扩散与自回归之争
哔哩哔哩 2025-12-17 00:00:00
106. 上下文的力量:多模态改善图像超分辨率(CVPR2025)
微信公众号 2025-12-14 00:00:00
107. InternVL-U:生成和理解一体的多模态大模型
小红书 2026-03-15 00:00:00
108. OpenCode 接本地 Ollama 一直不会调工具?排查一上午,最后发现是上下文长度的坑
知乎 2026-04-10 00:00:00
109. 2025多模态大模型:技术革新与应用突破
今日头条 2026-02-19 00:00:00
110. 🚀多模态统一模型居然能理解并生成图像
小红书 2026-04-25 00:00:00
111. AAAI 2026 | PulseMind:面向真实临床多轮对话的医疗多模态模型!
微信公众号 2026-05-04 00:00:00
112. 性能对齐封闭模型,Qwen3-VL 多模态双模型上线模力方舟
微信公众号 2026-01-21 00:00:00
113. 算力|从上下文看存储趋势:上下文长度激增,显存优化不改存力爆发需求
微信公众号 2026-03-31 00:00:00
114. 2026多模态大语言模型技术发展报告
小红书 2026-03-02 00:00:00
115. 多模态文档解析模型整理
小红书 2026-02-06 00:00:00
116. Qwen3-VL-Embedding:阿里通义开源的多模态信息检索模型,助力高效跨模态理解与检索
微信公众号 2026-01-28 00:00:00
117. 让 AI "看懂"世界!一文搞懂视觉语言模型(VLM)
微信公众号 2026-02-15 00:00:00
118. OpenDriveVLA:迈向基于大规模视觉-语言-动作模型的端到端自动驾驶
微信公众号 2026-04-06 00:00:00
119. Omni Model vs Pipeline 多模态实现方式优劣对比报告 - 哔哩哔哩
哔哩哔哩 2026-05-16 00:00:00
120. 语言先验👉大模型Mental Visual Reasoning
小红书 2025-12-19 00:00:00
121. AI大模型如何提高上下文长度?
知乎 2025-11-25 00:00:00
122. 大AI模型赋能多模态语义通信:LAM-MSC框架的创新与实现【附python代码】
微信公众号 2026-04-07 00:00:00
123. 首个统一多模态模型评测工具箱来了!解决现有评测痛点,揭示训练 trade-off 【多模态大模型】
哔哩哔哩 2026-04-23 00:00:00
124. 刚刚,小米发布Xiaomi MiMo-V2.5系列大模型,百万上下文长度
知乎 2026-04-23 00:00:00
125. 入选 CVPR 2026!多模态评测发展的下一个风向标
微信公众号 2026-04-21 00:00:00
126. AAAI 2026|SDEval:首个面向多模态模型的安全动态评估框架
微信公众号 2025-12-16 00:00:00
127. Unsloth实现50万上下文长度微调:单卡H100训练gpt-oss-20b
微信公众号 2025-12-08 00:00:00
128. 如何使用前沿视觉 LLMs:Qwen3-VL
知乎 2026-03-18 00:00:00
-
罗永浩怒斥电视机厂商:不毁灭没天理!170 539 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚150 378 -
快把随手买的套套扔掉!赤尾这三款王炸,解锁情侣完美亲密体验226 143 -
韩路谈携程被罚51.79亿:家里三个手机 自己级别最高价格却最贵108 265
已收藏
去我的收藏夹