张大妈

AR试衣、VR开会,多模态交互是噱头还是真需求?

源自212位全网作者

05-21 18:07

内容由AI生成

精选参考来源

1. 【元宇宙】2025 年的 VR 和 AR:突破还是停滞?

2. 走出屏幕,多模态智能硬件如何承载最新的 AI?

3. 商汤SenseNova U1:原生多模态统一模型的范式革命

4. 谷歌发布 Gemini3Pro,其多模态理解和生成能力将如何影响 AI 发展?

5. 会议交互进入全新时代 ,成者StarryHub会议星AI会议机器⼈实测

6. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

7. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】

8. 跨OS GUI智能体基础设施白皮书——重新定义人机交互自动化|甲子光年智库

9. 泡泡玛特悉尼旗舰店盛大开业! 南半球最大门店12月20日登陆悉尼核心CBD,超600平米,呈现沉浸式的购物与潮流创意空间。 配合开业店外落地泡泡玛特号帆船,载着IP跨海来到悉尼最繁华的中心街道,店内更有实景AR互动实现IP与消费者的互动,快来跟着视频一起体验吧! #泡泡玛特 #泡泡玛特悉尼 #悉尼旗舰店 #澳洲生活

10. #微博声浪计划##听见微博# DeepSeek正式跨入图文交互时代,5月9日开放“识图模式”,以“视觉原语思考”框架解决“指代鸿沟”,算力效率超GPT等模型10倍,适配国产昇腾芯片。实测能识别清代玉器、转化网页截图为HTML、解答立方体题等,覆盖多场景。用户反馈褒贬不一,企业版已接入金融医疗,正寻求500亿融资,推动国产AI多模态竞争升级。 科技小意的微博音频

11. MWC 2026:科大讯飞40克AR翻译眼镜背后,一家中国光学厂商正在定义AR产业的“交付标准”

12. Cell Reports Medicine(一区|IF=10.6)|人工智能驱动的多模态成像集成在神经精神疾病精准医疗中的应用

13. 把飞行乐趣还给我!全景无人机选购指南

14. 【VR寒冬】Meta大砍VR预算转向AI赛道 | 快问快答

15. Agent时代,为什么多模态数据湖是必选项?

16. 北交&地平线提出DIVER:扩散+强化的多模态规划新框架

17. 【元宇宙】VR 会议对比实体活动:如何最大化投资回报率和覆盖范

18. 2026年了还在徒手整理会议记录?快用AI来帮忙!思必驰、科大讯飞、BOOX文石哪块才是办公er的本命AI办公本?全方位对比!

19. 【元宇宙】智能眼镜和VR:2026年最重要的三大趋势

20. 个人AI已在路上,带你体验2026 MWC的未来科技!

21. 完了,我做的这只猫开始监视我了…【AI桌宠开源】

22. 对话 rabbit 吕骋:活下来的 AI 硬件先行者,熬出人机交互的下一个时代

23. DeepSeek发布多模态论文又连夜删除

24. 天玑 AIDV 智能体座舱让「AI 定义汽车时代」来临!👁️ 全模态交互:座舱可理解语音、视觉、听觉、情绪、健康、环境等信息,随时与你感同身受🤖 主动式服务:Always-On 的感知能力,预判需求,主动提供服务🚗 并发任务执行:全场景、多用户、多并发的复杂任务,都能自行拆解,并行处理☁️ 端云协同:本地与云端算力无缝接力,兼顾安全、响应时间与智能智能体化座舱体验,不再只是「一问一答」,更是「你没说的,它也懂」✨#MDDC2026##天玑开发者大会#

25. 今晚华为乾崑不仅带来了#华为乾崑智驾ADS5# 还有鸿蒙座舱Harmony Space6,带来了全新一代的舱内感知、智慧交互和移动营业,包括行业唯一的鸿蒙座舱AI多模态感知系统AMS、小艺也升级为行业首个全场景跨域交互座舱智能体,小艺甚至多了个伙伴——AI陪伴机器人哈蒙蒙,还有行业首发的双17.2英寸+3.4K蝶羽双联屏。

26. 独家|玄华智能完成数千万元天使轮融资,百度“三驾马车”创始人打造交互式AI知识伙伴

27. 香港2亿AI诈骗案细节曝光,视频会议里只有你是真人

28. 会议整理从30分钟到5分钟:通过TicNote AI 录音卡片,我在职场效率直接开挂 !

29. 当智能座舱开始“感知呼吸”,意义已经不只是交互升级。#鸿蒙座舱可识别后排乘客胸腔起伏#华为这套AMS舱内AI多模态感知系统,挺牛逼的,核心在于基于多普勒效应的微动感知能力,通过视觉、毫米波与算法“三合一”融合,实现活体检测、在位识别与高精度状态感知,并可主动提醒与风险预警,把座舱感知从“看得到”升级为“看得懂”。更重要的是,智能座舱正从功能体验迈向主动安全。AMS可实时感知全车乘员状态,通过多通道预警形成从感知、判断到干预的安全闭环,把Safety First落到每一次出行。在家庭出行、宠物陪伴、长途驾驶等真实场景中,这种“无感守护+主动关怀”的体验,让鸿蒙座舱从智能交互进一步进化为情感化陪伴,太强了!

30. #鸿蒙座舱可识别后排乘客胸腔起伏# 鸿蒙座舱AMS舱内AI多模态感知系统,依托多普勒效应实现微动精准捕捉,搭配“三合一”融合架构,可实时识别后排乘客胸腔起伏,完成活体检测、在位识别与生命体征监测。从驾驶员状态到全车乘员安全,系统构建全时域感知、智能判断、多通道预警的主动安全闭环,兼顾家庭出行、长途驾乘、宠物随行等场景。以Safety First为核心,让智能座舱从便捷交互进阶为无感守护,用硬核技术筑牢全舱安全防线,彰显华为座舱感知领域的领先实力。

31. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

32. 把同声传译戴在脸上,亮亮视野AR翻译眼镜Hey2体验

33. 头部车企AIGC全域营销革新:全链路即兴多模态渲染短视频,刷屏全网社交阵地 恰逢2026北京车展流量窗口期,一套轻量化、高互动、强转化的AIGC全新车企营销玩法快速走红全域社交媒体平台,刷屏各大流量阵地。奥迪、蔚来等主流车企头部品牌率先试水规模化落地,依托Sora 2.0同级高阶多模态生成式大模型,重磅上线全民可参与、实时可生成的新车即兴广告定制生成专属服务。现场用户仅需极简输入个人日常出行习惯、用车场景偏好、审美风格倾向等基础轻量化信息,后台AI即可秒级联动多模态渲染算力,实时生成专属定制化超写实高清短视频,画面可自由适配火星星际、深海秘境、赛博朋克都市等多元个性化沉浸式场景,实景呈现用户专属座驾全域驾乘动态效果。五一假期车展流量高峰叠加社交传播红利,这套AIGC交互式沉浸式创新营销模式,全域用户停留时长、主动互动率、线下到店转化量均遥遥高于传统营销,商业落地成效直观凸显。行业前瞻预判,传统静态平面海报、标准化量产TVC汽车广告将加速退场,千人千面、一人一景、实时定制的AIGC原生生成内容,将全面接管车企全域营销主阵地,AI彻底抹平专业视觉内容创作门槛,重构汽车行业全域营销生态。

34. VR产业2026预测:游戏大作落幕、设备全面提价、大空间当兴!

35. #微博声浪计划##听见微博# iOS26.4前瞻:Siri融合Google Gemini大模型,实现多模态交互,但高阶功能仅限A17 Pro/M3以上芯片,国行或缩水。密码自动填充、AirPods定位等实用功能升级,健康应用重构引分歧。旧机型兼容性存忧,建议新机型尝鲜,旧机型谨慎评估。 科技开的微博音频

36. 这次荣耀Magic V6发布会上,荣耀宣布与电影级摄影机品牌ARRI达成深度技术战略合作,通过四自由度云台系统随音起舞;多模态大模型交互灵动;三轴云台配合AI防抖引擎稳若行云,把电影感的故事带到每个人的生活中,荣耀与ARRI 重新定义手机影像上限,正式开启移动电影时代。#荣耀Magic V6折叠大满贯##荣耀Magic V6#

37. 天玑AIDV智能体座舱重磅亮相,正式开启AI定义汽车时代!它搭载全模态交互能力,精准读懂语音、视觉、情绪、健康及环境信息,真正做到与你感同身受。凭借Always-On全天候感知,实现主动式服务,提前预判需求、贴心响应。更支持多用户、多场景并发任务执行,复杂需求轻松并行处理;端云协同无缝衔接,安全、速度与智能一步到位。 MediaTek还带来三大开发捷径:更强AI座舱平台、便捷AI开发工具、全开放生态系统,携手开发者共筑主动式智能座舱新体验,让未来出行更懂你!#MDDC2026##天玑开发者大会#

38. 【豆包大模型日均Token使用量飙至120万亿!三个月翻倍,一年暴涨1000倍】4月2日,火山引擎举办AI创新巡展,公司总裁谭待现场公布重磅数据:豆包大模型当前日均Token处理量正式突破120万亿 。这一数字不仅较三个月前实现翻倍增长,更相较2024年5月约1200亿的日均水平,实现了惊人的1000倍跃升 。如此迅猛的增长节奏,远超行业平均增速,反映出豆包在真实业务场景中的高频调用、多模态任务承载能力及终端用户渗透率的全面突破 。从API调用量、智能体交互频次到长文本理解与实时生成需求,底层算力与模型效率的协同优化正持续释放规模化价值 。业界普遍认为,该指标已成为衡量大模型落地成熟度的关键风向标之一 。

39. 阿里云发布多模态交互开发套件

40. 独家|VUI Labs宇生月伴完成数千万元天使+轮融资,同创伟业领投,打造行业领先的情感语音大模型和多模态Agent

41. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

42. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!

43. #夸克AI眼镜持续霸榜第一#智能眼镜赛道迎来颠覆性突破夸克AI眼镜已连续三周稳居智能穿戴设备销量榜首,成为本季度最受关注的AI硬件产品。这款集成了增强现实与人工智能技术的眼镜,正在重新定义人机交互的边界。产品核心突破:多模态交互系统:支持语音、手势及眼动操控实时AI服务:会议速记准确率达98%,支持40种语言实时互译轻量化设计:重量仅48克,续航达18小时市场反响热烈:首批用户反馈显示,该产品在商务、教育、旅游等场景表现突出。数码博主@科技新知 评价:"这是首个将AI能力无缝融入日常生活的成熟产品。"行业意义:夸克AI眼镜的持续热销,标志着AI硬件从概念验证阶段迈入规模化商用,为整个行业注入了新的活力。分析师认为,这种"AI+光学"的创新组合,或将开启下一代计算平台的竞争序幕。

44. SenseNova U1开源:8B参数原生统一多模态模型

45. “VR+AI”重塑人机交互及内容生态分论坛在青岛虚拟现实创享中心成功举办

46. Nature | 统一的多模态学习模型

47. 阿里妈妈发布MUSE:用多模态搞定十万级超长行为序列,并开源Taobao-MM数据集

48. 混合研究新路径:多模态内容分析法及其应用

49. 天玑 AIDV 智能体座舱全模态交互:座舱可理解语音、视觉、听觉、情绪、健康、环境等信息主动式服务:Always-On 的感知能力,预判需求,主动提供服务并发任务执行:全场景、多用户、多并发的复杂任务,都能自行拆解,并行处理端云协同:本地与云端算力无缝接力,兼顾安全、响应时间与智能MediaTek 天玑座舱平台 C-X1,内置 NVIDIA GPU 座舱芯片,拥有媲美主机级图形渲染能力、硬件级光线追踪技术,并支持 DLSS 神经网络渲染技术,可为乘客打造 4K60 帧的 3A 游戏体验。#MDDC2026##天玑开发者大会#

50. 高效沟通与协作:让邮件、会议、 日程不再占用你的时间(会议纪要革命:从手动记录到AI自动生成)

51. 内存芯片成本飙升,Meta官宣全线上调Quest VR头显价格,最高涨价100美元!

52. 边聊天也能边导航,添加/切换途经点全程语音操作?全新的鸿蒙座舱小艺智能体到底怎么样。

53. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

54. 【直播回放】解析谷歌Gemini 3:“AI 全模态”时代与Scaling Law的极致执行

55. #我的AI穿搭大秀# 看到淘宝推出AI试穿功能,我忍不住赶紧试了下。只需要上传全身照片,即可一键试衣,还可以先选择喜欢上衣,然后再搭配裤子,看整体效果。这个功能我觉得很有意义,一方面可以解决网购衣服不合身,退货率高的问题;另一方面还可以帮助不会搭配的人,提升穿搭效果。AI正在重塑人的购物习惯,大家可以体验下……#上淘宝AI购物#

56. #谷歌开发者大会# 带来多项重磅技术更新,Gemini 3.5 Flash模型全球免费开放,支持多模态处理与自然语言视频剪辑。 还发布Gemini Omni、Veo 3、Imagen 4系列模型,AI搜索模式、Android XR平台同步上线。开发门槛大幅下降,文本就能生成APK应用,应用分发与人机交互迎来变革,行业竞争将聚焦AI智能体协作能力。

57. 今年除夕看春晚,弹幕刷屏的不是“马年大吉”,而是“豆包这包袱啥意思”“豆包帮我解释下这个梗”……全网都在找豆包帮忙解说节目、扒冷知识、拆段子,感觉豆包突然成了春晚的“实时字幕君+梗王”。作为科技AI博主,我得说这不是巧合。春晚这种国民级直播,实时交互、海量并发、内容不确定性极高——观众问题五花八门,从典故到无障碍需求,一秒钟都不能卡。豆包能扛住,得益于背后火山引擎的硬核支撑:独家AI云合作伙伴,从节目制作(Seedance 2.0生成视觉特效、机器人人机交互)到直播实时合成祝福语,全链路兜底。豆包2.0的多模态理解、长上下文推理、快速响应,让它在亿级流量下稳如老狗,解释通俗、追问扩展还准,难怪大家边看边问,边问边笑。今年春晚不一样了,以前我们被动看节目,现在边看边和AI聊天,节目冷门梗秒懂、亲戚难题AI教你怼(“啥时候结婚?”豆包:时机到了自然水到渠成,先问问您老人家最近身体咋样?),科技悄无声息地把围观变成互动,把代际隔阂变成全家一起玩的乐子。这届春晚,大家找豆包帮忙,其实是在找一种“懂我”的陪伴。AI不再是工具,而是过年多了一个会接梗、会暖心的“家人”。你们看春晚时问豆包啥了?评论区来分享~#这届春晚大家都在找豆包帮忙#

58. #清华教授建议把token命名为模元#🔻AI时代token已成为核心度量单位,急需一个精准、易传播的标准中文译名,以推动产业共识、技术普惠与公众认知。🔻清华教授杨斌建议将token译为模元:“模”对应大模型、多模态,贴合AI核心场景;“元”代表最小基本单元,延续“字节”等中文计量单位逻辑。🔻统一规范token中文译名,是AI产业发展、普及应用与文化表达的刚需,具有重要现实意义。(video by 小猿星星) #微博超有用视频大赛# 川北小哥的微博视频

59. 具身数据才是最大「金矿」,数据云商城来了:全球首个、百亿级、全模态、高自由度

60. 家里Wi-Fi总是抢不过别人?联发科这次拿出了解决方案——全球首个整合了Wi-Fi 8技术的5G-Advanced CPE设备!用了他们最新的芯片,不光网速飙升,关键是内置的AI网络引擎能把延迟降低多达90%,打游戏、开视频会议再也感觉不到卡顿了。而且它特聪明,能自动识别你是在刷视频还是在开会,优先保障重要应用的网络畅通。

61. #用声音马住中国年##微博声浪计划# 2026年国产新能源汽车将迎来技术突破:固态电池规模化应用,续航超1000公里;L4级自动驾驶落地;智能座舱升级多模态交互。产业链垂直整合降本30%,芯片自主化摆脱依赖,出口成全球第一。用户体验更个性化,商业模式创新,充电网络全覆盖。#新能源汽车# 瘦子說的微博音频

62. 最新!AI再迎「十字路口」,林达华演讲曝光多模态底层路线图

63. #康林松称将持续深化中国智造和研发# 3月22至23日,梅赛德斯-奔驰集团股份公司董事会主席康林松(Ola Källenius)应邀出席2026年中国发展高层论坛并致辞。这是梅赛德斯-奔驰连续第九年作为论坛合作伙伴参与盛会。他表示,中国的“十五五”规划为全球汽车工业共创未来出行带来了巨大机遇,并重申梅赛德斯-奔驰“在华发展、与华共进”的战略决心,承诺将持续加速本土化升级、深化本土合作,全力融入中国蓬勃的科技创新浪潮。梅赛德斯-奔驰与清华大学的产学研合作迎来全新落地成果。今日,梅赛德斯-奔驰中国宣布,基于双方十余年的长期合作,前沿AI技术——多模态大模型——将应用于年内上市的新一代梅赛德斯-奔驰S级轿车。这一项目由奔驰中国研发团队与清华大学及智谱深度共创,打造梅赛德斯-奔驰独有的端侧多模态大模型。梅赛德斯-奔驰也因此成为首个在后排娱乐系统中应用多模态大模型的车企。基于多模态大模型技术,新一代梅赛德斯-奔驰S级轿车的高端后排娱乐系统将深度融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,为乘客打造更智能、更人性化、更具情感温度的沉浸式交互体验。2025年至2027年间,梅赛德斯-奔驰将推出7款中国专属车型,届时本土化生产阵容将增加至20款。中国研发团队携手本土领先合作伙伴Momenta,采用数据驱动的强化学习大模型并遵循奔驰标准,2026年将为9款新车搭载“安全为先”的城区及高速领航辅助驾驶。未来12-18个月,几乎全系产品将配备AI智能座舱和行业领先的智能辅助驾驶系统。#汽车黑科技#

64. B 站下一代多模态数据工程架构的落地实践

65. 【元宇宙】AR和VR技术提升生产计划和绩效

66. #deepseek正式跨入图文交互时代# DeepSeek这次识图模式的广泛灰度,本质上是从纯语言交互向多模态能力的一次关键跨越。值得关注的是,dp没有停留在简单的 OCR 文字提取,而是具备了看懂图片语义的能力,这意味着用户可以直接让模型分析图表趋势、理解场景关系,甚至解读设计稿或示意图的含义。把识图入口与快速模式、专家模式并列,也传递出一个清晰信号:多模态不是尝鲜功能,而是会成为基础交互的一部分。目前仍标注“内测”且分批开放,说明在理解精度和稳定度上还有打磨空间。但这种审慎反而比仓促全量上线更让人踏实。对尚未获得功能的用户来说,不妨保持耐心,真正的图文对话时代已经不远,这类能力一旦成熟,对学习、办公的实际效率提升将是指数级的。deepseek正式跨入图文交互时代 #热点观点##热点解读#

67. CES 2026行业观察:当巨头们还在打磨“全能眼镜”,垂直场景的AI硬件已悄然闭环

68. Gemini 3 Flash 来了!谷歌说这波升级幅度挺大 #AI前沿速递# 模型主打一个轻快,适合那些不需要长链条思考、追求效率的对话场景。Gemini 3 Flash 的亮点还在于多模态能力,它能更快地处理视觉、音频等输入,把「看见、听见、理解」串成一条相对顺滑的链路,适合需要即时反馈的交互场景。

69. 会议室改造预算有限?成者会议星Bot帮你省下80%成本

70. 王者荣耀首部VR沉浸式互动剧 《星海奇航:梦境救援》今年暑期即将启航!鲁班七号邀请你一起开展一场精彩绝伦的太空航行,但突如其来的危机打破了平静,失控的航向、破碎的梦境、封存的回忆不断袭来、你能否完成这一次星空救援?由《王者荣耀》和《上海天文馆》联合授权!这个暑假,和鲁班七号等多位英雄一起共赴星海,开始新的冒险吧!#王者荣耀 #星海奇航 #VR #互动剧 #天文

71. #科技先锋官# 谷歌 Project Genie 横空出世,文本图片一键生成可交互游戏世界,直接让游戏股集体暴跌,也让它成了科技圈最具争议的焦点! 有人说它是谷歌的王炸,丰富 AI 订阅服务、落地 Gemini 多模态能力,反哺模型迭代还打通生态闭环,让谷歌在 AI 格局中占据绝对优势。也有人骂这是市场过度恐慌,Genie 如今功能受限,既无完整游戏逻辑,也无法替代传统引擎,根本撼动不了 Take-Two、Roblox 的商业模式。 Meta、英伟达也在加紧布局世界模型,AI 造世界到底是颠覆行业的革命,还是徒有噱头的技术试水?看完这条视频,带你看清背后的真相!#微博超有用视频大赛##上微博涨知识##AI生活指南# http://t.cn/AXqrFsNg

72. 沉浸式演出的时代真的来了!佳能EOS VR系统让 “每个观众都在第一排”不再是口号,180° 立体影像 + 专业级画质,把演出现场的能量和情绪精准传递,这波技术赋能太戳观众心了❤️#VR##EOS R5 C##VR演唱会##佳能EOS VR# 松鼠娱评的微博视频

73. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

74. 在今天的华为乾崑技术大会上,全新一代鸿蒙座舱HarmonySpace 6正式亮相舱内感知升级——首发舱内AI多模态感知系统AMS,安全守护再进阶。智慧交互升级——基于MoLA 2.0,小艺智能体打通导航、控车、聊天与生活服务,实现全场景跨域交互。移动影音升级——百万像素彩色车灯、LCoS车载激光投影、HUAWEI SOUND全面进化。智能座舱,再次向未来迈了一大步。

75. #微博声浪计划# iOS26.4前瞻:2026年3-4月推送,Siri融合1.2万亿参数Gemini模型,支持多模态交互;密码应用新增信用卡自动填充,AirPods户外定位;健康应用重构界面,新增膳食AI识别,不过高阶功能需A17 Pro以上芯片,国行版或受限,对此你们怎么看? 值言说的微博音频

76. 轻至 26g!AI录音+智能交互的眼镜能否解放双手?Vidda G11智能眼镜开箱体验

77. ML:多模态数据集的基本结构

78. 面向实战的多模态数据生成与表征技术创新

79. 【推动不同品牌家电互联互通互操作,华为、海尔、美的、海信、TCL、欧普、公牛等发布《智家统一互联标准》】据上海海思消息,在 2026 年中国家电及消费电子博览会(AWE 2026)期间,GIIC 全球智慧物联网联盟(以下简称“GIIC 联盟”)智能家居工作委员会举办了《智家产业创新发展论坛》。会上,GIIC 联盟联合中国家用电器研究院,以及海尔、美的、海信、TCL、欧普、公牛等家电企业,华为、上海海思、中国移动等产业伙伴,共同发布了《智家统一互联标准》。《智家统一互联标准》是在 2025 年 GIIC 发布的《鸿蒙生态设备统一互联标准 2.0》的基础上,结合家庭家电场景完善定义,旨在定义智家生态设备之间统一的发现、配网、接入认证和控制接口规范,实现不同厂商的智家生态设备之间能够互联互通互操作。《智家统一互联标准》考虑并融入了场景的需求和细节,适配了自主创新的协议如星闪,符合相关数据和安全合规要求。从上海海思公告获悉,作为标准制定的重要参与方和技术支持者,上海海思“鸿蒙星闪统一智联”解决方案全面支持《智家统一互联标准》,通过便捷配网、互联互通、AI 协同“三步走”,赋能家居互联互通。便捷配网:用户可通过鸿蒙手机、路由网关、小屏中控三类不同的配网终端,自动发现设备,一键免密完成便捷配网;互联互通:使能无屏、小屏、中屏不同中枢,通过开放统一的物模型,让不同类型、乃至不同厂家的智能终端能够统一“语言”,实现跨终端跨厂家的统一的互联互通生态;AI 协同:中枢可搭载 AI Agent,从 OS 到算法 / Agent 组件,融合语音、视觉、多模态交互能力。在 AWE 2026 现场,上海海思以无屏、小屏、中屏三类中枢形态,分场景展示了鸿蒙星闪统一智联方案的互联互通能力:无屏中枢:FTTR / 路由网关中枢:家庭 FTTR 或路由网关作为联接中枢,当使用 FTTR 网关中枢时候,用户可在手机端运营商 App 界面,实现对接入不同品牌、不同品类家电设备的可联、可视、可管。家庭亦可以通过温湿度传感自动监测,联动空调调节运行。小屏中枢:星闪网关:满足家电厂家自闭环,可联接单品牌或跨品牌不同家电设备。不依赖手机,用户通过语音、按键、触摸等多种交互方式,实现对家电设备的管理与控制。中屏 AI 中枢:AI Agent 走入家庭的载体现场实际演示了 10.5 寸中枢屏搭载 AI Agent,端云结合,支持语音、视觉、多模态交互,它能对用户及家庭需求进行判断,主动提供服务 —— 如判断用户状态,自动管理空调运行。该方案将交付包含 IoT 设备统一互联组件、中枢 & 网关统一互联组件及 AI Agent 智能体组件。其中 IoT 设备和中枢 & 网关统一互联组件即将在上海海思 HiSpark 社区开放上架。

80. 【#零态洞察百态##DeepSeek内测识图模式#,多模态能力正式开放】据钛媒体4月29日消息,部分用户反馈,DeepSeek网页版已上线“识图模式”。试用发现,该模式支持用户上传图片并进行内容理解与分析。目前,该功能尚未全量推送,具体功能边界尚不清楚。值得一提的是,就在今日,DeepSeek负责多模态开发的研究员陈小康在X平台发文“Now, we see you”并配图,图中DeepSeek标志性的“鲸鱼”摘下了眼罩。本月初,DeepSeek刚刚上线了“快速模式”和“专家模式”,前者适合日常对话,即时响应;后者擅长复杂问题,高峰需等待。彼时就有网传截图显示,除了“快速”和“专家”模式,DeepSeek还有个名为“vision”的模式。最新的“识图模式”与此前流传的“vision”入口高度吻合。分析认为,DeepSeek多模态能力的开放,意味着其产品矩阵从纯文本对话正式延伸至图文交互,向GPT-4o、Gemini等主流多模态大模型靠拢。各位网友,您怎么看?(钛媒体)@东方财经 东方财经的微博视频

81. 基于真实教学场景的多模态AI赋能高校教师教学(学术)资源内容生产与教学/比赛PPT课件制作

82. 会议室改造预算有限?成者会议星Bot帮你省下80%成本

83. XREAL 与 Google 合作项目 Project Aura 正在 I/O 2026 大会展示落地体验中,在场的媒体欢迎前往。它是目前唯一的 Android XR 轻量化 OST AR 眼镜,分体设计、最新高通骁龙XR平台、70° FoV、X1S空间计算芯片。确定年内正式发售,I/O 2026 现场展示了沉浸式 Google 地图导航,多窗口虚拟巨幕、 沉浸式 YouTube 180/360 VR 视频、3D 空间绘画、AR 工作流之类功能。 一直评的微博视频

84. 从“听音乐”到“第一排沉浸式观演”,娱乐体验正在大升级!佳能EOS VR系统凭借硬核技术,解决VR拍摄的诸多痛点,让VR演唱会成为偶像内容必备选项,未来追星真的越来越酷了!#VR##EOS R5 C##VR演唱会##佳能EOS VR# 晓辉侃科技的微博视频

85. 偶像与粉丝的新桥梁来了🌉 VR演唱会不只是沉浸式观看表演,还有幕后花絮、沉浸式排练、虚拟签售等,每一个环节都能形成新的互动触点… 佳能EOS VR系统提供稳定制作标准,让这些粉丝福利内容高效产出,追星体验直接升级!#VR##EOS R5 C##VR演唱会##佳能EOS VR# 晓枫科技的微博视频

86. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

87. 四大手机操作系统终极对决:从流畅度到智能交互,全维度硬核解析!

88. 我的差旅新欢!雷鸟air4 pro深度体验

89. 华为乾崑技术大会上首发舱内 AI 多模态感知系统,行业唯一的三合一舱内AI多模态感知,摄像头、红外摄像头加星闪传感器,鸿蒙座舱可识别后排乘客胸腔起伏,这样就不用再开车时时刻关注儿童情况了。#华为乾崑开启内外双融合感知时代#

90. 华为乾崑坚定多传感器融合感知路线 ,舱外多传感器融合与舱内AMS三合一AI多模态感知系统,构建起车内、车外一体化安全体系,为用户出行提供更全面、更可靠的安全保障!#鸿蒙座舱可识别后排乘客胸腔起伏##华为乾崑开启内外双融合感知时代##华为乾崑技术大会# 小新的奇妙测评的微博视频

91. 2026年的AR新品!VITURE Beast值得入手吗?

92. DeepSeek多模态能力为零这件事,很多人觉得是短板。我反而觉得这是一个极其清醒的战略选择。你看字节、阿里、月之暗面,都在往“什么都能干”的方向堆功能,恨不得一个模型又能写诗又能剪视频又能读PDF。这很合理,因为C端用户确实需要一站式体验,这个逻辑完全可以理解。但DeepSeek选择把所有资源砸在推理深度上,不碰图像,不碰视频,就死磕逻辑链条的纯度。这让我想到一句话:当所有人都在比谁的瑞士军刀功能多的时候,手术刀的价值反而凸显了。 多模态是锦上添花,但推理能力是地基。地基打到全球第一梯队,上面想盖什么楼都来得及。反过来,地基不行的多模态,想要补起来可不那么容易。 #DeepSeek还是最强国产AI吗# deepseek还是最强国产ai吗

93. 人机交互的范式正在发生结构性迁移,从最初的键盘指令到图形界面,再到如今以语音、实时影像与三维空间为主的沉浸式交互,整个链路正在被重新定义。每一次交互能力的跃迁,都会从根本上冲击前端作为“粘合层”的角色:从低代码、无代码,到 sketch2code、image2code,再到如今模型直接生成交互逻辑,传统意义上以切图、对齐 UI、手写交互为中心的人力需求自然会持续收缩,于是“前端已死”的声音周而复始地出现。但我眼中的前端,从来不是一门技术栈,而是一条翻译层。它负责将终端服务的能力翻译成可感知、可理解、可操作的体验,也负责将用户的行为、反馈与真实诉求翻译回底层系统。这是一条细腻、繁琐、又极度关键的链路,它贯穿任何时代的人机交互,不会因代码生成而消失,也不会因界面形式改变而过时。只有执行方式会换,角色本质不会换。前端市场的紧缩与释放,本质取决于范式成熟度与用户需求的离散度。在 Chatbot 这种高度同质化的交互形态下,对前端的需求自然趋向过剩;而当交互正式迈向语音、多模态、AR/VR、空间计算,新的交互结构和感知模式将迅速增殖,界面与操作将重新被塑造,前端的边界又会重新被拉伸。真正不会被淘汰的,不是某个技术栈,而是对“下一次人机关系”保持足够敏锐的洞察力,理解自己如何与未来的交互方式接驳。范式迁移不会淘汰人,只会淘汰那些不再迁移的人。

94. Best of AWE 2026:这5款产品在定义未来?

95. OPPO在MWC 2026上获重要奖项!3月3日,OPPO在MWC 2026上斩获GTI“移动AI应用奖”,该奖项是全球通信行业的重要奖项,这意味着以OPPO为代表的国产智能通信技术获得国际行业的高度认可。3月4日,在MWC 2026举行的联发科技发布会上,OPPO 与联发科技联合研发的技术预研成果——端侧全模态 Omni 模型正式亮相。作为业界首个在手机端侧实现多模态融合理解与交互的 AI 模型,Omni使手机端侧 AI 能够深入感知并理解周遭物理世界,为未来更主动、更自然的人机交互形态,奠定了坚实的技术基础。

96. HarmonySpace 6的舱内AI多模态感知系统,系统搭载800万像素RGB摄像头,200万像素红外摄像头及高精度星闪雷达,更精准动作感知和乘员检测,在智能化与交互体验能力得到提升#华为乾崑技术大会##鸿蒙座舱小艺智能体智商爆表# 余洋ddc的微博视频

97. 中小企业的会议神器——成者AI音视频会议主机Bot20:AI全功能,预算有限也能实现AI极简会议!

98. 玄景MLVision推出全球首款硬件可持续升级的AR眼镜M6系列,预约价1299元起

99. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

100. 联发科的汽车业务,天玑 AIDV 智能体座舱在全模态交互,主动式服务,并发任务执行,端云协同等方面都给出了自己的解决方案过去是软件定义,现在是 AI 定义其实我觉得主要改变的点是需要软件主动提供交互,而不需要用户来主动提需求了#MDDC2026##天玑开发者大会#

101. 这个方向好!卓驭不仅做燃油车的辅助驾驶,而且还要做重卡的辅助驾驶,解决重卡司机长时间驾驶疲劳的痛点!卓驭已经和徐工集团、陕汽重卡和中国重汽达成合作,首批支持重卡车型将于 2026 年上半年正式量产!希望到时候有机会体验一下。#卓驭称油车辅助驾驶没有对手##卓驭发布VLA多模态世界模型#

102. #苹果WWDC26邀请函#定档6月8-12日(北京时间6.9-6.13)。本届主题“先来曝点光”,AI是重头戏。iOS 27、iPadOS 27、macOS 27、watchOS 27、visionOS 27 集体更新。Siri重构、多模态交互、本地AI优化,看点拉满。

103. 多模态数据存储、治理、开发管理平台实现 AI-Ready 的落地实践

104. HarmonySpace 6 带来三大升级:感知端首发行业唯一 AMS 舱内 AI 多模态感知系统;交互端发布全场景跨域鸿蒙座舱小艺智能体;影音端首发多款硬件,HUAWEI SOUND 同步升级。#华为乾崑智驾ADS5##华为乾崑智驾ADS5正式发布##华为乾崑技术大会# 大肥皂的微博视频

105. 商汤科技正式发布并开源了与南洋理工大学 S-Lab合作研发的全新多模态模型架构 —— NEO,为日日新 SenseNova 多模态模型奠定了新一代架构的基石。作为行业首个可用的、实现深层次融合的原生多模态架构(Native VLM),NEO 从底层原理出发,打破了传统“模块化”范式的桎梏,以“专为多模态而生”的创新设计,通过核心架构层面的多模态深层融合,实现了性能、效率和通用性的整体突破,重新定义了多模态模型的效能边界,标志着人工智能多模态技术正式迈入“原生架构”的新时代。发布了头条文章:《商汤发布 NEO 架构,重新定义多模态模型效能边界》 #大模型  # 商汤科技##ai# 商汤发布 NEO 架构,重新定义多模态模型效能边界

106. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#

107. 【元宇宙】虚拟现实中的远程协作:未来的工作方式

108. 化繁为简!杂乱会议室终结者!成者StarryHub会议星AI会议机器人体验

109. 从视频透视到眼动追踪功能,安森美图像传感器树立下一代 AR/VR 应用标杆

110. #用声音马住中国年##微博声浪计划# Seedance2.0正式接入豆包,2026年2月12日全端上线!文生视频、分身功能等多模态创作能力强大,获《黑神话》制作人盛赞。好莱坞导演实测降本增效,产业端洗牌加速。虽有版权与技术限制,但个人创作与商业应用潜力巨大,2月14日豆包大模型将升级强化能力。 科技晓鑫的微博音频

111. 女装退货率高达50%至60%,部分商家退货率超90%,退货率居各品类首位,为什么退货率那么高?

112. AI虚拟试衣,在中国是伪需求

113. AR虚拟试穿火了,但90%的电商小程序没搞明白

114. AI试衣(Virtual Try-On)市场分析报告

115. 哆啦A梦道具解析|换装照相机

116. Tstars-Tryon 1.0

117. 告别网购试衣烦恼!DressMeAI

118. AI+电商

119. 虚拟现实

120. #豆包AI 5年后很多人可能不用每天挤地铁或者骑车上班,甚至都不用跑到大城市打拼了。因为线上办公将成为主流。

121. AR眼镜不是VR!90%人都搞混,买错必后悔

122. 官宣!Meta放弃元宇宙办公,企业级VR业务全线终止

123. VR/AR技术爆发前夜

124. AI 语境下

125. AI面试题

126. 情感化多模态AI交互

127. 每天一个AI小知识

128. 人和AI交互的核心体验-智能视频云多模态处理与传输

129. "多模态"通俗易懂的理解

130. "多模态"通俗易懂的理解

131. GPT-4o多模态整合 如何革新AI交互?

132. 多模态AI的黎明

133. 多模态AI爆发

134. 智生科技|全新一代多模态交互数字人重构人机交互新范式

135. 技术文章

136. 基于多模态VLM的“终端智能大脑”

137. 2026软件开发新趋势

138. 多模态交互 赢消客AI数字员工 解决沟通新可能

139. 教培专属AI系统如何实现多模态交互?看懂这三点就够了

140. 多模态智能体觉醒

141. 2026年企业如何应用智能客服?实现多模态交互与全域服务协同

142. 🤖 AI试衣(Virtual Try-On)市场分析报告

143. 直播带货翻车后

144. 2026年AI颠覆零售!从无人店到虚拟试衣,这6大应用彻底改变购物方式

145. 2026 AI行业大变局

146. 「虚拟衣间」2.0

147. 下一代AI沟通系统

148. 服装高退货率居高不下 淘宝 微盟“AI试衣”能否有“疗效”?

149. AI虚拟试衣助力解决电商退货率高这一利润“隐形杀手”

150. 退货率降1.6个点,利润涨了一半——中国跨境卖家也要做这道题

151. C2M、虚拟试衣、可持续时尚——服装行业三个新方向

152. VR技术如何让我在客户会议上侃侃而谈 - 哔哩哔哩

153. 视频会议疲劳背后的心理学原因是什么?

154. 告别无效对接!VR实景规模化落地,成千行百业升级“关键钥匙”

155. VR实景规模化赋能,千行百业对接难题已成历史

156. 线上会议兴起后,线下会议未来走向会怎样?会被线上模式取代吗?

157. 鲸鱼睁眼!DeepSeek正式跨入图文交互时代国产多模态AI迎来里程碑

158. 锐评 MLLM 交互短板!人大 GeWu-Lab 与上海 AI Lab 发布 MIBench

159. 从“跨模态炫技”到“产业实用”多模态大模型真的能落地见效吗?

160. 多模态大模型的落地困境

161. AI多模态交互避坑指南

162. 多模态,正在悄悄改变 AI 产品是怎么“理解世界”的

163. 多模态大模型的感官革命

164. 【完结】多模态与视觉大模型开发实战 - 2026必会

165. 2026 年多模态大模型格局、主流架构与代表模型综述

166. 多模态交互在人机协作中的应用最佳分析

167. 多模态人工智能

168. 新题材:AI试衣!电商革命,谷歌 + 淘宝接入黑科技,小群会来吗?

169. 新风口:2.6万亿服装市场变革!AI试衣渗透率狂飙至40%!

170. 【AI论文解读】虚拟试衣终于能模拟不合身效果了!首个包含各种尺码适配情况的大规模虚拟试衣数据集 | SIGGRAPH 2026

171. 【富氏多媒体】3D 虚拟试衣:时尚购物新革命

172. 谷歌上线 AR 虚拟试衣:电商的新武器来了!

173. MIBench:揭示多模态大模型核心交互能力短板

174. AR虚拟试穿/试妆:在家搞定逛街需求,省下2小时+百元邮费(亲测5个平台)

175. 淘宝AI试穿灰度上线,老陈实测,邀请码分享

176. 具身智能人机交互技术:从指令响应到自然协作的突破

177. 退货率降1.6个点,利润涨了一半——中国跨境卖家也要做这道题

178. 俄罗斯消费者拥抱AI虚拟试衣,商品图文“含AI量”却引发信任危机

179. 江西服装学院+昌硕户外:户外服装虚拟试衣系统技术(智试户外)

180. 【榜样领航】专访2025年度CSIG科技进步二等奖“面向智能显示设备的多模态感知与交互关键技术及应用”团队

181. 【元宇宙】VR 会议对比实体活动:如何最大化投资回报率和覆盖范

182. TechViz 推出 Cloud&Viz:云端 VR 沉浸式会议协作解决方案

183. 2026四大虚拟试衣 / AI 电商图工具深度测评

184. 后视频时代:VR实景孪生,正重塑企业交互的底层逻辑

185. AR魔镜试衣体验|品牌互动宣传新玩法 AR魔镜结合增强现实技术,实现虚拟试衣与品牌互动展示,让用户无需换装即可完成沉浸式试穿体验。 通过AR试衣试穿系统,消费者可以实时查看不同服装、配饰或品牌形象效果,大幅提升互动参与感与品牌传播效率。 AR魔镜广泛应用于商场活动、品牌快闪店、新品发布、展览展示与数字营销空间,是当前品牌宣传与互动营销的重要趋势。#AR魔镜 #AR试衣 #互动装置 #品牌宣传 #互动营销

186. AI 智能客服能否支持多模态交互?能读懂用户图文语音、视频提问?

187. 中科算网《2026多模态大语言模型技术发展报告》:全模态、实时交互的“全能”模型崛起,MLLMs如何从“可用”迈向“好用”

188. 【特地对接1720】技术需求:多模态融合交互大模型

189. 淘宝灰度“AI试穿”?一手邀请码分享!

190. 服装电商退货率飙至80%!淘宝、微盟AI试衣能否终结“试穿退货”乱象?

191. WebRTC多对多音视频会议(react/express/socketIO/webRTC)

192. 阿里-MUSE:简单而有效的多模态终身建模,CTR +12.6%,RPM +5.1,ROI +11.4%

193. 《智能座舱人机交互系统多模态融合技术规范》团体标准审查会议顺利召开

194. 2026多模态大语言模型技术发展报告

195. NPU如何驱动下一代多模态交互座舱?

196. 当AI睁开"双眼":多模态模型如何重塑人机交互边界

197. VR/AR全面爆发!国产设备碾压海外,元宇宙时代提前到来

198. 【元宇宙】虚拟现实中的远程协作:未来的工作方式

199. 多模态大规模语言模型技术应用

200. 2026年AI+服饰消费新纪元

201. OPPO全新开源端侧移动AI Agent!统一多模态感知交互的X-OmniClaw 【AI Agent开源技术解读】

202. 多模态 AI 破局而来 重构人机交互全场景新生态

203. 展商风采 | 万有引力将亮相2026上海VR/AR产业博览会

204. 2026 多模态交互大模型求职指南:从 VLM 到人机闭环。机器人/人形机器人「多模态交互大模型」方向最全求职攻略

205. 多模态数据如何赋能智能意图推理?我院肖帅勇副教授在MIS Quarterly与INFORMS Journal on Computing发表研究成果

206. 展商风采 | 元客视界将亮相2026上海VR/AR产业博览会

207. GPT-4o如何通过端到端训练实现多模态交互低延迟?

208. 阿里云发布多模态交互开发套件,让硬件能听、会看、会交互

209. AI 智能体商业化提速!LED 显示屏成 “多模态交互第一入口”

210. 增强现实AR硬件的发展状况

211. 智能体核心能力“多模态交互”的原理

212. CCCS国标最佳实践 | 软通计算机有限公司服务管理部:引领多模态交互,塑造智能客户体验新潮流

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章