语音交互系统高效落地实战指南

源自55位全网作者

05-28 14:22

内容由AI生成

精选参考来源

1. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

2. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

3. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说

4. 盘点一周AI大事(3月22日)|OpenAI红色警报 字节开源AI超级员工DeerFlow 2.0 英伟达开源Agent安全补丁NemoClaw Okara发布AI CMO Junior开源能雇佣的AI员工Junior 清华开源Agent课堂OpenMAIC MiniMax发布最强开源大模型M2.7 Miro开源最强深度研究模型Miro Thinker H1 Unsloth开源AI训练工具Unsloth Studio Google升级AI Studio和Stitch 阿里开源最强影视配音模型Fun-CineForge Google开源最强视频超分模型Spark VSSR 研究员开源最强数字人模型ID-LoRA 研究员开源首个城市级别的世界模型Seoul World Model #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #OpenAI

5. 千问23天月活突破3000万碾压欧美,中国AI时代开启! 就在刚刚,确认数据!千问23天月活突破3000万,首周下载量1000万碾压欧美,阿里AI从“技术储备”向“价值落地”加速演进 #AI #阿里 #千问

6. 用 Claude Code 省钱的正确方式,收藏~1. 正确配置1)创建 .claudeignore 文件,把 node_modules/、dist/、.git/、日志目录统统排掉。Claude 看不到的文件,就不会被塞进上下文。2)CLAUDE.md 控制在 500 token 以内。细节拆进独立的 skill 文件,用到哪个才加载哪个——按需加载,不是全部预加载。3)装 context-mode 插件,实时可视化上下文占用,在它失控之前感知到。2. 每次开 session 的习惯1)每个任务开一个新 session。上下文不跨任务污染,这一条单独能省很多。2)长 session 用 /compact 压缩上下文,而不是让它一直涨。3)用 /cost 随时查当前 session 消耗了多少 token,心里有数。4)读日志、全库扫描这种"大量读取"型任务,放到子 agent 里跑。子 agent 有自己的上下文,不会污染主会话。5)给 Claude 明确的验证标准——"跑完测试,截图对比",而不是让它自己判断对没对。能自我验证的 Claude 犯错更少,绕弯路更少,token 自然也用得少。#HOW I AI# #程序员#

7. #小米MiMo大模型首次推出TokenPlan#小米MiMo大模型正式推出Token Plan,39块钱起步,最高659一个月。一次订阅,通吃MiMo-V2-Pro、V2-Omni、V2-TTS等全模态模型,不用再为不同能力反复买套餐。给大家整理了一下:第一,一次订阅直接包含MiMo-V2-Pro、V2-Omni、V2-TTS三个模型,全模态全家桶一次到位。看了很多小伙伴分享之前用其他家的套餐,不同模型消耗差异大得离谱,小米这次把计费规则明明白白摆出来了。第二,MiMo-V2-Pro的实力不用多说,OpenRouter上累计消耗超6万亿token,月榜第一第三,MiMo-V2-TTS限时免费,不花credit,这对经常需要语音合成的开发者来说是白送。现在MiMo出了包月,329块700M credits,配置上跟Anthropic的标准看齐了。国模能把套餐做到这个水平,小米确实是带头卷了。理性建议:如果你高频调用多模态能力,尤其依赖MiMo-V2-Pro,这个套餐值得算账。如果只是偶尔用用,按量可能更划算。翻雷总微博评论区,正在催app啦!

8. 在线语音合成技术日新月异,阿里云Qwen团队最新开源的Qwen3-TTS项目,非常强大!它支持多语言(中英日韩德法俄葡西意等10种,以及多方言),拥有超低延迟流式合成功能,甚至能按自然语言指令智能调控声线的情绪、语调和节奏,真正实现“想怎么说,就怎么听”。Qwen3-TTS集合了定制声线、自由设计声音、以及精彩的音色克隆功能,还能应对嘈杂文本,稳定演绎高保真声音。无论做主播配音、智能助理、或是个性化语音内容生产,都特别适合。GitHub地址:github.com/QwenLM/Qwen3-TTS核心亮点:- 自研高效语音编码器,保证声音细节完整还原;- 端到端多码本模型架构,提升生成速度和音质上限;- 双轨流式架构,最高97毫秒合成延迟,适合实时交互;- 支持以文字自然语言控制发声风格和情绪表达;- 提供丰富预训练模型,快速实现声线设计、克隆和合成;- Python一键安装qwen-tts库,支持本地和API在线调用;- 兼容多平台和硬件加速,支持从示例到专业定制多种场景。对TTS开发者、AI语音爱好者、内容创作者都很友好,赶紧试试吧!🔊✨

9. 现在的阿里,AI领域的每一步,面子和里子,都是自己给自己的! 别人死磕参数内卷,阿里闷头搞全栈自研;别人依赖外部算力,阿里有平头哥芯片自给自足;别人只推模型不落地,阿里连发3款硬核产品,从编程大模型到数字世界生成,每一款都有自己的特色。阿里用全栈技术闭环,悄悄跑出自己的路。#一分钟精选视频扶持计划##专业视频创作季##AI创造营##科技先锋官# http://t.cn/AXxOOabK

10. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC

11. Claude Code 实战经验,学习~1. 写 CLAUDE.md 文件(最高性价比的一件事)在项目根目录放一个 CLAUDE.md,把技术栈、目录结构、编码规范、常用命令写进去。Claude Code 每次启动都会读它,省去反复交代背景的时间。写一次,每次会话都受益。2. 用 .claude/rules/ 管理分域规则CLAUDE.md 管全局,具体领域的规则拆成独立文件放在 .claude/rules/(比如 api-routes.md、testing.md)。Claude Code 只在相关任务时读对应文件,上下文更聚焦,输出更准。3. 设置 .claudeignore类似 .gitignore,把 node_modules、dist、日志文件排除掉。需要扫描的上下文少了,响应更快更准。4. 大任务先要计划,再执行遇到复杂需求,先说"给我列出实现思路,不要写代码"。确认方向对了再执行,避免改了十几个文件后发现方向错了。5. 改大功能前先 commitgit add -A && git commit -m "checkpoint" 是救命操作。作者因为没做这步损失了 3 小时,现在每次大改动前必做。6. 用 /compact 控制上下文长度会话太长后 Claude Code 质量会下降——它在处理老旧上下文上浪费了太多 token。完成一个主要任务后就 /compact 一次,保持专注。7. 一次只做一件事每个会话只做一个任务。任务拆得越细,输出越准,不要在一个会话里混着做多件事。8. 让 Claude Code 自己跑测试把测试命令写进 CLAUDE.md,然后直接说"跑一下测试,修复失败的用例"。它会自动运行→读报错→修复→重跑,比手动复制粘贴报错信息快 5 倍。9. 用 Hooks 做自动化Hooks 可以在 Claude Code 每次写文件后自动触发 shell 命令,比如自动跑 Prettier 格式化。最被低估的功能,用好了能省掉大量帮我修一下格式的重复提示。原文:dev.to/lukaszfryc/claude-code-best-practices-15-tips-from-running-6-projects-2026-9eb#HOW I AI##程序员#

12. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

13. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

14. #阿里发布旗舰推理模型# 1月26日阿里正式推出通义千问旗舰推理模型Qwen3-Max-Thinking,这是其目前参数超万亿、综合能力最强的大模型,在19项权威基准测试中性能媲美GPT-5.2、Gemini 3 Pro等国际顶尖模型,标志国产大模型跻身全球第一梯队。该模型两大核心创新亮眼,自研测试时扩展技术通过迭代反思提升推理效率,同等Token消耗下多项指标超竞品;自适应工具调用能力可自主启用搜索、代码解释器等功能,大幅降低幻觉,实测中工具协同表现优于ChatGPT。目前模型已上线Qwen Chat开放体验,API同步开通,还将接入千问APP,同时阿里同步开源Qwen3-TTS全系列语音合成模型。依托“算力-模型-应用”全栈闭环,该模型已落地淘宝、支付宝等场景,其高效推理路径也为算力约束下的国产大模型创新提供了新方向。

15. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

16. 怎么看待新加坡政府宣布在东南亚语言大模型项目放弃Meta模型,采用阿里的通义千问(Qwen)开源架构?

17. 盘点一周AI大事(12月28日)|最强开源大模型易主 智谱发布最强开源大模型GLM 4.7 MiniMax发布最强开源编码模型MiniMax M2.1 阿里开源超长上下文模型QwenLong-L1.5 字节发布最强数学模型Seed-Prover 1.5 英伟达开源游戏智能体Nitrogen 阿里开源语音对话模型Fun-Audio-Chat 字节开源短剧视频模型StoryMem 字节开源关键帧视频模型DreaMontage 奥特曼认为通用人工智能已成为过去式,并提出超级人工智能定义 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #OpenAI #大模型

18. OpenAI 在 Realtime API 里上线了三款新语音模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别管对话、翻译和实时转录。【1】主角:GPT-Realtime-2号称带 GPT-5 级别的推理能力。比上一代 GPT-Realtime-1.5,在 Big Bench Audio 智能测试上从 81.4% 涨到 96.6%,Audio MultiChallenge 多轮对话指令跟随从 34.7% 涨到 48.5%。几个实际变化:开口前会先垫一句。执行长任务前先说"我查一下""稍等一下",避免用户对着空气以为它死机了。工具调用透明化。能同时调多个工具,过程会被念出来,比如"正在查你的日历""正在搜索",让用户听到 agent 在干什么。上下文窗口从 32K 扩到 128K,能撑更长的对话和更复杂的任务编排。开发者可以在 minimal 到 xhigh 五档推理强度里选,默认 low。简单问答用低延迟,复杂任务挂高推理。出错时会说"这块我现在处理不了",不再直接卡死或乱讲。【2】Translate 和 WhisperGPT-Realtime-Translate 支持 70 多种输入语言、13 种输出语言的实时语音翻译,主打跨境客服、教育、直播场景。德国电信已经在测;BolnaAI 在印地语、泰米尔语、泰卢固语等印度方言场景下报告错词率比其他模型低 12.5%。GPT-Realtime-Whisper 是流式版 Whisper,边说边出字幕,主打会议、直播、客服转录。【3】价格GPT-Realtime-2:每百万音频输入 token $32(缓存 $0.40),输出 token $64。GPT-Realtime-Translate:每分钟 $0.034。GPT-Realtime-Whisper:每分钟 $0.017。三款都已在 Realtime API 上线,Playground 可以直接试 GPT-Realtime-2。官方公告:网页链接 宝玉xp的微博视频

19. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

20. 马斯克大赞阿里 AI,9B 参数硬刚 120B,海外网友:这叫小模型?

21. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

22. Claude Code+DeepSeek V4 Pro安装教程|3步从零装好开始用 | Mac Windows

23. 阿里自研芯片大突破!10万卡真武PPU落地,国产算力硬核崛起 里程碑时刻!阿里平头哥自研的真武PPU,已有超10万卡部署在阿里云公共云,服务30+家主流车企与智驾公司,国产AI芯片规模化商用再下一城。 这不是简单的芯片出货,而是全栈自研硬实力的证明:芯片自研:平头哥打造,性能对标国际高端AI芯片,打破海外垄断;云芯一体:真武PPU+阿里云+千问大模型,形成完整技术闭环,训推效率拉满;场景落地:从智驾研发到AI大模型训练,覆盖核心高景气赛道,已累计交付超47万片。 从“缺芯少魂”到“自研自强”,10万卡是起点,更是中国科技突围的底气。国产算力替代加速,硬科技的黄金时代,才刚刚开始!本文提示:个人观点,仅供交流,不构成投资建议!理财有风险,投资需谨慎!

24. 【字节跳动发布全双工语音大模型Seeduplex!豆包率先接入:打电话可边听边讲】字节跳动正式推出原生全双工语音大模型Seeduplex,基于“边听边说”的全新架构,彻底打破传统AI语音交互“一问一答”的局限,实现自然实时对话。目前Seeduplex已在豆包App全量落地,成为行业内首个规模化应用的全双工语音大模型。Seeduplex的核心突破的是改变了传统半双工“听完再说”的交互模式,真正实现了听与说的同步处理,其中两大核心能力得到重点突破:精准抗干扰:模型具备持续的“倾听”能力,从而能更好地理解用户所处的声学环境,准确忽略背景噪音和无关对话。在复杂场景下,相比半双工模型,其误回复率和误打断率减少了一半。动态判停:模型能联合语音和语义特征,综合判断用户意图,可实现更自然的对话节奏控制。面对用户的思考犹豫,模型能耐心倾听;在用户说完后,又能快速响应。相比半双工模型,其抢话比例相对下降了40%。多维度评测显示,Seeduplex在对话的流畅度和节奏感上,均显著优于传统的半双工方案及行业主流App的语音通话功能;在判停表现上,模型相比半双工方案提升了8%,展现出更接近自然对话的分寸感。对话流畅度MOS分提升12%,整体通话满意度提升8.34%,其打断响应表现已略优于真人对话平均水平,让人机交互更贴近自然交流状态。工程落地方面,该模型依托字节跳动自研LLM底座,通过架构创新、海量语音预训练、推理优化及稳定性保障,有效解决了高并发场景下的卡顿问题,可支持亿级用户稳定使用。目前,用户更新至豆包App最新版,在“打电话”语音通话界面即可体验该功能。

25. 阿里大模型核心变动:Qwen技术负责人离职,AI战略进入“深水区”

26. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格

27. 盘点一周AI大事(5月24日)|最强AI同声传译 Codex再进化,电脑息屏也能远程派活 OpenAI新模型数学界80年猜想 Google发布AI科学家 AI Co-Scientist Google推出多模态大模型Gemini Omni Google升级AI画布Stitch Agent 阿里发布国产最强大模型Qwen3.7-Max 阿里开源直播试穿模型FashionChameleon 字节开源多模态模型Lance Odyssey 连发世界模型Starchild-1 Agora-1 研究员开源室内设计世界模型PanoWorld Longcat开源最强数字人模型LongCat-Video-Avatar 1.5 Meta发布最强配音模型WavFlow 研究员开源最强语音识别模型Mega-ASR 阿里发布实时翻译语音模型Qwen3.5 LiveTranslate #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

28. 如何评价阿里千问大模型负责人林俊旸自宣卸任?会对通义千问造成什么影响?

29. 【ComfyUI迎来全能TTS节点:克隆任意人声只需5秒】阿里Qwen3-TTS模型终于有了完整的ComfyUI集成方案。这个名为FL Qwen3 TTS的节点包刚刚发布,功能覆盖之全面让人眼前一亮。三种语音生成模式各有千秋。声音克隆只需5到15秒的参考音频就能复刻目标音色,这对于想要保持一致人声风格的内容创作者来说相当实用。声音设计则走了一条更有趣的路子:用自然语言描述你想要的声音特质,比如"一个温暖的英式女声",模型就能凭空创造出来。另外还预置了9位发言人,覆盖中英日韩四种语言,其中中文发言人甚至区分了普通话、北京话和四川话。支持的语言总共有10种:中文、英文、日文、韩文、德文、法文、俄文、葡萄牙文、西班牙文和意大利文。真正让这个节点包脱颖而出的是它内置的微调训练界面。准备好音频文件和对应的文本转录,配置好学习率和训练轮数,就能在实时仪表盘上看到损失曲线和训练进度。训练完成后的检查点可以直接用于推理生成。这种端到端的工作流设计,把原本需要在命令行和各种脚本之间来回切换的操作全部整合到了一个可视化界面中。技术细节方面,音频编解码使用12Hz的离散编码器,内置Whisper转录功能可以自动生成参考文本。硬件门槛不算太高,推理阶段CPU和Mac MPS都能跑,训练则建议配备12GB以上显存的N卡和32GB内存。通过ComfyUI Manager搜索"FL Qwen3 TTS"即可安装。github.com/filliptm/ComfyUI-FL-Qwen3TTS

30. 蚂蚁数科王磊:垂直大模型训练成本呈百倍级下降,金融AI落地需构建“可信智能体”三大基石 | Alpha峰会

31. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人

32. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

33. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#

34. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

35. 一觉醒来OpenAI发了三个语音模型。GPT-Realtime-2:OpenAI目前最强的语音模型,具备 GPT-5 级别的推理能力。它能边听边想,在对话中实时解决复杂问题。可以理解为:一个能打电话的 GPT-5。GPT-Realtime-Translate:实时语音翻译,支持 70 多种语言输入,翻译成 13 种语言输出,翻译的同时还能保留说话者的语调和情感。GPT-Realtime-Whisper:实时语音转文字,一边说话一边出字幕。适合做实时字幕、会议记录。

36. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

37. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

38. AI 原生落地成果获认可,阿里云云原生多项案例入选信通院「AI 云」典型示范

39. 报道:字节跳动、阿里巴巴将于2月推出新的人工智能模型

40. 让Ai帮你找工作有没有搞头?威联通部署开箱即用的“简历神器”

41. #零态洞察百态##阿里新设技术委员会# 【阿里官宣人事与架构调整,李飞飞出任阿里云CTO】4月8日,阿里巴巴集团CEO吴泳铭发布全员信,正式启动集团AI相关组织架构与人事的重大调整,以全面加速AI战略落地,为集团长期技术发展注入强劲动能。此次调整中,通义实验室正式升级为通义大模型事业部,由周靖人全面负责,进一步聚焦大模型技术研发与商业化落地;李飞飞(飞刀)出任阿里云CTO,牵头阿里云技术体系与AI云基础设施建设,强化阿里云在AI算力与云服务领域的核心竞争力;吴泽明(范禹)专注集团CTO本职工作,淘宝闪购CEO职务由雷雁群接任,同时范禹负责集团业务技术平台与AI推理平台建设,保障全集团AI技术的高效协同。此外,阿里巴巴集团全新成立技术委员会,由吴泳铭担任组长,周靖人、吴泽明、李飞飞为核心成员,周靖人兼任首席AI架构师,形成集团层面AI战略的顶层决策与统筹机制。本次调整是阿里锚定AI时代的关键布局,通过组织升级、权责优化与核心技术人才的精准配置,打通从大模型研发、云基础设施到全业务落地的全链路,彰显了集团全力押注AI、以技术驱动长期增长的坚定决心,也为中国AI产业的规模化落地注入了行业信心。#阿里巴巴#

42. 词错误率仅1.8%领跑,阿里语音大模型国际评测登顶,全面超越GPT构建生态闭环

43. 阿里语音大模型登顶 三项指标超越GPT 行业格局改写?

44. 阿里语音大模型登顶 三项指标超越GPT 行业格局改写?

45. 超越GPT-Realtime-2,阿里语音大模型获三项第一

46. 阿里语音大模型全球登顶!方言、外语全拿下,人机交互新纪元来了

47. 阿里巴巴考察参访预约 | 阿里语音大模型登顶全球榜单,Fun-Realtime拿下三项第一

48. 阿里语音模型拿第一,爸妈也能和AI好好说话

49. 阿里语音大模型登顶全球评测,三项核心指标超越GPT-Realtime-2

50. 阿里语音大模型揽三项全球第一!碾压GPT-4,中国AI再次扬威世界

51. 阿里语音大模型登顶全球评测

52. 阿里语音大模型获三项第一;智谱发布新成果:不加一块GPU,算力多出15%|数智早参

53. 阿里Fun系列语音大模型全球夺冠,落地千问高德钉钉等多场景

54. 全球及中国顶尖TTS厂商核心竞争力调研

55. 降噪耳机再强也救不了 ASR 在复杂声场里的“耳背”:Mega-ASR 用 2M 条合成数据把语音识别从 “听不清” 拉回 “听得懂”

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章