真实场景字错率高出3倍?选语音识别API别再被实验室数据骗了
05-17 13:55
精选参考来源
精选参考来源
1. 击败GPT、Gemini,复旦×创智孵化创业团队「模思智能」,语音模型上新了
微信公众号 2026-01-20 00:00:00
2. 还有哪款车?语音识别误关大灯#领克#语音识别#高兴侃车
抖音 2026-02-28 00:00:00
3. 真的,vibe coding搭配语音输入很爽!| 使用技巧+自制语音输入法分享(免费)
哔哩哔哩 2026-04-27 00:00:00
4. 4月30日,xAI正式发布Grok自定义语音和语音库功能。用户仅需在xAI控制台录制约一分钟自然语音,即可在不到两分钟内获得个人声音克隆模型,并立即应用于Grok文本转语音(TTS)和Voice Agent API。该功能采用严格的安全验证流程,用户需先朗读验证短语,由语音转文本引擎实时匹配确认身份,再通过说话人嵌入技术比对录音一致性,确保只有本人才能创建自己的声音模型,无法克隆预录音频或他人声音,有效防止滥用。自定义语音为多种应用场景带来便利,包括为品牌客服代理赋予一致且可识别的专属声音、让内容创作者用本人声音大规模旁白视频和播客、为失声人士保留个人声音特征,以及支持多语言团队将演讲自然呈现于英语、西班牙语、法语、德语、中文、日语等多种语言。同时,它还适用于游戏角色配音、播客和有声书制作,无需反复进入录音室。全新语音库集成于xAI控制台,用户可在同一页面浏览、预览和管理所有自定义语音及超过80种内置声音(覆盖28种语言)。自定义语音完全继承Grok TTS的各项能力,包括语音标签、多语言输出和流式传输,且使用Text to Speech或Voice Agent API时不收取额外费用。xAI表示,此次更新大幅降低个性化语音的使用门槛,有望推动AI语音技术在客服、内容创作、娱乐和无障碍领域实现更多创新。目前开发者已可通过xAI控制台直接体验该功能。
新浪微博 2026-05-02 00:00:00
5. 如何从零开始构建一个低于500毫秒延迟的语音助手 www.ntik.me/posts/voice-agent 这篇文章讲述了作者如何从零开始构建一个延迟低于500毫秒的语音代理。 与文本Agent相比,语音Agent的复杂性更高。语音Agent需要实时协调多个模型,确保用户讲话时系统及时停止播放语音,避免错误的转接或延迟。 作者使用了流式管道将语音识别、大语言模型和语音合成结合起来,确保每个环节都能迅速响应用户输入。同时,系统需要在用户开始说话时即时取消正在进行的生成任务和播放。 #HOW I AI##人工智能[超话]#
新浪微博 2026-03-03 00:00:00
6. 想做出逼真的AI语音合成,很多人只能依赖在线API:隐私全泄露,费用居高不下。NeuTTS 把顶级语音能力带到本地设备,提供开源免费的超拟真TTS解决方案。不仅有最佳尺寸比的真实语音,还支持3秒即克隆音色,手机笔记本树莓派全都能跑,英语/西班牙/德/法多语种支持。GitHub:github.com/neuphonic/neutts主要功能:- 超拟真语音合成:小模型大自然度,像真人说话;- 3秒即时声音克隆:短音频样本快速复刻音色;- 全本地离线运行:隐私安全,不上传数据;- 轻量高效部署:GGUF量化,手机/嵌入式设备实时生成;- 多语种支持:英语、西班牙语、德语、法语(模型相关);- 流式生成+水印:实时播放,输出可追溯更负责。支持 pip install neutts 一键安装,Python代码几行搞定,适合开发者、App嵌入和语音应用。#AI##开源##TTS##语音合成#
新浪微博 2026-04-28 00:00:00
7. 传统TTS合成往往依赖GPU或云端API,资源消耗大、延迟高,还需网络连接,使用起来门槛不低。Agora Pocket TTS 颠覆传统,提供超轻量级文本转语音解决方案,完全适配CPU运行。仅100M参数模型,支持音频流式生成,低至200ms首帧延迟,MacBook Air M4上CPU实时6倍速,仅用2核。支持Python API/CLI、语音克隆、多语言(英法德葡意西),无限长文本输入,甚至浏览器端运行。GitHub:github.com/kyutai-labs/pocket-tts主要功能:- CPU高效运行,无需GPU,~200ms低延迟音频流式生成;- 超轻量100M参数模型,实时6x速度,仅2核CPU;- 语音克隆,支持自定义wav样本快速适配;- 多语言支持:英语、法语、德语、葡萄牙语、意大利语、西班牙语;- Python库/CLI/HTTP服务,pip/uv一键安装;- 浏览器WebAssembly运行,无需安装即试用;- 无限长文本处理,适合长篇朗读/ audiobook。支持Python 3.10+,PyTorch 2.5+,跨平台Web/桌面,通过pip install pocket-tts本地运行,适合开发者、内容创作者和AI应用。#AI创造营##人工智能# #TTS# #语音合成#
新浪微博 2026-05-09 00:00:00
8. Ai软件会议纪要横测,谁才是效率王者
小红书 2025-11-26 00:00:00
9. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?
知乎 2026-05-07 00:00:00
10. 在语音识别和语音转文字领域,Vosk是一个开源的离线语音识别工具,支持多语言,能够在本地运行,无需依赖云服务,适合对隐私和可控性有要求的个人或项目使用。 项目地址:github.com/alphacep/vosk-api 主要功能 1.支持实时语音识别,将语音转换为文本 2.支持多种语言和方言模型,可根据需求选择 3.可离线运行,无需上传音频到云端,保护数据隐私 4.提供Python、Java、C++等多语言接口,易于集成 5.支持语音流处理,可用于会议记录、字幕生成等场景 Vosk专注于高效、轻量和可控的语音识别,适合希望在本地完成语音转写、开发智能助手或构建语音应用的人使用,不依赖网络,部署灵活,可直接嵌入各种系统。
新浪微博 2026-02-03 00:00:00
11. 「Github一周热点105期」Rust 版openclaw,本地语音克隆工具,Qwen3.5, AI 渗透测试系统和精美源码图片生成工具
哔哩哔哩 2026-02-28 00:00:00
12. Claude深夜长出「双手」,接管电脑狂飙代码!额度光速耗尽,全网哀嚎
知乎 2026-03-31 00:00:00
13. 发现一个开源项目叫 Type4Me,作者自己定位就是 Typeless 平替,MIT 协议,免费用。它最吸引我的地方有两个。第一个是本地识别。底层跑的是 SherpaOnnx 引擎,不需要联网,不需要 API Key,Apple Silicon 上速度很快。你的语音数据全程不出本机,所有识别历史都存在本地的 SQLite 里,没有遥测,没有云同步。如果你觉得本地识别的准确率不够用,也可以切到云端引擎,目前支持火山引擎和 Deepgram。第二个是它把语音识别和大模型串起来了。识别出文字之后,可以直接交给大模型做后处理,比如润色、翻译、按你写的 Prompt 做任意加工。内置了几种常用模式,也完全可以自己定义。更狠的是它有个命令模式:选中一段文字,按快捷键,对着麦克风说你想让大模型干什么,选中的文字就是上下文,大模型直接执行然后输出结果。等于把语音变成了大模型的命令行。架构上做了插件化设计,加新的识别引擎只需要实现两个协议然后注册,Whisper、Google、AWS 的接口都预留好了,等社区来填。要求 macOS 14 以上,GitHub 地址:github.com/joewongjc/type4me#科技先锋官##How I AI#
新浪微博 2026-03-27 00:00:00
14. OpenAI 在 Realtime API 里上线了三款新语音模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别管对话、翻译和实时转录。【1】主角:GPT-Realtime-2号称带 GPT-5 级别的推理能力。比上一代 GPT-Realtime-1.5,在 Big Bench Audio 智能测试上从 81.4% 涨到 96.6%,Audio MultiChallenge 多轮对话指令跟随从 34.7% 涨到 48.5%。几个实际变化:开口前会先垫一句。执行长任务前先说"我查一下""稍等一下",避免用户对着空气以为它死机了。工具调用透明化。能同时调多个工具,过程会被念出来,比如"正在查你的日历""正在搜索",让用户听到 agent 在干什么。上下文窗口从 32K 扩到 128K,能撑更长的对话和更复杂的任务编排。开发者可以在 minimal 到 xhigh 五档推理强度里选,默认 low。简单问答用低延迟,复杂任务挂高推理。出错时会说"这块我现在处理不了",不再直接卡死或乱讲。【2】Translate 和 WhisperGPT-Realtime-Translate 支持 70 多种输入语言、13 种输出语言的实时语音翻译,主打跨境客服、教育、直播场景。德国电信已经在测;BolnaAI 在印地语、泰米尔语、泰卢固语等印度方言场景下报告错词率比其他模型低 12.5%。GPT-Realtime-Whisper 是流式版 Whisper,边说边出字幕,主打会议、直播、客服转录。【3】价格GPT-Realtime-2:每百万音频输入 token $32(缓存 $0.40),输出 token $64。GPT-Realtime-Translate:每分钟 $0.034。GPT-Realtime-Whisper:每分钟 $0.017。三款都已在 Realtime API 上线,Playground 可以直接试 GPT-Realtime-2。官方公告:网页链接 宝玉xp的微博视频
新浪微博 2026-05-08 00:00:00
15. 未来汽车的中控系统会发展成什么样,语音交互能完全取代触摸吗?
知乎 2025-12-22 00:00:00
16. 豆包输入法的语音识别功能确实很强,毕竟用的豆包同款,准确率极高,特别是长语音识别,但是可惜了,iPhone避免不了要跳转,而且提示灯会一直显示,这个暂时无解不过对于我来说,输入法还是打字多,语音输入的场景极少,基本用不到,朋友们语音输入用的多吗?
新浪微博 2025-11-29 00:00:00
17. 豆包发布语音识别模型 2.0,支持多模态视觉和 13 种海外语言,有哪些技术亮点?
知乎 2025-12-05 00:00:00
18. 在线语音合成技术日新月异,阿里云Qwen团队最新开源的Qwen3-TTS项目,非常强大!它支持多语言(中英日韩德法俄葡西意等10种,以及多方言),拥有超低延迟流式合成功能,甚至能按自然语言指令智能调控声线的情绪、语调和节奏,真正实现“想怎么说,就怎么听”。Qwen3-TTS集合了定制声线、自由设计声音、以及精彩的音色克隆功能,还能应对嘈杂文本,稳定演绎高保真声音。无论做主播配音、智能助理、或是个性化语音内容生产,都特别适合。GitHub地址:github.com/QwenLM/Qwen3-TTS核心亮点:- 自研高效语音编码器,保证声音细节完整还原;- 端到端多码本模型架构,提升生成速度和音质上限;- 双轨流式架构,最高97毫秒合成延迟,适合实时交互;- 支持以文字自然语言控制发声风格和情绪表达;- 提供丰富预训练模型,快速实现声线设计、克隆和合成;- Python一键安装qwen-tts库,支持本地和API在线调用;- 兼容多平台和硬件加速,支持从示例到专业定制多种场景。对TTS开发者、AI语音爱好者、内容创作者都很友好,赶紧试试吧!🔊✨
新浪微博 2026-02-19 00:00:00
19. 开发AI玩具和语音伴侣设备,常常需要集成多种模型、音频处理和网络通信,硬件兼容性差、部署复杂,调试起来异常麻烦。ElatoAI 把实时语音AI的全栈功能整合到ESP32上,支持100+模型的端到端语音交互解决方案。不仅兼容OpenAI Realtime API、Gemini Live、xAI Grok、ElevenLabs和Hume AI EVI,还提供安全WebSocket、边缘函数部署、全球低延迟对话,甚至支持本地LLM和OTA更新。GitHub:github.com/akdeb/ElatoAI主要功能:- 实时语音转语音,支持OpenAI、Gemini、xAI Grok、ElevenLabs、Hume AI等多模型;- 安全WebSocket和Opus音频压缩,实现<2s全球低延迟对话;- 自定义AI代理,支持个性化声音、音调调节和工具调用;- ESP32固件,支持按钮/触摸控制、WiFi配置、OTA更新,无需PSRAM;- Next.js前端+Supabase后端,提供设备管理和对话历史;- 边缘部署,支持Deno Edge/Cloudflare Workers,全球20分钟不间断对话。支持Arduino IDE/PlatformIO开发,Web/移动端控制,适合AI玩具、语音助手和IoT设备开发者。#AI硬件##ESP32##语音AI#
新浪微博 2026-04-21 00:00:00
20. 领克语音助手夜间误关大灯引发撞车,这是怎么回事?车企该怎样解决语音控制系统的安全问题?
知乎 2026-02-27 00:00:00
21. 领克语音助手夜间误关大灯引发撞车,这是怎么回事?车企该怎样解决语音控制系统的安全问题?
知乎 2026-02-27 00:00:00
22. 字节又放大招!最强语音输入法来了,实测遥遥领先
微信公众号 2025-11-22 00:00:00
23. 【大家测】好玩!399元预售 土豆子2号 开箱体验 一款可以随身携带的智能语音
哔哩哔哩 2025-12-17 00:00:00
24. //@ItsLiliana:我们的最新工作OmniVoice:我们设计了一个新的非自回归TTS架构,在极致简化的同时性能显著超越了此前模型。在此基础上,我们用纯开源数据打造出了一个超越商用系统的多语种语音克隆TTS模型,覆盖600+语种,也是业内首个覆盖上百语种的语音克隆TTS模型。欢迎大家试用体验。
新浪微博 2026-04-07 00:00:00
25. 有时候真的对微信又爱又恨,最新微信发现输入框右边有了一个“语音按钮”。而且识别准确率特别高,应该是跟微信输入法的是同一个底层。这对iPhone来说体验提升太多了,之前用微信输入法的语音转文字都有图2的跳转提醒,很烦。现在舒服了。
新浪微博 2025-11-18 00:00:00
26. 【#千问上线新模型#】3月30日,阿里千问宣布全模态大模型Qwen3.5-Omni上线。Qwen3.5-Omni系列包含Plus、Flash、Light三种尺寸的Instruct版本,支持256k长上下文,模型支持超过10小时的音频输入及超过400秒的720P(1FPS)音视频输入。模型在海量文本、视觉以及超过1亿小时的音视频数据上进行原生多模态预训练,该模型展现出卓越的全模态感知与生成能力。相比Qwen3-Omni,Qwen3.5-Omni多语言能力大大增强,能够支持113种语种和方言的语音识别和36种语种和方言的语音生成。(财联社)
新浪微博 2026-03-30 00:00:00
27. 视频语音转文字怎么弄?学会这几招,便捷转写更省心!
知乎 2026-04-21 00:00:00
28. 语音AI的应用越来越实际了目前OpenAI 发布了三款全新实时语音模型,面向开发者开放了API接入,分别是GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper。GPT-Realtime-2作为最强的语音模型,我们可以把它理解成一个可以打电话的GPT-5 #openai发布三款实时语音模型##ai创造营##微博兴趣创作计划#
新浪微博 2026-05-08 00:00:00
29. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC
抖音 2025-12-14 00:00:00
30. 最近体验了两个输入法。实话实说,没想到豆包输入法真的太好用了,词语联想很贴切,尤其是语音输入,识别速度超快,而且准确率非常高,没有那么多乱七八糟的附加功能,比某度某狗的都好,我之前一直用某度的。微信输入法没有想象中好,不舒服,卸载了。大家不妨也试试看,对比对比。
新浪微博 2025-12-02 00:00:00
31. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。
新浪微博 2026-03-31 00:00:00
32. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#
新浪微博 2026-03-31 00:00:00
33. 语音转文字软件哪个好用?这几款帮助解锁便捷沟通新体验!
知乎 2026-04-20 00:00:00
34. 估值狂飙至130亿美元!语音AI初创公司Deepgram融资1.3亿美元,引爆智能语音赛道
微信公众号 2026-05-03 00:00:00
35. OpenAI Whisper 产品调研
微信公众号 2026-03-30 00:00:00
36. OpenAI语音延迟压缩到毫秒级
微信公众号 2026-05-08 00:00:00
37. OpenAI 如何实现低延迟语音 AI?深入解析 WebRTC 架构重构
微信公众号 2026-05-07 00:00:00
38. Gemini升级语音交互 响应延迟降低60%
今日头条 2026-04-23 00:00:00
39. 语音识别的五个颠覆性真相
微信公众号 2025-12-12 00:00:00
40. 微软开源VibeVoice,语音AI变天了
微信公众号 2026-04-02 00:00:00
41. Scale AI 推出 Voice Showdown 首个语音 AI 模型的真实测试
微信公众号 2026-03-23 00:00:00
42. 语音 AI 的“双重人格”
微信公众号 2026-04-05 00:00:00
43. 构建生产级语音智能体
知乎 2026-03-23 00:00:00
44. 打造低延迟语音智能体
微信公众号 2025-12-09 00:00:00
45. SP-MCQA
微信公众号 2026-03-25 00:00:00
46. 阿里千问开源Qwen3-ASR语音识别模型,支持52种语种与方言
今日头条 2026-01-30 00:00:00
47. 2026权威评测
今日头条 2026-04-30 00:00:00
48. 权威评测与精准甄选
知乎 2026-02-28 00:00:00
49. 智汇云API市场
知乎 2025-12-03 00:00:00
50. 方言识别+实时翻译!讯飞星火评测,语音交互技术有多强?
微信公众号 2026-04-07 00:00:00
51. OpenAI突然发布超强语音AI!延迟压到300毫秒,跨境电商老板笑了
今日头条 2026-05-09 00:00:00
52. 300毫秒生死线
微信公众号 2026-05-05 00:00:00
53. AI语音交互的“四环”瓶颈与ElevenLabs的优化实践
知乎 2026-03-01 00:00:00
54. 阶跃 StepAudio 2.5 ASR 上线!500TPS 极速推理,30分钟语音“秒级转写”
知乎 2026-04-24 00:00:00
55. 深度解读
知乎 2026-05-05 00:00:00
56. 阿里Fun-ASR1.5语音识别模型发布
今日头条 2026-04-20 00:00:00
57. 小红书开源了自己的语音识别模型
小红书 2026-02-13 00:00:00
58. 支持200种国内方言的智能语音识别芯片
知乎 2026-02-27 00:00:00
59. 千问语音识别模型Qwen3-ASR开源
知乎 2026-01-30 00:00:00
60. Meta 开源超千种语言语音识别模型,迈向真正的“全球听写”
今日头条 2025-11-24 00:00:00
61. Fun-ASR - 多语言多方言的高精度语音识别软件 支持50系显卡 一键整合包下载
知乎 2025-12-18 00:00:00
62. Fun-ASR 全新升级|企业级抗干扰 通义百聆语音识别大模型 Fun-ASR在抗噪、多语言、方言覆盖、歌词识别和企业定制等能力上全面提升,并同步开源 Fun-ASR-Nano(0.8B)轻量模型。
抖音 2025-12-16 00:00:00
63. GLM-ASR - 最强中文及方言语音识别利器 语音识别 语音转文字 支持50系显卡 一键整合包下载
知乎 2025-12-16 00:00:00
64. 阿里千问开源语音识别模型Qwen3-ASR
今日头条 2026-01-30 00:00:00
65. 豆包语音识别模型2.0发布
什么值得买 2025-12-06 00:00:00
66. 讯维AI会议语音转写系统
微信公众号 2026-03-23 00:00:00
67. 讯维AI会议语音转写系统在某政府单位的应用案例!
微信公众号 2026-05-14 00:00:00
68. 讯维新一代 AI 智能语音转写系统,重构语音文字转换新体验!
微信公众号 2026-03-31 00:00:00
69. 学术语音识别
什么值得买 2026-02-01 00:00:00
70. 从“听见”到“理解”
知乎 2026-02-24 00:00:00
71. 智能会议记录工具是如何识别每一个发言人的
什么值得买 2025-11-22 00:00:00
72. 离开了人工速记,如何留住转瞬即逝的灵感
什么值得买 2026-04-20 00:00:00
73. 开源!1 分钟搞定 3 小时会议记录的顶级AI会议纪要系统
微信公众号 2026-02-02 00:00:00
74. 跨国会议转写总听不清?2026该如何选合适的多语言语音识别方案
什么值得买 2026-05-07 00:00:00
75. 阿里AI语音转写神器方言都能写对
微信公众号 2026-04-21 00:00:00
76. 你负责头脑风暴,智能AI负责会议纪要
什么值得买 2026-04-25 00:00:00
77. 当实时翻译、转写、推理被打包进一个 API,语音 Agent 真要落地了
微信公众号 2026-05-11 00:00:00
78. 打电话被AI气死?OpenAI刚刚把语音交互升级了
微信公众号 2026-05-08 00:00:00
79. OpenAI把语音模型和Realtime API一起升级,AI助手开始真正抢耳朵入口
微信公众号 2026-05-09 00:00:00
80. OpenAI推出语音智能功能 覆盖客服教育领域
今日头条 2026-05-09 00:00:00
81. 假期客服压力峰值如何应对?实测
今日头条 2026-02-25 00:00:00
82. RAG+语音=下一代智能客服?方案已就位,零基础也能跑通
知乎 2026-05-12 00:00:00
83. AI 电话客服,终于到了真正挨骂的地方
微信公众号 2026-05-13 00:00:00
84. 2026记者线下采访遇语音识别准确率低适合选哪款实用转写工具
今日头条 2026-05-04 00:00:00
85. 阿里语音大模型准确率超95%
微信公众号 2026-04-20 00:00:00
86. 2026高准确率语音识别软件转写准整理快,帮你省下大量打字时间
今日头条 2026-04-29 00:00:00
87. 方言+降噪双能打,科大讯飞成中文语音最优解
今日头条 2025-12-02 00:00:00
88. 让车机听懂不同口音有多难?我们在车里录了30万句话。
微信公众号 2026-04-02 00:00:00
89. 为AI机器人装上“金耳朵”
知乎 2026-03-19 00:00:00
90. 2025年5款主流AI语音机器人实测
今日头条 2026-01-21 00:00:00
91. 语音转文字准确率 95%!Whisper 本地部署完全指南
知乎 2026-04-13 00:00:00
92. 什么软件能把语音转换成文字,寻找准确率更高的语音转文字工具
今日头条 2025-11-27 00:00:00
93. 2026 年度语音转文字工具哪个好,高准确率多语种支持推荐
知乎 2026-01-13 00:00:00
94. 2025年语音转文字工具权威测评
今日头条 2025-12-22 00:00:00
95. 智谱语音识别大模型开源,支持中国方言,消费级显卡本地部署
微信公众号 2026-01-23 00:00:00
96. 实测|免费替代剪映会员!openai whisper CLI语音转文本,准确率几乎无差别
知乎 2026-04-16 00:00:00
97. NVIDIA Nemotron Speech ASR
微信公众号 2026-02-03 00:00:00
98. GitHub一巡!边缘设备语音识别延迟高?Moonshine Voice开源工具包实现实时低延迟高准确率语音转文字
微信公众号 2026-02-18 00:00:00
99. 语音识别演变
微信公众号 2026-02-01 00:00:00
100. 云平台一键部署【Nemotron-0.6B】英文长语音转文本神器
知乎 2026-03-10 00:00:00
101. 一起看看OpenAI 如何把低延迟语音 AI 做到规模化
今日头条 2026-05-06 00:00:00
102. Mistral发布两款语音模型,实时处理延迟低于200毫秒
知乎 2026-03-10 00:00:00
103. GitHub一巡!解决实时语音识别延迟痛点,Moonshine实现边缘设备低延迟高准确率语音转文本
微信公众号 2026-02-17 00:00:00
104. AI语音通话实现流程,怎么保证低延迟的
知乎 2026-04-09 00:00:00
105. 🎙️千问开源 Qwen3-ASR 系列语音识别模型。
抖音 2026-01-30 00:00:00
106. Qwen3-ASR 正式开源
微信公众号 2026-02-02 00:00:00
107. 2026重磅黑科技亮相!AI加持颠覆多语言语音识别,快准稳极致体验
今日头条 2026-01-29 00:00:00
108. 方言识别准确率参差不齐,语音技术面临多样语言环境考验
今日头条 2026-03-09 00:00:00
109. 思玄科技|方言标注
知乎 2026-03-31 00:00:00
110. 终于有 AI 模型能识别方言了。
微信公众号 2026-04-22 00:00:00
111. 实测AI语音助手
今日头条 2026-01-06 00:00:00
112. 思玄科技|方言标注
知乎
113. OpenAI正式推出3款音频模型
微信公众号 2026-05-08 00:00:00
114. 微软VibeVoice-ASR开源,60分钟长音频一口气转录,自带声纹识别和时间戳,强得可怕
知乎 2026-02-10 00:00:00
115. OpenAI 再升级:三款实时语音模型登场,听说翻译一体化
微信公众号 2026-05-08 00:00:00
116. 通义开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
微信公众号 2025-12-16 00:00:00
117. 打破语音识别边界,豆包 2.0 带来三重革命
微信公众号 2025-12-15 00:00:00
118. xAI发布Grok语音API
微信公众号 2025-12-19 00:00:00
119. 豆包语音识别2.0上线!听音识图、13语种全开
微信公众号 2025-12-06 00:00:00
120. 2025年度语音转文字工具哪个好,高准确率多语种支持推荐
知乎 2026-01-13 00:00:00
121. 2026年实测语音识别不准确?5个轻松技巧提准确率至95
什么值得买 2026-01-23 00:00:00
122. 推荐一个嵌入式语音识别开源项目
微信公众号 2026-05-07 00:00:00
123. 2026最新口碑整理 | 解决语音识别不准确的实用选择建议
今日头条 2026-04-30 00:00:00
124. 幽冥大陆(五十六)ASR Whisper模型如何选择 C语言—东方仙盟筑基期
微信公众号 2025-12-23 00:00:00
125. 阿里通义开源Fun ASR Nano 支持31个语种识别
知乎 2025-12-27 00:00:00
126. 构建AI智能体:九十三、基于OpenAI Whisper-large-v3模型的本地化部署实现语音识别提取摘要
知乎 2026-01-24 00:00:00
127. 5 分钟上手!用 Python 调用讯飞语音评测(流式版)API
微信公众号 2026-01-05 00:00:00
128. 会议录音转文字还在低效折腾?AI精准高效帮你搞定!
今日头条 2025-12-23 00:00:00
129. WhisperLiveKit:本地实时语音转写,低延迟
今日头条 2025-12-04 00:00:00
130. 主流多语种ASR模型概览
知乎 2025-12-17 00:00:00
131. 微软、英伟达、小米 开源 AI 语音三剑客:VibeVoice vs PersonaPlex vs OmniVoice 全方位对比!
微信公众号 2026-04-06 00:00:00
132. 语音识别动态策略系统搭建
微信公众号 2026-03-02 00:00:00
133. ✅2025 最新ASR语音识别王者榜单
小红书 2025-12-25 00:00:00
134. 语音机器人品牌实力推荐:谁在大模型语音对话实测中拔得头筹?
今日头条 2025-11-21 00:00:00
135. 豆包语音识别模型2.0上线,支持13种海外语种精准识别
今日头条 2025-12-06 00:00:00
136. 具备身份感知能力的全双工语音交互前端 ASR 模型: SenseVoice (Small):采用阿里开源的 SenseVoice 模型 (Int8 量化版)。这是一个多语言(中、英、日、韩、粤)全能模型,识别准确率极高,且推理速度极快。 声纹模型: CAM++ (3D-Speaker):采用 ModelScope 的 CAM++ 模型。相较于传统的 ResNet 方案,在短语音上的声纹特征提取更加鲁棒。 VAD 模型: Silero VAD:业界公认最强的轻量级端侧静音检测模型,延迟极低。 #语音识别
抖音 2025-12-24 00:00:00
137. MiniMax 海螺 AI API 接入教程:语音+文本多模态实战
知乎 2026-04-21 00:00:00
138. 豆包发布语音识别模型2.0,支持多模态视觉识别和13种海外语种识别
今日头条 2025-12-05 00:00:00
139. Fun-ASR-Nano最新语音识别整合包,支持31种语言和26种方言识别
哔哩哔哩 2025-12-17 00:00:00
140. 复杂场景语音识别新突破:SAP²技术精准剪枝,提升长上下文场景ASR性能
微信公众号 2025-11-18 00:00:00
141. 2025年中国车载语音行业发展趋势分析,行业正从基础指令识别向多模态交互、情感化计算升级「图」
微信公众号 2026-01-07 00:00:00
142. 2026年AI语音机器人选型:5大维度评测实力驱动效能双重突破
知乎 2026-02-25 00:00:00
143. 2025实测:5款AI语音机器人对比,哪款AI领衔语义理解之王
知乎 2026-03-01 00:00:00
144. ListenHub ASR 语音识别 API 全新上线,无限免费
微信公众号 2026-03-14 00:00:00
145. Agent新突破:方言识别
小红书 2026-04-02 00:00:00
146. GLM-ASR-Nano-2512 语音识别整合包,支持低语/轻声识别,支持17种语言和方言,使用最方便
哔哩哔哩 2025-12-22 00:00:00
已收藏
去我的收藏夹