谷歌重磅发布 Gemini 3.5 Transcribe 刷新语音识别精度

2026-08-27 18:21:38 0点赞 0收藏 0评论

谷歌近日宣布推出其 Gemini 家族语音转文字模型的最新版本 —— Gemini 3.5 Transcribe。这家搜索巨头表示,这是该系列迄今为止精度最高的语音识别模型。

Gemini 3.5 TranscribeGemini 3.5 Transcribe

新模型在处理背景噪音和复杂专业术语方面表现更为出色。谷歌指出,得益于这一新模型,macOS 端 Gemini 应用以及 Android 端 Gboard 键盘的 Rambler 功能均已实现性能提升。同时,开发者也可利用该模型打造语音智能体、实时字幕工具或通话后分析系统。

谷歌在博客中写道:“Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,从而更好地理解用户意图并识别自定义词汇,让用户能够通过语音高效执行各类任务。”

这款全新的 AI 模型还配备了一系列提升输出质量的新功能。首先,它具备自我纠错能力,能够自动去除口语中的填充词(如“嗯”、“啊”),并实现文本的自动排版。此外,它还能将文件分析、图像生成等复杂任务无缝委派给其他 Gemini 模型处理。

据谷歌介绍,Gemini 3.5 Transcribe 提供了更精准的转录服务,在流式传输和非流式传输场景下的平均词错率(WER)分别仅为 4.0% 和 2.6%。在嘈杂环境中,该模型依然能保持出色的识别效果,并能准确捕捉订单号、邮政编码等字母数字混合实体。

Gemini 3.5 TranscribeGemini 3.5 Transcribe

目前,Gemini 3.5 Transcribe 支持 85 种语言,并兼容多种地区口音与方言。在处理预录音频时,它最多可为三位说话人进行语音分离并添加时间戳;同时,模型支持用户自定义专属词汇表,能够精准识别特定领域的专业术语及特殊拼写。

在可用性方面,谷歌表示开发者现已可通过 Google AI Studio 和 Google Antigravity 在 Gemini API 中公开预览 Gemini 3.5 Transcribe。普通用户则可在 Android 和 macOS 平台上进行体验。此外,该模型即将登陆 Google Chrome 浏览器,届时用户可在任意网页输入框中实现“语音输入”。

除了语音识别模型,谷歌在 Gemini 领域近期动作频频。公司刚刚发布了 Gemini 3.7 Flash 模型,正式加入 AI 价格战。同时,面向美国用户的 Android 版 Chrome 浏览器已全面上线 Gemini 功能,该 AI 助手也被集成到了 Waymo 的最新无人驾驶出租车中。

最后,对于有人声音频分离需求的用户,也可以通过简鹿人声分离来使用 AI 模型轻松从音频中分离人声或伴奏,它支持 Windows 和 macOS 系统,是制作音乐处理音频的好帮手。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松