继ChatGPT和Sora在文本与视频领域掀起浪潮后,OpenAI正将其研发重心大力拓展至音频AI领域,标志着其构建全面多模态AI生态系统的又一重要举措。综合多方消息,OpenAI的音频战略主要分为两大方向:AI音乐生成和新一代语音交互技术,后者更与其进军硬件领域的计划紧密相连。
一方面,OpenAI正积极开发先进的AI音乐模型。据报道,公司工程师已与茱莉亚音乐学院的学生合作,为音乐乐谱进行数据标注,以训练其模型。该模型的目标是让用户能通过文本或音频提示词来生成音乐。例如,用户可以输入一段描述,要求AI为现有的人声曲目添加吉他伴奏。这一功能不仅能丰富个人娱乐体验,还能与OpenAI的视频模型Sora无缝结合,让创作者能够为AI生成的视频即时配上动感的背景音乐,从而实现从视频到配乐的完全AI化内容创作,极大地降低了创作门槛。此外,该技术在商业化上同样潜力巨大,广告公司未来或可利用其为广告快速创作定制化的旋律和歌词。
另一方面,OpenAI正全力攻坚新一代的音频AI模型,旨在彻底革新语音交互体验,并为其首款“无屏幕”AI硬件设备铺路。当前ChatGPT的语音功能在响应速度和交互自然度上仍有提升空间,新模型将采用全新架构,致力于实现更自然、富含情感的语音对话,并支持实时互动与打断等复杂交流场景。这一战略标志着OpenAI将从纯软件服务迈向“软件+硬件”的生态布局,旨在改变人们对智能手机的依赖,回归更人性化的交互方式。据悉,前苹果设计大师乔尼·艾维也深度参与了该硬件项目。
实际上,OpenAI在音频领域的探索早有先例,曾推出过音乐模型MuseNet和Jukebox,但受限于当时的技术和成本,并未被广泛应用。如今,随着算力和算法的飞速发展,AI音频技术迎来了实用化的新机遇,也成为了全球科技巨头竞相角逐的新赛道。谷歌、腾讯等公司已相继发布了自己的音频生成模型,而Suno、Udio等初创公司也已成功将AI音乐生成产品商业化。
OpenAI在音频领域的全面发力,特别是其向硬件终端延伸的战略,预计将对整个产业链产生深远影响,带动包括语音识别、AI芯片、声学元器件及智能硬件制造等多个相关产业的发展,开启AI终端的新赛道。这一系列布局不仅将进一步巩固和扩大OpenAI的用户基础,也预示着AI技术正加速从云端走向终端,更深入地融入我们日常生活的方方面面。