ElevenLabs发布新功能,通过API可快速开发多人播客APP。相比Google NotebookLM仅限双人对话,该方案支持无上限人数,并可精细调节音色与情绪,为广播剧制作提供了全新解决方案。
智能速览
ElevenLabs推出text-to-dialogue新接口,支持单次请求生成多人对话
结合ChatGPT实现文稿自动转化为多人演播播客
功能优于NotebookLM,打破双人对话限制,支持自定义音色与情绪
提供V0 Podcast Generator模板,方便开发者快速上手
适用于制作广播剧或多人访谈节目,扩展性强
精华内容
利用ElevenLabs最新的V3 API,开发者能够在一个请求内完成多人对话的语音合成,极大降低了复杂播客应用的开发门槛。
多人对话生成
ElevenLabs V3 API引入了“text-to-dialogue”端点,允许在单个API请求中生成包含多个说话人的对话。这与传统需要拼接多个音频文件的方式不同,新接口能直接处理复杂的对话逻辑。用户只需提供语言组合和声音ID,即可在后台完成多角色音频的生成。
对比优势
与Google NotebookLM仅支持两人对谈的模式相比,ElevenLabs API的优势在于没有人数上限。开发者不仅能够自由设定对话人数,还能通过情绪代码指导AI的演绎效果。这种灵活性使得从简单的两人访谈到复杂的广播剧制作都成为可能。
开发实现
在技术实现上,该应用模板结合了Vercel AI SDK与OpenAI。流程上,先由ChatGPT根据主题生成文稿,随后将文稿处理为ElevenLabs API所需的格式。最终,通过流式传输技术,前端能够实时接收并播放生成的音频片段,无需等待完整文件处理完毕。
应用场景
该模板不仅适用于制作技术类播客,其强大的多角色定制能力使其成为制作广播剧生成器的理想选择。通过调整不同角色的音色和情绪指令,创作者可以快速产出具有丰富听觉体验的内容,极大提升了音频内容的创作效率。
ElevenLabs的这一新API接口为播客制作提供了更高效的工具,打破了以往在角色数量和表现力上的限制。对于开发者和内容创作者而言,这无疑是降低音频创作门槛的重要一步,期待看到更多基于此技术的创新应用涌现。