Google Deepmind推出的AI音乐生成模型Lyria 3,通过Gemini应用向全球用户开放。它最大的特点是支持用图片和自然语言直接生成音乐,极大地降低了音乐创作门槛,为短视频内容创作等领域带来了全新的可能性,标志着AI音乐创作进入了新阶段。
智能速览
用户上传图片或视频,AI即可分析生成匹配的音乐。
通过自然语言描述,可自由定制90年代复古说唱等复杂风格。
音频输出达48kHz录音室级别,并能创作歌词与生成逼真人声。
支持包括中文在内的10余种语言,能融入地方特色音乐元素。
整合Nano Banana模型,可为生成的歌曲自动创作专属封面。
生成音乐可直接导出至YouTube Shorts,实现快速分享。
精华内容
Lyria 3的革命性不仅在于能生成音乐,更在于它如何重塑人与音乐的互动方式。通过视觉与语言的输入,复杂的音乐创作变得前所未有的直观和高效。
灵感输入新方式
Lyria 3的核心创新在于其多模态输入能力。用户只需上传一张照片,如日落或宠物,系统就能分析画面的色彩、构图与情绪,并将其转化为具体的音频提示词,生成环境音乐。此外,它还支持极高的自由度进行自然语言定制,比如输入“一首关于在未来城市寻找记忆的90年代复古说唱”,模型便能精准理解并创作出符合描述的音乐。
录音棚级音质体验
在输出质量上,Lyria 3达到了行业领先水平。单次生成的标准时长为30秒,完美适配短视频BGM场景。音频采样率高达48kHz,达到专业录音室标准,并以立体声输出,确保了听感的饱满与层次分明。其最大的突破在于智能歌词与人声的生成,模型能根据主题自动创作韵脚复杂的歌词,并生成具有呼吸感和情感起伏的男声、女声及和声,效果已非常接近真人。
跨越语言与文化
为了服务全球用户,Lyria 3首批支持了包括中文(普通话)、英语、日语在内的10余种语言。更重要的是,它并非简单地翻译歌词,而是能够根据不同语言的文化语境,生成具有地方特色的音乐元素。例如,在创作中文歌曲时,模型可能会融入民乐旋律,使作品更具本土风情和辨识度。
一体化创作生态
Lyria 3不仅是一个音乐生成工具,更构建了一个完整的创作与分享生态。每生成一首歌曲,系统都会调用谷歌的Nano Banana图像模型,自动生成一张与音乐风格高度匹配的专辑封面。同时,它与YouTube生态深度打通,用户可以将生成的音乐一键导出到YouTube Shorts的Dream Track功能中,作为原创配乐直接发布,极大地简化了从创作到分享的流程。
Lyria 3的出现,让普通人与专业音乐创作的距离被前所未有地拉近。它不仅是技术的迭代,更是创作民主化的又一次推进。当音乐可以像说话一样被“描述”出来,未来的艺术表达形式将迎来怎样的变革?这无疑值得我们持续关注与期待。