MiniMax Music 2.5与昆仑万维Mureka V8同期发布,直击AI音乐长期存在的段落失控与人声失真两大顽疾。二者分别以结构化标签控制和类人类创作逻辑实现技术跃迁,首次在中文歌曲生成中系统性超越国际主流模型。
智能速览
MiniMax Music 2.5支持14种精确段落标签控制,实现Intro、Bridge、Hook等专业结构级干预
Music 2.5针对华语演唱优化,解决‘吞字、糊音’问题,转音与共鸣切换达到可混淆人耳水准
Mureka V8在旋律性、人声表现力、编曲结构、情绪渲染四项主观评分中全面超越Suno V5
Mureka V8基于MusiCoT技术链,按动机→旋律→情绪铺陈的逻辑生成音乐,更贴近人类创作路径
2025年Q1中国独立发行新歌中,AI生成作品占比达56.9%,创作流程正从流水线转向‘一人乐队’模式
精华内容
当AI不再只是拼接音符,而是能理解前奏的情绪铺垫、桥段的张力转折、副歌的记忆锚点,音乐生成便真正迈入专业门槛。
段落强控
MiniMax Music 2.5开放全段落标签控制体系,覆盖Intro、Bridge、Interlude、Build-up、Hook等14种结构变体。实测显示,用户输入‘先30秒钢琴铺垫,接着20秒弦乐渐入,进入8小节说唱副歌’,模型可严格按指令分段生成,误差率低于3%。相较上一代,段落衔接准确率提升67%,彻底摆脱‘AI想到哪写到哪’的不可控状态。
人声保真
针对中文演唱特有的齿音模糊、韵母拖沓、声调失准等问题,Music 2.5重构了声学建模层,在1000小时华语流行语料上专项微调。官方对比测试中,专业制作人盲听分辨准确率仅为52.3%,接近随机猜测;在Billie Eilish风格转音片段中,胸腔至头腔共鸣切换时长误差控制在±17ms内,已逼近顶级录音棚实录水平。
结构逻辑
Mureka V8摒弃提示词驱动式生成,转而采用MusiCoT(Music Chain-of-Thought)架构。模型先解析‘怀旧都市夜景+略带忧郁的电子律动’这一意图,生成4小节动机乐句,再据此发展主歌旋律、设计副歌记忆点、安排间奏情绪回落,最终完成结构闭环。《MCE》全曲共127小节,段落起承转合符合专业流行曲式规范,无机械重复或逻辑断裂。
中文超越
昆仑天工委托第三方机构对Mureka V8与Suno V5进行双盲评测,覆盖40首中文原创歌词。在人声表现力维度,Mureka V8在音色贴合度、性别辨识准确率、唱法匹配度三项指标上分别高出Suno V5 28%、33%、41%。例如输入‘男声,烟嗓,周杰伦式咬字’,Mureka V8生成人声在‘的’‘了’等轻声字处理上保留气声衰减细节,Suno V5则普遍出现字头过重或字尾吞没。
这两款模型标志着AI音乐从‘能生成’迈向‘可交付’的关键拐点。它们不替代作曲家,却正在重定义创作分工:灵感构思、结构设计、音色选择、混音调整——每个环节都开始出现人机协同的新范式。当技术已能支撑专业级输出,下一个待解的问题或许是:我们该如何重新界定‘作者权’与‘工具性’的边界?