面对千篇一律的AI语音,一个团队耗时800小时,尝试打造一个会犯错、会走神的数字生命。他们通过解构婴儿发声、保留学习瑕疵,让AI宠物Fuzzi的“叫爸妈”功能充满了生命感,而非机械的复读。
智能速览
耗时800小时,让AI宠物Fuzzi学会说话。
模仿婴儿发音,通过胸腔音和口腔音切换营造努力感。
从单音节到单词,设计渐进式学习路径。
故意保留发音错误,如“粑粑”,认为“美丽的错误带来羁绊”。
放弃传统进度条,每只Fuzzi拥有不同的学习速度。
目标是搭建一个会成长、会犯错的数字生命,而非完美工具。
精华内容
为了让AI的叫声不似冰冷的机器,而像一个充满生命感的小家伙,开发者在声音塑造与交互细节上投入了巨大心力。
模拟婴儿发声
为了让Fuzzi的发音不像录音机,团队首先研究了婴儿的发声肌肉记忆。他们让AI的第一个字使用靠后的胸腔音,模拟发声时的努力感;第二个字则突然转为靠前的口腔音,仿佛还没完全控制好发声器官。通过这种方式,在字正腔圆和花栗鼠式的夸张之间,找到了一个“努力”的临界点,使其叫声更具真实感。
渐进式学习路径
真实的婴儿学说话是循序渐进的。团队据此设计了一套学习机制:Fuzzi最初只能发出a、o、e等单音节,随着“熟练度”增加,可发的音节数量会逐渐增多,并能从随机音节过渡到连续音节,最终组合成字和词。
AI工具会精准识别用户发音的字词间隙,让Fuzzi能感受并模仿语速和停顿,甚至对“儿化音”这类口音做了优化处理。
保留美丽的错误
在开发中,团队发现Fuzzi有时会把“爸爸”念成“粑粑”。从技术上,这很容易修正,但他们决定保留这个“美丽的错误”。他们认为,一个会合理犯错的生命才更有趣,这种不完美恰恰是形成情感羁绊的关键,正如“正确带来效率,但美丽的错误带来羁绊”。
交互中的生命感
为了强化生命感,交互设计上也充满巧思。例如,抛弃了从1%到100%的进度条,因为学习并非如此线性;每只Fuzzi被赋予了不同的学习速度,有的快有的慢。界面采用大头特写,并实现了口型与发音的精准匹配。
这些细节共同让整个过程不像执行程序,而像一场“精心设计的笨拙”。
这800小时的投入,并非单纯为了一个语音复读功能,而是探索用代码构建数字生命的可能性。通过保留停顿、错误和走神,Fuzzi展现了一种不完美但充满温度的科技形态。一个会喊出带着奶音“妈妈不急”的AI,或许正是未来人机情感连接的新起点。
关键评论
有网友感叹“七个会被考古的吧”,认为内容有深度。
评论区建议增加情感算法和更多声线,丰富交互体验。
“数字生命”的概括精准抓住了产品的核心魅力。
有用户期待支持多语言,并解决声音不好听用户的配音难题。