最近刷古装悬疑剧《海市蜃楼》的讨论,一条吐槽把我看乐了,也看服了:“感觉武戏里没有拟音师的。其中有一段打戏,棍棒打击是砰砰声,拳脚互怼是砰砰声,刀剑相碰也是砰砰声,我真是人都麻了”。知乎你看,观众的耳朵其实很毒。说不清哪里不对,但一定听得出敷不敷衍。
而就在今年,AI 正式盯上了这门手艺。6 月 23 日火山引擎 FORCE 大会上,字节发布豆包音频生成模型 Seed-Audio 1.0,官方的说法是"在一次生成中同步编排角色对白、情绪语气、方言口音、背景音乐及拟音特效,一次性直出影视级的成品音效"。微博也就是说,"拟音"这个靠人捏芹菜、甩牛仔裤干出来的行当,第一次被 AI 写进了产品说明书。

那替代的边界到底画在哪儿?我把全网最近的讨论、实测和行业访谈捋了一遍,今天一次说清。
先看今年 AI 对"声音"做了什么
这条时间线值得记住:
2 月,Seedance 2.0 上线,AI 视频开始自带同步音效,能"同步生成与画面动作严丝合缝的音效(如刀切玫瑰的酥脆声)"。当时就有行业观察文章写道,传统手艺人(如分镜师、原画师、初级剪辑师与拟音师)面临被彻底"物理消灭"的生存焦虑。知乎
6 月 23 日,豆包音频生成模型 1.0 发布,人声、音乐、环境声、拟音一锅出,有博主直接说"字节的音频生成模型,才是今天的王炸"。微博
7 月 20 日,Seed-Audio 1.0 升级,新增"精准时间控制",官方的表述是"让人声可以按照画面节奏准确出现,无论是台词进点、情绪停顿,还是与镜头、动作、字幕的配合,都能更自然地卡准每一帧"。
注意第三个节点:当"时间控制"需要被单独拎出来当卖点,恰恰说明"跟画面对齐"是这个行业目前最难啃的骨头。而"对齐",正是拟音师的看家本领。
另一边:人类拟音反而更火了
有意思的矛盾来了——AI 步步紧逼的同时,拟音内容正在迎来自己的流量高峰:
B 站那条"拟音师玩游戏,那都是自带声音的",播放超过 140 万。哔哩哔哩小红书上有《幻兽帕鲁》版"你不干有的是帕鲁干!拟音师玩游戏自带声音",几千赞。小红书年初一个"5 分钟一镜到底拟音挑战",评论区一堆人交作业。
微博上有拟音创作者给自己的内容"破亿"庆生;“工资高但是很小众的工作"这种话题里,拟音师跟闻臭师、碳排放管理师并列出圈,被形容为"竞争极小,薪资远超普通白领”。微博
综艺也在用它做文章:《喜人奇妙夜》的声效片段被剪成"从魔性拟音到灵魂呐喊"的合集;动画《小虫虫大冒险》的制作特辑专门出了拟音设计篇。
《黑神话:钟馗》8 月 20 日实机演示刷屏之后,官方民乐制作花絮播放近 80 万,拟音团队还发了全员吹拉弹唱庆祝钟馗登场的视频——玩家已经开始逐帧审一部游戏的"声音"了。哔哩哔哩
为什么越被"替代"越火?因为拟音内容卖的从来不是"声音文件",而是反差感和手艺现场:原来骨折声是芹菜掰出来的,武打片袖子纷飞是牛仔裤甩出来的,蜘蛛侠发射蛛网的声音也是拟音师手搓出来的。这种"我猜不到"的体验,AI 目前给不了。

边界在哪:三种声音,三种命运
结合知乎多篇文生音效实测、声音模型公司访谈和观众的真实吐槽,我的判断是分三层:
第一层,AI 已经能接手的:通用环境音和功能音效。 雨声、风声、雷声、UI 点击、转场音效,以及"脑子里有画面但素材库搜不到"的声音。有创作者在知乎实测,输入"暴风雨中远处传来的雷声,伴随细密的雨点打在玻璃窗上",大概 3 秒出结果,雷声的远近层次做得很好。对量产的短剧、解说、营销号内容,这是实打实的效率工具。
第二层,AI 还欠火候的:同步和质感。 拟音(Foley)的核心,是跟画面动作逐帧咬合,还得有材质:同样是脚步声,皮鞋和布鞋、木地板和泥地,声音完全不一样。《海市蜃楼》被吐槽的"砰砰砰"就是反面教材——不是没声,是所有声都一样。观众听得出来的"廉价感",差的就是这一层。
第三层,人类暂时交不出去的:表演性和判断力。 拟音师本质上是演员:甩牛仔裤的节奏要贴画面的力道,捏芹菜的力度要跟角色的表情对戏。有声音模型公司在访谈里说得很直白:拟音"成本高、效率低,一场戏的音效制作可能耗时数天",他们瞄准的替代对象主要是快速迭代的量产环节;而像"高跟鞋踩在沙滩上的质感"这类复杂声音,“要么不存在,要么难以通过传统拟音实现”,恰恰是拉开作品上限的地方。知乎
这条边界画得对不对,入行 16 年的青岛拟音师韩睿达可能最有发言权。他的工作室有各式高跟鞋、皮鞋、球鞋,不同料子的袜子,地面还被划分出沙坑、大理石砖、橡胶板等多个区域,只为模拟脚步声时找到最佳搭配。他对新华社记者说:“利用电脑合成技术可以完成一些简单的音效,但有生命力的声音更能打动人心”。新华网这份"生命力"是他拿时间换的:"脚步声里有情绪,热情的人和伤心的人不一样,儿童和老人的不一样,光是研究脚步声我就用了3年。"完成一部电影的拟音至少要花费 1 个月,几秒钟的画面有时对应着上百个音轨;为了给某部科幻片的关键道具配启动音效,他去废品回收站淘了一个变压器,让钢珠在上面滑出想要的声音变量。这种判断力和较真,正是 AI 暂时交不出去的部分。

当然,丑话说前面:这条边界是按 2026 年年中的状况画的。AI 音效这个月跟下个月可能就不一样,半年后欢迎回来打脸。
对你意味着什么
自己做短视频、配音效: 通用音效优先用 AI 工具和免费素材库,又快又省;但商用授权是个隐形坑,“‘个人使用免费,商业需联系’这种表述在创作者圈里等于‘不敢用’”,尽量选授权条款写得清楚的。知乎
想学拟音、考虑入行: 低水平的重复活儿大概率先被 AI 吃掉,但"给画面表演"的能力反而在升值。入门门槛其实很低:手机、安静的屋子、一把芹菜一条旧牛仔裤,就能拍第一条。B 站上已经有大学生把拟音作业发出来练手了。
普通观众: 你获得了一个新的鉴片标准——下次看打戏,听听刀剑相碰和拳脚互怼是不是同一种声音。全网的声音越容易被 AI 生成,"有人真的一帧一帧做过"这件事,就越值钱。
拟音这门手艺最妙的地方,一直是"被听见、不被看见"。现在 AI 也想学着隐形了——但观众对"真"的那点敏感,暂时还没被生成出来。
你被哪个影视剧的音效骗过,或者被哪个"五毛音效"雷过?评论区聊聊。