张大妈

北大:多智能体生成中文脱口秀,段子变演出

源自小红薯:每日ComputerScience

01-18 14:02

AI生成幽默文本已不稀奇,但要让段子变得好笑又好演,却是一大难题。现有模型常产出平淡、说教的内容。北大的OpenMic系统另辟蹊径,采用多智能体协同工作,将一个生活话题直接转化为具备舞台表演性的完整脱口秀脚本,甚至能生成最终表演视频,从根源上解决了AI幽默生成中的结构塌陷与表演缺失问题。

北大:多智能体生成中文脱口秀,段子变演出智能速览

  • 多智能体分工协作,模拟人类脱口秀创作流程。

  • 将幽默建模为多步推理,强调“包袱”的时机。

  • 采用分层RAG机制,精准提炼幽默素材。

  • 通过专用微调,注入脱口秀独有的节奏与风格。

  • 具备自我改进机制,定向提升脚本质量。

  • 实现端到端生成,从文本直达完整表演视频。

北大:多智能体生成中文脱口秀,段子变演出精华内容

OpenMic的核心在于将复杂的脱口秀创作过程,拆解给多个专业的AI智能体共同完成,每个角色各司其职,从而保证了最终成品的结构性与表演感。

分工式创作

系统将脱口秀生成拆解为五个专业的智能体角色:受众分析、结构规划、段子写作、表演指导和质量评估。这种分工模式避免了单个AI模型同时承担内容规划、写作与审美判断,有效防止了内容结构混乱或风格不统一的问题,确保每个环节都由“专才”处理,最终产出高度结构化的脚本。

幽默的推理链

OpenMic将幽默的产生机制明确建模为“多步推理+信息释放”的过程。它强调一个完整的笑点包含setup(铺垫)、bridge(桥接)和punchline(包袱)三个环节。系统区分了backdoor(倒叙)和frontdoor(顺叙)两类推理结构,并认识到“什么时候说”与“说什么”同样重要,从而精准控制笑点的呈现节奏。

素材与记忆管理

为了获取高质量的幽默素材,系统采用分层RAG机制,并非直接检索现有段子,而是通过“检索素材→LLM评分→LLM精炼”三步内对话,将原始信息蒸馏为可复用的写作组件。同时,通过Blackboard(黑板)存储受众画像、结构大纲等关键信息,并用Secret Blackboard隔离大规模检索结果,防止上下文污染,保证创作过程的纯净。

定向训练与迭代

团队对通用大模型进行了专用微调,通过QLoRA技术注入“铺垫-包袱延迟、callback(前后呼应)、口语化舞台风格”等脱口秀专属能力。训练时采用completion-only loss,避免模型学会“解释笑话”。此外,质量评估智能体能精确诊断失败原因,触发定向的重检索或重写,形成高效的自我改进闭环。

端到端生成

OpenMic的最终成果不仅是文本脚本。系统通过一种结构化的DSL(领域特定语言)来标注表演细节,如停顿时长、重音位置、掌声提示和语速变化。这些标注可以直接驱动TTS(语音合成)和数字人系统,自动生成节奏自然、语气生动的脱口秀表演视频,彻底摆脱了AI朗读常见的“机器人味”。

OpenMic项目不仅是技术上的创新,更是对AI创意生成边界的探索。它证明通过精巧的系统设计,AI能够掌握幽默、节奏与表演这类复杂的人类技能。未来,这样的多智能体框架或许能应用于更多元的创意领域,我们或许可以期待,下一个能让人捧腹大笑的AI创作者,就在不远处。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章