面对一小时Zoom会议需半天剪辑的低效现状,一个基于AI与FFmpeg的全流程自动化工具应运而生。它不依赖黑盒SaaS服务,全程本地可验证,从高光识别到多平台文案生成仅需几分钟,为内容创作者提供透明、可控、可复用的技术方案。
智能速览
全程3小时开发完成,API总成本低于30美元
Gemini分析转录稿自动输出高光时间戳,支持传播力判断
FFmpeg驱动一键裁剪,输出纯视频/英文字幕/中英双语字幕三种格式
自动生成YouTube Shorts、TikTok、小红书等7个平台适配文案
开源项目,支持clone后单命令运行,亦可集成至OpenClaw
适用在线课程讲师、播客主播及需批量短视频分发的创作者
精华内容
当会议录像不再是信息沉没的成本黑洞,而成为可即时调度的内容资产,工具的价值就体现在每个被节省的分钟里。
高光识别有依据
工具将会议音频转录文本送入Gemini模型,非简单关键词匹配,而是基于语义密度、发言节奏、问答交互频次等维度综合评估传播潜力。实测对68分钟技术分享会议,准确标出9段共4分12秒的高光片段,人工复查吻合率达89%,较传统手动快进查找提速17倍。
剪辑流程全闭环
输入原始MP4与时间戳清单后,FFmpeg自动执行无损裁剪,全程无需GUI操作。实测单段剪辑平均耗时4.2秒,支持批量处理;字幕渲染采用硬编码方式,中英双语字幕同步率误差小于±0.15秒,兼容B站与小红书的竖屏字幕安全区规范。
文案生成讲场景
针对不同平台特性差异化生成文案:TikTok标题控制在22字符内并前置悬念钩子,LinkedIn文案保留专业术语并添加行业标签,小红书正文强制包含3个emoji且段落不超过4行。测试10条会议片段,各平台首条评论互动率平均提升31%,高于通用文案模板。
部署轻量可验证
项目依赖仅Python 3.9+、FFmpeg及Google API Key,无闭源SDK或强制云账户。M1 MacBook Pro本地运行全流程平均耗时2分38秒,全程日志可追溯;所有AI调用均返回原始响应体,用户可随时校验Gemini判断逻辑,避免黑盒决策风险。
这个工具的价值不仅在于效率跃升,更在于将内容生产权交还给创作者——无需妥协于算法推荐逻辑,也不必让渡数据所有权。当更多人能基于同一套开源范式定制工作流,视频生产力的底层规则或许正在悄然改写。下一个被自动化的,会是哪类长内容?
关键评论
动手能力值得点赞
也用ffmpeg做剪辑,感谢分享