这个工具能把写好的Markdown课件,直接变成带讲解的完整教学视频。整个过程不需要录音和剪辑,解决了教育工作者和内容创作者在视频制作上的耗时难题,让精力能专注于内容本身。
智能速览
基于通义千问大模型,能理解教学逻辑生成讲稿。
全流程本地化处理,保障数据安全与隐私。
支持断点续传和日志记录,方便调试与复用。
采用纯Python实现,轻量化且易于扩展。
遵循Apache 2.0开源协议,可免费商用。
精华内容
这项技术并非简单的模板套用,而是真正利用AI能力重塑知识生产流程,将备课从繁琐的体力劳动中解放出来。
核心工作流
整个流程始于一份结构化的Markdown教案。通义千问大模型首先解析内容,理解教学逻辑,并自动生成口语化的讲解脚本和简洁的HTML幻灯片。随后,系统调用高质量TTS技术将脚本转换为自然语音。接着,利用Playwright驱动浏览器自动演示幻灯片并录制翻页动画。最后,通过FFmpeg将音频与录屏精准合成,输出音画同步的MP4视频文件。
智能化与易用性
工具的智能化体现在大模型对教案的深度理解上,它能自动分章节、理逻辑,而非机械套用模板。易用性则体现在极简的操作上,用户只需在命令行输入一行指令,如“python main.py assemble …”,并指定API Key和声音参数即可。所有中间产物(HTML、MP3等)都会保存在Temp文件夹,方便预览和调试,修改后再次运行能实现秒级复用,大大提升了效率。
安全与可控性
隐私和安全是该工具的突出优势。所有处理环节,包括解析教案、渲染幻灯片和合成音视频,均在用户本地电脑完成,原始文件和中间产物不会上传到任何服务器。仅有的网络请求是调用DashScope API,且只传递必要的文本内容。TTS生成的音频下载后立即转为本地MP3文件,不存云端。项目也明确建议通过环境变量管理API Key,避免硬编码带来的泄露风险。
轻量与可扩展
该工具完全由Python编写,无需安装Node.js或庞大的Electron框架,保持了系统的轻量化。生成的幻灯片是独立的HTML文件,无第三方CSS依赖,加载速度极快。其模块化的架构(Parser、Scripter、Slides、TTS、Recorder、Composer)允许用户轻松替换或扩展任何环节,例如集成新的TTS引擎(如11labs)或增加对PDF、PPTX输入格式的支持,为二次开发提供了极大便利。