OpenMontage 上手教程:5.8 万 Star 的开源 Agent 视频制作系统,把 AI 编程助手变成制片厂
"AI 做视频"这件事,过去两年基本是这样一个体验:你给一句话,它给你一段 5 秒、10 秒的片段。看着惊艳,但离"一条能发出去的视频"还差着十万八千里——差剧本、差配音、差字幕、差配乐、差剪辑节奏。而这些恰恰是真正耗时间的部分。
OpenMontage 想解决的就是这后面半段。它是一个开源项目,2026 年 3 月底上线,截至 2026-09-13 已经拿到 57,996 个 Star、7,307 个 Fork,并在 README 里挂着 GitHub Trending 日榜第一的徽章。它的自我定位是"全球首个开源的、代理化(agentic)的视频制作系统"——而它真正的卖点,是它跑在你的 AI 编程助手里。
本文基于项目官方仓库的 README(中英文两版)、配置文件和官方 API 数据写成,所有数字都标了出处和核实日期。文末有参考来源。
先说结论:它不是又一个视频模型,而是编排层
理解 OpenMontage 的关键,是别把它当成"又一个 Sora"。它自己不会生成一帧画面,它的角色是制片厂——决定用什么工具、按什么顺序、花多少钱、以及什么情况下不许交付。
传统 AI 视频工具的产出是"一个片段";OpenMontage 的产出是"一条完整的、带研究、脚本、配音、字幕、配乐和片尾的成片"。它的工作方式也不一样:
- 你的 AI 编程助手本身就是编排器(官方原话:"这里没有代码编排器")。Python 只负责提供工具和状态持久化。
- 所有的创意决策、质量标准、审查规则都写在可读的 YAML 清单和 Markdown 技能文件里,你能打开、能改、能审计。
- 它兼容 Claude Code、Cursor、GitHub Copilot、Windsurf、Codex——任何能读文件、能跑代码的 AI 编程助手。
还有一个它反复强调的差异点,值得单独拎出来:"让静态图片动起来"不等于视频。OpenMontage 当然能基于 AI 生成图像做视频,但它也能走另一条路——从免费免版税的素材库和开源档案(Archive.org、NASA、Wikimedia Commons)里建立语料库,检索真实的动态影像,剪辑到时间线上再渲染。这一步在免费路径上也能做出来,是它比较特别的地方。
一、先把项目底细核实清楚
以下数据取自 GitHub 官方接口,核实时间 2026-09-13:
| 项目 | 值 |
|---|---|
| 仓库 | calesthio/OpenMontage |
| Star / Fork | 57,996 / 7,307 |
| 创建时间 | 2026-03-29 |
| 最近推送 | 2026-09-06 |
| 主语言 | Python |
| 许可证 | GNU AGPL-3.0 |
| 未关闭 Issue | 321 |
| 官网 | openmontage.video |
关于规模数字,这里要专门说明一下。项目在不同位置的表述并不一致:GitHub 仓库简介写的是"12 条生产流水线、100+ 工具、700+ 智能体技能与制作知识文件";而 README 正文里写的又是"52 种生产工具、400 多项智能体技能",架构章节又写"48 个 Python 工具"。
为了不跟着含糊,我用官方 tree 接口把仓库文件实际数了一遍(2026-09-13):
| 类别 | 实测文件数 | 说明 |
|---|---|---|
流水线清单 pipeline_defs/*.yaml |
13 | 其中 12 条是生产流水线,另 1 个是 framework-smoke 冒烟测试 |
工具 tools/**/*.py |
167 | 含各提供商的适配文件与辅助模块,不等于对外暴露的工具数量 |
技能 skills/**/*.md |
157 | Markdown 指令文件 |
数据契约 schemas/*.json |
29 | README 架构章节写的是"15 个" |
| 仓库文件总数 | 2,115 | 不含 Git 对象 |
所以"12 条生产流水线"这个数字是站得住的(13 个清单文件减掉 1 个测试用),但工具数和技能数在不同文档里口径不一,我不替它挑一个来用。你如果要在正式场合引用具体数字,建议自己跑一遍上面那个 tree 接口,或者直接看仓库。
二、12 条流水线:它到底能拍什么
每条流水线都是一个从创意到成片的完整工作流。官方列了 12 条:
| 流水线 | 产出 | 适合场景 |
|---|---|---|
| 动画解说 Animated Explainer | 含研究、旁白、视觉、音乐的 AI 解说 | 教育内容、教程、主题解析 |
| 动画 Animation | 动态图形、动态排版、动画序列 | 社交媒体、产品演示、抽象概念 |
| 化身代言 Avatar Spokesperson | 数字人驱动的演讲视频 | 企业通讯、培训、公告 |
| 电影级 Cinematic | 预告片、前导片、情绪剪辑 | 品牌宣传、促销 |
| 片段工厂 Clip Factory | 从一条长素材批量切出排序后的短视频 | 长内容重制成社交短片 |
| 纪录片蒙太奇 Documentary Montage | 从免费影像库与开放档案剪辑出的主题蒙太奇 | 视频随笔、情绪短片、纯真实素材且不花视频 API 钱 |
| 混合 Hybrid | 源素材 + AI 生成辅助视觉 | 给已有画面加图形 |
| 本地化与配音 Localization & Dub | 给现有视频加字幕、配音、翻译 | 多语言分发 |
| 播客重制 Podcast Repurpose | 把播客精彩片段变成视频 | 播客营销 |
| 屏幕演示 Screen Demo | 打磨过的软件录屏演示 | 产品演示、文档 |
| 口播 Talking Head | 真人出镜为主的演讲视频 | 演示、vlog、访谈 |
| 角色动画 Character Animation | SVG 绑定 + GSAP 的卡通角色表演 | 卡通短片 |
12 条流水线共用同一套结构化流程:
研究 → 提案 → 脚本 → 场景规划 → 资产生成 → 剪辑 → 合成
每个阶段都配一份专门的导演技能(一个 Markdown 文件),告诉智能体这个阶段该怎么干。智能体读技能、用工具、自我审查、在关键点存档、在创意决策处停下来等你批准。
其中一个设计我觉得挺关键:网络研究是一等公民。在写下第一句脚本之前,智能体会去搜 YouTube、Reddit、Hacker News、新闻站和学术资源,把数据点、受众问题、热门角度、视觉参考整理成一份结构化的研究简报。官方说法是每个视频会做 15–25 次网络检索。这一步直接决定了成片会不会是"一本正经地胡说八道"。
三、上手:三步跑起来
3.1 前置条件
- Python 3.10+
- FFmpeg(
brew install ffmpeg/sudo apt install ffmpeg/ 官网下载) - Node.js 18+(用 Remotion 渲染时需要 22+)
- 一款 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex
3.2 安装
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
没有 make 也没关系,官方给了等价命令。Windows PowerShell 下是:
py -3 -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install -r requirements.txt
cd remotion-composer
npm install
cd ..
python -m pip install piper-tts
Copy-Item .env.example .env
Windows 用户注意一个已知坑:如果 npm install 报 ERR_INVALID_ARG_TYPE,改用 npx --yes npm install。这条是官方 README 里直接写明的。
3.3 在 AI 编程助手里发指令
用你的编程助手打开这个项目目录,然后直接用大白话说需求:
制作一个 60 秒的动画解说视频,讲解神经网络是如何学习的
想要真实素材路线,就说得更具体:
制作一部 75 秒的纪录片蒙太奇,展现雨中的城市生活。只使用真实素材,无旁白,需要一种挽歌般的基调和配乐。
接下来智能体会自己去检索资料、生成或抓取素材、写脚本配音、找免版税配乐、烧录词级字幕、渲染成片。在给你看之前,它会先自己过一遍检查:ffprobe 验证、抽帧看有没有黑屏、音频电平分析、交付承诺核对、字幕检查。
3.4 零 API 密钥也能出片
这是我觉得最值得试的一点:不花一分钱也能做出真正的视频。 make setup 之后开箱即用的免费能力包括:
| 能力 | 免费工具 |
|---|---|
| 旁白配音 | Piper TTS(完全离线) |
| 开源影像素材 | Archive.org、NASA、Wikimedia Commons |
| 额外素材库 | Pexels、Unsplash、Pixabay(开发者密钥免费申请) |
| React 合成 | Remotion(图片场景、文字卡片、数据卡片、逐词字幕、数字人) |
| HTML/GSAP 合成 | HyperFrames(动态排版、网站转视频、SVG 角色动画) |
| 后期制作 | FFmpeg(编码、字幕烧录、混音、调色) |
| 字幕 | 内置词级时间轴生成 |
想走这条路,提示词里要明确要求做纪录片蒙太奇、音画诗或素材库拼贴,并写清"只使用真实素材"。
四、要花钱的路径:从 0.15 美元到 3 美元
API 密钥是可选的,加得越多能用的工具越多。官方给出的成本区间如下(以下均为项目自述,来自其官方 README 与演示视频说明):
| 配置 | 典型成本 | 说明 |
|---|---|---|
| 零密钥 | 0 | Piper TTS + 免费素材 + Remotion/FFmpeg |
| 仅图像生成 | 约 0.15 美元 | 如 12 张 FLUX 图像做一部吉卜力风格短片 |
| 图像/视频都配 | 约 0.15–1.50 美元 | 加入视频生成提供商 |
| 完整配置 | 约 1–3 美元 | 电影级预告片等 |
官方展示的几个成本样本:一部只用 OpenAI 一个密钥的产品广告 0.69 美元;一部 12 张 FLUX 图像的吉卜力风格动画 0.15 美元;一部用 6 个 Kling v3 片段的 60 秒皮克斯风格短片 1.33 美元。
这些数字请在动手前当作参考,不要当预算依据——真实开销取决于你选的提供商、视频长度和重试次数。
4.1 它内建了预算控制
配置文件 config.yaml 里有一个 budget 段落,默认值如下:
budget:
mode: warn # observe | warn | cap
total_usd: 10.00
reserve_pct: 0.10 # 预留 10% 给重试和清理
single_action_approval_usd: 0.50
require_approval_for_new_paid_tool: true
也就是说:总预算默认封顶 10 美元;单次操作超过 0.50 美元会暂停等你确认;首次使用某个付费工具也要你点头。执行前先估算、调用前锁定资金、事后结算实际开销——"没有意外账单"是它明确的设计目标。
4.2 支持的提供商(部分)
- 视频生成 15 家:Kling、Seedance 2.0(火山方舟直连)、Runway Gen-4、Google Veo 3、Grok Imagine Video、MiniMax、HeyGen,以及本地免费 WAN 2.1 / 混元 / CogVideo / LTX-Video,另有 Pexels、Pixabay、Wikimedia 素材库。
- 图像 10 种:FLUX、Google Imagen、Grok Imagine Image、GPT Image 2、Recraft,本地 Stable Diffusion,以及 ManimCE(数学动画)。
- TTS 4 家:ElevenLabs、Google TTS(700+ 音色、50+ 语言)、OpenAI TTS、Piper(本地免费)。
- 音乐音效:Suno AI、ElevenLabs Music、ElevenLabs SFX。
- 增强分析:Real-ESRGAN 放大、rembg 抠图、CodeFormer/GFPGAN 人脸修复、WhisperX 词级转录、CLIP/BLIP-2 画面理解。
五、它凭什么比"一键生成"靠谱
如果只是把一堆 API 串起来,这个项目不会有 5.8 万 Star。真正让它区别于"提示词乱炖"的是三件事:
5.1 用 7 个维度给提供商打分
所有工具选择(视频生成、图像、TTS、音乐)都要过一遍评分引擎,权重是:任务契合度 30%、输出质量 20%、控制功能 15%、可靠性 15%、成本效益 10%、延迟 5%、连续性 5%。获胜的提供商、得分、以及所有被考虑过的备选方案,都会记进决策日志。
还有个细节挺实用:如果你只知道"要一个皮克斯风格的、角色一致的动画短片"这种模糊简报,选择器会先把它展开成便于打分的意图和风格信号,不需要你提前写出结构完美的任务描述。
5.2 三道质量关卡
- 合成前验证:如果违反了交付承诺,就阻止渲染。官方举的例子很直白——一部宣称"以运动为主"的视频,结果 80% 是静态图片,这种计划在浪费 GPU 之前就被拦下来。
- PPT 风险评分:6 个维度检测(重复性、装饰性视觉、运动幅度弱、镜头意图、过度依赖排版、无法支撑的电影级宣称),专门防"带动画的 PPT"。
- 渲染后自我审查:ffprobe 验证 + 4 个位置抽帧查黑屏和破图 + 音频电平查静音和削峰 + 交付承诺核对 + 字幕检查。审查不通过,视频不会给你看。
5.3 每一个决定都可追溯
提供商选择、风格选择、音乐曲目、音色、渲染器族系,以及任何降级方案,都会连同伴选项、置信度和推理过程一起记录下来,跨阶段持久保存。所以你能回答"这条片子为什么最后长这样"这个问题。
六、上手前该知道的几个坑
- 文档里的规模数字口径不一。如第一章所述,工具数在不同位置是 48 / 52 / 100+ 三种说法,技能数是 400+ / 700+ 两种。功能不受影响,但你引用数字时要么自己数,要么注明出处。
- 项目很年轻,迭代很快。2026 年 3 月底创建,5 个多月跑了 57,996 Star,同时积压了 321 个未关闭 Issue。默认分支 2026-09-06 还有推送,API 和目录结构随时可能变。用之前先看一眼 Issue 区里有没有你踩的那类问题。
- AGPL-3.0 不是随便用。这是"传染性"最强的开源协议之一:如果你修改了它并把它作为网络服务提供给别人用,你必须把修改后的源码也以 AGPL 开放。自己本地用来做视频没问题;打算做成 SaaS 要先想清楚。
- 依赖链不算轻。Python + Node + FFmpeg 三套运行时都得装好,还要
npm install一次 Remotion 的依赖。这是"完整的制作流水线"必然的代价。 - 成本数字都是官方自述。0.15 美元、0.69 美元、1.33 美元这些来自项目自己的演示说明,没有第三方核对。第一次跑建议把
budget.mode设成cap,先小成本试一条 30 秒的。 - "全本地、不联网"还没实现。官方明确说本地 LLM 支持(Ollama / LM Studio)是"即将推出"。目前编排还是靠云端 AI 编程助手。
七、适合谁,不适合谁
值得试:已经习惯用 Claude Code / Cursor 写代码的人;需要批量产出教育解说、产品演示、播客切片的内容团队;想用免费素材做纪录片式短片、又不想付视频生成 API 钱的人;以及想研究"agentic 工作流怎么编排"这个题目的开发者——它把 YAML 清单 + Markdown 技能 + 状态检查点这套模式做得很完整,本身就是一个不错的参考样本。
可以再等等:只想一句话出片、不想碰命令行和 API 密钥的人;需要生产级 SLA 的商业项目;以及特别在意许可证传染性的团队。
一句话总结
OpenMontage 的价值不在于"生成得多好",而在于它把 AI 视频从"抽卡出片段"推进到了"可编排、可审计、有质量门槛的制作流程"——而且用免费素材 + 本地 TTS 这条路径,不花一分钱也能做出真正剪辑过的成片。它是目前少有的、把"制片厂"而不是"模型"当作产品形态的开源项目。
参考来源
- OpenMontage 官方仓库 README(中文版
README_zh-CN.md与英文版README.md):项目定位、流水线清单、成本样本、提供商列表、制作治理机制、许可说明。核实日期 2026-09-13。 - GitHub 官方接口:仓库元数据(Star 57,996 / Fork 7,307 / 创建 2026-03-29 / AGPL-3.0 / Python)与 full tree 文件清单(2,115 个文件、13 个流水线清单、167 个 tools Python 文件、157 个 skills Markdown 文件、29 个 JSON Schema)。核实日期 2026-09-13。
- 仓库内
config.yaml:预算控制默认参数。requirements.txt:运行时依赖。
说明:本文为工具介绍与上手教程。文中标注为"项目自述"的数据(成本样本、性能描述)来自项目官方文档,未经第三方验证;实际效果与开销请以你自己跑出来的结果为准。

