说到”让 AI 做产品宣传片”,多数人脑子里跳出来的是 Sora、Veo 那一类文生视频模型:喂一段描述,等它吐一段像素回来。video-shotcraft 里一个生成模型都没有,连一次推理 API 都不调。它往你的技能目录里塞的是 152 个 Markdown 文件、两百来个 TSX 组件和一批音效。
底层跑的是 Remotion,那个用 React 写视频的框架。Agent 读完卡,写代码,然后在本机渲染出一个 1920×1080、30fps 的 mp4。素材不上云,成片不带水印,渲染发生在你自己的 CPU 上。这条路子和”AI 生成视频”完全不是一回事。

反直觉的地方在于它赌的不是模型能力,是词汇表。让一个裸大模型去做运镜,你能拿到的基本是通用淡入淡出配上一言难尽的节奏,因为动效设计的隐性知识在训练数据里本来就稀薄。给它 152 个有名字、有参数表、有已知坑标注的镜头模式,它立刻表现得像个照着风格指南干活的初级动效师。
这仓库 2026 年 7 月 19 日建,到 8 月 28 日实测 6584 Stars、581 Forks。六周冲到这个量级本身不算稀奇,但把它和”贡献者 6 人、open issue 只有 2 个”放在一起看,味道就变了。这不是社区共建出来的东西,这是一个人在高频输出,其余人在围观收藏。
真正的问题是:这批镜头卡到底值多少钱,以及你要为它付什么代价。往下翻之前先说结论,它值得装,但只对一种人。
打动我的几个地方
先说清楚这个包的构成。SKILL.md 一个入口,references/ 里躺着 152 张镜头卡和整套方法论,demos/ 里有对应的 Remotion 实现源码,assets/ 里是 7 个可复制组件加 149 个分 16 类的音效和 5 首 BGM,template/ 是一支能直接跑的完整工程。

镜头卡不是 prompt 模板。每张卡给了用途、能量等级、建议时长、参数表和”已知坑”,但 SKILL.md 铁律 6 写得很难听:配方卡给的只是语义和参数表,demos/ 里调校过的 TSX 源码才是参数真相,凭卡名和理解新写等于放弃全部调校积累。允许你改,但卡上标了命门的参数不许降档。
第二条让我改观的是确定性渲染。SKILL.md 明确禁用 Date.now() 和 Math.random(),所有伪随机必须固定种子,seed 从 index 派生。这一条看着像洁癖,实际是把”把第 7 秒那个镜头改一下”从掷骰子变成了可执行的工程操作:改完重渲,其余帧逐帧一致。
第三条是它对”宣传片皮肤”的拒绝。整支片子的字体、排版、配色、材质必须从目标产品自身的设计系统里提取,先写进设计 spec 再动手,模板和镜头卡只继承镜头结构、运动语法和已调参数。表现产品真实页面时必须起本地 dev server 用无头浏览器截 2x 纹理,手搓 UI 只能用在抽象开场这类非复刻场景。
最见功力的是它对失败的记录。2026 年 8 月 22 日有用户反馈”给了音乐的片子镜头会随节奏抖动”,PR #46 的归因结果是两条:kick 命中表被当成了触发器而不是候选池,以及音画存在系统性偏移。于是新增 R4 规定全画面级节拍冲击全片不超过 3 处、间隔至少 16 拍,节拍泵单次不超过 4 拍、全片最多 1 次。
同一批改动还纠了自己的错。音轨滞后最初被归因为 Remotion 的 <Audio> 起播延迟,复测后确认根因是输出编码链路的 AAC encoder priming,48kHz 下典型 2048 采样约等于 1.28 帧(30fps),Remotion 官方 issue #7099 有跟踪。验收标准也钉死了:补偿残差不超过 0.5 帧,渲后从成片抽音轨回测切点误差不超过 3 帧。
最后一条是终检机制。交付前必须派一个干净上下文的 subagent 做独立审查,逐条出带帧号证据。文档原话是”制作者对自己的产出有确认偏差,首检永远不能交给用户”。一个技能包愿意把这条写进去,说明作者真的被自己的产出骗过。问题是纸面纪律归纸面纪律,真装到机器上会不会翻车?
跑起来是什么感觉
装法有三种,最省事的是把仓库链接直接丢给 Agent,让它自己 clone 并注册进技能目录,全程不用你碰命令行:
# 方式一:在 Claude Code / Codex 里直接说
Install this skill for me: https://github.com/Vincentwei1021/video-shotcraft
# 方式二:skills CLI
npx skills add Vincentwei1021/video-shotcraft
# 方式三:手动软链
git clone https://github.com/Vincentwei1021/video-shotcraft.git
ln -s "$(pwd)/video-shotcraft" ~/.claude/skills/video-shotcraft
装完在 Agent 里说一句”用 Ink Press 模板给我的产品做支宣传片”就行。想自己跑渲染的话,复制模板出来装依赖,先渲一帧静帧确认管线通了,再渲全片:
cp -R ~/.claude/skills/video-shotcraft/template ./promo && cd promo
npm install
npx remotion still src/index.ts AiflPromo out/f150.png --frame=150
npx remotion render src/index.ts AiflPromo out/promo.mp4 --concurrency=1

工作流被切成六个闸门,前四个阶段全部定稿后才允许进素材采集和逐镜头实现。文档里那句”素材方向错误拖到逐镜头阶段才暴露,代价是整套场景报废”,是真金白银换来的。共同创作模式会在产品简报、视觉方向、镜头映射、分镜四个点停下来等你确认。

坑也有,而且都是会吃掉半天的那种。MoClaw 那篇实录里,用 4 倍并发渲染把源帧根本不存在的 slice artifacts 烤进了 mp4,降到 --concurrency=1 才好;父目录里的 pnpm-workspace.yaml 会静默吞掉这个独立模板导致 remotion 命令找不到,得加 --ignore-workspace。
无头环境另有三堵墙:低核机器上并发上限是 2 必须显式压到 1,新版 Chrome 移除了 old headless 需要改用 chrome-headless-shell,CDN 不通时自动下载会被拒,要用 --browser-executable 指到本地二进制。README 把这三件事连同解法一起写了,读起来像是某个下午被折磨过之后的产物。
最后一个坑不在代码里,在上下文里。仓库本体 94MB 上下,样片 release 另挂约 123MB,152 张卡全文加上 pipeline 387 行、sound-design 286 行、music-beat-sync 219 行,全量读进来会吃掉可观的窗口。SKILL.md 自己给了一张”何时读哪个文件”对照表,照表读才是省 token 的正确姿势。不过坑说到这儿也就够了,真正决定要不要装的是它适合谁。
什么时候用,什么时候别用
| 场景 | 典型用户 | 优势 | 局限 |
|---|---|---|---|
| web / 桌面产品发布片 | 独立开发者、SaaS 小团队 | 36.2 秒模板换素材即出片 | 目前只有 Ink Press 一支模板 |
| 单镜头动效抽卡复用 | 前端 / 动效开发者 | 卡名即接口,参数已调过 | 需要自己已有 Remotion 工程 |
| 功能演示短片段 | 产品、增长同学 | 真实截图配 2.5D 运镜 | 录屏演绎路线还不成熟 |
| 中文社媒投放素材 | 国内独立开发者 | 可导剪映工程改字幕和变速 | Windows 剪映未做真机验证 |
不适用的情况得说清楚。你要拍真人出镜或实景,这套东西帮不上忙,老老实实用剪映或 PR;你想要的是”一句话生成任意画面”,那是 Sora、Veo 那类模型的活儿;你没有 Node 环境也不想碰命令行,部署门槛会劝退你。
还有一条容易被忽略的合规问题。video-shotcraft 本身是 Apache-2.0,成片免费商用、不用向作者申请授权,但它渲染依赖的 Remotion 有自己的许可:个人和小团队免费,公司用户可能需要付费。SKILL.md 在交付话术里专门保留了这句提示,没有做无条件承诺。
录屏演绎这条线目前也确实拉胯。Issue #47 里用户的原话是”我如果录屏,然后让他基于录屏介绍来做个视频,我发现它的效果好像不好,主要体现在字的突然放大缩小,嵌入录屏的时候容易出现字交织在一起”。同一条 issue 还提到改一个 10 秒左右的视频花了半个多小时没跑完。边界划清楚了,接下来该看维护侧能不能接住这些反馈。
维护靠不靠谱
| 指标 | 数据(2026-08-28 实测) | 说明 |
|---|---|---|
| Stars | 6584 | 7 月 26 日前后约 2213,一个月涨到 6.5k |
| Forks | 581 | Star/Fork 比约 11:1,收藏属性明显 |
| 核心维护者 | 1 人(42 次提交中 28 次) | Bus Factor = 1,高风险 |
| Open Issues | 2 | 极少,但订阅者仅 7 人 |
| 协议 | Apache-2.0 | 商业友好,衍生成品无需开源 |
| Release | 仅 gallery-media(媒体资产) | 无版本化 tag,建议按提交哈希冻结使用 |
这组数据读出来的是一个高关注、低共建的消费型项目。六个人贡献过,除作者外最多的一位 6 次提交,其余是 1 到 3 次的小修。6584 个 Star 里绝大多数是收藏动作,不是参与承诺。Bus Factor 就是 1,作者停手项目就停。
维护质量本身倒是相当能打。Issue #44 有人问”是否支持最新的 deepseek harness”,从提问到关闭回复不到四天。PR #50 修的三处问题全部是实渲才暴露的中段时序和层级错误:DigitRoll 计数器滚不到 5、blur 把 9 个飞入元素整组糊掉、DarkTunnelTransition 方向对撞还带两帧纯黑死帧,作者在 PR 里直接写了”现有 smoke test 只渲染首帧捕获不到”。
测试体系是 8 月才补上的,而且补得很对症。#42 给 helpers 里的纯函数加了 23 条 vitest 用例,锁住 mulberry32、velocityAt、dampedSettle 这些确定性行为的边界;#43 加了 57 个 demo 的首帧渲染冒烟,专门堵”能编译但跑不起来”。一个动效技能包先把伪随机函数的确定性锁死,这个优先级排得比多数正经项目都清醒。
未解决的两条 issue 都指向同一个真问题:迭代成本。Issue #49 提的是一个 80.8 秒、2424 帧的片子,最终只有 69 到 100 帧需要修正,现有工作流却只能全片重渲,建议补一套局部帧渲染加成片补丁的流水线。这条 8 月 25 日提出,到 8 月 28 日仍开着。维护画像画到这儿,往下就该问一句最实在的话:这东西到底值不值得跟?
值不值得跟
判断值不值得跟,得先把它放回赛道里。做产品视频的同类方案大致可以这么分:
| 方案 | 你得到什么 | 你失去什么 | 适合谁 |
|---|---|---|---|
| 裸 Remotion + 通用 Agent | 完全自由 | 所有调校和验收纪律自己补 | 有动效经验的人 |
| Remotion 官方 agent skills | 框架层规则,帧时序不搞错 | 没有创意层,镜头自己想 | 任何人都建议先装 |
| video-shotcraft | 镜头词汇表 + 调过参的 demo + 验收纪律 | 仅一支模板,单人维护 | 手上有产品要出片的人 |
| Sora / Veo 类文生视频 | 任意画面,想象力无上限 | 无法精准还原你自己的产品界面 | 品牌片、概念片 |
| 剪映等可视化剪辑 | 零代码,上手即用 | 做不出 2.5D 页面运镜 | 短视频口播、vlog |
它和 Remotion 官方 skills 是叠加关系不是替代关系。官方那套解决的是”Agent 总把帧和秒搞混、对着墙钟时间做动画”这类框架层问题,video-shotcraft 加的是上面一层创意方向。这是围绕一个框架形成的两层 skill 栈,一层厂商维护,一层社区自建,挺有意思的结构。
它的护城河不在代码,在被真实反馈磨过的参数和被标注出来的命门。R4 这条密度上限背后是 8 月 22 日一次具体的用户抱怨,§4.6 那套补偿公式背后是一次归因错误后的自我推翻。这种”知道自己会在哪里翻车”的认知,正是它和”让 Agent 直接写个 Remotion 视频”的本质差距。
不过我得泼一盆冷水。6584 Stars 对 6 个贡献者、2 条 open issue,这个比例说明社区没有真的长起来。第二个风险是没有版本化 release tag,唯一一个 release 挂着的是样片媒体,文档和资产随时可能漂移,最稳的用法是 clone 之后按提交哈希冻结,别指望语义化版本。
趋势上它在上升期,而且作者在系列化。8 月 22 日开了 video-talkcraft 做口播视频,78 张动效卡、字级配音对齐、七层反 PPT 镜头系统,思路是同一套配方卡加 Remotion 的工作流换个内容形态。但截至 8 月 28 日,那个仓库只有 2 个 Star、许可证还是 NOASSERTION。系列化是好事,只是目前流量全压在第一个仓库上。
我对它的判断是:镜头卡这套抽象本身是对的,甚至是可移植的。同样的结构搬到幻灯片、落地页、播客片头都说得通。真正的问题不在设计,在它能不能长出第二个维护者。
资源地址
-
仓库:https://github.com/Vincentwei1021/video-shotcraft -
在线画廊(209 条动态样片):https://vincentwei1021.github.io/video-shotcraft/ -
剪映工程导出指南:https://github.com/Vincentwei1021/video-shotcraft/blob/main/references/jianying-export.md -
系列口播版 video-talkcraft:https://github.com/Vincentwei1021/video-talkcraft -
底层框架 Remotion:https://www.remotion.dev/ -
用户作品投稿页:https://vincentwei1021.github.io/video-shotcraft/showcase.html
先渲一帧,再渲全片
如果你手上真有一个 web 或桌面产品要做宣传片,直接装,从 Ink Press 模板切入:换截图、换文案、换品牌色,先渲一张静帧确认管线通了再全片渲染。模板路线是这套包里最快也最可靠的路径,单镜头抽卡的用法门槛更低,代价是你需要先有一个自己的 Remotion 工程。
如果你只是好奇 Agent 怎么做视频,在线画廊逛一圈就够了,不必把 94MB 仓库和 123MB 样片塞进上下文。想学 Agent 工作流设计的话,pipeline.md 的阶段隔离和 final-review.md 的独立终检都值得单独读,那是教科书级的任务分解样本。
还在观望的话,盯住两个指标:模板数量会不会从 1 变多,以及会不会出现第二个稳定维护者。这两点决定了它能不能从一个调得很好的个人技能包,变成能长期依赖的生产力。
说到底,它卖的从来不是”AI 帮你做视频”这个想象,是一批被真人反馈磨过的参数。这批参数值钱,但也只在你真要出片的时候才值钱。
