← 专题报告

AI 视频 Skill:当视频生产流程变成一份可安装、可执行的“手艺说明书”

专题报告资料截止 2026-07-23

核心个案:`web-video-presentation` 与 `vox-director`

资料截止:2026-07-23

导语:它既不是模型,也不只是一段提示词

过去几年,人们谈 AI 视频时习惯问:“哪个模型最好?”到了 2026 年,另一个问题开始浮出水面:“谁能把十几个模型和工具,稳定地组织成一条成片流程?”

这正是 AI 视频 Skill 出现的背景。

一个视频 Skill 通常是一个文件夹:入口是一份 `SKILL.md`,里面写明何时启用、要先读什么、按什么步骤做、在哪些地方停下来让人确认;旁边还可以放脚本、参考资料、模板和素材。支持 Agent Skills 的智能体在识别到任务后,加载这套流程,并调用代码、浏览器、模型 API、FFmpeg 或其他工具执行。

它不训练新的视频模型,也不保证一句话直接变成好片。它做的事情更接近:把一位熟练制作人的方法、清单、文件结构、决策点和返工经验,封装成智能体可以反复执行的生产制度。

一句话结论是:AI 视频 Skill 的真正创新,不是让模型更会“画”,而是让智能体更会“做项目”。

一、先分清五个经常混用的词

概念回答的问题例子
视频模型能生成或编辑什么画面?Veo、Kling、Seedance、Vidu、Wan
视频工具用户在哪里操作?剪映、Premiere、ComfyUI、Flow
工作流多个步骤怎样连接?脚本→分镜→生成→配音→剪辑
Agent谁根据目标做决定并调用工具?VideoAgent、Media Agent、coding agent
SkillAgent 应按什么专业方法做?`web-video-presentation`、`vox-director`

模型提供能力,工具提供界面,工作流提供顺序,Agent 负责执行和判断,Skill 则把一套可复用的职业知识交给 Agent。

这也是为什么 Skill 不能被简单翻译成“提示词模板”。按照 Agent Skills 规范,一个 Skill 除了 `SKILL.md`,还可以包含可执行脚本、参考文档和资产,并采用渐进披露:先读取简短描述,任务匹配后再加载完整流程,需要时才打开更深的资料。Agent Skills 规范

二、它的“前世”:视频自动化走过的五步

1. 模板和预设:把重复劳动存下来

传统剪辑软件早就有片头模板、字幕预设、转场、调色 LUT 和工程模板。它们能复用“结果”,却很难复用完整的判断过程:为什么这一段该删、数据该怎样呈现、什么时候需要用户确认。

2. 程序化视频:用代码换取确定性

FFmpeg 长期承担转码、拼接、混音、字幕和抽帧;Remotion 则让创作者用 React 和代码制作视频。程序化路径的优势是精确、可重复、适合批量;缺点是需要工程能力。FFmpegRemotion

3. 节点工作流:把模型和后期拼在一起

ComfyUI 等节点工具让创作者把图像、视频、控制模型、放大、插帧和输出连成可视化图。它解决了“怎样组合模型”,但复杂工作流仍依赖操作者理解每个节点、版本和失败原因。

4. 视频 Agent:系统开始自己规划和重试

OpenMontage、HKU VideoAgent、MiniMax Media Agent 等项目,把脚本、检索、生成、剪辑、预算门和质量检查交给 Agent 编排。它们提示了一个现实:完整视频生产不是一次模型调用,而是多状态、多工具、多次失败和人工接管。OpenMontageHKU VideoAgent

5. Agent Skills:把具体方法封装并跨 Agent 搬运

2025 年后,`SKILL.md` 形式开始产品化并形成开放规范。Skill 可以在不同智能体之间携带:同一个文件夹既告诉 Claude Code、Codex 或其他 coding agent 何时启用,也附带脚本和资产,让流程不必每次从头解释。Anthropic 对 Agent Skills 的介绍

三、个案一:`web-video-presentation`——把口播变成可录屏的网页

`web-video-presentation` 来自 ConardLi 的 Garden Skills。它的目标不是生成写实镜头,而是把文章、口播稿、课程或产品演示做成一套 16:9、点击驱动、适合录屏的网页演示。最终产物是 Vite + React + TypeScript 项目,并可选择合成口播音频。项目总览

它怎样工作

它把流程分成四段:

1. 内容编写:把原文转为 `script.md`,同时生成 `outline.md`。

2. 计划确认:用户一次确认稿子、章节、主题、素材和开发模式。

3. 网页开发:每一个口播节拍映射为一个全屏视觉 step;先完成第一章让用户验收,再继续后续章节。

4. 音频与录屏:可调用 MiniMax、OpenAI 或其他 TTS;Auto 模式按音频结束自动推进画面,再用系统录屏或 OBS 录制。

项目把 `narrations.ts` 设为 step 数量和音频文本的“唯一真相源”,用它避免脚本、页面和音频编号互相漂移。`SKILL.md`

录屏文档写得非常明确:它本身不直接渲染 MP4。页面和音频完成后,在浏览器打开 Auto 模式,按一次空格,系统逐段播放音频并推进画面;录完后裁掉头尾得到成片。录屏说明

它真正解决的问题

这套 Skill 的价值不在“网页也能动”,而在于它选择了一条高确定性路线:

  • 文字不会像生成视频里的招牌那样变形;
  • 数据、图表、代码和 UI 可以精确呈现;
  • 视觉节奏与口播一一对应;
  • 画面可在网页里继续编辑;
  • 不必为每一秒都调用昂贵的视频模型。

它特别适合:

  • 知识讲解、课程和科普;
  • 产品发布、软件演示和技术 talk;
  • 数据报告、商业复盘和信息密度高的内容;
  • 希望先交互演示、再录成视频的项目。

它不适合:

  • 依赖真人表演、复杂摄影或自然环境的叙事片;
  • 需要直接交付可逐帧剪辑时间线的传统影视项目;
  • 希望完全不碰网页开发、浏览器录屏和后期的人。

它的设计判断

项目设置了多个“硬检查点”,这点比 23 套主题更重要。它承认审美不能靠一次生成解决:用户先确认脚本和大纲,第一章必须成为风格锚点,音频生成前再次确认。它还明确要求章节实现进行自检,并允许用独立 agent 或 subagent 审查。

换句话说,它没有追求“零人类”,而是把人放在高杠杆决策点。

四、个案二:`vox-director`——把主题或口播变成 Vox 风拼贴视频

`vox-director` 来自 Alisa0808。它面向另一种内容形态:现代编辑感的纸片拼贴讲解片或广告片。项目把 Vox 风格概括为手撕纸边、胶带、半调网点、报纸剪报、大号剪贴标题和大胆平涂色,再加入旁白、配乐、字幕与运动。项目总览

它同时支持两条路径:

  • B-roll 路线:输入一个主题,系统写叙事节拍,生成拼贴海报,再让海报动起来。
  • A-roll 路线:输入已有真人或数字人口播视频,先转录和切段,再保留原始脸、口型和手势,把人物轮廓与周边环境改成拼贴视觉。

这正对应用户所说的“口播变 Vox 风拼贴视频”。

B-roll:主题如何变成成片

项目用每个项目唯一的 `beats.json` 驱动全流程:

1. 选择叙事弧,写 beat map;用户确认。

2. 同一段内容生成 3—4 种视觉风格;用户凭画面选择。

3. 每个 beat 生成一张完整拼贴海报。

4. 使用图生视频模型让海报产生运动。

5. 生成旁白和背景音乐。

6. 用 FFmpeg 拼接镜头、压低音乐、烧录字幕和水印。

7. 输出 `final.mp4`。

默认后端是 Atlas Cloud。文档列出的模型包括 Google 图像/视频模型、Kling、xAI TTS、MiniMax Music 和抠图模型;模型 ID 会变化,因此 Skill 在运行前获取实时模型列表。中文 `SKILL.md`

A-roll:口播如何被“拼贴化”

当用户给的是一段真人或数字人口播,Skill 先做语音识别和自然切段,每段控制在模型单次处理时长内;随后调用视频编辑或参考生视频模型保留表演,并在人物周围加入纸片、贴纸和半调视觉。合成时重新使用原始音轨,以降低生成音频与口型漂移。

这个设计很关键:它没有让模型重新发明主播说了什么,而是把原始口播当作时间轴和表演基准,只改视觉层。

“海报先行”是它最核心的方法论

项目反复强调:拼贴感必须在关键帧阶段完成。每个 beat 先是一张信息丰富、构图完整的海报;视频模型只是让它成为“会动的海报”。如果关键帧只是普通插画,后续加再多运动也不会自动变成 Vox 式拼贴。

这种方法把最不稳定的“整段生成”拆成两个较可控的问题:

  • 一张静态画面是否成立;
  • 这张画面怎样动。

对于需要更精确的碎片飞入、逐层组装,项目还提供本地元素级动画引擎:先抠出部件,再以关键帧和程序化运动合成。这条路线不依赖视频模型生成运动,控制更强,也更适合真人或品牌素材。

它适合和不适合什么

适合:

  • 30—60 秒解释视频、人物小传、历史/财经/科技科普;
  • 有明确旁白、需要高频视觉刺激的社交视频;
  • 拼贴广告、品牌致敬片、数字人口播风格化;
  • 希望直接得到 MP4,而不是网页演示。

不适合:

  • 需要中性、严肃、低装饰的长篇报告;
  • 对品牌视觉必须像素级稳定、不能接受生成误差的项目;
  • 不愿使用云 API 或不能把素材上传到第三方后端的项目;
  • 把“Vox 风格”误当成可以随意复制 Vox 品牌资产的项目。

五、两个 Skill 的正面对照

维度`web-video-presentation``vox-director`
输入文章、口播稿、课程、产品演示一句话主题,或已有真人/数字人口播视频
核心视觉Web 动效、排版、图表、UI、全屏 step纸片拼贴海报、半调、剪报、贴纸
时间轴一个口播节拍对应一个网页 step`beats.json` 中每段拆成 1—2 个镜头
主要生成方式代码生成网页;TTS 可选图像生成 + 图生视频/视频编辑 + TTS/音乐
成片路径浏览器 Auto 播放后录屏FFmpeg 直接合成 `final.mp4`
人类检查点稿子/大纲/主题/素材/模式、第一章、音频beat map、风格 bake-off、近似画幅确认
强项信息准确、可编辑、数据/文字稳定、成本可控视觉冲击、社媒节奏、风格统一、直接 MP4
主要依赖Node/Web 技术、浏览器、可选 TTS、录屏Atlas Cloud、多模型 API、FFmpeg、Python/Pillow
主要风险页面开发失败、跨浏览器/字体问题、录屏步骤API 成本、模型漂移、内容审核、素材上传、风格同质化

它们的共同点比外观更值得注意:

1. 都先把口播拆成结构化节拍;

2. 都设置了人类确认关口;

3. 都把生成和确定性工具混合使用;

4. 都强调“唯一真相源”,避免脚本、画面和音频漂移;

5. 都不相信一条长 Prompt 能稳定替代完整制作流程。

六、为什么 Skill 可能比“更强模型”更重要

视频模型更新很快,今天的模型名和参数可能几个月后就变化。稳定的专业方法相对更长寿:

  • 先写清叙事目标;
  • 把内容切成可观察的节拍;
  • 在昂贵生成之前先确认低成本方案;
  • 对每个阶段保留中间文件;
  • 失败时只重做坏掉的环节;
  • 用确定性工具完成字幕、拼接、混音和导出;
  • 在关键节点让人做审美与事实判断。

Skill 把这些原则从“某个熟练操作者脑中的经验”变成文件。模型可以替换,流程仍能延续。

这也是 `vox-director` 在运行前拉取实时模型列表、`web-video-presentation` 把 TTS 做成可插拔 provider 的原因:两者都试图把“方法”与“供应商”分开。

七、但 Skill 不是魔法:四个结构性限制

1. 文档写得好,不等于执行一定一致

同一 Skill 在不同 Agent、不同模型和不同权限环境中,可能产生不同结果。Skill 的描述触发、上下文加载和脚本执行也会因宿主而异。所谓“跨 Agent”首先是格式兼容,不是结果完全相同。

2. 自动化越深,供应链越长

`web-video-presentation` 涉及 Node 依赖、网页脚本、TTS 和录屏;`vox-director` 涉及 Atlas Cloud、多个模型、FFmpeg、Python 与 Pillow。任何一个 API 退役、模型 ID 改名、依赖升级或内容审核变化,都可能使流程中断。

3. Skill 可以执行代码,因此必须当软件审计

安装一个 Skill 不是“阅读一份教程”。其中的脚本可能访问文件、调用网络、读取 API key、安装依赖或生成大量费用。安全做法包括:

  • 从官方仓库获取;
  • 阅读 `SKILL.md` 和脚本;
  • 优先钉住 release 或 commit;
  • 核对校验值;
  • 使用最小权限和独立项目目录;
  • 为 API 设置预算和速率限制;
  • 不把密钥写入截图、日志和仓库。

`web-video-presentation` 提供带 SHA-256 的版本化压缩包;`vox-director` 截止核验日没有 GitHub Releases,若用于生产应固定具体 commit,而不是长期跟随 `main`。

4. 开源许可证不替你解决内容权利

两个项目均采用 MIT 许可证。MIT 允许使用、修改和分发代码,但不自动授予:

  • 输入文章和口播的版权;
  • 字体、图片、音乐和人物肖像权;
  • 云模型输出的商业使用权;
  • “Vox”名称、品牌和视觉识别的使用权。

“Vox 风”更适合作为视觉语言描述,而不是让成片冒充 Vox 官方作品。

八、怎样专业地评测一个视频 Skill

只看样片不够。建议用同一篇 60 秒口播做三组对照:网页录屏、Vox 拼贴、传统剪辑,并记录:

维度具体指标
时间首版耗时、总耗时、等待 API 时间
成本API、TTS、音乐、素材和人工成本
稳定性成功率、重试次数、构建/合成失败
人工接管修改脚本、换图、修字幕、调节奏的分钟数
信息保真数据、专名、文字、口播内容是否准确
视觉质量一致性、重复感、品牌适配、手机端可读性
成片效果完播、3 秒留存、理解度和观众主观评价
可维护性模型替换、版本锁定、中间产物可复用程度

只有这样,才能回答 Skill 是“漂亮的演示”,还是“能进入生产的工具”。

九、未来:视频行业会出现“流程市场”

如果模型是发动机,Skill 更像车型和驾驶手册。未来的 AI 视频生态可能出现三层市场:

1. 模型市场:出售生成、编辑、语音和音乐能力。

2. 工具市场:提供可视化工作台、资产管理和团队协作。

3. Skill 市场:出售或分享特定内容类型的生产方法,例如漫剧、商品广告、知识讲解、Vox 拼贴、课程视频和财报解读。

真正有价值的 Skill 不会只是“使用某模型的 50 条提示词”,而会包含:

  • 清晰触发条件;
  • 可复核的流程和中间产物;
  • 人类确认点;
  • 失败处理和预算门;
  • 可替换的模型与工具;
  • 质量检查;
  • 安全、版权和发布规则。

结语:视频生产正在从“学软件”变成“装方法”

传统视频教育教人操作摄像机、剪辑软件和动效工具;生成式 AI 第一阶段教人写 Prompt;Skill 阶段则试图直接交付一套做事方法。

`web-video-presentation` 把口播变成可录屏网页,核心是确定性、信息密度和逐步确认;`vox-director` 把主题或口播变成 Vox 风拼贴视频,核心是叙事 beat、海报先行和生成/FFmpeg 混合生产。它们外观不同,却共同说明一件事:

当模型能力逐渐商品化,真正拉开成片差距的,可能不是“你用了哪一个模型”,而是“你安装并执行了哪一种生产方法”。

关键证据与口径提醒

  • 两个项目的功能、流程和兼容性来自官方仓库文档,尚未在本报告中进行端到端实测。
  • GitHub 星标只代表核验日的公开关注度,不是质量、稳定性或安全认证。
  • `vox-director` 的模型可用性和价格依赖 Atlas Cloud 实时状态;文档列出的 ID 会变化。
  • “端到端自动化”仍包含人类确认点、API 等待、失败重试和可能的素材返工。
  • 许可证分析仅做信息整理,不构成法律意见。

主要资料

  • 本地:开源模型项目与基础设施、应用产品与行业实践、产业链与专业工作流、安全版权标识与监管
  • 联网:[资料索引与证据说明](./00-资料索引与证据说明.md)