← 资料库

视频生成评测研究卡

正式研究卡核验 2026-07-23下次复查 2026-08-23

没有一个“总分”能代表视频模型。正式比较必须说明模型版本、入口、提示集、样本数、输出规格、随机抽样、自动指标、人评方式和核验日期。

FVD|Fréchet Video Distance

  • 资料身份:经典自动评测论文;A3 · historical/foundational。
  • 原文具体讲什么:FVD 把生成视频和真实视频送入视频特征网络,比较两组特征分布的距离,试图同时反映画面和时间动态。它比只逐帧看图像分数更符合视频任务,后来成为学术视频生成常见指标。
  • 为什么值得读:很多论文只报一个 FVD 数字,却可能使用不同数据集、特征网络、样本量和实现。读原文能理解它衡量的是分布差异,不是单个镜头的角色一致性、提示遵循或叙事质量。
  • 阅读前要知道:跨论文 FVD 往往不可直接比较;对训练数据、实现和样本规模敏感;低 FVD 不保证人类更喜欢。
  • 建议:评测基础必读;重点看 embedding、distribution comparison 和 human study。
  • 原文论文

VBench

  • 资料身份:CVPR 2024 评测套件与官方仓库;A3 · current。
  • 原文具体讲什么:VBench 将视频生成质量拆成多个维度,包括主体一致性、背景一致性、运动平滑、动态程度、审美、成像质量、物体类别、多个物体、动作、颜色、空间关系、场景和整体文本一致等,并提供提示集、自动指标和评分代码。
  • 为什么值得读:它让“这个视频不好”变成可诊断问题。对实验室而言,可把人物大小漂移、背景跳变和动作不足映射到不同维度,而不是汇总成模糊总分。
  • 阅读前要知道:自动指标和人类观感并非完全一致;官方 leaderboard 的模型版本与商业入口可能过期;总分会掩盖模型在特定维度的强弱。
  • 建议:必读并作为实验设计参考;优先使用分项,不制作单一“本站冠军”。
  • 原文VBench 官方仓库

VBench-2.0

  • 资料身份:扩展评测论文;A3 · current。
  • 原文具体讲什么:VBench-2.0 将重点从基础画质和文本对齐进一步推向视频中的物理、常识、对象关系和复杂动态能力,尝试测模型是否只是生成“看起来像视频”的片段,还是理解世界状态和时间变化。
  • 为什么值得读:模型样片越来越漂亮后,真正的失败常出现在因果、持续性和物体交互。它为评估“角色拿起杯子后杯子是否仍在手里”这类问题提供更接近任务的框架。
  • 阅读前要知道:更复杂的指标也可能依赖 VLM 判断并继承其偏差;不能把 benchmark 覆盖面误写成完整世界理解。
  • 建议:物理与复杂剧情专题必读;重点看能力 taxonomy、metric validity 和 failure analysis。
  • 原文论文

FETV

  • 资料身份:细粒度开放域文本生视频评测;A3 · current。
  • 原文具体讲什么:FETV 按主要内容、需要控制的属性、提示复杂度和时间类别组织提示词,对代表性模型进行人工评价,并检查 CLIPScore、FVD 等自动指标与人类评价的一致性。研究发现常见自动指标在不少类别上与人评相关性较差,并提出改进指标。
  • 为什么值得读:它不只给模型排名,更研究“评测方法本身是否可信”。公开实验室要做盲测、角色一致性或镜头连续性评估时,可借用其分类和人评流程。
  • 阅读前要知道:论文模型版本已经具有历史性;改进指标仍不是绝对真值;人评也受样本、问题表述和评审背景影响。
  • 建议:评测方法必读;重点看 prompt categorization、human protocol 和 metric correlation。
  • 原文论文 · 官方仓库

EvalCrafter

  • 资料身份:大视频生成模型综合评测;A3 · current/historical-models。
  • 原文具体讲什么:EvalCrafter 根据真实用户请求构建 700 条多样化提示,从视觉、内容、运动和文图对齐等方面选取 17 个客观指标,并用人类评价拟合各指标权重,希望得到比简单平均更接近用户意见的分数。
  • 为什么值得读:它展示“综合分”不是天然存在,而是由提示集、指标选择和人评拟合共同制造。读者可以据此审问任何榜单:权重从哪来、代表谁的偏好、是否适合自己的内容类型。
  • 阅读前要知道:700 条提示和拟合人群不能代表所有创作者;模型迭代后排名会失效;17 项指标也可能重复测量相近特征。
  • 建议:榜单方法专题必读;重点看 prompt source、17 metrics、human alignment 和 coefficient fitting。
  • 原文论文

T2V-CompBench

  • 资料身份:组合式文本生视频基准;A3 · current。
  • 原文具体讲什么:T2V-CompBench 使用 1,400 条提示测试属性绑定、动态属性、空间关系、运动绑定、动作绑定、物体交互和数量等七类组合能力,并组合多模态模型、检测和跟踪指标,再以人评验证相关性。
  • 为什么值得读:角色一致性和复杂剧情常不是单一主体失败,而是“红衣角色拿错蓝杯”“两个人动作绑定反了”“数量变化”。该基准比画质榜更贴近这些可观察错误。
  • 阅读前要知道:检测器、跟踪器和 MLLM 会引入自身错误;组合提示的学术覆盖不等于真实分镜的完整复杂度。
  • 建议:多角色、多道具和动作关系专题必读;重点看七类 taxonomy、metric construction 和 human correlation。
  • 原文论文

Arena Text-to-Video

  • 资料身份:公开人类两两盲选榜;A3/B1 · current/high-volatility。
  • 原文具体讲什么:Arena 让用户在隐藏模型身份的情况下比较同一提示生成的两个视频,再用成对偏好估计相对排名。它比厂商自选样片更接近开放人类偏好,但结果依赖参评模型版本、样本分布、票数和用户群。
  • 为什么值得读:适合判断市场模型在一般审美上的相对位置,也能发现新版本变化;不适合直接回答哪个模型最适合固定角色或特定中文剧情。
  • 阅读前要知道:必须保存查询日期、模型版本、票数和置信区间;整体偏好会被画质和冲击力主导;同名模型的产品入口可能不同。
  • 建议:用于候选筛选,不作为购买或专题结论的唯一依据。
  • 原文Arena Text-to-Video Leaderboard

Artificial Analysis Video Arena

  • 资料身份:独立模型分析与盲选榜;B1 · current/high-volatility。
  • 原文具体讲什么:Artificial Analysis 汇总多个视频生成模型的盲选偏好,并结合价格、速度和能力信息提供市场比较。与厂商榜单相比更独立,也比纯学术基准更新快。
  • 为什么值得读:它适合做“当前有哪些模型值得进入本站 A/B 实验”的雷达,尤其能同时观察质量与成本。但真正项目选择仍需绑定具体镜头任务。
  • 阅读前要知道:并非监管或学术机构;模型入口、提示分布、样本量和商业合作透明度要逐次复核;嵌入榜单可能随时间变化。
  • 建议:每周雷达,按月保存快照;与 Arena 和本站实测交叉。
  • 原文Artificial Analysis 视频榜

本站评测最小协议

1. 先写任务:人物身份、动作、空间、商品、音频或剪辑衔接。

2. 同一提示至少多随机种子,不能用每个模型最好的一条互比。

3. 隐藏模型名做人评,同时保留失败样本。

4. 画质、提示遵循、运动、连续性、声音、速度和成本分别记分。

5. 榜单结论必须带模型版本和日期;模型更新后重新测试。