AI视频训练数据与数据治理
模型能力不只由架构决定。视频是否清晰、动作是否丰富、字幕是否准确、镜头是否连续,以及数据能否合法使用,都会直接限制训练结果。本页优先收录论文、官方仓库和数据卡;“公开下载”不自动等于“可商用”。
2021|Frozen in Time / WebVid
- 资料身份:ICCV 2021 论文;A3 · historical;视频—文本预训练与 WebVid 数据源。
- 这篇原文具体讲什么:论文原本研究图像与视频共用编码器进行跨模态检索,同时发布 WebVid-2M——从网络收集的两百多万条弱标注视频—文本对。后来扩展的 WebVid-10M 被大量早期文本生视频项目采用。它代表了第一代“大规模但噪声较高”的公开视频文本数据:数量解决了预训练饥渴,网页标题式描述、压缩、画质和水印又给生成质量留下明显上限。
- 关键内容:可以从原文理解 WebVid 的来历,而不是把“10M”当作质量保证;论文说明数据最初服务检索而非电影级生成;后续项目对 WebVid 的批评也应回到这一采集背景理解。
- 为什么值得读:它是追溯许多开源视频模型数据血缘的起点。研究一个模型为何容易生成短、弱运动或带网络视频风格的结果时,这篇比只看模型参数更有解释力。
- 阅读前要知道:数据来自网络弱标注,链接存续、原视频版权和实际可下载规模会变化;学术公开不代表每段素材都获得商业训练授权。
- 建议:专题必读;重点看 dataset construction、训练目标与 limitation。
- 原文:ICCV 论文页 · Stanford Foundation Model Ecosystem 数据血缘页
2022|HD-VILA-100M
- 资料身份:CVPR 2022 论文;A3 · historical/current-data;高分辨率视频语言数据。
- 这篇原文具体讲什么:微软研究团队构建 HD-VILA-100M,目标是补足早期视频语言数据分辨率低、语义类型窄的问题。论文披露数据覆盖约 37.15 万小时、720p 视频和 15 个 YouTube 类别,并设计混合高低分辨率帧的 Transformer 做视频语言预训练;随后 Panda-70M 等数据集又以它作为原始视频来源。
- 关键内容:既是数据论文,也是视频语言预训练架构论文;提供分辨率、类别和时长分布;补充材料讨论数据限制与社会影响。
- 为什么值得读:它连接 WebVid 时代和后来的自动切片、自动重描述数据时代。想理解“高分辨率原视频”为什么仍不等于“高质量生成训练对”,要看其转录文本、切片和语义对齐方式。
- 阅读前要知道:主要面向视频理解和跨模态学习,不是专为商业视频生成清洗的数据;来源、授权和下游再分发条件需要逐项确认。
- 建议:专题必读;重点看数据统计、数据来源、补充材料 B/C 部分。
- 原文:CVPR 论文页 · 补充材料
2024|InternVid
- 资料身份:ICLR 2024 论文;A3 · current-data;超大规模视频—文本数据。
- 这篇原文具体讲什么:InternVid 把公开视频处理成超过 2.34 亿个片段,总时长约 76 万小时,并用自动流程生成详细描述,目标同时服务视频理解与生成。论文不仅强调规模,还描述从原始视频、镜头切分、过滤、字幕生成到数据质量分层的流水线,并通过检索、分类和生成任务检验数据价值。
- 关键内容:展示“大规模原视频”如何转成可训练片段;把视觉质量、文本匹配和运动等维度用于筛选;可用于研究视频数据工程,而不只是下载数据。
- 为什么值得读:这是理解现代视频基础模型数据管线的代表材料。对公开实验室而言,它能帮助建立“来源→切镜→过滤→重描述→抽检”的数据治理框架。
- 阅读前要知道:规模数字来自作者统计;自动字幕仍可能产生幻觉;数据访问、原视频权利和每个子集用途需要以仓库最新说明为准。
- 建议:数据工程专题必读;重点看数据构建、过滤、caption pipeline 和 ablation。
- 原文:ICLR 2024 论文 · 官方数据入口
2024|Panda-70M
- 资料身份:CVPR 2024 论文与官方仓库;A3 · current-data。
- 这篇原文具体讲什么:Panda-70M 从约 380 万条 HD-VILA 原视频中切出约 7070 万个语义连续片段,并综合字幕、画面帧等多种输入,由多个跨模态教师模型生成候选描述,再用人工选择过的小样本训练检索器挑选最佳描述。仓库还披露完整版约需 36TB,后续补充了运动与审美标注。
- 关键内容:核心贡献不是“70M”本身,而是语义切片、多教师描述和自动选优;论文验证了其对字幕、检索和文本生视频训练的作用;仓库明确提醒使用者继续遵守源数据许可。
- 为什么值得读:它非常适合研究“脏而大”和“精选但小”之间如何权衡,也是理解不少 2024–2025 开源模型训练数据来源的重要节点。
- 阅读前要知道:数据继承上游来源与许可问题;自动生成字幕和自动质量分存在偏差;论文结果不等于任意模型加入该数据都会同幅度提升。
- 建议:必读;重点看 Figure 1、数据构建、人工选优以及仓库 license。
- 原文:CVPR 论文 · 官方仓库
2024|OpenVid-1M
- 资料身份:ICLR 2025 论文与官方仓库;A3 · current-data。
- 这篇原文具体讲什么:OpenVid-1M 选择以较小规模换取更高画质和更细描述,提供约一百万组视频—文本对,其中约 43.3 万条为 1080p 的 OpenVidHD 子集。论文同时提出 MVDiT,用于验证数据和架构;仓库披露单独的高清子集约需 4.5TB,并提供下载和路径映射脚本。
- 关键内容:明确把 WebVid/Panda 的规模路线与高质量精选路线作比较;数据卡能看到实际存储成本;论文把数据质量与模型结构的提升混合验证,阅读时应拆开判断。
- 为什么值得读:适合个人或小团队估算“开放数据是否真的可用”。它把下载规模、分辨率、描述质量和研究复现成本写得比单纯榜单更具体。
- 阅读前要知道:论文中的优越性是作者实验结论;视频来源与授权仍需核查;“open”表示可获得,不自动表示所有商业用途都被许可。
- 建议:必读;先看仓库数据说明和存储要求,再读论文实验。
- 原文:ICLR 论文页 · 官方仓库
2024|MiraData
- 资料身份:论文与腾讯 ARC Lab 官方仓库;A3 · current-data / restricted-use。
- 这篇原文具体讲什么:MiraData 专门面向长视频生成,样本平均约 72 秒,描述平均约 318 词,并把主体、动作、场景、摄影等信息组织成结构化长描述。项目同时提出 MiraBench,用运动强度、时间一致性和 3D 一致性等指标检查长视频;仓库还提供利用 GPT-4V 生成描述和计算评测分数的代码。
- 关键内容:强调长镜头而非大量短切片;把“描述镜头语言”纳入字幕;仓库许可证说明视频版权仍归原权利人,数据仅限信息用途,并禁止商业利用和再分发。
- 为什么值得读:它直接关联“为什么模型难以维持长时间角色、动作和场景连续”。对虾米君多镜头实验也有启发:结构化描述必须区分持续状态与时间变化。
- 阅读前要知道:许可限制很强,不适合看到“可下载”就拿去做商业训练;GPT-4V 自动描述可能有误;作者模型结果需要独立复现。
- 建议:长视频专题必读;首先阅读仓库 License,再看 caption schema 和 MiraBench。
- 原文:论文 · 官方仓库及许可
2024|Vript
- 资料身份:论文与官方仓库;A3 · current-data。
- 这篇原文具体讲什么:Vript 将约 1.2 万条高分辨率长视频拆成超过 42 万个片段,每段描述平均约 145 词。它不只写画面里有什么,还记录景别、摇移等摄影操作,希望把普通 caption 提升为更接近“视频脚本”的密集描述;同时发布 Vriptor 字幕模型和面向幻觉、检索推理、事件顺序的困难评测。
- 关键内容:把摄影机语言写入视频文本;提供中文和多语言扩展;既可研究生成提示,也可研究视频理解模型是否真的识别事件顺序。
- 为什么值得读:对于需要写分镜、关键帧和视频提示词的人,它比泛化的“提示词大全”更有知识价值:能看到研究者怎样系统描述镜头运动与事件时间线。
- 阅读前要知道:字幕长度不等于准确;作者称 Vriptor 接近 GPT-4V 属实验结论;数据使用条件仍要以仓库为准。
- 建议:创作方法和数据专题必读;重点看 caption format、camera operation taxonomy、Vript-Hard。
- 原文:论文 · 官方仓库
2024|LVD-2M
- 资料身份:NeurIPS 2024 Datasets and Benchmarks 论文;A3 · current-data。
- 这篇原文具体讲什么:LVD-2M 聚焦不少于 10 秒、无切镜、运动明显的长镜头,建立场景切换、动态程度和语义质量过滤流程,再生成时间密集型字幕,最终形成约 200 万个长镜头样本。论文用微调实验验证长镜头数据对生成持续运动的帮助。
- 关键内容:把“长视频”限定为真正连续镜头,而不是多个短片拼接;过滤指标本身可转化为实验室素材质检规则;字幕按时间描述事件变化。
- 为什么值得读:它能解释为什么简单重复首尾帧或拼接短片不能解决长期一致性。对评估角色漂移、动作停滞和镜头内状态变化尤其有用。
- 阅读前要知道:作者实验仍受基础模型和评测指标影响;数据可得性、源视频许可及训练成本需另查项目说明。
- 建议:长视频与连续性专题必读;重点看数据过滤条件、temporally dense caption 和消融实验。
- 原文:NeurIPS 论文页
2024|FineVideo
- 资料身份:Hugging Face 官方数据卡与构建说明;A3 · current-data。
- 这篇原文具体讲什么:FineVideo 从约 190 万条候选视频过滤到 43,751 条,合计约 3,425 小时、122 个类别,并提供场景、人物、叙事、情绪、视听关系、问答及带时间码语音转写。官方长文完整解释动态性过滤、分类体系、Gemini 1.5 Pro 与 GPT-4o 自动标注以及时间对齐异常清洗。
- 关键内容:数据约 600GB,支持流式读取;数据卡标为 CC BY,并提供退出机制和偏差说明;它更偏长视频理解和叙事分析,也可辅助生成模型研究。
- 为什么值得读:这是少数把数据管线写得足够透明、普通研究者还能实际浏览和抽样的数据项目。其“从 190 万到 4.4 万”的过程比最终规模更值得借鉴。
- 阅读前要知道:CC BY 数据卡仍不免除对视频中肖像、商标、第三方素材的核查;自动注释会继承模型偏差;更适合理解/字幕研究,不能直接假设是最佳生成训练集。
- 建议:数据治理必读;先看构建博客,再看 Dataset Card 的 License、Biases 和 Opt-out。
- 原文:数据卡 · 构建过程
2025|OpenHumanVid
- 资料身份:CVPR 2025 论文与复旦官方仓库;A3 · current-data / gated-access。
- 这篇原文具体讲什么:OpenHumanVid 针对人物视频生成,提供人物外观、表情、姿态和动作状态的细描述,并附加骨骼序列与语音音频等条件。其管线组合 MiniCPM、CogVLM、Llama 和 BLIP2 投票过滤,目的是减少人物动作描述不足及多条件控制数据缺失。
- 关键内容:把人物身份外观、人体运动和语音条件分开组织;下载需要提交信息审核;仓库明确要求遵守源公开视频数据的许可。
- 为什么值得读:与用户最关心的角色一致性直接相关。它提醒我们“人物一致”不是单一人脸相似度,还包括身体、服装、表情、姿态、动作和音频驱动。
- 阅读前要知道:数据规模和效果主要来自作者论文;审批访问不代表自动取得商业权利;人物数据还涉及肖像、生物特征和同意问题。
- 建议:角色一致性专题必读;重点看 annotation taxonomy、motion conditions、access 与 license。
- 原文:官方仓库 · 论文
2026|CI-VID
- 资料身份:CVPR 2026 论文与官方代码;A3 · current-data。
- 这篇原文具体讲什么:CI-VID 针对传统数据都是孤立“文字—单片段”对的问题,构建超过 34 万个由多个相关视频片段与交错文字组成的连贯序列,同时描述单个片段内容和片段之间的关系。论文把任务从单镜头 T2V 推进到文本与视频共同条件下的多片段生成,并用人工、VLM 与相似度指标评价内容衔接。
- 关键内容:训练单位从独立镜头变成带上下文的镜头序列;重点评价跨片段准确性与连贯性;公开数据构建和评估代码。
- 为什么值得读:它直接对应“几个镜头单看都行,剪到一起很别扭”的问题。资料价值不在于承诺已经解决,而在于给出如何表达和评估镜头间关系的新数据结构。
- 阅读前要知道:论文结果是研究环境中的相对提升,不能直接推导闭源产品实际成功率;2026 新项目仍需观察数据、代码与复现成熟度。
- 建议:连续叙事和角色一致性专题必读;重点看 inter-clip relation schema、benchmark 和失败案例。
- 原文:CVPR 论文页 · 官方仓库
数据资料的统一判断
看到任何“开放视频数据集”,至少回答五个问题:
1. 原视频从哪里来,是否能追溯权利人?
2. 开放的是视频文件、URL、字幕、特征,还是下载脚本?
3. 数据集许可证是否覆盖底层视频和人物权利?
4. 字幕是人工写、转录、网页弱标注,还是模型生成?
5. 论文证明的是数据有效、模型有效,还是两者同时改变后得到的综合结果?