← 资料库

主流闭源视频模型研究卡

正式研究卡核验 2026-07-23下次复查 2026-07-30

闭源模型变化极快。这里研究的不是“谁永远第一”,而是官方资料实际披露了什么、哪些只是营销主张、怎样决定是否值得实测。价格、地区、积分和界面以核验当天产品为准。

Google|Gemini Omni Flash

  • 资料身份:Google DeepMind 模型卡和模型页;A1 · current。
  • 原文具体讲什么:模型卡发表于 2026-05-19,描述一个可接收文本、图像、音频和视频,并输出带音频视频的统一模型。重点能力是多轮对话编辑、参考素材迁移、视频理解与生成共享上下文;模型卡还披露训练数据模态、责任评测、安全缓解与已知限制,而不只是展示样片。
  • 为什么值得读:它代表视频工具从“一次 Prompt 生成一个片段”转向“围绕同一素材连续对话修改”。对角色一致性最值得验证的是第二、第三轮修改是否仍保持人物、服装、尺度和空间,而不是只测首轮画质。
  • 阅读前要知道:模型卡中的评测由 Google 完成;“高分辨率”“保持参考”仍需按实际产品/API 参数解释;地区、配额和可访问入口会变化。
  • 建议:必读;重点看 model overview、capabilities、evaluation、limitations 和 safety mitigations。
  • 原文模型卡 · 模型页

Google|Veo 3.1 与 Flow

  • 资料身份:Google 官方模型和产品更新;A1/B2 · current。
  • 原文具体讲什么:Veo 3.1 资料介绍参考素材、Ingredients to Video、首尾帧、纵向画幅、视频延展、原生音频及 1080p/4K 输出等能力;Flow 更新则说明这些能力如何被包装为素材管理、镜头生成和编辑工作台。两份资料分别回答“模型能做什么”和“创作者在哪个产品里怎么控制”。
  • 为什么值得读:很多对比把 Veo 和 Flow 混为一谈,导致无法复现。研究卡应分别记录底层模型版本、入口、功能层和后期处理,尤其注意 4K 是原生生成还是后处理。
  • 阅读前要知道:样例由官方精选;身份保持、音画同步和延展成功率没有公开统一值;Flow 里的功能、地区和积分可能与 API 不同。
  • 建议:模型与产品必须成对阅读;重点看 Ingredients、Frames、Extend、audio 和 SynthID。
  • 原文Veo 3.1 · Flow 更新 · Veo 模型页

ByteDance|Seedance 2.0

  • 资料身份:ByteDance Seed 官方发布与产品页;A1/B2 · current。
  • 原文具体讲什么:官方将 Seedance 2.0 定义为统一多模态音视频模型,可组合文本、图像、视频和音频参考生成最长约 15 秒的多镜头片段,并公开最多 9 张图、3 段视频、3 段音频等输入规模。资料也主动列出细节稳定、超写实运动和偶发音频失真等不足。
  • 为什么值得读:这不是普通的“文生视频升级”,而是把故事板、角色参考、动作参考和声音参考放入同一生成任务。对虾米君最关键的实验应是多参考冲突、跨镜头尺度、光向和道具状态,而非只看单镜头炫技。
  • 阅读前要知道:功能描述来自厂商;即梦、API 或地区版本的开放参数可能不同;多参考输入多不代表模型会自动正确分配每个参考的作用。
  • 建议:必读并优先实测;重点记录参考数量、引用方式、镜头时长和失败类型。
  • 原文官方发布 · 产品页

Kuaishou|Kling 3.0 / O1

  • 资料身份:快手上市公司业绩材料与产品发布;A1/B2 · current。
  • 原文具体讲什么:快手 2025 年度业绩材料确认 Kling 3.0 于 2026 年 2 月推出,并把 Kling O1 描述为统一生成与编辑路线,覆盖文字、图像、视频和音频等多模态能力。上市材料还把模型版本、用户和商业化放入公司整体业务背景,而非只谈样片。
  • 为什么值得读:它是少数能从上市公司披露追踪模型迭代和商业化的中国视频模型。模型研究应把版本功能、产品收入叙事和独立效果测试分开记录。
  • 阅读前要知道:PDF 中“领先”“全球首个”等仍是公司主张;上市披露可确认发布时间和业务口径,不能替代技术模型卡;自动访问可能受 IR 站反爬影响。
  • 建议:公司与模型专题必读;重点看版本时间线、商业指标口径和风险因素。
  • 原文快手 2025 年度业绩材料 · Kling O1 发布材料

Runway|Gen-4.5

  • 资料身份:Runway 官方研究页;A1/B2 · current。
  • 原文具体讲什么:Gen-4.5 官方资料重点展示复杂运动、提示遵循、视觉保真和电影感,并将模型放入 Runway 从生成视频、视频编辑、表演驱动角色到世界模型的更大路线。页面也提供与其他模型的厂商评测及精选样例。
  • 为什么值得读:Runway 是最早把生成视频持续产品化的公司之一,研究其版本史可以观察“纯生成镜头”如何扩展到 Aleph 编辑、Act 表演控制和 GWM 交互环境。
  • 阅读前要知道:官方“世界第一”和内部榜单属于 B2 主张;需要用 Arena、Artificial Analysis 和本站同题测试交叉验证;产品入口的默认增强可能影响模型原始输出。
  • 建议:模型史专题必读;实验时保存 model、mode、resolution、upscale 和 credit cost。
  • 原文Gen-4.5 官方研究页 · 研究索引

Luma AI|Ray3.2

  • 资料身份:Luma 官方发布与学习中心;A1/B2 · current。
  • 原文具体讲什么:Ray3.2 将重点放在视频到视频生产:最多 16 个关键帧、最长约 20 秒输入、1080p、HDR 与 16-bit EXR 等能力,面向已有拍摄素材的角色、服装、环境或风格改造。官方学习中心明确区分其核心用途与纯文生视频,也解释关键帧约束和后期流程。
  • 为什么值得读:它提供一条不同于“重新抽卡”的一致性路线:先获得动作、构图和时长稳定的底片,再用 V2V 改外观。对连续镜头和真人/3D 预演转角色尤其值得实验。
  • 阅读前要知道:HDR、EXR 和关键帧数量不等于自动无漂移;输入素材质量、遮挡和大幅外观替换会影响结果;Dream Machine/Ray2 已是旧代,不能混写。
  • 建议:专业后期和 V2V 专题必读;重点看 input requirements、keyframes、HDR pipeline 和 limitations。
  • 原文Ray3.2 发布 · 核心概念 · 当前模型状态

MiniMax|Hailuo 2.3 与 Media Agent

  • 资料身份:MiniMax 官方公告;A1/B2 · current。
  • 原文具体讲什么:Hailuo 2.3 支持文本生视频和图生视频,提供 768p/1080p、6 秒或 10 秒等模式,并强调人物动作、微表情和风格。MiniMax 同时把模型包装进 Video Agent / Media Agent,尝试从脚本、素材、镜头、声音到合成进行自动化。
  • 为什么值得读:同一公司同时展示“基础模型”和“自动制作 Agent”,适合判断成片改善究竟来自模型升级,还是脚本改写、素材选择、重试和后期编排。
  • 阅读前要知道:“性价比纪录”和效果比较属于公司主张;Agent 自动完成不代表没有人工选择;实际积分、Fast 模式质量和可用入口应在实验日核验。
  • 建议:模型卡与 Agent 产品一起读;实验分别计生成成本和人工接管时间。
  • 原文Hailuo 2.3 · Video Agent

ShengShu|Vidu Q3 与 S1

  • 资料身份:Vidu 官方 API 文档、更新记录及 S1 论文;A1/A3/B2 · current。
  • 原文具体讲什么:Vidu 模型地图以 API 为功能真值,列出 Q3 Pro、Mix、Drama、Ad、Turbo 等面向通用、剧情与广告的变体,以及输入、音频、切镜和时长范围。S1 则转向实时交互角色,论文研究语音条件下连续生成,发布稿给出帧率等产品数字。
  • 为什么值得读:这是少见把模型按内容类型产品化的路线,也与用户提到的 LibTV skill hub 分类思路相呼应:同一“视频模型”可能针对剧情、广告、速度或实时交互采用不同入口。
  • 阅读前要知道:API 文档能确认参数,不保证质量;S1 论文证明研究存在,发布稿的实时帧率和领先结论仍需硬件与场景复测。
  • 建议:先读 API model map,再按具体任务选择模型;不要混用不同变体结果。
  • 原文模型地图 · 更新记录 · S1 论文

Adobe|Firefly Video Model

  • 资料身份:Adobe 官方发布、产品说明与内容凭证资料;A1/B2 · current。
  • 原文具体讲什么:Adobe 将 Firefly Video Model 嵌入 Firefly 与 Premiere,支持文生、图生和 Generative Extend,并强调训练使用获许可内容、Adobe Stock 与公版内容,输出可带 Content Credentials。其产品定位突出 Creative Cloud 工作流和企业知识产权风险管理。
  • 为什么值得读:Adobe 的差异化并非只追求榜单画质,而是“训练数据来源、企业条款、后期软件和溯源”一体化。商业项目选择模型时,这些可能比单个样片更重要。
  • 阅读前要知道:“commercially safe”是 Adobe 产品与法律承诺的表述,不等于全地区零侵权;还要读取适用计划、赔偿范围和第三方合作模型例外。
  • 建议:商业与企业工作流必读;重点看 training approach、Content Credentials、terms 和 partner-model distinction。
  • 原文Firefly Video 发布 · 产品与训练说明

Meta|Movie Gen

  • 资料身份:Meta 技术论文与研究页;A3 · research-only。
  • 原文具体讲什么:Movie Gen 覆盖文本生视频、参考人物个性化、指令式视频编辑、视频到音频和文本到音频。论文披露不同模型规模、训练数据处理、评测和局限,并展示最长约 16 秒、1080p 等研究结果;Meta 还与 Blumhouse 创作者做反馈计划。
  • 为什么值得读:它是研究“视频、人物、编辑和声音是否能由一组媒体基础模型统一”的重要技术报告,也可与 VideoPoet、Seedance、Gemini Omni 的统一多模态路线对照。
  • 阅读前要知道:它不是面向公众的独立产品;与创作者合作证明测试存在,不证明进入商业发行;样例和作者评测需要独立交叉验证。
  • 建议:研究专题必读,普通工具选型按需;重点看 personalization、editing、audio、data 和 evaluation。
  • 原文研究页 · 论文页 · Blumhouse 反馈计划

OpenAI|Sora 2

  • 资料身份:OpenAI 发布页与系统卡;A2 · closed。
  • 原文具体讲什么:Sora 2 于 2025-09 发布,主打物理与可控性改进、同步对话和音效,并由系统卡集中说明非自愿肖像、误导性生成、未成年人、安全分类和部署缓解。官方页面现明确写明 Sora 产品自 2026-04-26 起不再提供。
  • 为什么值得读:这是记录 AI 产品生命周期的典型材料:一项重要模型研究和安全文档仍具有历史价值,但产品已经关闭,旧教程、价格和操作说明不能继续当当前资料。
  • 阅读前要知道:关闭的是 Sora 产品可用性,不应擅自外推模型研究完全消失;官方系统卡是开发方自评,不替代外部审计。
  • 建议:历史、安全和失败/退役专题必读;工具选型中标为不可用。
  • 原文Sora 2 发布与关闭状态 · Sora 2 系统卡

选型时不要做的一件事

不要把不同入口的“最高分辨率、最长秒数、支持参考数、带音频”简单相加成总分。模型选择至少要绑定一个具体任务,例如:

  • 单人物表演驱动
  • 多角色多镜头剧情
  • 商品外观保持
  • 已有底片的视频到视频
  • 原生对白和环境音
  • 连续多轮编辑

然后用同一素材、同一可观察指标和固定预算做本站实验。