开放权重视频模型研究卡
“GitHub 可见”不等于完整开源。本页分别检查代码、模型权重、训练脚本、数据、许可证和硬件。显存数字只有在分辨率、帧数、精度、量化、CPU 卸载和速度同时说明时才有意义。
Wan2.2
- 资料身份:阿里 Wan 官方仓库;A3 · current。
- 原文具体讲什么:仓库汇总文本生视频、图生视频、统一 5B 模型及声音驱动、角色动画等扩展,提供模型下载、推理命令、Diffusers/ComfyUI 集成和部分训练或微调入口。技术路线包含视频扩散 MoE,不同模型尺寸、任务和分辨率有不同显存及速度要求。
- 为什么值得读:Wan 已成为开源视频生态的重要公共底座,很多角色、控制、LoRA 和 ComfyUI 项目依赖它。研究第三方工作流时,应先回到官方仓库确认它基于 Wan2.1 还是 2.2、5B 还是 14B、T2V 还是 I2V。
- 阅读前要知道:仓库对比表属于作者自评;代码许可证、各权重许可证和下游扩展许可要分别看;所谓消费级运行可能依赖量化、卸载或较长等待。
- 8GB 判断:不先承诺“可用”。选择最小模型与官方/主流低显存方案后,必须记录生成规格、峰值显存、内存、时间和质量。
- 建议:开放模型必读;重点看 Model Zoo、Installation、Usage、License 和最新 issues。
- 原文:Wan2.2 官方仓库
HunyuanVideo / HunyuanVideo 1.5
- 资料身份:腾讯混元官方仓库;A3 · current。
- 原文具体讲什么:初代 HunyuanVideo 是约 13B 的开放视频基础模型,仓库提供权重、推理与技术报告;1.5 版转向更轻量的约 8.3B 架构并强调消费级 GPU 推理。两代项目分别维护,模型结构、依赖、提示词处理、权重和许可不能混用。
- 为什么值得读:它展示大厂模型从“开放大基座”向更可部署版本演进,也衍生 Avatar 等人物专项模型。角色工作流要区分通用生成与音频驱动人物模型。
- 阅读前要知道:代码通常采用开源许可证,但权重可能有独立社区许可;“消费级”覆盖范围较宽,不等于 8GB;仓库样例可能使用高端 GPU 和特定加速。
- 8GB 判断:官方规格不支持直接下结论。除非采用社区量化/CPU offload 并实测,否则标为高风险。
- 建议:先读 1.5,再按历史需要回看初代;重点核对 requirements、GPU table、license 和 model card。
- 原文:HunyuanVideo · HunyuanVideo 1.5
CogVideoX
- 资料身份:智谱/清华系官方仓库;A3 · current。
- 原文具体讲什么:仓库从 2022 CogVideo 历史发展到 CogVideoX,覆盖文本生视频、图生视频、视频续写、量化、Diffusers 与训练/微调说明。模型有不同参数规模和许可证,仓库也列出社区推理优化和显存降低路径。
- 为什么值得读:这是少数能看到文本生视频路线连续演化多年的开放系列,也适合作为 LoRA、量化和 Diffusers 标准化的研究对象。
- 阅读前要知道:不同尺寸权重不一定采用完全相同许可;社区节点和量化包不由官方同等保证;演示配置与 8GB 实际速度不可混写。
- 8GB 判断:只把“可能启动某个量化/卸载配置”记为待实验,不写成“8GB 适合生产”。
- 建议:模型史与本地微调专题必读;重点看 Model License、Hardware Requirement、Diffusers 和 finetune。
- 原文:CogVideo 官方仓库
LTX-Video / LTX-2
- 资料身份:Lightricks 官方仓库;A3/B2 · current。
- 原文具体讲什么:LTX 路线强调高压缩视频 VAE、较快推理、多关键帧、视频延展和后续同步音视频统一,并提供官方 ComfyUI 节点、训练工具及桌面端。仓库最新说明会把旧 LTXV 与 LTX-2 放在同一演进背景中,必须按 tag 和模型名辨别。
- 为什么值得读:它是“模型+节点+训练+桌面应用”一体化最清晰的开放生态之一,适合研究开放权重如何变成创作者产品。
- 阅读前要知道:原生 4K、50fps、同步音频等是官方能力表述,实际模式可能包含不同阶段、增强或硬件;Desktop 本地 NVIDIA 路线官方曾要求至少 16GB 显存,Mac 可走 API,不等于本地。
- 8GB 判断:官方桌面端不支持把 8GB 视为目标配置;可研究社区量化,但要标注非官方和质量代价。
- 建议:音视频统一和生产工具专题必读;重点看 model/version table、ComfyUI、training、desktop requirements 与 license。
- 原文:LTX-Video · LTX-2 · LTX Desktop
Mochi 1
- 资料身份:Genmo 官方仓库;A3 · current/historical-baseline。
- 原文具体讲什么:Mochi 1 是约 10B 的 AsymmDiT 文生视频模型,官方开放模型、代码和推理说明。仓库明确原生单卡实现约需 60GB 显存,并列出多 GPU、CPU offload 或社区集成等替代路径。
- 为什么值得读:它是一个诚实展示“开放权重不等于普通电脑能跑”的案例。仓库对架构、权重和资源要求的说明适合作为审查其他项目硬件宣传的基准。
- 阅读前要知道:社区把模型塞入更低显存不代表速度和质量仍与官方样例一致;较老 checkpoint 也不应直接与当前闭源模型排名。
- 8GB 判断:不列为实用本地路线;只适合远程 GPU 或专门的极限优化研究。
- 建议:按需阅读;重点看 system requirements、weights、license 和 community integrations。
- 原文:Mochi 官方仓库
Open-Sora 2.0
- 资料身份:HPC-AI Tech 官方仓库与技术报告;A3 · current-research。
- 原文具体讲什么:项目公开模型、训练/推理代码、数据处理流程和训练成本,作者称约用 20 万美元训练 11B 模型。报告详细讨论数据清洗、训练阶段、性能和成本,官方 768p 推理测试仍使用 H100/H800 级硬件。
- 为什么值得读:它最有价值的部分不是“开源 Sora 替代品”,而是罕见地把视频基础模型训练配方和成本拆开。可用于理解为什么高质量视频模型难以由个人从头训练。
- 阅读前要知道:20 万美元是作者项目口径,不覆盖所有隐性人力、基础研究和数据成本;开放训练不等于本地低配推理;作者榜单需独立验证。
- 8GB 判断:不作为本地实用模型;适合阅读训练工程或租用高端 GPU 复现小部分。
- 建议:开放训练专题必读;重点看 cost breakdown、data pipeline、training stages 和 hardware。
- 原文:官方仓库 · 技术报告
FramePack
- 资料身份:Lvmin Zhang 等官方仓库;A3 · current。
- 原文具体讲什么:FramePack 通过固定长度上下文打包生成历史帧,使下一段预测的计算量不随视频总长度持续增长;仓库提供模型、运行方式、显存说明、实验更新和漂移控制讨论。作者明确称可在最低约 6GB 显存运行,并反复警告大量仿冒网站。
- 为什么值得读:它直接回应低显存长视频和长期漂移,是 8GB 用户最值得真实测试的项目之一;同时也是供应链安全的典型案例。
- 阅读前要知道:固定计算量不等于身份永不漂移,也不等于生成速度快;反向采样、量化和 CPU offload 会影响效果;唯一可信入口是官方 GitHub。
- 8GB 判断:列为优先实测,但验收必须包含每秒生成耗时、内存、人物漂移、动作重复和长片段退化。
- 建议:必读并实验;先看 README 顶部安全警告、requirements、memory 和 known issues。
- 原文:FramePack 唯一官方仓库
Pyramid Flow
- 资料身份:ICLR 2025 官方仓库;A3 · current-research。
- 原文具体讲什么:Pyramid Flow 使用金字塔式流匹配,从低分辨率到高分辨率分阶段生成,目标是降低训练成本;官方仓库提供训练代码、模型和文生/图生示例,并称 CPU offload 可在低于 8GB 显存环境启动。仓库同时给出 384p、768p、时长和帧率的不同 checkpoint。
- 为什么值得读:这是少数官方明确触及 8GB 门槛、同时开放训练代码的模型,适合验证“能运行”和“可使用”之间的差距。
- 阅读前要知道:低显存依赖卸载,可能非常慢;仓库更新集中在 2024,维护活跃度需看提交与 issues;官方质量比较是作者实验。
- 8GB 判断:列为次优先实测;先跑最低规格,记录首轮安装、下载、峰值内存和整段耗时。
- 建议:本地路线按需读;重点看 checkpoint differences、CPU offloading、training 和 latest commits。
- 原文:Pyramid Flow 官方仓库
MAGI-1
- 资料身份:Sand AI 官方仓库与技术报告;A3/B2 · current。
- 原文具体讲什么:MAGI-1 采用自回归分块的视频生成方式,每个固定帧块内部用扩散去噪,再逐块推进,支持并行处理部分块;仓库发布 24B、4.5B、蒸馏和量化版本、Docker 环境、ComfyUI 及训练技术说明。
- 为什么值得读:它是长视频“逐块生成”路线的代表,可与 FramePack 和长镜头数据方法比较:三者都处理长度,但上下文组织和漂移机制不同。
- 阅读前要知道:官方推荐 Docker 和高端 GPU 环境;“开放 4.5B 量化”不等于 8GB 流畅;仓库 SOTA 表述是作者自评。
- 8GB 判断:不在未实测前列为可用路线;先核查量化 checkpoint 的真实显存、CPU 内存和速度。
- 建议:长视频架构专题必读;重点看 chunk autoregression、distillation、model variants 和 hardware。
- 原文:MAGI-1 官方仓库 · 技术报告
NVIDIA Cosmos
- 资料身份:NVIDIA 官方模型、数据与工具平台;A3/B2 · current。
- 原文具体讲什么:Cosmos 以物理 AI 为目标,将文本、图像、视频、音频和动作条件用于世界状态生成、预测、机器人与自动驾驶,并开放预训练/后训练模型、推理、微调和特定任务配方。代码与模型使用不同许可证,仓库明确要求单独阅读。
- 为什么值得读:它提醒研究者不要把所有视频生成都按“影视效果”评价。世界模型更关心动作条件、未来预测、多相机和物理任务,其视频只是状态表示之一。
- 阅读前要知道:NVIDIA 的“open platform”不等于所有模型 Apache 2.0;硬件通常面向专业 GPU;官方物理能力需任务基准而不是样片验证。
- 8GB 判断:不作为创作者本地路线;用于理解世界模型和许可分层。
- 建议:世界模型专题必读;重点看 model matrix、license、post-training 和 task benchmarks。
- 原文:Cosmos 统一仓库 · Predict 2.5
8GB GPU 的真实候选顺序
1. FramePack:官方明确给出低显存入口,先测速度与漂移。
2. Pyramid Flow:官方提到 CPU offload 低于 8GB,重点评估等待时间。
3. Wan / CogVideoX 的社区量化:只作为非官方实验,严格记录版本与来源。
4. 其余大型模型:优先租云端或使用官方 API,不为了“本地”牺牲数小时和不可接受质量。
任何“8GB 可跑”只有完成一次公开实验记录后,才能升级为“本站已验证”。