MiniMax H3 Low‑VRAM Video Skill

在 Windows 低显存电脑上部署、运行和优化 MiniMax H3 本地视频生成:文生视频、图生视频、参考生视频、原生立体声音频、人脸清晰度优化与 1080p 社交平台发布。

Agent Skill Platform GPU License

这个仓库不是 MiniMax H3 模型镜像,也不会分发任何模型权重。它是一套可复用的 Agent Skill:让 Codex、Claude Code 或其他兼容 Agent Skills 的工具,能够根据机器配置完成部署、排错、分辨率决策、视频生成、逐帧 AI 超分和交付验证。

为什么创建它

MiniMax H3 可以在 8GB 笔记本显卡上运行,但“能启动”和“能稳定产出清晰视频”之间有很大距离。常见误区包括:

  • 把硬盘剩余空间误认为可用内存;
  • 只看显存,不检查系统内存和 Windows 分页文件;
  • 一开始就运行 1344×768,几十分钟后才发现编码或音轨失败;
  • 把 480p 简单放大到 1080p,并误认为得到了原生 1080p 细节;
  • 在多人远景中要求清晰人脸,却忽略脸部在原始画面里只有很少像素;
  • 一次性把所有视频帧送入超分模型,导致 16GB 内存溢出;
  • 仅检查 MP4 文件存在,没有完整解码全部画面与音频。

本 Skill 将这些问题整理为可执行的工作流和明确的验证门槛。

核心能力

  • 分析 CPU、RAM、GPU、显存、驱动、磁盘和分页文件;
  • 选择适合低显存机器的 H3 INT8 / NVFP4 模型组合;
  • 部署官方 ComfyUI Portable 与官方 H3 节点;
  • 生成文生、图生、首尾帧和参考视频;
  • 保留 H3 原生同步立体声音频;
  • 从 608×352 验证档逐级提升到 H3 原生 1344×768;
  • 使用构图和提示词提高人物面部有效像素;
  • 使用 Real‑ESRGAN 逐帧、低内存地生成 1080p 发布副本;
  • 检查完整帧数、时长、编码、码率和音轨;
  • 识别 OOM、分页文件未生效、模型文件损坏、服务未监听和 MP4 封装失败。

兼容性

已实测环境

项目 实测配置
操作系统 Windows 11
GPU NVIDIA RTX 5050 Laptop GPU,8GB VRAM
系统内存 16GB
存储 NVMe SSD
分页文件 E: 固定 64GB;C: 4GB
ComfyUI 0.31.0 Portable
PyTorch 2.13.0 + CUDA 13.0
H3 扩散模型 FL2VA / REF2VA INT8 ConvRot
文本编码器 Qwen3‑VL 32B MiniMax H3 NVFP4/AWQ
后处理 Real‑ESRGAN x4plus、PyAV、H.264/AAC

建议的最低条件

  • Windows 10/11 64 位;
  • 支持 CUDA 的 NVIDIA GPU;
  • 8GB 显存用于本仓库重点覆盖的低显存路线;
  • 16GB RAM,并配置至少 32GB 分页文件;
  • 建议为模型、输出和分页文件预留 100GB 以上空间;
  • 能运行当前官方 ComfyUI Portable 的 NVIDIA 驱动。

低于 8GB 显存、低于 16GB RAM、非 NVIDIA GPU 或不同量化后端可能仍可运行,但不属于本仓库已验证范围。Agent 必须明确标注推断,不能冒充实测。

安装

方法一:Codex Skill Installer

在 Codex 中发送:

从 GitHub 安装 https://github.com/zth464204365/minimax-h3-low-vram-video 中的 minimax-h3-low-vram-video skill。

安装后重新开启一个 Codex 任务,或刷新技能列表。技能应显示为:

$minimax-h3-low-vram-video

方法二:Windows PowerShell 手动安装

克隆仓库后执行:

git clone https://github.com/zth464204365/minimax-h3-low-vram-video.git
Copy-Item -Recurse -Force `
  .\minimax-h3-low-vram-video `
  "$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video"

验证核心文件:

Test-Path "$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video\SKILL.md"

返回 True 后,重启或刷新 Codex。

方法三:Claude Code / 通用 Agent Skills

minimax-h3-low-vram-video 目录复制到目标工具支持的 skills 目录。不同工具的目录和加载命令可能变化,请以对应产品当前文档为准。Skill 使用标准 SKILL.md frontmatter,核心指令不依赖 Codex 专有格式;agents/openai.yaml 仅用于 Codex 界面元数据。

更新

git pull
Copy-Item -Recurse -Force `
  .\minimax-h3-low-vram-video `
  "$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video"

更新前建议备份自己修改过的 references/ 或脚本参数。

卸载

关闭正在使用该 Skill 的任务后,删除:

%USERPROFILE%\.codex\skills\minimax-h3-low-vram-video

卸载 Skill 不会删除 ComfyUI、模型、分页文件或生成的视频。

快速开始

让 Agent 分析并部署

使用 $minimax-h3-low-vram-video 检查我的电脑,并把 MiniMax H3 部署到 E 盘。先做只读硬件检查,再给出模型版本、磁盘需求和风险;确认可行后完成部署并验证 API。

生成人物面部清晰的视频

使用 $minimax-h3-low-vram-video 生成一个 5 秒环保主题视频。主体为两个人的中近景,优先保证眼睛、五官、发丝和手部稳定;使用 H3 原生最高可行分辨率,保留原生音频,并制作单独的 1080p 发布副本。

诊断内存问题

使用 $minimax-h3-low-vram-video 诊断为什么我的 H3 在模型加载或第一步卡住。不要直接重装,先检查进程、日志、分页文件、空闲虚拟内存、显存和队列。

模型组合与目录

本 Skill 推荐使用官方量化组合:

ComfyUI/
└─ models/
   ├─ diffusion_models/
   │  ├─ minimax_h3_fl2va_pruned_int8_convrot.safetensors
   │  └─ minimax_h3_ref2va_pruned_int8_convrot.safetensors
   ├─ text_encoders/
   │  └─ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
   ├─ vae/
   │  ├─ minimax_h3_video_vae_fp16.safetensors
   │  └─ minimax_h3_audio_vae_fp32.safetensors
   └─ upscale_models/
      └─ RealESRGAN_x4plus.pth
  • FL2VA:文本、图像、首尾帧条件的视频生成;
  • REF2VA:参考图像/视频条件生成;
  • 视频与音频 VAE:联合输出画面和同步声音;
  • Real‑ESRGAN:只用于发布副本,不替代 H3 原生细节。

始终从官方发布页或可核验的一对一镜像下载。大型模型下载完成后检查文件大小和 SHA‑256。不要加载部分下载、HTML 错误页或同名未知权重。

分辨率策略

H3 原生画布 用途 8GB/16GB 实测耗时(5.17 秒、20 步)
608×352 端到端部署验证 约 6.5 分钟
864×480 提示词与构图草稿 约 11.8 分钟
1152×640 高质量折中档 未在本次基准单独计时
1344×768 官方原生画布上限、最终短片 约 36.7 分钟

耗时仅代表一台 RTX 5050 Laptop 8GB + 16GB RAM 机器,不是性能承诺。

推荐流程:

608×352 验证 → 864×480 调构图 → 1152×640 或 1344×768 最终生成
                                      ↓
                        保留 H3 原生母版
                                      ↓
                    轻度增强为 1920×1080 发布副本

人脸清晰度:最重要的经验

输出文件写着“1080p”,不代表人物脸部具有 1080p 级别的信息。决定人脸质量的第一因素,是脸在 H3 原生画面中实际占用多少像素

按下面顺序优化:

  1. 将主要人物限制为一至两名;
  2. 使用中近景或近景,确保脸部无遮挡;
  3. 将次要人物放到远处并虚化;
  4. 使用稳定的慢推镜头,避免快速切换身份和角度;
  5. 在提示词中描述眼睛、自然皮肤、眉毛、发丝和手部一致性;
  6. 再提高 H3 原生画布;
  7. 最后才制作 1080p 发布副本。

AI 超分可以增强边缘、纹理和平台压缩耐受度,但无法可靠修复错误的眼睛、畸形手指、身份漂移或原始远景中不存在的脸部信息。

Windows 低内存设置

建议的 ComfyUI 启动参数:

--windows-standalone-build
--enable-dynamic-vram
--fast-disk
--cache-none
--reserve-vram 1.0
--disable-pinned-memory

关键说明:

  • 8GB 显存运行 20GB 级量化扩散权重依赖动态显存卸载;
  • 16GB RAM 机器必须依赖分页文件承接模型暂存;
  • 分页文件配置后通常需要重启,必须确认它已经激活;
  • 生成时不要运行游戏、3D 渲染器或其他 CUDA 工作负载;
  • “0% 很久”不一定卡死,满分辨率首次初始化可能超过 100 秒;
  • 检查进程、队列、日志和资源变化后再判断是否停止任务。

低内存 Real‑ESRGAN 超分

技能自带逐帧脚本:

python .\minimax-h3-low-vram-video\scripts\upscale_video_realesrgan.py `
  --input "H3-native.mp4" `
  --output "H3-publish-1080p.mp4" `
  --model "RealESRGAN_x4plus.pth" `
  --width 1920 `
  --height 1080 `
  --crf 16

它会:

  1. 一次只读取一帧;
  2. 通过重叠分块减少显存峰值与拼接缝;
  3. 将增强结果精确缩放到目标尺寸;
  4. 先正常关闭临时视频容器;
  5. 再无损复用原始 AAC 音频包;
  6. 删除临时无声视频。

依赖:Python、PyTorch、PyAV、Pillow、NumPy、Spandrel,以及支持的 H.264 编码器。ComfyUI Portable 的内嵌 Python通常已包含大部分依赖,但不同版本必须实际检查。

交付验证

不要只看文件是否存在。最终视频至少验证:

  • 输出绝对路径;
  • 是否为 H3 原生母版或后处理副本;
  • 分辨率、帧率、时长和总帧数;
  • H.264/H.265 等视频编码;
  • 平均码率;
  • AAC 等音频编码、采样率和声道数;
  • 完整解码全部视频帧;
  • 完整解码音频流;
  • 抽取代表帧检查脸部、手部、身份和构图。

故障排查

现象 常见原因 优先动作
有 200GB 空间仍提示内存不足 分页文件未配置或未激活 检查 Windows PageFileUsage 和空闲虚拟内存
启动后接口无法访问且日志为空 启动命令本身未执行 使用绝对 Python 路径和明确工作目录
长时间停在 0% 权重暂存、卸载或首步初始化 检查进程、GPU、队列和日志是否仍变化
生成中 OOM 分辨率过高、其他程序占显存 关闭 GPU 程序,降低画布或加大保留显存
1080p 仍然脸糊 原生画面中脸太小 重新生成中近景,不要继续放大旧视频
超分时 RAM 爆满 一次性处理全部帧 使用逐帧分块脚本
最终 MP4 损坏 容器未关闭或音轨添加顺序错误 先关闭临时视频,再声明并复用音视频流
权重加载报错 文件下载不完整或型号不兼容 比对大小、SHA‑256、目录和节点型号

安全与注意事项

  • 阅读脚本后再运行来自第三方仓库的 Skill;
  • 不在仓库、日志或截图中提交令牌、Cookie、私有模型地址和用户名路径;
  • 不上传模型权重、生成的视频或用户参考图,除非版权与隐私允许;
  • 修改分页文件属于系统级变更,记录原值并确保目标磁盘有足够空间;
  • 长时间生成前接通电源并关闭睡眠;
  • 笔记本持续满载时注意温度和散热;
  • 不保证 MiniMax、ComfyUI 或第三方模型的许可覆盖你的商业用途,请分别阅读其当前许可证和服务条款;
  • 本仓库与 MiniMax、ComfyUI、Real‑ESRGAN 及其作者没有隶属关系。

仓库结构

.
├─ README.md
├─ LICENSE
├─ .gitignore
└─ minimax-h3-low-vram-video/
   ├─ SKILL.md
   ├─ agents/
   │  └─ openai.yaml
   ├─ references/
   │  ├─ decision-guide.md
   │  ├─ installation.md
   │  ├─ prompt-guide.md
   │  └─ troubleshooting.md
   └─ scripts/
      └─ upscale_video_realesrgan.py

设计参考

仓库结构和说明方式参考了成熟的 Agent Skills 项目:

  • OpenAI Skills:Codex Skills 目录、渐进式资源组织;
  • Anthropic Skills:标准 SKILL.md、自包含目录与示例;
  • Superpowers:清晰的安装入口、工作流边界和跨 Agent 使用说明。

这里的 H3 参数、耗时和故障经验来自实际本地部署与完整视频生成,并非复制上述项目的具体实现。

许可证

本仓库的原创说明和脚本使用 MIT License。MiniMax H3、ComfyUI、Real‑ESRGAN、PyTorch 和其他依赖仍使用各自许可证;MIT 许可证不重新授权第三方模型或软件。