MiniMax H3 Low‑VRAM Video Skill
在 Windows 低显存电脑上部署、运行和优化 MiniMax H3 本地视频生成:文生视频、图生视频、参考生视频、原生立体声音频、人脸清晰度优化与 1080p 社交平台发布。
这个仓库不是 MiniMax H3 模型镜像,也不会分发任何模型权重。它是一套可复用的 Agent Skill:让 Codex、Claude Code 或其他兼容 Agent Skills 的工具,能够根据机器配置完成部署、排错、分辨率决策、视频生成、逐帧 AI 超分和交付验证。
为什么创建它
MiniMax H3 可以在 8GB 笔记本显卡上运行,但“能启动”和“能稳定产出清晰视频”之间有很大距离。常见误区包括:
- 把硬盘剩余空间误认为可用内存;
- 只看显存,不检查系统内存和 Windows 分页文件;
- 一开始就运行 1344×768,几十分钟后才发现编码或音轨失败;
- 把 480p 简单放大到 1080p,并误认为得到了原生 1080p 细节;
- 在多人远景中要求清晰人脸,却忽略脸部在原始画面里只有很少像素;
- 一次性把所有视频帧送入超分模型,导致 16GB 内存溢出;
- 仅检查 MP4 文件存在,没有完整解码全部画面与音频。
本 Skill 将这些问题整理为可执行的工作流和明确的验证门槛。
核心能力
- 分析 CPU、RAM、GPU、显存、驱动、磁盘和分页文件;
- 选择适合低显存机器的 H3 INT8 / NVFP4 模型组合;
- 部署官方 ComfyUI Portable 与官方 H3 节点;
- 生成文生、图生、首尾帧和参考视频;
- 保留 H3 原生同步立体声音频;
- 从 608×352 验证档逐级提升到 H3 原生 1344×768;
- 使用构图和提示词提高人物面部有效像素;
- 使用 Real‑ESRGAN 逐帧、低内存地生成 1080p 发布副本;
- 检查完整帧数、时长、编码、码率和音轨;
- 识别 OOM、分页文件未生效、模型文件损坏、服务未监听和 MP4 封装失败。
兼容性
已实测环境
| 项目 | 实测配置 |
|---|---|
| 操作系统 | Windows 11 |
| GPU | NVIDIA RTX 5050 Laptop GPU,8GB VRAM |
| 系统内存 | 16GB |
| 存储 | NVMe SSD |
| 分页文件 | E: 固定 64GB;C: 4GB |
| ComfyUI | 0.31.0 Portable |
| PyTorch | 2.13.0 + CUDA 13.0 |
| H3 扩散模型 | FL2VA / REF2VA INT8 ConvRot |
| 文本编码器 | Qwen3‑VL 32B MiniMax H3 NVFP4/AWQ |
| 后处理 | Real‑ESRGAN x4plus、PyAV、H.264/AAC |
建议的最低条件
- Windows 10/11 64 位;
- 支持 CUDA 的 NVIDIA GPU;
- 8GB 显存用于本仓库重点覆盖的低显存路线;
- 16GB RAM,并配置至少 32GB 分页文件;
- 建议为模型、输出和分页文件预留 100GB 以上空间;
- 能运行当前官方 ComfyUI Portable 的 NVIDIA 驱动。
低于 8GB 显存、低于 16GB RAM、非 NVIDIA GPU 或不同量化后端可能仍可运行,但不属于本仓库已验证范围。Agent 必须明确标注推断,不能冒充实测。
安装
方法一:Codex Skill Installer
在 Codex 中发送:
从 GitHub 安装 https://github.com/zth464204365/minimax-h3-low-vram-video 中的 minimax-h3-low-vram-video skill。
安装后重新开启一个 Codex 任务,或刷新技能列表。技能应显示为:
$minimax-h3-low-vram-video
方法二:Windows PowerShell 手动安装
克隆仓库后执行:
git clone https://github.com/zth464204365/minimax-h3-low-vram-video.git
Copy-Item -Recurse -Force `
.\minimax-h3-low-vram-video `
"$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video"
验证核心文件:
Test-Path "$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video\SKILL.md"
返回 True 后,重启或刷新 Codex。
方法三:Claude Code / 通用 Agent Skills
将 minimax-h3-low-vram-video 目录复制到目标工具支持的 skills 目录。不同工具的目录和加载命令可能变化,请以对应产品当前文档为准。Skill 使用标准 SKILL.md frontmatter,核心指令不依赖 Codex 专有格式;agents/openai.yaml 仅用于 Codex 界面元数据。
更新
git pull
Copy-Item -Recurse -Force `
.\minimax-h3-low-vram-video `
"$env:USERPROFILE\.codex\skills\minimax-h3-low-vram-video"
更新前建议备份自己修改过的 references/ 或脚本参数。
卸载
关闭正在使用该 Skill 的任务后,删除:
%USERPROFILE%\.codex\skills\minimax-h3-low-vram-video
卸载 Skill 不会删除 ComfyUI、模型、分页文件或生成的视频。
快速开始
让 Agent 分析并部署
使用 $minimax-h3-low-vram-video 检查我的电脑,并把 MiniMax H3 部署到 E 盘。先做只读硬件检查,再给出模型版本、磁盘需求和风险;确认可行后完成部署并验证 API。
生成人物面部清晰的视频
使用 $minimax-h3-low-vram-video 生成一个 5 秒环保主题视频。主体为两个人的中近景,优先保证眼睛、五官、发丝和手部稳定;使用 H3 原生最高可行分辨率,保留原生音频,并制作单独的 1080p 发布副本。
诊断内存问题
使用 $minimax-h3-low-vram-video 诊断为什么我的 H3 在模型加载或第一步卡住。不要直接重装,先检查进程、日志、分页文件、空闲虚拟内存、显存和队列。
模型组合与目录
本 Skill 推荐使用官方量化组合:
ComfyUI/
└─ models/
├─ diffusion_models/
│ ├─ minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ └─ minimax_h3_ref2va_pruned_int8_convrot.safetensors
├─ text_encoders/
│ └─ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
├─ vae/
│ ├─ minimax_h3_video_vae_fp16.safetensors
│ └─ minimax_h3_audio_vae_fp32.safetensors
└─ upscale_models/
└─ RealESRGAN_x4plus.pth
FL2VA:文本、图像、首尾帧条件的视频生成;REF2VA:参考图像/视频条件生成;- 视频与音频 VAE:联合输出画面和同步声音;
- Real‑ESRGAN:只用于发布副本,不替代 H3 原生细节。
始终从官方发布页或可核验的一对一镜像下载。大型模型下载完成后检查文件大小和 SHA‑256。不要加载部分下载、HTML 错误页或同名未知权重。
分辨率策略
| H3 原生画布 | 用途 | 8GB/16GB 实测耗时(5.17 秒、20 步) |
|---|---|---|
| 608×352 | 端到端部署验证 | 约 6.5 分钟 |
| 864×480 | 提示词与构图草稿 | 约 11.8 分钟 |
| 1152×640 | 高质量折中档 | 未在本次基准单独计时 |
| 1344×768 | 官方原生画布上限、最终短片 | 约 36.7 分钟 |
耗时仅代表一台 RTX 5050 Laptop 8GB + 16GB RAM 机器,不是性能承诺。
推荐流程:
608×352 验证 → 864×480 调构图 → 1152×640 或 1344×768 最终生成
↓
保留 H3 原生母版
↓
轻度增强为 1920×1080 发布副本
人脸清晰度:最重要的经验
输出文件写着“1080p”,不代表人物脸部具有 1080p 级别的信息。决定人脸质量的第一因素,是脸在 H3 原生画面中实际占用多少像素。
按下面顺序优化:
- 将主要人物限制为一至两名;
- 使用中近景或近景,确保脸部无遮挡;
- 将次要人物放到远处并虚化;
- 使用稳定的慢推镜头,避免快速切换身份和角度;
- 在提示词中描述眼睛、自然皮肤、眉毛、发丝和手部一致性;
- 再提高 H3 原生画布;
- 最后才制作 1080p 发布副本。
AI 超分可以增强边缘、纹理和平台压缩耐受度,但无法可靠修复错误的眼睛、畸形手指、身份漂移或原始远景中不存在的脸部信息。
Windows 低内存设置
建议的 ComfyUI 启动参数:
--windows-standalone-build
--enable-dynamic-vram
--fast-disk
--cache-none
--reserve-vram 1.0
--disable-pinned-memory
关键说明:
- 8GB 显存运行 20GB 级量化扩散权重依赖动态显存卸载;
- 16GB RAM 机器必须依赖分页文件承接模型暂存;
- 分页文件配置后通常需要重启,必须确认它已经激活;
- 生成时不要运行游戏、3D 渲染器或其他 CUDA 工作负载;
- “0% 很久”不一定卡死,满分辨率首次初始化可能超过 100 秒;
- 检查进程、队列、日志和资源变化后再判断是否停止任务。
低内存 Real‑ESRGAN 超分
技能自带逐帧脚本:
python .\minimax-h3-low-vram-video\scripts\upscale_video_realesrgan.py `
--input "H3-native.mp4" `
--output "H3-publish-1080p.mp4" `
--model "RealESRGAN_x4plus.pth" `
--width 1920 `
--height 1080 `
--crf 16
它会:
- 一次只读取一帧;
- 通过重叠分块减少显存峰值与拼接缝;
- 将增强结果精确缩放到目标尺寸;
- 先正常关闭临时视频容器;
- 再无损复用原始 AAC 音频包;
- 删除临时无声视频。
依赖:Python、PyTorch、PyAV、Pillow、NumPy、Spandrel,以及支持的 H.264 编码器。ComfyUI Portable 的内嵌 Python通常已包含大部分依赖,但不同版本必须实际检查。
交付验证
不要只看文件是否存在。最终视频至少验证:
- 输出绝对路径;
- 是否为 H3 原生母版或后处理副本;
- 分辨率、帧率、时长和总帧数;
- H.264/H.265 等视频编码;
- 平均码率;
- AAC 等音频编码、采样率和声道数;
- 完整解码全部视频帧;
- 完整解码音频流;
- 抽取代表帧检查脸部、手部、身份和构图。
故障排查
| 现象 | 常见原因 | 优先动作 |
|---|---|---|
| 有 200GB 空间仍提示内存不足 | 分页文件未配置或未激活 | 检查 Windows PageFileUsage 和空闲虚拟内存 |
| 启动后接口无法访问且日志为空 | 启动命令本身未执行 | 使用绝对 Python 路径和明确工作目录 |
| 长时间停在 0% | 权重暂存、卸载或首步初始化 | 检查进程、GPU、队列和日志是否仍变化 |
| 生成中 OOM | 分辨率过高、其他程序占显存 | 关闭 GPU 程序,降低画布或加大保留显存 |
| 1080p 仍然脸糊 | 原生画面中脸太小 | 重新生成中近景,不要继续放大旧视频 |
| 超分时 RAM 爆满 | 一次性处理全部帧 | 使用逐帧分块脚本 |
| 最终 MP4 损坏 | 容器未关闭或音轨添加顺序错误 | 先关闭临时视频,再声明并复用音视频流 |
| 权重加载报错 | 文件下载不完整或型号不兼容 | 比对大小、SHA‑256、目录和节点型号 |
安全与注意事项
- 阅读脚本后再运行来自第三方仓库的 Skill;
- 不在仓库、日志或截图中提交令牌、Cookie、私有模型地址和用户名路径;
- 不上传模型权重、生成的视频或用户参考图,除非版权与隐私允许;
- 修改分页文件属于系统级变更,记录原值并确保目标磁盘有足够空间;
- 长时间生成前接通电源并关闭睡眠;
- 笔记本持续满载时注意温度和散热;
- 不保证 MiniMax、ComfyUI 或第三方模型的许可覆盖你的商业用途,请分别阅读其当前许可证和服务条款;
- 本仓库与 MiniMax、ComfyUI、Real‑ESRGAN 及其作者没有隶属关系。
仓库结构
.
├─ README.md
├─ LICENSE
├─ .gitignore
└─ minimax-h3-low-vram-video/
├─ SKILL.md
├─ agents/
│ └─ openai.yaml
├─ references/
│ ├─ decision-guide.md
│ ├─ installation.md
│ ├─ prompt-guide.md
│ └─ troubleshooting.md
└─ scripts/
└─ upscale_video_realesrgan.py
设计参考
仓库结构和说明方式参考了成熟的 Agent Skills 项目:
- OpenAI Skills:Codex Skills 目录、渐进式资源组织;
- Anthropic Skills:标准
SKILL.md、自包含目录与示例; - Superpowers:清晰的安装入口、工作流边界和跨 Agent 使用说明。
这里的 H3 参数、耗时和故障经验来自实际本地部署与完整视频生成,并非复制上述项目的具体实现。
许可证
本仓库的原创说明和脚本使用 MIT License。MiniMax H3、ComfyUI、Real‑ESRGAN、PyTorch 和其他依赖仍使用各自许可证;MIT 许可证不重新授权第三方模型或软件。
No comments yet
Be the first to share your take.