MiniMax H3 no es “otro Hailuo en la nube”. En local es un sistema de vídeo+audio nativo: un solo paso genera imagen, voz, FX y música en estéreo. Lo que importa no es descargar “el modelo”, sino elegir bien familia (FL2VA o Ref2VA), cuantización, LoRA de velocidad y tipo de atención. Equivocarte en cualquiera de las cuatro te deja o sin VRAM o con un clip que parece turbo barato.
Esta guía resume el montaje que tiene sentido en 2026 con ComfyUI 0.30 o posterior, el pack Comfy-Org/MiniMax-H3 y las LoRAs LightX2V. No sustituye la documentación oficial de Comfy ni la ficha de MiniMax: es el mapa que echas en falta cuando ya tienes GPU y no quieres perder una tarde mezclando checkpoints.
Qué es H3 en local (y qué no)
El sistema completo de MiniMax tiene tres piezas. Solo una está abierta de verdad:
- H3-Base (abierto): genera vídeo+audio a ~768 px de lado corto, 24 fps, 4–15 s. Esto es lo que corres en ComfyUI, SGLang, vLLM o diffusers.
- H3-Context-IR (cerrado): reescribe el prompt multimodal a una representación interna. En local lo sustituyes tú con un prompt bien estructurado (o con la skill oficial de prompting).
- H3-Regenerate-2K (cerrado): no es un upscaler clásico; regenera el 768 p a 2K con el contexto original. En local no lo tienes. Si quieres 2K “oficial”, pasas el 768 p a la API de MiniMax.
H3-Base es un transformer denso de ~33B (unos 13B son ramas AdaLN que en inferencia se pueden cachear). El encoder de texto es Qwen3-VL-32B. Por eso el cuello de botella no es “un safetensors”, sino DiT + encoder + dos VAE (vídeo y audio).
FL2VA o Ref2VA: no mezcles las familias
Hay dos checkpoints distintos. No son el mismo modelo con otro nodo:
| Familia | Para qué | Entradas | Nodo Comfy |
|---|---|---|---|
| FL2VA | Texto a vídeo, primer fotograma, último fotograma, o ambos | Texto; 0, 1 o 2 imágenes | MiniMaxH3ImageToVideo (plantillas T2V / I2V) |
| Ref2VA | Referencias: identidad, estilo, motion, cámara, voz | Hasta 9 imágenes, 3 vídeos, 3 audios (máx. 12 archivos) | MiniMaxH3ReferenceToVideo (plantilla R2V) |
La LoRA turbo de FL2VA no va en un grafo Ref2VA, y al revés. Si el clip “no pilla la cara” o se te va el audio, lo primero que miras es si cargaste la familia correcta.
Archivos que sí merecen disco
Usa el repo empaquetado para Comfy, no el checkpoint original en formato Diffusers, salvo que sirvas con SGLang/vLLM.
Rutas:
ComfyUI/models/ diffusion_models/ <-- DiT text_encoders/ <-- Qwen3-VL-32B vae/ <-- vídeo FP16 + audio FP32 (los dos) loras/ <-- turbo / Acc embeddings/ <-- opcional, estilo
DiT (el “modelo”)
| Fichero (Comfy-Org) | Cuándo |
|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | Arranque por defecto en 16–24 GB. Es el que piden las plantillas oficiales. |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | Igual, pero para R2V. |
*_int8_convrot.safetensors (sin pruned) | Más calidad de movimiento; pide más VRAM/RAM. Priorízalo si tienes 24 GB+ holgados o 48 GB. |
*_bf16.safetensors | Tope de calidad. En consumo no compensa salvo que midas A/B. |
*_pruned_fp8_scaled.safetensors | Solo si no puedes usar int8_convrot (PyTorch/CUDA viejo). Comfy lo dice claro: int8 primero. |
int8_convrot rinde de verdad con PyTorch compilado para CUDA 13 (cu130). En CUDA 12.x la misma cuantización puede ir a mitad de velocidad. Si H3 te parece “imposible de lento”, actualiza la pila CUDA antes de cambiar de modelo.
Encoder de texto
| Fichero | Cuándo |
|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | El de las plantillas. El NVFP4 de este pack no exige GPU Blackwell. |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | Si el NVFP4 te da problemas de calidad de prompt o de driver. |
qwen3vl_32b_minimax_h3_bf16.safetensors | Solo con mucha VRAM. El encoder entero en BF16 se come la tarjeta. |
No sustituyas el encoder de 32B por un Qwen “pequeño” genérico y esperes el mismo seguimiento de instrucciones. Hay proyectores comunitarios (ClipProj) para 16 GB extremos; son un apaño, no el H3 de catálogo.
VAE
Siempre los dos: minimax_h3_video_vae_fp16 y minimax_h3_audio_vae_fp32. Sin el de audio no hay estéreo nativo. El OOM en el decode suele ser el VAE de vídeo en clips largos, no el DiT: limpia VRAM antes del decode o acorta duración.
Stack recomendado por VRAM
Cifras de comunidad, no de ficha oficial. Disco del pack mínimo (pruned INT8 + NVFP4 + VAE) ~40–43 GB.
| GPU | Combinación que aguanta | Notas |
|---|---|---|
| 24 GB (4090 / 3090 / 5090) | pruned INT8 + NVFP4, 20 pasos; o turbo 8 pasos | El “bueno de verdad” en casa. Lienzo nativo 1344×768. |
| 16 GB (4080 / 5080 / 4060 Ti 16) | pruned INT8 + NVFP4 + turbo 8 pasos + Sage | Cabe. Lento si te vas a 10–15 s a resolución nativa. CUDA 13 cambia el partido. |
| 12 GB | pruned INT8 + NVFP4 + offload + turbo; mucha RAM (64 GB) y disco rápido | Posible según Comfy; no es un flujo cómodo. |
| 48 GB+ | INT8 sin pruned o BF16 | Deja de pelearte con offload. |
RAM de sistema: 32 GB es el suelo; 64 GB evita el swap cuando el encoder y el DiT no caben a la vez. Arranca Comfy con offload a disco rápido (--fast-disk en builds recientes) si estás en 16 GB.
Atención: de qué palanca hablamos
H3 nació con sparse attention en el entrenamiento. El peso abierto inicial infiere en atención densa; el sparse “oficial de MiniMax” iba a salir después. En Comfy, hoy, las palancas reales son estas:
- PyTorch / Flash (por defecto). Correcto, lento. Las plantillas salen así.
- Sage Attention. El atajo más limpio. Instala la rueda de SageAttention que coincida con tu PyTorch/CUDA, añade KJNodes y el nodo
Patch Sage Attention KJentre el UNET y el guider, modoauto. O lanza Comfy con--use-sage-attention. En capas que no son fp16/bf16 verás avisos y hace fallback: es normal. En la práctica, ~1,5–2× más rápido con pérdida mínima. - Comfy Kitchen / ck-attn. En alguna 40/50 series la comunidad lo pone por encima de Sage. Pruébalo si Sage no escala.
- Sparse comunitario (SLA / PlagueKind / H3-Optimizations). Tira el 85–95 % de la matriz de atención. Densidad 0,85 ≈ indistinguible; 0,90 casi gratis; 0,95 solo para planos largos a más resolución. No es el sparse de MiniMax: es un parche. Úsalo cuando Sage ya no basta.
- Parche de memoria Sage (KJNodes, experimental). Cuantiza Q/K a int8. Es el que sacas cuando el OOM es la atención, no el peso.
Orden sano: plantilla oficial → Sage → turbo LoRA → sparse. No actives turbo + sparse + TE-speed a la vez el primer día: el texto en pantalla es lo primero que se rompe.
LoRAs de velocidad (y cuáles no tocar)
H3 va ~20 pasos de serie. Las LoRAs turbo recortan a 4 u 8. Siempre de la misma familia que el DiT.
| LoRA | Pasos | Familia | Uso |
|---|---|---|---|
LightX2V minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 | 8 | FL2VA | La de las plantillas T2V/I2V. Mejor equilibrio calidad/tiempo. |
LightX2V minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16 | 4 | FL2VA | Iterar prompts. Audio y motion peores. |
LightX2V minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16 | 4 | Ref2VA | La de la plantilla R2V. |
| Alibaba PAI Acc-8Step (FL2VA / Ref2VA) | 8 | la que toque | Distilación PDD; más “oficial de laboratorio”, menos integrada en el template de Comfy. |
En el nodo H3: turbo_mode (o checkbox Lightning) + strength 1.0 de entrada. Si el movimiento se rompe, baja a 0,7–0,85 o vuelve a 8 pasos. No mezcles Acc-8Step con LightX2V 4-step en el mismo grafo.
Hay LoRAs de control (ControlNet Union de Alibaba PAI) y de estilo. Eso ya no es velocidad: es control. Cárgalas aparte, no en el slot turbo.
Resolución, duración y el truco del 0,98 MP
- Lienzo nativo: lado corto 768 px. En 16:9 es 1344×768, múltiplo de 32.
- El selector de las plantillas a 1,0 MP te saca 1376×768 y te pasas del tope. Pon 0,98 MP o escribe 1344×768 a mano.
- Duración a 24 fps en bloques de 17 fotogramas (17k+5). No pidas “12,3 s”: el nodo redondea.
- Itera en 0,4–0,7 MP o 5 s. El plano final, a nativo. Un 10 s a 1344×768 en 16 GB con 20 pasos se va a decenas de minutos; con turbo 8 pasos entra en terreno usable.
Prompts que H3 entiende de verdad
Sin Context-IR, el modelo come un bloque único. Estructura:
- Escena global (dónde, quién, qué pasa).
- Planos con tiempo (
[Shot 1], corte a los 4 s, etc.). - Cámara (push-in, estático, shake).
- Audio en el mismo bloque: diálogo, FX, música. H3 no “pone música después”: la modela con el vídeo.
En R2V etiqueta referencias en el mismo orden que los pines: <Picture 1>, <Video 1>, <Audio 1>, y di qué hace cada una (identidad, estilo, motion, voz). ref_image_size=match va más rápido; max conserva más cara (hasta ~2048 px de lado corto) y cuesta VRAM.
Guías oficiales: base (T2V/I2V) y referencia (R2V). MiniMax publica skills de prompting en GitHub si las quieres en un agente.
Embeddings de estilo en models/embeddings/: embedding:minimaxh3_bullet_time, etc. Son comunitarios (silveroxides), no de MiniMax. Útiles para fx; no los uses como muleta de un prompt vacío.
Nodos extra que sí valen la pena
- MiniMaxH3AddGuide: ancla imagen o audio en cualquier fotograma, no solo primero/último. Sirve para continuar un clip (22 frames + audio en frame 0) o forzar un still a mitad.
- Máscara de ruido (denoise_mask): inpaint / extender sin regenerar todo. 0 conserva, 1 regenera. El vídeo alinea a parches 2×2; el audio, a frames latentes.
ComfyUI ≥ la versión que traiga esos PRs. Si el nodo no aparece, actualiza; no instales forks viejos “H3 lowvram” a ciegas encima de las plantillas nativas.
Flujo de trabajo que no te hace perder la tarde
- ComfyUI 0.30+.
- Plantilla Video → MiniMax H3 T2V o I2V.
- DiT pruned INT8 FL2VA + encoder NVFP4 + ambos VAE + LoRA turbo 8-step.
- Sage Attention.
- 0,98 MP, 5 s, 8 pasos turbo. Ajusta el prompt.
- Cuando el plano funciona: 20 pasos sin turbo, o 8 pasos a 1344×768.
- ¿Identidad de personaje? Cambia a Ref2VA y su LoRA. No recicles el DiT FL2VA.
Errores típicos
- Cargar FL2VA en un grafo R2V (o al revés).
- Olvidar el VAE de audio y preguntarte por qué el mp4 va mudo o desafinado.
- 1,0 MP en el selector.
- Turbo 4-step + sparse 0,95 + recorte agresivo del encoder: el texto de marca sale mal.
- Esperar 2K nativo local. No está en los pesos. Haz 768 p bien y, si hace falta, API de regenerate.
- Ignorar la MiniMax H3 Community License: no es MIT; mira territorio y uso comercial antes de publicar o vender.
Dónde encaja con el resto del sitio
Si todavía no tienes claro el flujo creativo (guion, planos, publicación), empieza por crear vídeos con IA desde texto y por el hub de IA para vídeo. H3 es la herramienta local cuando ya sabes qué plano quieres. Para modelos en general, modelos de IA; para el resto de recetas, guías.
