
En resumen
- El FastH3 abierto funciona en local desde el 2 de septiembre de 2026. El equipo FastVideo de Hao AI Lab publicó una ruta para la vista previa de FastH3 en 4 pasos sobre una o dos NVIDIA DGX Spark y sobre Apple Silicon mediante MLX, con un mínimo de 36 GB de memoria unificada en Mac (blog de Hao; @haoailab).
- La cifra de velocidad no es un único número. El título del blog dice 7x; su resumen dice hasta 8x; el hilo dice 8x. Las tablas del cuerpo, comparadas con una receta pública de MiniMax H3 en vLLM-Omni sobre Spark, marcan unas 7× a 1024×576, 8,4× a 832×480 y 7,9× a 1344×768 (blog de Hao; hilo 1/7).
- Esos segundos son de la receta local de Hao, no de este sitio. Hilo: 134 s para un clip de 5 s a 480p en una Spark y 454 s en un M4 Max con 36 GB. Blog: el mismo par 134 s / 119 s corresponde a la ruta TAEH3 a 480p; con el VAE completo tarda más. No interpretes ninguno de esos tiempos como espera en la cola de este sitio.
- Regla para decidir: si tienes una DGX Spark o un Mac con 36 GB o más, aceptas cargar el modelo por fases y quieres los pesos abiertos de FastH3 en tu máquina → el Cookbook de Hao. Si quieres un clip de 5 a 15 segundos y no quieres ese hardware, ni CUDA 13, ni un modelo que no cabe entero en memoria → genera Fast H3 en este sitio.
- Este sitio no es el checkpoint abierto. El generador de la página de inicio es Fast H3: prompt o fotograma inicial, fotograma final opcional, 480P / 768P y sonido nativo. No son los pesos de 4 pasos de FastVideo ejecutándose en tu navegador.
Puntos clave
- FastH3 en local se publicó el 2 de septiembre de 2026 para NVIDIA DGX Spark (un equipo o un par conectado por QSFP) y para Apple Silicon mediante MLX. Ese mismo día FastVideo abrió también un Cookbook (blog de Hao; README en GitHub).
- El hardware es el requisito real, no un eslogan. Las cifras oficiales en Mac salen de un M4 Max con 36 GB de memoria unificada. Spark es el equipo de escritorio Blackwell de NVIDIA: chip GB10 y 128 GB de memoria unificada (blog de Hao; DGX Spark). Ninguna de las dos máquinas mantiene todo el sistema cargado a la vez; ambas trabajan por fases.
- A la mayoría le conviene saltarse la instalación. Si lo que necesitas es una toma de 5 a 15 segundos con sonido, el generador de la página de inicio es el camino corto. No tendrás que compilar CUDA 13 ni convertir un DiT.
- Los segundos del hilo y los del blog no siempre se refieren al mismo decodificador. El par de 134 s / 119 s a 480p del hilo coincide con la columna de extremo a extremo con TAEH3 del blog. Con el VAE completo, en la misma receta de 832×480, 124 fotogramas y cuatro pasos, los tiempos son 451 s (M4 Max), 243 s (una Spark) y 209 s (dos Spark) (blog de Hao; hilo 2/7).
- El FastH3 abierto es MiniMax H3 destilado, no el producto alojado de MiniMax en 2K. MiniMax abrió H3 el 31 de julio / 3 de agosto de 2026: hasta 15 segundos, ruta de regeneración en 2K, 24 FPS, estéreo a 32 kHz y licencia Community License (MiniMax H3; nota de código abierto). FastH3 es el modelo «alumno» de 4 pasos que FastVideo destiló a partir de esa base (HF Preview v0.2).
- El clip de 13 s / 14× en Blackwell de la semana pasada es otra receta. El hilo de FastH3 v1 del 28 de agosto afirmaba 15 s a 768p en 13 s y hasta 14× en NVIDIA Blackwell. No es una cifra de Spark ni de Mac, y tampoco es lo que promete este sitio (hilo v1).
Qué se publicó de verdad
El 2 de septiembre de 2026 Hao AI Lab anunció que FastH3 «pasa a local». Esa misma semana, el README de FastVideo fechó el trabajo con Spark y MLX el 1 de septiembre de 2026 (blog de Hao; README).
NVIDIA DGX Spark. La ruta CUDA de la versión Preview ahora funciona en una Spark o en un par. Un par reparte una misma generación a través de QSFP (paralelismo de secuencia). El modelo no se carga de la forma habitual: el codificador, el transformer y los decodificadores juntos superan los ~121 GB que una carga de trabajo recibe realmente en una Spark. Por eso la canalización codifica el texto, descarga el codificador de texto, carga el transformer, ejecuta la eliminación de ruido, lo descarga y, por último, carga el VAE. La carga del DiT directamente en la GPU redujo el tiempo de carga del transformer de 445 s a 39 s en un GB10 (blog de Hao; hilo 2/7).
Apple Silicon / MLX. Mínimo oficial: 36 GB de memoria unificada o más. Se usa la misma carga por fases. Un prompt sin caché pasaba unos 80 s en el codificador de texto; una lectura acotada lo bajó a unos 17 s, y un prompt en caché se salta la codificación. TAEH3 reduce la decodificación de 102 s a 1 s en Mac (blog de Hao; hilo 3/7). En Hugging Face hay DiT de MLX listos para usar en INT8 / INT6 / INT4; INT6 es el formato por defecto que cronometraron (MLX INT6; modelos de FastVideo).
En un M4 Max, con el mismo prompt y la misma semilla:
| Formato | Tiempo total | Memoria máxima |
|---|---|---|
| INT8 | 481 s | 24,2 GiB |
| INT6 | 456 s | 19,5 GiB |
| INT4 | 467 s | 14,8 GiB |
Fuente: blog de Hao, 2 de septiembre de 2026. Los 454 s del hilo corresponden a la misma clase de máquina, no a un cuarto formato.
Cookbook. Las recetas de MiniMax H3 ya cubren CUDA, MLX nativo, una receta para un par de Spark y un servidor local compatible con OpenAI. En MLX, la única ruta mantenida es texto a video con audio (T2VA): el primer/último fotograma y la referencia omni no están conectados en ese entorno de ejecución (Cookbook; guía de Apple Silicon).
Lo que no se publicó. Hao no ha publicado tiempos de FastH3 en M6, M5 Ultra, M5 Max ni M5 Pro. Las RTX 5090 / 4090 aparecen como el siguiente objetivo de CUDA, no como tarjetas locales medidas en este artículo (blog de Hao).

FastH3 en local es una cuestión de hardware · portada editorial · generada para el blog de Fast H3
FastH3 en local frente a Fast H3 en este sitio
Esta tabla se lee en 30 segundos. Las celdas recogen datos públicos, no una prueba A/B de laboratorio que hayamos hecho nosotros. Los segundos de la ejecución local remiten siempre a las URL de Hao.
| Tu objetivo | FastH3 abierto (FastVideo / Hao) | Fast H3 en este sitio |
|---|---|---|
| Qué es | MiniMax H3 destilado en 4 pasos que descargas y ejecutas tú (HF Preview) | Generador en el navegador para clips de 5–15 s con sonido. No es el checkpoint abierto de FastH3 |
| Hardware que pones tú | DGX Spark (1 o 2) o un Mac con 36 GB o más (blog de Hao) | Un navegador. Sin Spark y sin mínimo de 36 GB |
| Quién lo mantiene | Tú: CUDA 13 / MLX, carga por fases, parámetros del Cookbook | Este sitio |
| Resolución / duración (datos públicos) | Las recetas cronometradas giran en torno a 832×480 y 124 fotogramas (~5 s); el par con VAE completo llega a 345 fotogramas (~14 s) (blog de Hao) | 480P / 768P, segundos enteros de 5 a 15, 5 por defecto. Aquí no hay opción 2K |
| Entradas en la ruta documentada | MLX: T2VA. El Cookbook de CUDA incluye otras recetas de H3; MLX no conecta FL2VA ni Ref2VA (Cookbook) | Texto, o un fotograma inicial con un fotograma final opcional |
| ¿Cargas tú los pesos? | Sí. Codificador, DiT y VAE no caben cargados a la vez | No |
| Duración pública de una toma | Hilo: 134 s (1 Spark, 5 s a 480p), 454 s (M4 Max con 36 GB). Blog TAEH3 a 480p: 134 s / 119 s. VAE completo a 832×480: 451 s / 243 s / 209 s (M4 / 1 Spark / 2 Spark) | Pruebas alojadas de agosto de 2026: un clip de 5 s a 768P en menos de 3 segundos de tiempo de modelo, más la cola. No es el reloj de Spark/Mac de Hao |
| Cómo probarlo | Cookbook + repositorio | El generador de la página de inicio de este sitio |
Cómo usar la tabla: si ya tienes el equipo y quieres los pesos abiertos, sigue a Hao. Si quieres un clip esta misma tarde, quédate en esta página.
Lo que sabemos y lo que no
| Lo que sabemos (con fuente) | Lo que no sabemos / no afirmamos |
|---|---|
| Artículo de FastH3 en local del 2026-09-02; línea de novedades del README del 2026-09-01 (blog; README) | Que 7x y 8x sean la misma medición. El título, el resumen, el hilo y las filas frente a vLLM-Omni no coinciden; mantenemos cada cifra con su URL |
| Mínimo en Mac de 36 GB o más; todas las cifras de Mac del artículo son de un M4 Max con 36 GB (blog) | La velocidad de FastH3 en M6, M5 Ultra, M5 Max, M5 Pro o en un Mac de 16 GB |
| Spark: GB10, 128 GB unificados; el par se conecta por QSFP (blog; NVIDIA) | Un tiempo en una RTX 5090 / 4090 de consumo. Se menciona como siguiente objetivo de CUDA, no se midió aquí |
| Hilo: 1 Spark, 224 s a 768p; blog con VAE completo: 374 s (luego 336 s tras la carga directa en GPU) a 768×1344 y 124 fotogramas | Qué receta a 768p usó el hilo para sus 224 s. No la igualamos con los 336/374 del blog |
| TAEH3 es el decodificador de vista previa; el VAE completo de H3 es la ruta de calidad (blog) | Que los 134 s con TAEH3 sean «la» velocidad de FastH3 en local |
| Los pesos abiertos de MiniMax H3 existen bajo una Community License (código abierto) | Que este sitio sirva esos pesos, INT4/INT6/INT8 o un programa de 4 pasos |
| Este generador: 5–15 s, 480P/768P, prompt o fotograma inicial, final opcional, audio nativo | Un SLA de tiempo de cola en este sitio. El «menos de 3 segundos» alojado es tiempo de modelo de agosto de 2026, no una promesa en horas punta |
| Hilo de FastH3 v1 del 2026-08-28: 13 s a 768p, 14× en Blackwell (hilo v1) | Que esos 13 s / 14× sean la velocidad de este sitio o la velocidad local en Spark/Mac |
Cómo probarlo en este sitio
Para los tres prompts siguientes no necesitas Spark, MLX ni un Mac con 36 GB.
- Abre el generador de la página de inicio (en la cabecera: Generar).
- Pega el Prompt A, B o C sin cambios (sustituye solo el nombre de un producto si de verdad lo necesitas).
- Empieza con 5 segundos / 480P. Deja 768P para la toma que vayas a publicar.
- Escucha con auriculares. Imagen y sonido salen en un mismo archivo.
- Los créditos se cobran por segundo generado. Revisa los precios antes de encadenar varias tomas definitivas de 15 segundos a 768P. Este artículo no compara la tarifa por segundo de nadie más.
Los prompts se dejan en inglés para que los pegues tal cual en el generador. Debajo de cada uno te explicamos qué pide.
Prompt A — travelling en un jardín
Horizontal 16:9, about 8 seconds, sunny garden.
A white kitten chases a yellow butterfly across low herbs. Camera tracks at cat height,
leaf-filtered daylight, shallow depth, no logos, no captions.
Soft garden ambience, wing flutter, no music bed, no watermark.
Un gatito blanco persigue una mariposa amarilla entre hierbas bajas; la cámara lo sigue a la altura del gato, con luz filtrada por las hojas, poca profundidad de campo, ambiente suave de jardín y aleteo, sin música, textos ni marcas de agua.
Prompt B — guion con tiempos marcados
Horizontal 16:9, about 10 seconds, cliffside monastery at dusk.
First four seconds: a warrior-monk in a weathered robe stands on a ruined terrace,
two small survey drones overhead, wind in prayer flags.
Then he walks the cracked stone toward camera, same robe, same drones.
Native wind and distant rotor hum, no music, no on-screen text, no watermark.
Un monasterio en un acantilado al atardecer: durante los cuatro primeros segundos, un monje guerrero espera en una terraza en ruinas bajo dos drones; después camina hacia la cámara sobre la piedra agrietada, con el mismo hábito y los mismos drones, viento y zumbido lejano de rotores.
Prompt C — una foto que dice la frase
Use a portrait as the start frame. About 6 seconds, medium close-up, indoor window light.
The person looks to camera and says, clearly, "This is the take we keep."
Natural room tone only, lips match the line, no music, no captions, no watermark.
Parte de un retrato como fotograma inicial: plano medio corto con luz de ventana; la persona mira a cámara y pronuncia la frase en inglés con los labios sincronizados, solo con el sonido ambiente de la habitación.
El Prompt C necesita un fotograma inicial. A y B funcionan solo con texto.
Regla para decidir (en una frase)
Elige el Cookbook de Hao si ya tienes una DGX Spark o un Mac con 36 GB o más, aceptas la carga por fases y quieres ejecutar FastH3 abierto por tu cuenta.
Elige Fast H3 en este sitio si lo que necesitas es un clip de 5 a 15 segundos y no quieres comprar ese hardware, compilar CUDA 13 ni vigilar un modelo que no cabe de una sola pieza. Las preguntas frecuentes de la página de inicio resumen qué hace y qué no hace este generador.
Preguntas frecuentes
¿Puedo ejecutar FastH3 en local?
Sí, con la ruta que Hao publicó el 2 de septiembre de 2026: NVIDIA DGX Spark (una o dos) o Apple Silicon con 36 GB o más de memoria unificada, mediante el Cookbook y el repositorio de FastVideo (blog; Cookbook; GitHub). No es una aplicación de un clic, sino una instalación local.
¿Este sitio es ese paquete de código abierto?
No. FastH3 (en una sola palabra) es la destilación abierta en 4 pasos que FastVideo hizo de MiniMax H3. Fast H3 en este sitio es el generador en el navegador: de 5 a 15 segundos, 480P o 768P, con prompt o fotograma inicial. No ejecutamos en tu pestaña el checkpoint de Hao, ni INT4, ni su programa de 4 pasos.
No tengo una Spark ni un Mac con 36 GB. ¿Y ahora qué?
Usa el generador de la página de inicio. El mínimo de Hao en Mac es 36 GB, y Spark es un equipo de escritorio Blackwell. Un portátil con 16 GB no aparece en su tabla de mediciones. Este sitio no exige ese hardware.
¿Por qué unas publicaciones dicen 7x y otras 8x?
Porque Hao no publicó una cifra única. El título del blog dice 7x; el resumen, hasta 8x; el hilo, 8x; y las filas de Spark frente a vLLM-Omni dan ~7× / 8,4× / 7,9× según la resolución (blog; hilo). Nosotros no elegimos una ganadora.
¿Cuánto tarda de verdad una toma en local?
Depende de la receta. Los 134 s del hilo (1 Spark, 5 s a 480p) cuadran con la ruta TAEH3 del blog. Con el VAE completo a 832×480 y 124 fotogramas: 451 s en Mac, 243 s con una Spark y 209 s con dos. Ninguna de esas cifras es la cola de este sitio (blog; hilo 2/7).
¿La ruta de Mac admite primer y último fotograma o referencias omni?
No en el entorno MLX que documenta Hao hoy. Según el Cookbook, FastH3 en MLX es T2VA; FL2VA y Ref2VA no están conectados (Cookbook). Este sitio sí acepta un fotograma inicial y un fotograma final opcional.
¿FastH3 es lo mismo que MiniMax H3?
No. MiniMax H3 es el modelo omnimodal abierto de MiniMax (hasta 15 segundos, regeneración en 2K, estéreo) (H3; código abierto). FastH3 es la destilación de pocos pasos que FastVideo hizo a partir de esa base (ficha en HF).
¿No habían mostrado ya 15 segundos en 13 segundos?
El 28 de agosto de 2026, el hilo de FastH3 v1 habló de 15 s a 768p en 13 s y de hasta 14× en Blackwell. Es la historia de centro de datos de la semana pasada, no la tabla local de Spark/Mac, y tampoco un SLA de este sitio (hilo v1).
¿Cuánto cuesta un clip en este sitio?
Pagas por segundos terminados: 10 créditos/s a 480P y 20 a 768P. Una toma de 5 segundos a 480P cuesta 50 créditos. Los planes están en la página de precios. Aquí no comparamos la tarifa en dólares por segundo de otros servicios.
¿Puedo vender lo que genere aquí?
Con un plan de pago, los resultados son tuyos para uso comercial lícito. Las marcas, la imagen de personas y el material con derechos de autor que incluyas siguen siendo responsabilidad tuya. Los pesos abiertos de FastH3 están bajo la Community License de MiniMax; eso corresponde a la descarga de Hao, no a este generador (código abierto).
Sobre Priya Nand
Priya Nand es analista de lanzamientos de Fast Video. Sigue los lanzamientos de FastVideo y MiniMax H3, tanto en local como alojados, y convierte los datos públicos de hardware en rutas claras para probar Fast H3.
