
Resumo rápido
- O FastH3 aberto roda localmente desde 2 de setembro de 2026. A equipe FastVideo do Hao AI Lab publicou um caminho para a prévia de 4 passos do FastH3 em um ou dois NVIDIA DGX Spark e em Apple Silicon via MLX, com um piso de 36 GB de memória unificada no Mac (blog do Hao; @haoailab).
- O ganho de velocidade não tem um número só. O título do blog fala em 7x; o resumo (TLDR) do próprio blog diz até 8x; a thread diz 8x. Nas tabelas do texto, comparando com uma receita pública do MiniMax H3 no vLLM-Omni rodando no Spark, os valores ficam em cerca de 7× a 1024×576, 8,4× a 832×480 e 7,9× a 1344×768 (blog do Hao; thread 1/7).
- Esses segundos são da receita local do Hao, não deste site. Thread: 134s para um vídeo de 5s em 480p em um Spark, 454s em um M4 Max com 36 GB. No blog, o mesmo par 134s / 119s corresponde ao caminho TAEH3 em 480p; com o VAE completo fica mais lento. Nenhum desses números é tempo de fila aqui.
- Regra de decisão: você tem um DGX Spark ou um Mac com 36 GB ou mais, aceita carregar o modelo em etapas e quer rodar os pesos abertos do FastH3 por conta própria → Cookbook do Hao. Você quer um vídeo de 5 a 15 segundos e não quer esse hardware, nem CUDA 13, nem um modelo que não cabe inteiro na memória → gere com o Fast H3 neste site.
- Este site não é o checkpoint aberto. O gerador da página inicial é o Fast H3: prompt ou quadro inicial, quadro final opcional, 480P / 768P e som nativo. Não são os pesos de 4 passos do FastVideo rodando na sua aba do navegador.
Pontos principais
- O FastH3 local foi lançado em 2 de setembro de 2026 para NVIDIA DGX Spark (uma máquina ou um par ligado por QSFP) e para Apple Silicon via MLX. No mesmo dia o FastVideo abriu um Cookbook (blog do Hao; README no GitHub).
- O hardware é a barreira de verdade, não um detalhe de marketing. Os números oficiais de Mac vêm de um M4 Max com 36 GB de memória unificada. O Spark é o computador de mesa Blackwell da NVIDIA: GB10, 128 GB de memória unificada (blog do Hao; DGX Spark). Nenhuma das duas máquinas mantém o pipeline inteiro carregado ao mesmo tempo; as duas trabalham em etapas.
- A maioria das pessoas pode pular a instalação. Se o trabalho é uma tomada de 5 a 15 segundos com som, o gerador da página inicial é o caminho mais curto. Você não precisa compilar CUDA 13 nem converter um DiT.
- Os segundos da thread e os do blog nem sempre se referem à mesma decodificação. O par 134s / 119s em 480p da thread bate com a coluna de ponta a ponta TAEH3 do blog. Com o VAE completo, na mesma receita de 832×480, 124 quadros e quatro passos, os tempos são 451s (M4 Max), 243s (um Spark) e 209s (dois Spark) (blog do Hao; thread 2/7).
- O FastH3 aberto é o MiniMax H3 destilado, não o produto hospedado em 2K da MiniMax. A MiniMax abriu o H3 em 31 de julho / 3 de agosto de 2026: até 15 segundos, caminho de regeneração em 2K, 24 FPS, áudio estéreo a 32 kHz e Community License (MiniMax H3; nota sobre o código aberto). O FastH3 é o modelo "aluno" de 4 passos que o FastVideo destilou a partir dessa base (HF Preview v0.2).
- O vídeo de 13s / 14× em Blackwell da semana anterior é outra receita. A thread do FastH3 v1, de 28 de agosto, afirmava 15s em 768p gerados em 13s e até 14× em NVIDIA Blackwell. Esse não é um número de Spark/Mac e também não é uma promessa deste site (thread do v1).
O que de fato foi lançado
Em 2 de setembro de 2026, o Hao AI Lab anunciou que o FastH3 "goes local", ou seja, passou a rodar localmente. Na mesma semana, o README do FastVideo registrou o trabalho com Spark + MLX com a data de 1º de setembro de 2026 (blog do Hao; README).
NVIDIA DGX Spark. O caminho CUDA da versão Preview agora roda em um Spark ou em um par. Um par divide uma mesma geração pela conexão QSFP (paralelismo de sequência). O modelo não é carregado do jeito habitual: codificador, transformer e decodificadores juntos passam dos ~121 GB que uma carga de trabalho realmente recebe no Spark. Por isso o pipeline codifica o texto, descarta o codificador de texto, carrega o transformer, faz o denoising, descarta o transformer e só então carrega o VAE. O carregamento do DiT direto na GPU reduziu o tempo de carga do transformer de 445 s para 39 s em um GB10 (blog do Hao; thread 2/7).
Apple Silicon / MLX. O piso oficial é de 36 GB de memória unificada ou mais. O carregamento também é feito em etapas. Um prompt sem cache passava cerca de 80 s no codificador de texto; uma leitura limitada baixou isso para cerca de 17 s, e um prompt em cache pula a codificação. O TAEH3 reduz a decodificação de 102 s para 1 s no Mac (blog do Hao; thread 3/7). Há DiTs MLX prontos para uso em INT8 / INT6 / INT4 no Hugging Face; o INT6 é o padrão que eles cronometraram (MLX INT6; modelos do FastVideo).
Em um M4 Max, com o mesmo prompt e a mesma seed:
| Formato | Tempo total | Pico de memória |
|---|---|---|
| INT8 | 481 s | 24,2 GiB |
| INT6 | 456 s | 19,5 GiB |
| INT4 | 467 s | 14,8 GiB |
Fonte: blog do Hao, 2 de setembro de 2026. Os 454 s da thread são da mesma classe de máquina, não um quarto formato.
Cookbook. As receitas do MiniMax H3 agora cobrem CUDA, MLX nativo, uma receita para par de Spark e um servidor local compatível com a API da OpenAI. No MLX, o caminho mantido é apenas texto para vídeo com áudio (T2VA): primeiro/último quadro e omni-reference não estão ligados nesse runtime (Cookbook; guia de Apple Silicon).
O que não foi lançado. O Hao não publicou tempos do FastH3 em M6, M5 Ultra, M5 Max ou M5 Pro. As RTX 5090 / 4090 aparecem como o próximo foco em CUDA, não como placas locais medidas neste post (blog do Hao).

FastH3 local é uma questão de hardware · capa editorial · gerada para o blog do Fast H3
FastH3 local vs Fast H3 neste site
Esta tabela se lê em 30 segundos. As células trazem fatos públicos, não um teste A/B de laboratório feito por nós. Os segundos de execução local ficam nos links do Hao.
| O que você precisa | FastH3 aberto (FastVideo / Hao) | Fast H3 neste site |
|---|---|---|
| O que é | MiniMax H3 destilado em 4 passos, que você baixa e roda (HF Preview) | Gerador no navegador para vídeos de 5–15s com som. Não é o checkpoint aberto do FastH3 |
| Hardware que você precisa ter | DGX Spark (1 ou 2) ou um Mac com 36 GB ou mais (blog do Hao) | Um navegador. Sem Spark, sem piso de 36 GB |
| Quem faz a manutenção | Você: CUDA 13 / MLX, carregamento em etapas, flags do Cookbook | Este site |
| Resolução / duração (dados públicos) | As receitas cronometradas giram em torno de 832×480, 124 quadros (~5s); no par com VAE completo, 345 quadros (~14s) (blog do Hao) | 480P / 768P, segundos inteiros de 5 a 15, padrão de 5. Não há opção 2K aqui |
| Entradas no caminho documentado | MLX: T2VA. O Cookbook de CUDA também lista outras receitas do H3; o MLX não liga FL2VA / Ref2VA (Cookbook) | Texto, ou um quadro inicial com quadro final opcional |
| Você mesmo carrega os pesos? | Sim. Codificador / DiT / VAE não ficam carregados juntos | Não |
| Duração pública de uma tomada | Thread: 134s (1 Spark, 5s em 480p), 454s (M4 Max 36 GB). Blog TAEH3 480p: 134s / 119s. VAE completo 832×480: 451s / 243s / 209s (M4 / 1 Spark / 2 Spark) | Benchmarks hospedados de agosto de 2026: um vídeo de 5s em 768P em menos de 3 segundos de tempo de modelo, mais a fila. Não é o relógio do Spark/Mac do Hao |
| Como testar | Cookbook + repositório | Gerador na página inicial deste site |
Como usar a tabela: se você já tem a máquina e quer os pesos abertos, siga o Hao. Se quer um vídeo ainda hoje à tarde, fique nesta página.
O que sabemos vs. o que não sabemos
| Sabemos (com fonte) | Não sabemos / não vamos afirmar |
|---|---|
| Post do FastH3 local em 2026-09-02; linha de notícia no README em 2026-09-01 (blog; README) | Que 7x e 8x sejam a mesma medição. Título, TLDR, thread e as linhas comparadas ao vLLM-Omni divergem; mantemos cada número com o seu link |
| Piso no Mac de ≥36 GB; todo número de Mac no post é de um M4 Max 36 GB (blog) | Velocidade do FastH3 em M6, M5 Ultra, M5 Max, M5 Pro ou em um Mac de 16 GB |
| Spark: GB10, 128 GB unificados; par ligado por QSFP (blog; NVIDIA) | Um tempo medido em RTX 5090 / 4090 de consumo. Elas aparecem como próximo foco em CUDA, sem medição aqui |
| Thread: 1 Spark, 224s em 768p; blog com VAE completo: 374s (depois 336s com carga direta na GPU) em 768×1344, 124 quadros | Qual receita de 768p gerou os 224s da thread. Não achatamos esse número nos 336/374 do blog |
| O TAEH3 é o decodificador de prévia; o VAE completo do H3 é o caminho de qualidade (blog) | Que os 134s do TAEH3 sejam "a" velocidade do FastH3 local |
| Os pesos abertos do MiniMax H3 existem sob uma Community License (código aberto) | Que este site sirva esses pesos, INT4/INT6/INT8 ou um esquema de 4 passos |
| Este gerador: 5–15s, 480P/768P, prompt ou quadro inicial, quadro final opcional, áudio nativo | Um SLA de tempo de fila neste site. O "menos de 3 segundos" hospedado é tempo de modelo de agosto de 2026, não uma promessa para horários de pico |
| Thread do FastH3 v1 em 2026-08-28: 13s em 768p, 14× em Blackwell (thread do v1) | Que 13s / 14× seja a velocidade deste site, ou a velocidade local em Spark/Mac |
Como testar neste site
Para os três prompts abaixo você não precisa de Spark, MLX nem de um Mac de 36 GB.
- Abra o gerador da página inicial (no cabeçalho: Gerar).
- Cole o Prompt A, B ou C sem alterações (troque só o nome de um produto, se realmente precisar).
- Comece com 5 segundos / 480P. Deixe o 768P para a tomada que você vai publicar.
- Ouça com fones. Imagem e som saem no mesmo arquivo.
- Os créditos são cobrados por segundo de vídeo gerado. Consulte os preços antes de empilhar tomadas de 15 segundos em 768P. Este artigo não compara a tabela de preço por segundo de outros serviços.
Os prompts ficam em inglês para você copiar e colar direto no gerador; abaixo de cada título explicamos em português o que cada um pede.
Prompt A — travelling no jardim
Um gatinho branco persegue uma borboleta amarela entre ervas baixas, com a câmera acompanhando na altura do gato, em formato horizontal 16:9 de cerca de 8 segundos.
Horizontal 16:9, about 8 seconds, sunny garden.
A white kitten chases a yellow butterfly across low herbs. Camera tracks at cat height,
leaf-filtered daylight, shallow depth, no logos, no captions.
Soft garden ambience, wing flutter, no music bed, no watermark.
Prompt B — roteiro com tempos marcados
Cerca de 10 segundos em um mosteiro no penhasco ao entardecer: nos quatro primeiros segundos um monge guerreiro está parado em um terraço em ruínas com dois drones no alto; depois caminha em direção à câmera, mantendo o mesmo manto e os mesmos drones.
Horizontal 16:9, about 10 seconds, cliffside monastery at dusk.
First four seconds: a warrior-monk in a weathered robe stands on a ruined terrace,
two small survey drones overhead, wind in prayer flags.
Then he walks the cracked stone toward camera, same robe, same drones.
Native wind and distant rotor hum, no music, no on-screen text, no watermark.
Prompt C — foto que fala a fala
Use um retrato como quadro inicial: em cerca de 6 segundos, a pessoa olha para a câmera e diz a frase entre aspas, com sincronia labial e apenas o som ambiente da sala.
Use a portrait as the start frame. About 6 seconds, medium close-up, indoor window light.
The person looks to camera and says, clearly, "This is the take we keep."
Natural room tone only, lips match the line, no music, no captions, no watermark.
O Prompt C precisa de um quadro inicial. A e B funcionam só com texto.
Regra de decisão (em uma frase)
Escolha o Cookbook do Hao quando você já tem um DGX Spark ou um Mac com 36 GB ou mais, aceita o carregamento em etapas e quer rodar o FastH3 aberto por conta própria.
Escolha o Fast H3 neste site quando o trabalho é um vídeo de 5 a 15 segundos e você não quer comprar esse hardware, compilar CUDA 13 nem ficar cuidando de um modelo que não cabe inteiro na memória. O FAQ da página inicial resume o que este gerador faz e o que não faz.
Perguntas frequentes
Posso rodar o FastH3 localmente?
Sim, pelo caminho que o Hao publicou em 2 de setembro de 2026: NVIDIA DGX Spark (um ou dois) ou Apple Silicon com 36 GB ou mais de memória unificada, usando o Cookbook e o repositório do FastVideo (blog; Cookbook; GitHub). Não é um app de um clique. É uma instalação local.
Este site é esse pacote de código aberto?
Não. FastH3 (uma palavra só) é a destilação aberta de 4 passos do MiniMax H3 feita pelo FastVideo. Fast H3 neste site é o gerador no navegador: 5 a 15 segundos, 480P ou 768P, prompt ou quadro inicial. Não rodamos o checkpoint do Hao, o INT4 nem o esquema de 4 passos na sua aba.
Não tenho um Spark nem um Mac de 36 GB. E agora?
Use o gerador da página inicial. O piso do Hao para Mac é de 36 GB; o Spark é um computador de mesa Blackwell. Um notebook de 16 GB não aparece na tabela de medições deles. Este site não exige esse hardware.
Por que alguns posts falam em 7x e outros em 8x?
Porque o Hao não publicou um único número de destaque. O título do blog diz 7x; o TLDR diz até 8x; a thread diz 8x; as linhas do Spark contra o vLLM-Omni dão ~7× / 8,4× / 7,9× conforme a resolução (blog; thread). Não escolhemos um vencedor.
Quanto tempo leva, de verdade, uma tomada local?
Depende da receita. Os 134s da thread (1 Spark, 5s em 480p) correspondem ao TAEH3 do blog. Com VAE completo em 832×480 e 124 quadros: 451s no Mac / 243s em um Spark / 209s em dois Spark. Nenhum desses números é a fila deste site (blog; thread 2/7).
O caminho no Mac faz primeiro e último quadro ou omni-reference?
Não no runtime MLX que o Hao documenta hoje. Segundo o Cookbook, o FastH3 no MLX é T2VA; FL2VA e Ref2VA não estão ligados (Cookbook). Este site aceita um quadro inicial e um quadro final opcional.
O FastH3 é a mesma coisa que o MiniMax H3?
Não. O MiniMax H3 é o modelo omnimodal aberto da MiniMax (até 15 segundos, regeneração em 2K, áudio estéreo) (H3; código aberto). O FastH3 é a destilação de poucos passos dessa base feita pelo FastVideo (card no HF).
Eles já mostraram 15 segundos gerados em 13 segundos?
Em 28 de agosto de 2026, a thread do FastH3 v1 falou em 15s em 768p gerados em 13s e até 14× em Blackwell. Essa é a história de data center da semana anterior, não a tabela local de Spark/Mac, e não é um SLA aqui (thread do v1).
Quanto custa um vídeo neste site?
Você paga pelos segundos gerados: 10 créditos/s em 480P e 20 em 768P. Uma tomada de 5 segundos em 480P custa 50 créditos. Os planos estão na página de preços. Não colocamos aqui as tabelas de dólar por segundo de outros serviços.
Posso vender o que eu gerar aqui?
Em um plano pago, os resultados são seus para uso comercial lícito. Marcas registradas, imagem de pessoas e material protegido por direitos autorais que você incluir ainda precisam de autorização da sua parte. Os pesos abertos do FastH3 estão sob a Community License da MiniMax — isso vale para o download do Hao, não para este gerador (código aberto).
Sobre Priya Nand
Priya Nand é analista de lançamentos do Fast Video. Ela acompanha os lançamentos locais e hospedados do FastVideo e do MiniMax H3 e transforma alegações públicas sobre hardware em caminhos claros para testar no Fast H3.
