
Kurzfassung
- Das offene FastH3 läuft seit dem 2. September 2026 lokal. Das FastVideo-Team von Hao AI Lab hat einen Weg veröffentlicht, die 4-Schritt-Preview von FastH3 auf einem oder zwei NVIDIA DGX Sparks sowie auf Apple Silicon über MLX auszuführen. Für den Mac gilt eine Untergrenze von 36 GB Unified Memory (Hao-Blog; @haoailab).
- Die Geschwindigkeitsangabe ist keine einzelne Zahl. Der Titel des Blogposts nennt 7x, die TLDR dort spricht von bis zu 8x, der Thread von 8x. Die Tabellen im Fließtext, gemessen gegen ein öffentliches vLLM-Omni-Rezept für MiniMax H3 auf dem Spark, zeigen etwa 7× bei 1024×576, 8,4× bei 832×480 und 7,9× bei 1344×768 (Hao-Blog; Thread 1/7).
- Diese Sekundenwerte stammen aus Haos lokalem Rezept, nicht von dieser Website. Im Thread stehen 134 s für einen 5-Sekunden-Clip in 480p auf einem Spark und 454 s auf einem M4 Max mit 36 GB. Im Blog gehört dasselbe Paar 134 s / 119 s zum TAEH3-Pfad bei 480p; mit dem vollständigen VAE dauert es länger. Keiner dieser Werte ist eine Wartezeit hier auf der Website.
- Entscheidungsregel: Du hast einen DGX Spark oder einen Mac mit 36 GB oder mehr, nimmst das phasenweise Laden des Modells in Kauf und willst die offenen FastH3-Gewichte selbst betreiben → Haos Cookbook. Du willst einen 5–15 Sekunden langen Clip und weder diese Hardware noch CUDA 13 noch ein Modell, das nicht am Stück in den Speicher passt → Fast H3 auf dieser Website generieren.
- Diese Website ist nicht der offene Checkpoint. Der Generator auf der Startseite ist Fast H3: Prompt oder Startbild, optional ein Endbild, 480P / 768P, nativer Ton. Hier laufen nicht die 4-Schritt-Gewichte von FastVideo in deinem Browser.
Das Wichtigste im Überblick
- Lokales FastH3 ist am 2. September 2026 erschienen – für NVIDIA DGX Spark (ein Gerät oder ein Paar über QSFP) und für Apple Silicon über MLX. Am selben Tag hat FastVideo außerdem ein Cookbook veröffentlicht (Hao-Blog; GitHub-README).
- Die Hardware ist die eigentliche Hürde, kein Werbespruch. Die offiziellen Mac-Werte stammen von einem M4 Max mit 36 GB Unified Memory. Der Spark ist NVIDIAs Blackwell-Rechner für den Schreibtisch: GB10, 128 GB Unified Memory (Hao-Blog; DGX Spark). Keine der beiden Maschinen hält den gesamten Stack gleichzeitig im Speicher; beide arbeiten in Phasen.
- Für die meisten lohnt sich die Installation nicht. Wenn du einen einzelnen Take von 5–15 Sekunden mit Ton brauchst, ist der Generator auf der Startseite der kürzere Weg. Du musst weder CUDA 13 kompilieren noch ein DiT konvertieren.
- Sekunden im Thread und Sekunden im Blog beziehen sich nicht immer auf denselben Decoder. Das 480p-Paar 134 s / 119 s aus dem Thread entspricht der End-to-End-Spalte für TAEH3 im Blog. Mit dem vollständigen VAE und demselben Rezept (832×480, 124 Frames, vier Schritte) sind es 451 s (M4 Max), 243 s (ein Spark) und 209 s (zwei Sparks) (Hao-Blog; Thread 2/7).
- Das offene FastH3 ist ein destilliertes MiniMax H3, nicht MiniMax' gehostetes 2K-Produkt. MiniMax hat H3 am 31. Juli bzw. 3. August 2026 geöffnet: bis zu 15 Sekunden, ein 2K-Regenerate-Pfad, 24 FPS, 32 kHz Stereo, Community License (MiniMax H3; Open-Source-Hinweis). FastH3 ist das 4-Schritt-Schülermodell, das FastVideo aus dieser Basis destilliert hat (HF Preview v0.2).
- Der Blackwell-Clip mit 13 s / 14× aus der Vorwoche ist ein anderes Rezept. Der Thread zu FastH3 v1 vom 28. August sprach von 15 s in 768p in 13 s und bis zu 14× auf NVIDIA Blackwell. Das ist weder ein Spark- noch ein Mac-Wert, und es ist auch kein Versprechen dieser Website (v1-Thread).
Was tatsächlich veröffentlicht wurde
Am 2. September 2026 verkündete Hao AI Lab, dass FastH3 „lokal geht“. In derselben Woche datierte das README von FastVideo die Arbeit an Spark und MLX auf den 1. September 2026 (Hao-Blog; README).
NVIDIA DGX Spark. Der CUDA-Pfad aus dem Preview-Release läuft jetzt auf einem Spark oder einem Paar. Bei einem Paar teilen sich beide Geräte eine Generierung über QSFP (Sequenzparallelität). Das Modell wird dabei nicht auf dem üblichen Weg geladen: Encoder, Transformer und Decoder zusammen überschreiten die rund 121 GB, die einer Spark-Workload tatsächlich zur Verfügung stehen. Die Pipeline kodiert deshalb zuerst den Text, entlädt den Text-Encoder, lädt den Transformer, führt das Denoising aus, entlädt ihn wieder und lädt erst dann den VAE. Durch das GPU-direkte Laden des DiT sank die Ladezeit des Transformers auf einem GB10 von 445 s auf 39 s (Hao-Blog; Thread 2/7).
Apple Silicon / MLX. Die offizielle Untergrenze liegt bei 36 GB Unified Memory oder mehr. Geladen wird ebenfalls in Phasen. Ein noch nicht zwischengespeicherter Prompt verbrachte früher etwa 80 s im Text-Encoder; durch begrenztes Einlesen sind es nun etwa 17 s, und ein zwischengespeicherter Prompt überspringt das Kodieren ganz. TAEH3 senkt die Dekodierzeit auf dem Mac von 102 s auf 1 s (Hao-Blog; Thread 3/7). Sofort lauffähige MLX-DiTs in INT8 / INT6 / INT4 liegen auf Hugging Face; INT6 ist das Standardformat, mit dem gemessen wurde (MLX INT6; FastVideo-Modelle).
Auf einem M4 Max, mit gleichem Prompt und gleichem Seed:
| Format | Gesamtlaufzeit | Spitzenspeicher |
|---|---|---|
| INT8 | 481 s | 24,2 GiB |
| INT6 | 456 s | 19,5 GiB |
| INT4 | 467 s | 14,8 GiB |
Quelle: Hao-Blog, 2. September 2026. Die 454 s aus dem Thread stammen von derselben Geräteklasse und sind kein viertes Format.
Cookbook. Die Rezepte für MiniMax H3 decken jetzt CUDA, natives MLX, ein Rezept für ein Spark-Paar und einen lokalen OpenAI-kompatiblen Server ab. Unter MLX wird nur Text-to-Video-with-Audio (T2VA) gepflegt – Erst-/Endbild und Omni-Referenz sind auf dieser Laufzeit nicht angebunden (Cookbook; Apple-Silicon-Anleitung).
Was nicht veröffentlicht wurde. Hao hat keine FastH3-Messwerte für M6, M5 Ultra, M5 Max oder M5 Pro veröffentlicht. RTX 5090 / 4090 werden als nächster CUDA-Schwerpunkt genannt, sind in diesem Beitrag aber keine lokal gemessenen Karten (Hao-Blog).

Lokales FastH3 ist eine Hardware-Geschichte · redaktionelles Cover · für den Fast-H3-Blog generiert
Lokales FastH3 vs. Fast H3 auf dieser Website
Diese Tabelle liest du in 30 Sekunden. Die Zellen enthalten öffentlich belegte Fakten, keinen eigenen Laborvergleich von uns. Lokale Sekundenwerte bleiben bei Haos Quellen.
| Deine Aufgabe | Offenes FastH3 (FastVideo / Hao) | Fast H3 auf dieser Website |
|---|---|---|
| Was es ist | Auf 4 Schritte destilliertes MiniMax H3, das du herunterlädst und selbst ausführst (HF Preview) | Browser-Generator für 5–15-s-Clips mit Ton. Nicht der offene FastH3-Checkpoint |
| Hardware, die du mitbringst | DGX Spark (1 oder 2) oder ein Mac mit 36 GB+ (Hao-Blog) | Einen Browser. Kein Spark, keine 36-GB-Untergrenze |
| Wer es pflegt | Du: CUDA 13 / MLX, phasenweises Laden, Cookbook-Flags | Diese Website |
| Auflösung / Länge (öffentlich) | Die gemessenen Rezepte drehen sich um 832×480, 124 Frames (~5 s); beim Paar mit vollem VAE 345 Frames (~14 s) (Hao-Blog) | 480P / 768P, ganze Sekunden von 5–15, Standard 5. Keine 2K-Option hier |
| Eingaben auf dem dokumentierten Weg | MLX: T2VA. Das CUDA-Cookbook listet weitere H3-Rezepte; unter MLX sind FL2VA / Ref2VA nicht angebunden (Cookbook) | Text oder ein Startbild plus optionales Endbild |
| Gewichte selbst laden? | Ja. Encoder / DiT / VAE bleiben nicht gleichzeitig im Speicher | Nein |
| Öffentlich genannte Dauer pro Take | Thread: 134 s (1 Spark, 5 s @480p), 454 s (M4 Max 36 GB). Blog TAEH3 480p: 134 s / 119 s. Voller VAE 832×480: 451 s / 243 s / 209 s (M4 / 1 Spark / 2 Sparks) | Gehostete Benchmarks vom August 2026: ein 5-s-Clip in 768P in unter 3 Sekunden Modellzeit, plus Warteschlange. Nicht Haos Spark-/Mac-Messung |
| Zum Ausprobieren | Cookbook + Repo | Generator auf der Startseite dieser Website |
So nutzt du die Tabelle: Wenn du die Hardware schon besitzt und die offenen Gewichte willst, folge Hao. Wenn du heute Nachmittag einen Clip brauchst, bleib auf dieser Seite.
Was wir wissen – und was nicht
| Was wir wissen (mit Quelle) | Was wir nicht wissen / nicht behaupten |
|---|---|
| Beitrag zu lokalem FastH3 vom 2026-09-02; News-Zeile im README vom 2026-09-01 (Blog; README) | Dass 7x und 8x dieselbe Messung sind. Titel, TLDR, Thread und die Zeilen gegen vLLM-Omni weichen voneinander ab; wir belassen jeden Wert bei seiner Quelle |
| Mac-Untergrenze ≥36 GB; jeder Mac-Wert im Beitrag stammt von einem M4 Max mit 36 GB (Blog) | Die FastH3-Geschwindigkeit auf M6, M5 Ultra, M5 Max, M5 Pro oder einem Mac mit 16 GB |
| Spark: GB10, 128 GB Unified Memory; Paar über QSFP (Blog; NVIDIA) | Messwerte für eine Consumer-RTX 5090 / 4090. Als nächster CUDA-Schwerpunkt genannt, hier nicht gemessen |
| Thread: 1 Spark 224 s @768p; Blog mit vollem VAE: 374 s (nach GPU-direktem Laden 336 s) bei 768×1344, 124 Frames | Welches 768p-Rezept hinter den 224 s aus dem Thread steckt. Wir rechnen es nicht in die 336/374 s des Blogs um |
| TAEH3 ist der Vorschau-Decoder; der volle H3-VAE ist der Qualitäts-Pfad (Blog) | Dass die 134 s mit TAEH3 „die“ lokale FastH3-Geschwindigkeit sind |
| Offene Gewichte von MiniMax H3 gibt es unter einer Community License (Open Source) | Dass diese Website diese Gewichte, INT4/INT6/INT8 oder einen 4-Schritt-Ablauf bereitstellt |
| Dieser Generator: 5–15 s, 480P/768P, Prompt oder Startbild, optional Endbild, nativer Ton | Eine garantierte Wartezeit auf dieser Website. Das gehostete „unter 3 Sekunden“ ist Modellzeit vom August 2026 und kein Versprechen zu Spitzenzeiten |
| Thread zu FastH3 v1 vom 2026-08-28: 13 s @768p, 14× auf Blackwell (v1-Thread) | Dass 13 s / 14× die Geschwindigkeit dieser Website oder die lokale Spark-/Mac-Geschwindigkeit sind |
So probierst du es auf dieser Website aus
Für die nächsten drei Prompts brauchst du weder Spark noch MLX noch einen Mac mit 36 GB.
- Öffne den Generator auf der Startseite (im Header: Generieren).
- Füge Prompt A, B oder C unverändert ein (tausche höchstens einen Produktnamen aus, den du wirklich brauchst). Die Prompts bleiben auf Englisch, damit du sie direkt kopieren kannst.
- Starte mit 5 Sekunden / 480P. Heb dir 768P für den Take auf, den du tatsächlich verwenden willst.
- Hör mit Kopfhörern hin. Bild und Ton landen in einer Datei.
- Credits werden pro Sekunde Ausgabe berechnet. Wirf einen Blick auf die Preise, bevor du eine Reihe von 15-Sekunden-Takes in 768P erstellst. Dieser Artikel vergleicht keine Sekundenpreise anderer Anbieter.
Prompt A – Kamerafahrt durch den Garten
Ein weißes Kätzchen jagt im sonnigen Garten einen gelben Schmetterling; die Kamera fährt auf Katzenhöhe mit, ohne Musik.
Horizontal 16:9, about 8 seconds, sunny garden.
A white kitten chases a yellow butterfly across low herbs. Camera tracks at cat height,
leaf-filtered daylight, shallow depth, no logos, no captions.
Soft garden ambience, wing flutter, no music bed, no watermark.
Prompt B – zeitlich gegliederter Ablauf
Ein Kriegermönch auf einer verfallenen Klosterterrasse in der Dämmerung, zwei Drohnen über ihm; nach vier Sekunden geht er auf die Kamera zu.
Horizontal 16:9, about 10 seconds, cliffside monastery at dusk.
First four seconds: a warrior-monk in a weathered robe stands on a ruined terrace,
two small survey drones overhead, wind in prayer flags.
Then he walks the cracked stone toward camera, same robe, same drones.
Native wind and distant rotor hum, no music, no on-screen text, no watermark.
Prompt C – ein Standbild, das den Satz spricht
Ein Porträt als Startbild; die Person blickt in die Kamera und spricht einen kurzen englischen Satz, lippensynchron.
Use a portrait as the start frame. About 6 seconds, medium close-up, indoor window light.
The person looks to camera and says, clearly, "This is the take we keep."
Natural room tone only, lips match the line, no music, no captions, no watermark.
Prompt C braucht ein Startbild. A und B funktionieren allein mit Text.
Entscheidungsregel in einem Satz
Nimm Haos Cookbook, wenn du bereits einen DGX Spark oder einen Mac mit 36 GB+ hast, das phasenweise Laden akzeptierst und das offene FastH3 selbst betreiben willst.
Nimm Fast H3 auf dieser Website, wenn du einen 5–15 Sekunden langen Clip brauchst und weder diese Hardware kaufen noch CUDA 13 kompilieren noch ein Modell hüten willst, das nicht am Stück in den Speicher passt. Die FAQ auf der Startseite fasst kurz zusammen, was dieser Generator kann und was nicht.
FAQ
Kann ich FastH3 lokal ausführen?
Ja, auf dem Weg, den Hao am 2. September 2026 veröffentlicht hat: NVIDIA DGX Spark (einer oder zwei) oder Apple Silicon mit 36 GB+ Unified Memory, über das Cookbook und das Repo von FastVideo (Blog; Cookbook; GitHub). Das ist keine App mit einem Klick, sondern eine lokale Installation.
Ist diese Website dieses Open-Source-Paket?
Nein. FastH3 (ein Wort) ist die offene 4-Schritt-Destillation von MiniMax H3 durch FastVideo. Fast H3 auf dieser Website ist der Browser-Generator: 5–15 Sekunden, 480P oder 768P, Prompt oder Startbild. Wir führen weder Haos Checkpoint noch INT4 noch den 4-Schritt-Ablauf in deinem Tab aus.
Ich habe weder einen Spark noch einen Mac mit 36 GB. Was nun?
Nutze den Generator auf der Startseite. Haos Untergrenze für den Mac liegt bei 36 GB; der Spark ist ein Blackwell-Rechner für den Schreibtisch. Ein Laptop mit 16 GB taucht in ihren Messtabellen nicht auf. Diese Website setzt diese Hardware nicht voraus.
Warum steht in manchen Beiträgen 7x und in anderen 8x?
Weil Hao keine einheitliche Kernaussage veröffentlicht hat. Der Blogtitel nennt 7x, die TLDR bis zu 8x, der Thread 8x, und die Zeilen Spark gegen vLLM-Omni zeigen je nach Format ~7× / 8,4× / 7,9× (Blog; Thread). Wir küren keinen Gewinner.
Wie lange dauert ein lokaler Take wirklich?
Das hängt vom Rezept ab. Die 134 s aus dem Thread (1 Spark, 5 s @480p) entsprechen dem TAEH3-Wert im Blog. Mit vollem VAE bei 832×480 und 124 Frames: 451 s auf dem Mac, 243 s auf einem Spark, 209 s auf zwei Sparks. Keiner dieser Werte ist die Warteschlange dieser Website (Blog; Thread 2/7).
Kann der Mac-Pfad Erst- und Endbild oder Omni-Referenzen?
Nicht auf der MLX-Laufzeit, die Hao derzeit dokumentiert. Laut Cookbook ist FastH3 unter MLX T2VA; FL2VA und Ref2VA sind nicht angebunden (Cookbook). Diese Website akzeptiert dagegen ein Startbild und ein optionales Endbild.
Ist FastH3 dasselbe wie MiniMax H3?
Nein. MiniMax H3 ist das offene omnimodale Modell von MiniMax (bis zu 15 Sekunden, 2K-Regenerate, Stereo) (H3; Open Source). FastH3 ist die Few-Step-Destillation dieser Basis durch FastVideo (HF-Modellkarte).
Wurden 15 Sekunden in 13 Sekunden nicht schon gezeigt?
Am 28. August 2026 hieß es im Thread zu FastH3 v1: 15 s in 768p in 13 s und bis zu 14× auf Blackwell. Das ist die Rechenzentrums-Geschichte der Vorwoche, nicht die lokale Spark-/Mac-Tabelle und keine Zusage für diese Website (v1-Thread).
Was kostet ein Clip auf dieser Website?
Du zahlst für fertige Sekunden: 10 Credits/s bei 480P, 20 bei 768P. Ein 5-Sekunden-Take in 480P kostet 50 Credits. Die Pläne findest du auf der Preisseite. Dollarpreise pro Sekunde bei anderen Anbietern stellen wir hier nicht gegenüber.
Darf ich verkaufen, was ich hier erstelle?
Mit einem bezahlten Plan gehören dir die Ergebnisse für rechtmäßige kommerzielle Nutzung. Marken, Persönlichkeitsrechte und urheberrechtlich geschütztes Material, das du einbringst, musst du weiterhin selbst klären. Die offenen FastH3-Gewichte stehen unter der Community License von MiniMax – das betrifft Haos Download, nicht diesen Generator (Open Source).
Über Priya Nand
Priya Nand ist Release-Analystin für Fast Video. Sie verfolgt die lokalen und gehosteten Releases von FastVideo und MiniMax H3 und übersetzt öffentliche Hardware-Angaben in klare Wege zum Ausprobieren mit Fast H3.
