
要点まとめ
- オープン版FastH3は2026年9月2日からローカルで動きます。 Hao AI LabのFastVideoチームが、4ステップのFastH3プレビュー版を1台または2台のNVIDIA DGX Sparkと、MLX経由のApple Siliconで動かす手順を公開しました。Macではユニファイドメモリ36 GBが下限です(Haoのブログ、@haoailab)。
- 速度の見出しは一つの数字ではありません。 ブログのタイトルは7x、TLDRは最大8x、スレッドは8xと書いています。本文の表で、Spark上の公開版vLLM-Omni MiniMax H3レシピと比べた値は、1024×576で約7倍、832×480で8.4倍、1344×768で7.9倍です(Haoのブログ、スレッド 1/7)。
- これらの秒数はHaoのローカルレシピのもので、このサイトの数字ではありません。 スレッドでは、Spark 1台で5秒・480pの動画に134秒、36 GBのM4 Maxで454秒。ブログでは、同じ134秒/119秒の組み合わせはTAEH3を使った480pの経路で、フルVAEはさらに遅くなります。どれも、このサイトの待ち時間として扱わないでください。
- 判断の目安: DGX Sparkか36 GB以上のMacを持っていて、モデルを段階的に読み込むことを受け入れ、オープン版FastH3の重みを自分で扱いたいなら → HaoのCookbook。5〜15秒の動画が欲しいだけで、そのハードウェアもCUDA 13も、一度に収まりきらないモデルの面倒も避けたいなら → このサイトでFast H3を生成。
- このサイトはオープン版チェックポイントそのものではありません。 トップページのジェネレーターはFast H3です。プロンプトまたは開始フレーム、任意の終了フレーム、480P/768P、ネイティブ音声に対応します。FastVideoの4ステップ重みをブラウザ内で動かしているわけではありません。
押さえておきたいポイント
- ローカル版FastH3は2026年9月2日に公開されました。 対象はNVIDIA DGX Spark(1台、またはQSFPで接続した2台)と、MLX経由のApple Siliconです。FastVideoは同じ日にCookbookも公開しています(Haoのブログ、GitHub README)。
- ハードウェアは宣伝文句ではなく、本当の関門です。 公式のMacの数値は、ユニファイドメモリ36 GBのM4 Maxで計測されたものです。SparkはNVIDIAのデスクトップ型Blackwellマシンで、GB10と128 GBのユニファイドメモリを積んでいます(Haoのブログ、DGX Spark)。どちらのマシンでも、全体を同時にメモリへ常駐させることはできず、段階的に動かします。
- ほとんどの人はインストールを省いてかまいません。 音声付きの5〜15秒のテイクを1本作るのが目的なら、トップページのジェネレーターのほうが近道です。CUDA 13をビルドしたり、DiTを変換したりする必要はありません。
- スレッドの秒数とブログの秒数は、同じデコードを指しているとは限りません。 スレッドにある480pの134秒/119秒は、ブログのTAEH3によるエンドツーエンドの列と一致します。同じ832×480・124フレーム・4ステップのレシピでフルVAEを使うと、451秒(M4 Max)、243秒(Spark 1台)、209秒(Spark 2台)です(Haoのブログ、スレッド 2/7)。
- オープン版FastH3はMiniMax H3を蒸留したもので、MiniMaxがホストする2K製品ではありません。 MiniMaxは2026年7月31日/8月3日にH3を公開しました。最長15秒、2K再生成の経路、24 FPS、32 kHzステレオ、Community Licenseです(MiniMax H3、オープンソース化のお知らせ)。FastH3は、このベースモデルをFastVideoが4ステップで学習させた生徒モデルです(HF Preview v0.2)。
- 先週の「13秒/14倍」というBlackwellの動画は別のレシピです。 8月28日のFastH3 v1スレッドは、NVIDIA Blackwell上で15秒・768pを13秒で生成し、最大14倍速いと主張していました。これはSpark/Macの数値ではなく、このサイトが約束する速度でもありません(v1スレッド)。
実際に公開されたもの
2026年9月2日、Hao AI LabはFastH3が「ローカルで動くようになった」と発表しました。同じ週、FastVideoのREADMEはSpark+MLX対応を2026年9月1日付けで記載しています(Haoのブログ、README)。
NVIDIA DGX Spark。 プレビュー版リリースのCUDA経路が、Spark 1台または2台で動くようになりました。2台構成では、QSFP経由で1回の生成を分担します(シーケンス並列)。モデルの読み込み方は通常と異なります。エンコーダー、Transformer、デコーダーを合わせると、Sparkのワークロードが実際に使える約121 GBを超えてしまうためです。そこでパイプラインは、まずエンコードし、テキストエンコーダーを解放してからTransformerを読み込み、ノイズ除去を終えたらそれも解放し、最後にVAEを読み込みます。DiTをGPUへ直接読み込む方式により、GB10 1台でのTransformer読み込みは445秒から39秒に短縮されました(Haoのブログ、スレッド 2/7)。
Apple Silicon/MLX。 公式の下限はユニファイドメモリ36 GB以上です。読み込みは同じく段階的に行います。キャッシュのないプロンプトでは、以前はテキストエンコーダーに約80秒かかっていましたが、読み込み範囲を絞ることで約17秒になり、キャッシュ済みのプロンプトならエンコード自体を省略します。TAEH3を使うと、Macでのデコードは102秒から1秒に短縮されます(Haoのブログ、スレッド 3/7)。すぐ使えるINT8/INT6/INT4のMLX版DiTがHugging Faceで公開されており、計測にはINT6がデフォルトとして使われています(MLX INT6、FastVideoのモデル一覧)。
M4 Maxで、同じプロンプトとシードを使った結果:
| 形式 | 実時間 | ピークメモリ |
|---|---|---|
| INT8 | 481秒 | 24.2 GiB |
| INT6 | 456秒 | 19.5 GiB |
| INT4 | 467秒 | 14.8 GiB |
出典:Haoのブログ、2026年9月2日。スレッドにある454秒は同クラスのマシンでの値で、4つ目の形式ではありません。
Cookbook。 MiniMax H3のレシピは、CUDA、ネイティブMLX、Spark 2台構成のレシピ、そしてローカルのOpenAI互換サーバーをカバーするようになりました。MLXで保守されている経路は音声付きテキストから動画(T2VA)のみで、先頭/末尾フレーム指定とオムニリファレンスはこのランタイムでは接続されていません(Cookbook、Apple Siliconガイド)。
公開されなかったもの。 HaoはM6、M5 Ultra、M5 Max、M5 ProでのFastH3の計測値を公開していません。RTX 5090/4090は次のCUDA対応の重点として名前が挙がっているだけで、この記事で計測されたローカルGPUではありません(Haoのブログ)。

ローカル版FastH3はハードウェアの話 · エディトリアルカバー · Fast H3ブログ用に生成
ローカル版FastH3とこのサイトのFast H3の比較
この表は30秒で読めます。各セルは公開情報で、私たちが実施したA/Bテストではありません。ローカルの秒数はHaoのURLにある数字のままです。
| やりたいこと | オープン版FastH3(FastVideo/Hao) | このサイトのFast H3 |
|---|---|---|
| それは何か | ダウンロードして自分で動かす、4ステップ蒸留版MiniMax H3(HF Preview) | 音声付き5〜15秒の動画を作るブラウザのジェネレーター。オープン版FastH3のチェックポイントではない |
| 用意するハードウェア | DGX Spark(1台または2台)か36 GB以上のMac(Haoのブログ) | ブラウザだけ。Sparkも36 GBの下限も不要 |
| 保守するのは誰か | あなた自身:CUDA 13/MLX、段階的読み込み、Cookbookのフラグ | このサイト |
| 解像度/長さ(公開値) | 計測されたレシピは832×480・124フレーム(約5秒)が中心。2台構成のフルVAEは345フレーム(約14秒)(Haoのブログ) | 480P/768P、長さは5〜15秒の整数秒、デフォルトは5秒。2Kの選択肢はなし |
| ドキュメント化された経路での入力 | MLX:T2VA。CUDAのCookbookには他のH3レシピもあるが、MLXではFL2VA/Ref2VAは未接続(Cookbook) | テキスト、または開始フレーム+任意の終了フレーム |
| 重みを自分で読み込むか | はい。エンコーダー/DiT/VAEは同時に常駐しない | いいえ |
| 1テイクにかかる時間(公開値) | スレッド:134秒(Spark 1台、5秒・480p)、454秒(M4 Max 36 GB)。ブログのTAEH3・480p:134秒/119秒。フルVAE・832×480:451秒/243秒/209秒(M4/Spark 1台/Spark 2台) | 2026年8月のホスト版ベンチマーク:5秒・768Pの動画でモデル処理時間3秒未満、これに待ち時間が加わる。HaoのSpark/Macの時間とは別物 |
| 試す方法 | Cookbook+リポジトリ | このサイトのトップページのジェネレーター |
表の使い方: すでにマシンを持っていてオープン版の重みを動かしたいなら、Haoの手順に従ってください。今日の午後に動画が欲しいなら、このページにとどまってください。
わかっていること・わかっていないこと
| わかっていること(出典あり) | わかっていないこと/主張しないこと |
|---|---|
| ローカル版FastH3の記事は2026-09-02、READMEのニュース行は2026-09-01(ブログ、README) | 7xと8xが同じ計測を指しているかどうか。タイトル、TLDR、スレッド、vLLM-Omniとの比較行の値は食い違っており、それぞれをURL付きで残しています |
| Macの下限は36 GB以上。記事中のMacの数値はすべてM4 Max 36 GB(ブログ) | M6、M5 Ultra、M5 Max、M5 Pro、または16 GBのMacでのFastH3の速度 |
| Spark:GB10、ユニファイドメモリ128 GB、2台はQSFPで接続(ブログ、NVIDIA) | 一般向けRTX 5090/4090での計測値。次のCUDA対応の重点として名前が出ているだけで、ここでは計測されていない |
| スレッドのSpark 1台・768pで224秒に対し、ブログのフルVAEは768×1344・124フレームで374秒(GPU直接読み込み後は336秒) | スレッドの224秒がどの768pレシピによるものか。ブログの336秒/374秒とひとまとめにはしません |
| TAEH3はプレビュー用デコーダーで、H3のフルVAEが品質重視の経路(ブログ) | TAEH3の134秒が「ローカル版FastH3の速度」そのものだということ |
| MiniMax H3のオープンな重みはCommunity Licenseで公開されている(オープンソース化) | このサイトがその重み、INT4/INT6/INT8、または4ステップのスケジュールを提供していること |
| このジェネレーター:5〜15秒、480P/768P、プロンプトまたは開始フレーム、任意の終了フレーム、ネイティブ音声 | このサイトの待ち時間に関するSLA。ホスト版の「3秒未満」は2026年8月時点のモデル処理時間で、混雑時間帯の約束ではありません |
| FastH3 v1スレッド 2026-08-28:768pで13秒、Blackwellで14倍(v1スレッド) | その13秒/14倍がこのサイトの速度であること、またはSpark/Macでのローカル速度であること |
このサイトで試す方法
次の3つのプロンプトには、SparkもMLXも36 GBのMacも必要ありません。
- トップページのジェネレーターを開きます(ヘッダーの「生成」)。
- プロンプトA、B、Cのいずれかをそのまま貼り付けます(本当に必要な商品名だけ差し替えてください)。
- まずは5秒/480Pで始めます。768Pは、実際に使うテイクのために取っておきましょう。
- ヘッドホンで聞いてみてください。映像と音声は1つのファイルにまとまっています。
- クレジットは出力1秒ごとに消費されます。15秒・768Pのテイクを何本も作る前に、料金を確認してください。この記事では、他社の1秒あたりの料金表とは比較していません。
プロンプトA — 庭を追いかけるトラッキングショット
子猫が蝶を追う晴れた庭の約8秒のショットです。下のプロンプトは英語のまま貼り付けてください。
Horizontal 16:9, about 8 seconds, sunny garden.
A white kitten chases a yellow butterfly across low herbs. Camera tracks at cat height,
leaf-filtered daylight, shallow depth, no logos, no captions.
Soft garden ambience, wing flutter, no music bed, no watermark.
プロンプトB — 時間配分を決めたビートシート
夕暮れの崖の上の僧院で、最初の4秒は立ち姿、その後カメラへ歩いてくる約10秒の構成です。
Horizontal 16:9, about 10 seconds, cliffside monastery at dusk.
First four seconds: a warrior-monk in a weathered robe stands on a ruined terrace,
two small survey drones overhead, wind in prayer flags.
Then he walks the cracked stone toward camera, same robe, same drones.
Native wind and distant rotor hum, no music, no on-screen text, no watermark.
プロンプトC — 静止画にセリフを話させる
人物の写真を開始フレームにして、カメラに向かって英語のセリフを一言話させる約6秒のショットです。
Use a portrait as the start frame. About 6 seconds, medium close-up, indoor window light.
The person looks to camera and says, clearly, "This is the take we keep."
Natural room tone only, lips match the line, no music, no captions, no watermark.
プロンプトCには開始フレームが必要です。AとBはテキストだけで動きます。
判断の目安(ひとことで)
HaoのCookbookを選ぶのは、すでにDGX Sparkか36 GB以上のMacを持っていて、段階的な読み込みを受け入れ、オープン版FastH3を自分で動かしたいときです。
このサイトのFast H3を選ぶのは、目的が5〜15秒の動画で、そのハードウェアを買うことも、CUDA 13をビルドすることも、一度に収まらないモデルの世話をすることも避けたいときです。このジェネレーターでできること・できないことは、トップページのFAQに短くまとめてあります。
よくある質問
FastH3はローカルで動かせますか?
はい。Haoが2026年9月2日に公開した経路で動かせます。NVIDIA DGX Spark(1台または2台)か、ユニファイドメモリ36 GB以上のApple Siliconを使い、FastVideoのCookbookとリポジトリに従います(ブログ、Cookbook、GitHub)。ワンクリックのアプリではなく、ローカルへのインストールです。
このサイトはそのオープンソースパッケージですか?
いいえ。FastH3(一語)は、FastVideoがMiniMax H3を4ステップに蒸留したオープン版です。このサイトのFast H3はブラウザのジェネレーターで、5〜15秒、480Pまたは768P、プロンプトまたは開始フレームに対応します。Haoのチェックポイント、INT4、4ステップのスケジュールをあなたのタブ内で動かしているわけではありません。
Sparkも36 GBのMacも持っていません。どうすればいいですか?
トップページのジェネレーターを使ってください。HaoのMacの下限は36 GBで、Sparkはデスクトップ型のBlackwellマシンです。16 GBのノートPCは計測表に入っていません。このサイトでは、そうしたハードウェアは必要ありません。
7xと書いている記事と8xと書いている記事があるのはなぜですか?
Haoが一つの見出しの数字に統一していないからです。ブログのタイトルは7x、TLDRは最大8x、スレッドは8x、SparkでのvLLM-Omniとの比較行は形状ごとに約7倍/8.4倍/7.9倍です(ブログ、スレッド)。私たちはどれが正しいかを決めません。
ローカルでの1テイクには、実際どのくらいかかりますか?
レシピによって変わります。スレッドの134秒(Spark 1台、5秒・480p)は、ブログのTAEH3の値と一致します。832×480・124フレームでフルVAEを使うと、Macで451秒、Spark 1台で243秒、Spark 2台で209秒です。どの数字も、このサイトの待ち時間ではありません(ブログ、スレッド 2/7)。
Macの経路で先頭・末尾フレーム指定やオムニリファレンスは使えますか?
Haoが現在ドキュメント化しているMLXランタイムでは使えません。Cookbookによると、MLX版FastH3はT2VAのみで、FL2VAとRef2VAは接続されていません(Cookbook)。このサイトは開始フレームと任意の終了フレームに対応しています。
FastH3はMiniMax H3と同じものですか?
違います。MiniMax H3はMiniMaxのオープンなオムニモーダルモデルです(最長15秒、2K再生成、ステレオ)(H3、オープンソース化)。FastH3は、そのベースをFastVideoが少ないステップに蒸留したものです(HFカード)。
15秒の動画を13秒で作れると、すでに発表されていませんでしたか?
2026年8月28日のFastH3 v1スレッドでは、Blackwell上で15秒・768pを13秒で、最大14倍と述べていました。これは先週のデータセンター向けの話で、Spark/Macのローカル計測表とは別物であり、このサイトのSLAでもありません(v1スレッド)。
このサイトでは1本いくらかかりますか?
完成した秒数に応じて支払います。480Pは1秒あたり10クレジット、768Pは20クレジットです。5秒・480Pのテイクなら50クレジットです。プランは料金ページから始められます。他社の1秒あたりのドル建て料金表との比較はここでは載せていません。
ここで生成した動画を販売できますか?
有料プランなら、出力はあなたのものとして、合法的な商用利用に使えます。入力に含めた商標、肖像、著作物については、あなた自身で権利処理が必要です。オープン版FastH3の重みはMiniMaxのCommunity Licenseの下にあり、それはHaoのダウンロードについての話で、このジェネレーターのことではありません(オープンソース化)。
Priya Nandについて
Priya NandはFast Videoのリリースアナリストです。FastVideoとMiniMax H3のローカル版・ホスト版のリリースを追い、公開されたハードウェアの主張を、Fast H3での分かりやすい試し方に落とし込んでいます。
