AI×映像制作

【2026年版】LTX-2の使い方!ローカル要件と始め方を現役MVクリエイターが解説

LTX-2 使い方のアイキャッチ画像
edit-films
LTX-2 使い方のアイキャッチ画像

LTX-2をローカルで動かしてみたいんですが、解説記事ごとに手順がバラバラで…。「RTX 4090一台で動く」って書いてあるものもあれば、そうじゃないものもあって、どれを信じればいいのか分からないんです。

こんにちは、現役MVクリエイターの青来です。LTX-2 の使い方を調べていると、たしかに情報がバラバラですよね。理由ははっきりしていて、このモデルは公開からの更新ペースがかなり速く、半年前の記事の手順がもう通らない状態になっているからです。

先に結論から言います。LTX-2 の使い方は「ComfyUIで動かす」「コマンドラインで動かす」「クラウドのAPIで触る」の3ルートに分かれます。そして自分の環境がどこに当てはまるかは、GPUのVRAM容量ひとつでほぼ決まります。

そのうえで、いちばん誤解が多いところを最初に置いておきます。公式ドキュメントが示すLTX-2の最小要件は「VRAM 32GB以上のNVIDIA GPU」で、RTX 4090(24GB)はこの最小ラインを下回ります。「4090一台で動く」と書かれた記事を見かけたら、それがどのバージョンの話なのかを疑ったほうがいいです。

この記事は、2026年7月29日時点の公式リポジトリ・公式ドキュメント・ライセンス原文・モデルカードを実際に開いて確認しながら書いています。僕自身が自分のマシンでLTX-2を回した検証記事ではありません。なので「動かしてみたら何分だった」といった実測値は書きません。代わりに、公式が明記している数字と、MV/PV案件にこの手のローカル生成モデルを組み込むなら、どこで判断が分かれるかという運用側の話をセットで書きます。

AI動画ツール全体の中でのLTX-2の位置づけから知りたい人は、先に動画生成AIおすすめ完全ガイドで他社サービスとの並びをつかんでおくと、この記事の内容が入りやすいと思います。

この記事でわかること
  • LTX-2の使い方は3ルートあり、現行の公開モデルは「LTX-2.3(22B)」だということ
  • 公式が示すVRAM・システムメモリ・ストレージ・CUDAの要件と、必要なモデルファイルの合計サイズ
  • ComfyUIでの導入から初回生成までの5ステップと、コマンドラインでの起動手順
  • 音声込みで指定するプロンプトの型と、公式が「避けたい」としている書き方
  • クラウドで触る導線と従量課金の単価、ライセンス原文が定める商用利用の線引き
Contents
  1. 1. LTX-2の使い方は3ルート|現行モデルは「LTX-2.3(22B)」という前提
  2. 2. LTX-2をローカルで動かす要件|公式が示すVRAM・容量・必要ファイル
  3. 3. LTX-2の使い方【ComfyUI編】|導入から初回生成までの5ステップ
  4. 4. LTX-2の使い方【コマンドライン編】|uv syncと10種類のパイプライン
  5. 5. LTX-2のプロンプトの書き方|映像と音声をまとめて指定する型
  6. 6. LTX-2をクラウドで使う導線|プレイグラウンドと従量課金の目安
  7. 7. LTX-2の商用利用とライセンス|年商1,000万ドルの線引きを原文で確認
  8. 8. 【運用視点】LTX-2をMV/PV案件に組み込むなら|損益分岐と使いどころ
  9. 9. LTX-2の使い方でよくある質問と合う人・合わない人|まとめ

1. LTX-2の使い方は3ルート|現行モデルは「LTX-2.3(22B)」という前提

LTX-2の使い方は、ComfyUI・コマンドライン・クラウドAPIの3ルートに分かれます。現在公開されている本体は、22BパラメータのLTX-2.3です。

LTX-2 使い方の3ルートを整理した図解
STEP 0:LTX-2を触る前に「ComfyUI・コマンドライン・クラウド」のどのルートで入るかを決める

まず前提から。LTX-2は、Lightricksが公開しているDiTベースの「音声と映像を1つのモデルで同時に生成する」基盤モデルです。映像を作ってから音を後付けするのではなく、同じ生成パスの中で音声と映像が一緒に出てくるのが構造上の特徴になっています。

LTX-2とLTX-2.3の関係を先に整理する

ここが混乱の元なので、先に切り分けます。「LTX-2」はモデルファミリーの総称であり、2026年7月時点でHugging Faceに置かれている最新の公開ウェイトは「LTX-2.3」です。公式リポジトリの名前は今もLTX-2ですが、READMEがダウンロードを指示しているのはLTX-2.3のチェックポイントになっています。

  • ltx-2.3-22b-dev:フル版。bf16で学習・改造が可能なベースモデル
  • ltx-2.3-22b-distilled-1.1:蒸留版。8ステップ・CFG=1で回る高速モデル
  • ltx-2.3-22b-distilled-lora-384-1.1:蒸留版をLoRAとして本体に適用するためのファイル
  • ltx-2.3-spatial-upscaler-x2-1.1:2段構成パイプラインで解像度を上げるための空間アップスケーラ
  • ltx-2.3-temporal-upscaler-x2-1.0:フレームレートを上げるための時間方向アップスケーラ

ちなみに旧世代の19B版(LTX-2)も別リポジトリに残っています。ネット上の解説が19B前提なのか22B前提なのかで、必要ファイルもVRAMの話も変わってきます。「LTX-2の使い方」で検索して出てくる記事の多くは、まだ19B時代の情報のまま止まっています。

3つのルートは「VRAMと手間」で選ぶ

ルートの違いはシンプルです。

  • ルート1|ComfyUI:公式が「ほとんどのユーザーにおすすめ」としている経路。ノードを繋ぐGUIで、テンプレートを読み込めばモデルの自動ダウンロードまで面倒を見てくれます
  • ルート2|コマンドライン(PyTorch):公式リポジトリをクローンして uv で環境を作り、10種類あるパイプラインを直接叩く経路。細かい制御と自動化に向きます
  • ルート3|クラウド(APIプレイグラウンド):GPUを用意せず、ブラウザとAPIキーだけで触る経路。秒単位の従量課金で、環境構築の手間はゼロ

加えて、公式が別途出している「LTX Desktop」というデスクトップアプリ(ベータ)もあって、こちらはVRAM 16GB以上という条件で動くと案内されています。ここは後のセクションで詳しく触れます。

情報が古くなりやすい理由も知っておく

もうひとつ。LTX-2はクラウドAPI側でもモデルの世代交代が進んでいます。公式ドキュメントには、API上の旧モデル(ltx-2-fast / ltx-2-pro)は7月15日に非推奨となり、8月15日に削除されるという告知が出ています。ローカルもクラウドも、この速度で入れ替わっているわけです。

だからこの記事も含めて、LTX-2まわりの解説は「いつ書かれたか」を必ず見るクセをつけたほうがいいと思います。手順が通らなかったら、まず公式リポジトリのREADMEを開き直すのが結局いちばん早いですよ。

2. LTX-2をローカルで動かす要件|公式が示すVRAM・容量・必要ファイル

LTX-2のローカル実行は、公式ドキュメントの最小要件が「VRAM 32GB以上・システムメモリ32GB・空き容量100GB」と明記されています。まずここを自分のマシンと突き合わせます。

LTX-2 ローカル実行の要件を整理した図解
STEP 1:LTX-2をローカルで動かす前に、公式が示す最小要件と推奨構成を自分の環境と照合する

公式ドキュメントに書かれている最小要件と推奨構成

公式のシステム要件ページには、LTX-2.3向けとして次のように書かれています。

  • 最小要件:GPUはVRAM 32GB以上のNVIDIA製(多いほど良い)/システムメモリ32GB/空き容量100GB/CUDA 11.8以上/Python 3.10以上
  • 推奨構成:NVIDIA A100(80GB)またはH100/システムメモリ64GB以上/SSD 200GB以上/CUDA 12.1以上

ComfyUI向けの導入ページにも、前提条件として「32GB以上のVRAMを持つCUDA対応GPU」「モデルとキャッシュ用に100GB以上の空き容量」が同じく書かれています。ここは公式の複数ページで一致している数字です。

つまり、RTX 4090(24GB)は公式が示す最小要件を満たしません。これが今回いちばん重要な訂正ポイントです。「4090で動く」という記述を見かけたら、19B世代の話か、解像度・尺をかなり落とした条件の話か、そもそも裏取りがされていないかのどれかだと考えたほうが安全です。

なお、環境まわりの数字はリポジトリ側とドキュメント側で少し幅があります。モデルカードには「Python 3.12以上、CUDA 12.7超、PyTorch 2.7系でテスト済み」と書かれており、ドキュメントの最小要件(Python 3.10以上/CUDA 11.8以上)より新しい環境が想定されています。迷ったら新しいほうに合わせておくのが無難です。

必要なモデルファイルと、その合計サイズ

「100GB空けておけ」と言われる理由は、落とすファイルの数と大きさを見れば納得できます。Hugging Faceのファイル情報から実サイズを拾うと、こうなります。

  • 本体チェックポイント(22b-dev または 22b-distilled-1.1):約46GB
  • 蒸留LoRA(distilled-lora-384-1.1):約7.6GB
  • 空間アップスケーラ(spatial-upscaler-x2-1.1):約1.0GB
  • 時間アップスケーラ(temporal-upscaler-x2-1.0):約0.26GB
  • テキストエンコーダ(Gemma 3 12B):5分割で合計およそ24GB

フル精度で一式そろえると合計80GB近くになります。ここに生成物とキャッシュが乗るので、100GBという数字はかなり現実的なラインですね。

一方で、ComfyUIの標準テンプレートが落とすのは量子化版を含む5ファイルで、実ファイルサイズの合計はおよそ43GBです(FP8のチェックポイント+蒸留LoRA+Gemma用のLoRA+FP4のGemma+空間アップスケーラ)。まず触ってみたいだけなら、こちらのほうが入口としては軽いですよ。

32GBに届かない環境の逃げ道

「じゃあ4090勢は詰みなのか」というと、公式が用意している道はいくつかあります。

VRAMが足りないときに公式が案内している手段は、大きく4つあります。

①LTX Desktopを使う。公式のデスクトップアプリ(ベータ)は、Windows/LinuxのNVIDIA GPUでVRAM 16GB以上ならローカル生成に対応すると明記されています。ただし必要な空き容量は160GB以上、システムメモリは16GB以上(32GB推奨)。macOS(Apple Silicon)版はAPIモード専用です。

②FP8量子化を使う。コマンドラインなら fp8-cast のオプション、ComfyUIならFP8のチェックポイントを選ぶことで、メモリ使用量を下げられます。

③テキストエンコードをAPIに逃がす。ComfyUIの上級ワークフローには GemmaAPITextEncode ノードがあり、Gemma 3をローカルで動かす代わりにAPI側で処理させられます。公式はこのテキストエンコードAPIを「無料」と明記していて、その分のVRAMを生成側に回せます。

④解像度・フレーム数を落とす。ComfyUI用の低VRAMローダーや reserve-vram オプション、タイル化VAEデコードなども用意されています。ただし公式の説明でもこれらは「32GB VRAMに収める」ための仕組みとして書かれているので、24GB環境で通るかどうかまでは公式に明記されていません。

この手のモデルはVRAMがそのまま作業効率に跳ね返るので、これから機材を組む人は先に予算配分を考えたほうがいいです。編集用マシンの構成そのものは動画編集用PCおすすめ構成ガイドにまとめていますし、動画編集はMacとWindowsどっちかで迷っている人は、ローカル生成をやる前提だとこの記事の答えがけっこう変わってきます。

3. LTX-2の使い方【ComfyUI編】|導入から初回生成までの5ステップ

ComfyUIはLTX-2の公式推奨ルートです。ノードパックを入れてテンプレートを読み込み、モデルを一括ダウンロードしてプロンプトを書けば、初回生成まで到達できます。

LTX-2 使い方 ComfyUIの5ステップ図解
STEP 2〜6:ComfyUIでLTX-2を初回生成するまでの5ステップ(導入→テンプレ→モデル→設定→実行)

STEP 1:ComfyUIを入れて、LTXVideoノードを追加する

ComfyUI本体を導入したら、ComfyUI Managerから「LTXVideo」を検索してノードパックをインストールし、ComfyUIを再起動します。公式リポジトリの説明によると、LTX-2はComfyUIのコアにも組み込まれているので、追加ノードパックは「より高度な機能を使うため」の位置づけです。

手動で入れる場合は、custom_nodes ディレクトリでリポジトリをクローンして requirements.txt を入れる形になります。再起動後、キャンバスの右クリックから Add Node → LTXVideo に loaders / samplers / conditioning / utils が並んでいれば導入成功です。

STEP 2:テンプレートを読み込む

ComfyUIのTemplatesパネルで「LTX-2.3」を検索し、Text to Video か Image to Video を選びます。テンプレートは設定済みのノードグラフとして開くので、自分でノードを繋ぐ作業は要りません。

STEP 3:「Download all」でモデルを落とす

右サイドバーのWorkflow Overviewパネルを開くと、足りないモデルが一覧で出ます。「Download all」を押せば必要な5ファイル(合計およそ43GB)がComfyUI内で自動ダウンロードされます。回線次第でかなり時間がかかりますが、落とすのは最初の1回だけですよ。

手動で置く場合の配置先も公式に書かれています。チェックポイントは models/checkpoints、LoRAは models/loras、テキストエンコーダは models/text_encoders、アップスケーラは models/latent_upscale_models です。

STEP 4:プロンプトと解像度・尺を決める

Promptフィールドにシーンを書き、必要ならDuration・Frame Rate・Width・Heightを調整します。公式テンプレートの初期値は5秒・25fps・1280×720。公式ガイドでも「まずは1280×720・5秒で試して、ハードウェアが耐えるようなら上げていく」と案内されています。

STEP 5:Runを押して、2段パイプラインの動きを理解する

Runを押すと、テンプレートは自動で2段構成の処理を走らせます。公式の解説によると流れはこうです。

  • ステージ1:目標解像度の半分(初期設定なら640×360)で、映像と音声を8ステップで同時生成
  • アップスケール:空間アップスケーラで映像の潜在表現を2倍に拡大
  • ステージ2:拡大した映像を、ステージ1の音声と再結合して4ステップで精緻化

音声はステージ1で映像と一緒に作られ、そのまま最終出力まで持ち越されます。これが「同期がとれた状態で出る」という話の中身です。仕組みを知っておくと、音がおかしいときにどのステージを疑えばいいかが分かります。

つまずきポイント:解像度とフレーム数には「割り切れる数字」の制約があります。

モデルカードに明記されているのは2点。幅と高さは32で割り切れる値、フレーム数は「8の倍数+1」である必要があります。121フレームや193フレームが例として挙がっているのはこのためです。割り切れない値を入れたい場合は、−1でパディングしてから目的の解像度・フレーム数に切り出す、という手順が案内されています。秒数指定のテンプレートでは「フレーム数=秒数×フレームレート+1」で自動計算されるので、普段は意識しなくても大丈夫ですよ。

4. LTX-2の使い方【コマンドライン編】|uv syncと10種類のパイプライン

コマンドラインでのLTX-2の使い方は、リポジトリをクローンして uv sync で環境を作り、目的に合ったパイプラインモジュールを python -m で叩く流れです。

環境構築はuvで行う(pipのrequirements.txtではない)

公式READMEのQuick Startに書かれている手順は、次の数行だけです。

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --frozen
source .venv/bin/activate

ポイントは、このリポジトリがuvで管理されたモノレポ構成になっていることです。ltx-core(モデル定義と推論基盤)、ltx-pipelines(高レベルのパイプライン)、ltx-trainer(学習・ファインチューニング)の3パッケージに分かれています。

ネットで見かける「requirements.txt を入れて、ウェイト取得スクリプトを叩いて、generate.py で生成する」という手順は、現在のリポジトリには存在しません。

2026年7月29日時点の公式READMEを実際に確認すると、環境構築は uv sync、モデルはHugging Faceから個別の safetensors を落とす形になっています。ウェイト一括ダウンロード用のスクリプトも、generate.py という統一エントリポイントも用意されていません。この形の手順を載せている解説は、内容が古いか、そもそも確認されていないと判断していいと思います。手順が通らないときは、まず公式READMEを開き直してみてください。

生成コマンドの基本形

推奨の2段パイプラインを叩くコマンドは、公式のパイプライン解説にこう書かれています。

python -m ltx_pipelines.ti2vid_two_stages \
    --checkpoint-path path/to/checkpoint.safetensors \
    --distilled-lora path/to/distilled_lora.safetensors 0.8 \
    --spatial-upsampler-path path/to/upsampler.safetensors \
    --gemma-root path/to/gemma \
    --prompt "A beautiful sunset over the ocean" \
    --output-path output.mp4

見てのとおり、チェックポイント・蒸留LoRA・空間アップスケーラ・Gemmaのパスを全部自分で指定します。ここが「ダウンロードスクリプト1本で終わり」ではない理由です。オプションの全量は –help で確認できます。

10種類のパイプラインの使い分け

公式が用意しているパイプラインは10種類。MV/PVの作業を想定して並べ替えるとこうなります。

  • ti2vid_two_stages:本番品質のテキスト/画像→動画。公式が推奨としている本命
  • distilled:8ステップ+4ステップで回る最速版。案を大量に出す段階向き
  • ti2vid_two_stages_hq:同じ2段構成で res_2s サンプラーを使う版。少ないステップで品質を狙う
  • ti2vid_one_stage:単段。公式に「主に学習目的」と書かれている検証用
  • ic_lora:参照動画を使った動画→動画の変換。既存素材のルック替えに
  • keyframe_interpolation:キーフレーム画像の間を補間する
  • a2vid_two_stage:音声ファイルを与えて、それに合う映像を生成する
  • retake:既存動画の指定した時間範囲だけを作り直す
  • hdr_ic_lora:LogC3経由でリニアHDRのfloatフレームを出す。EXR書き出し前提
  • lipdub:既存の話者の口の動きと声を、新しいセリフに差し替える

個人的に面白いのは retake と hdr_ic_lora です。retakeは「1カットの中盤3秒だけ気に入らない」ときに全部作り直さずに済む機能で、公式の説明では指定した時間範囲だけを再生成し、それ以外は保持するとされています。ただし元動画のフレーム数が「8の倍数+1」で、解像度が32の倍数である必要があるという制約付きです。

公式が挙げている最適化のポイント

READMEの「Optimization Tips」には、次のような項目が並んでいます。

  • DistilledPipelineを使う:8つの固定シグマだけで回るので最速
  • FP8量子化を有効にする:fp8-cast を指定。Hopper世代でTensorRT-LLMがあるなら fp8-scaled-mm
  • xFormers(uv sync –extra xformers)やFlash Attention 3を入れる
  • 勾配推定を使って、推論ステップを40から20〜30に減らす
  • VRAMに余裕があるなら、ステージ間のメモリ解放を省いて時間を稼ぐ

FP8量子化を使うときは、環境変数 PYTORCH_CUDA_ALLOC_CONF に expandable_segments:True をセットして起動するよう公式が指定しています。ここは見落としやすいところですね。

環境の話はだいたい見えました。でも、いざプロンプトを書こうとすると手が止まるんですよね…。音声も一緒に出るって、どう書けばいいんですか?

5. LTX-2のプロンプトの書き方|映像と音声をまとめて指定する型

LTX-2のプロンプトは、箇条書きではなく「1つの流れる段落」で書くのが公式の推奨です。ショット・シーン・動作・人物・カメラ・音声の6要素を、現在形の4〜8文にまとめます。

公式が挙げる6つの要素

  • ショットを決める:狙うジャンルに合った撮影用語で、寄り引きを指定する
  • シーンを立てる:光の条件、色の傾向、質感、空気感
  • 動作を書く:始まりから終わりまで自然につながる一連の流れとして
  • 人物を定義する:年齢、髪型、服装、特徴。感情は身体的な手がかりで表現する
  • カメラの動きを指定する:どう動くかに加えて「動いた後にどう見えるか」まで書く
  • 音を描写する:環境音・音楽・話し声・歌。セリフは引用符で囲み、言語やアクセントも指定できる

特に効くのが5番目です。公式ガイドには「カメラが動いた後に被写体がどう見えるかを書くと、モデルが動きを正しく完了させやすい」と書かれています。これ、実写のカメラマンへの指示の出し方とほぼ同じ発想なんですよね。

公式が「避けたい」としている書き方

  • 内面の感情ラベル:「悲しい」「困惑している」ではなく、視覚的な手がかりで書く
  • 文字やロゴ:読める文字の生成は現状あてにならない、と公式が明言している
  • 複雑な物理現象:無秩序な動きはアーティファクトの原因になる(ダンスは問題なし)
  • シーンの詰め込みすぎ:登場人物やアクションが多いと解釈が破綻する
  • 矛盾したライティング:混ざった光の設定はシーン解釈を狂わせる

「文字やロゴはあてにならない」は、案件で使うなら押さえておきたいところです。アーティスト名やタイトルロゴを生成に含めようとすると、まず破綻します。文字は後段の編集ソフトで載せる前提で組んだほうが早いです。この辺りの分担はAI動画とAfter Effectsを組み合わせるワークフローで整理しています。

長さの目安とネガティブプロンプト

長さについては、公式リポジトリのREADMEが「200語以内に収める」、プロンプトガイドが「4〜8文の描写を1段落で」としています。テキストから作る場合は、長く詳しく書いたほうが結果が安定するとも書かれています。

ネガティブプロンプトは、ComfyUIのテンプレートに「pc game, console game, video game, cartoon, childish, ugly」が初期値として入っています。ゲーム的な質感やアニメ調に寄るのを抑えるための指定ですね。まずはそのまま使って、気になる癖が出たら足していく形でいいと思います。

なお、LTX-2のパイプラインには enhance_prompt というプロンプト自動拡張のパラメータも用意されています。英語で短く書いてしまいがちな人は、こちらを試す価値があります。

6. LTX-2をクラウドで使う導線|プレイグラウンドと従量課金の目安

GPUを用意せずにLTX-2を試すなら、公式のAPIプレイグラウンドが最短です。従量課金で、1080pなら1秒あたり0.06〜0.08ドルという単価が公式に公開されています。

LTX-2 をローカルとクラウドで使い分ける判断図解
STEP 7:LTX-2をローカルで組むかクラウドで回すかの判断軸(VRAM・本数・機密性)

まずは触るなら、公式プレイグラウンド

公式リポジトリのREADMEからリンクされているデモは、開発者コンソールのプレイグラウンド(console.ltx.video/playground)です。モデルカード側からはLTX Studioのプレイグラウンドにも導線があります。環境構築なしで出力の傾向を確かめられるので、80GBのモデルを落とす前にここで感触を掴むのは合理的です。

API課金は「出力1秒あたり」で決まる

公式の料金ページに載っている、テキスト→動画/画像→動画の単価がこちらです(いずれも生成される動画の秒数に対する課金)。

  • ltx-2-3-fast:1080p が1秒0.06ドル、1440p が0.12ドル、4K が0.24ドル
  • ltx-2-3-pro:1080p が1秒0.08ドル、1440p が0.16ドル、4K が0.32ドル
  • 音声→動画・retake・extend はいずれもpro専用で、1080p が1秒0.10ドル
  • HDRアップスケールは入力解像度で段階課金(1080pまで0.20ドル/1440pまで0.40ドル/4Kまで0.80ドル)

尺とフレームレートにも制限があります。公式のモデル対応表では、1080p・24/25fps のときだけ最長20秒まで(fastのみ)、それ以外の組み合わせは6・8・10秒という刻みです。アスペクトは16:9と9:16の両方に対応しています。

ここは素直に計算できます。1080p・fastで10秒のクリップなら1本0.6ドル。月に100本回しても60ドルです。この数字を、GPUの購入費・電気代・環境構築に使う自分の時間と並べてみると、判断はかなりはっきりしますよ。

他社の従量課金・月額プランと横並びで見たい人は、AI動画生成サービスの料金比較とVeoの料金プラン比較を合わせて読むと相場感がつかめると思います。

ひとつ注意点も。API側の旧モデル(ltx-2-fast / ltx-2-pro)は非推奨扱いになっていて、公式は8月15日での削除を告知しています。今から組むなら、最初からltx-2-3系を指定しておくのが安全です。

7. LTX-2の商用利用とライセンス|年商1,000万ドルの線引きを原文で確認

LTX-2の商用利用は「LTX-2 Community License Agreement」に従います。年間売上1,000万ドル以上の事業者は別途の有償ライセンスが要り、それ未満は使用制限つきの無償ライセンスで使えます。

ライセンス原文に書かれている線引き

公式リポジトリのLICENSEファイル(License date: January 5, 2026 と明記)を実際に読むと、第2条にこう書かれています。

  • 非独占・全世界・譲渡不可・ロイヤリティフリーの限定ライセンスが付与され、Attachment Aの制限の範囲内であれば目的を問わず利用できる
  • ただし年間売上が1,000万ドル以上の事業者(Commercial Entities)は、有償の商用利用ライセンスの取得が求められる
  • この売上のしきい値は、子会社・関連会社・共通支配下の会社を合算して判定される

個人や小規模なプロダクションであれば、金額の面では無償側に収まるケースが大半です。ただし「合算して判定する」という条項があるので、グループ会社を持つ制作会社に納品する場合などは、判定の主体が誰なのかを確認しておいたほうがいいと思います。

生成物の権利と、守るべき条件

生成物については、第5条に「本契約に定める場合を除き、ライセンサーは利用者が生成したOutputに対して権利を主張しない」と書かれています。同時に、入力した内容・生成したOutput・その後の利用について責任を負うのは利用者側だとも明記されています。

そして、意外と見落とされるのがAttachment Aの使用制限です。案件で使う立場から見て特に効いてくるのは次のあたりです。

  • 機械生成であることを明示せずに、生成した情報やコンテンツを配布してはいけない(第5項)
  • 本人の同意なく他者になりすます用途(ディープフェイク等)は禁止(第7項)
  • 軍事・兵器開発などの用途は禁止(第17項)
  • 商用利用においては、他の機械学習モデルの学習・改善に使うことは禁止(派生物として認められる場合を除く)(第18項)
  • ライセンサーの商用製品と直接競合する製品・サービスへの組み込みは、別途の商用ライセンスが要る(第20項)

再配布についても条件があります。第3条では、ライセンス全文を同梱すること、変更したファイルにその旨を明示すること、派生物(ファインチューニングしたウェイトを含む)も同じライセンスで配布することが求められています。LoRAを作って配りたい人は、ここを読み飛ばさないほうがいいですよ。

準拠法はニューヨーク州法、紛争はICC規則に基づく仲裁――という条項も入っています。僕は弁護士ではないので、本番案件で判断が必要な場面では、LICENSEの原文と専門家に当たってください。各社のAI動画サービスの商用条件をまとめて比べたい人は、AI動画の商用利用ガイドもあわせてどうぞ。

8. 【運用視点】LTX-2をMV/PV案件に組み込むなら|損益分岐と使いどころ

ここからは仕様の話ではなく、案件に組み込む立場からの判断軸です。結論を先に言うと、LTX-2のローカル運用は「機材が揃っている人の効率化」であって、入口ではありません。

最初にはっきりさせておきます。僕はLTX-2.3を自分のマシンで回した検証をしていません。なので生成時間や画質の実測は書きません。ここで書くのは、公開されている仕様を読んだうえで、MV/PVの現場にこの手のローカル生成モデルを入れるとしたら、どこで判断が分かれるかという話です。

判断軸1:VRAM 32GBという線が、実質的に何を意味するか

公式の最小要件が32GBということは、「今の作業マシンに載っている4090で片手間に試す」というシナリオが、素直には成立しないということです。ここを曖昧にしたまま構築に入ると、ダウンロードだけで一晩使って動かない、という時間の溶かし方をします。

現実的なのは、まずクラウドのプレイグラウンドで出力の質を確かめ、それからVRAM 16GB以上で動くとされているLTX Desktopを試し、そのうえでComfyUIやコマンドラインに進むという順番だと思います。いきなり80GBのフル精度一式を落とすのは、順番として無理があります。

判断軸2:クラウド課金と自前GPUの損益分岐をどう考えるか

単価から逆算すると、1080p・fastで10秒=0.6ドル。仮に月100本回して60ドル、年間で720ドルです。GPU1枚の価格と比べれば、「年間の生成本数が数百本を超えないなら、クラウドで払ったほうが総額は軽い」という結論になりやすい水準です。

ただし損益分岐に乗せるべき項目は課金額だけではありません。電気代、環境構築とトラブルシューティングに使う自分の時間、失敗生成の分、GPUの陳腐化まで含めると、自前運用のコストは見た目より重くなります。逆に、生成を大量に回すワークフローが固まっている人なら、この重さは回収できます。

判断軸3:B-roll用途としての適性と、納品尺との相性

仕様表を見るかぎり、この世代のモデルが得意なのは6〜10秒のクリップです。20秒まで伸ばせるのは1080p・24/25fpsという条件付き。これはMV/PVの構造とけっこう相性がいいんですよ。インサートのB-rollは、そもそも1カット2〜4秒で切ることが多いですから。

逆に言うと、3分半のMVを丸ごとAI生成で埋めるような使い方には向きません。10秒素材を並べて尺を埋めようとすると、ルックの揺れと繋ぎの不自然さが一気に見えてきます。あくまで「実写や既存素材の隙間を埋める道具」として設計に組み込むほうが、成果物としては安定します。

判断軸4:素材を外に出せない案件で、ローカルにどんな意味があるか

未発表楽曲、未公開のアーティストビジュアル、社内資料。「素材をクラウドに上げられない」という制約がある案件では、オープンウェイトをローカルで回せること自体に価値があります。これはクラウドAPIでは代替できない部分です。

ただし注意もあって、VRAM節約のためにテキストエンコードをAPIに逃がす設定にすると、プロンプトは外部に送信されます。公式もAPI機能を使う場合はプロンプトやメディア入力がサービス側に送られると明記しています。機密性を理由にローカルを選ぶなら、テキストエンコーダもローカルで持つ構成にする必要があります。

音声同時生成は、MVでは「主役」ではなく効果音まわりで効いてくると見ています。

MVは楽曲が主役なので、生成された音楽や歌声をそのまま使う場面はほぼありません。ただ、公式が用意している a2vid(音声から映像)や lipdub(口の動きの差し替え)を見ると、用途はむしろMV以外の領域に広いなと感じます。楽曲に合わせて映像を出す、既存インタビューのセリフを別言語に差し替える。このあたりは一般に、外注していた工程を内製に寄せられる可能性がある部分だとされています。一方で、話者の同意なきなりすましはライセンス上も明確に禁止されているので、使いどころは慎重に選ぶ必要があります。

使い分けの相手として考えるなら、クラウド側はRunway Gen-4.5の使い方やKling 3.0の使い方、オープンウェイト側の比較対象としてはWan 2.7の使い方あたりが近い位置にいます。「1つに絞る」より「用途で持ち替える」ほうが、結局は納品が速いというのが正直なところです。

だいぶ整理できました。あと細かいところで、無料で使えるのかとか、ComfyUIじゃないとダメなのかとか、そのへんが気になってて…。

9. LTX-2の使い方でよくある質問と合う人・合わない人|まとめ

最後に、LTX-2の使い方でよく出る質問に短く答えたうえで、このモデルが合う人・合わない人を整理します。判断材料としてどうぞ。

Q1. LTX-2は無料で使えますか?

ローカル実行なら、モデルのダウンロードと利用にライセンス料はかかりません。年間売上1,000万ドル未満の事業者・個人は、ロイヤリティフリーの限定ライセンスで使えます(使用制限あり)。ただしクラウドAPIでの生成は秒課金の有料です。テキストエンコードAPIだけは公式が無料と明記しています。

Q2. RTX 4090(24GB)で動きますか?

公式が示す最小要件は32GB以上なので、4090は要件を下回ります。ただし公式のLTX Desktopは「VRAM 16GB以上」でローカル生成に対応すると案内されているので、4090で試すならまずこちらが現実的な入口です。ComfyUIやコマンドラインで24GBに収める方法は、執筆時点で公式には保証されていません。

Q3. 商用利用できますか?

できます。ライセンサーは生成物に対して権利を主張しないと原文に明記されています。ただし年間売上1,000万ドル以上の事業者は有償ライセンスが要ること、機械生成であることを明示せずに配布しないこと、同意なきなりすましを行わないことなど、Attachment Aの制限は守る必要があります。判断が必要な場面ではLICENSE原文の確認をおすすめします。

Q4. ComfyUIで使えますか?

使えます。というより、公式が「ほとんどのユーザーにはComfyUIが推奨」と書いている本命ルートです。LTX-2はComfyUIのコアにも組み込まれていて、追加のノードパックをManagerから入れると、IC-LoRAやHDR、Lipdubなどのサンプルワークフローも使えるようになります。

Q5. Macでも動きますか?

ローカル生成は現状むずかしいです。公式のLTX DesktopはmacOS(Apple Silicon)版がAPIモード専用と明記されていて、ローカル生成にはWindows/LinuxのNVIDIA GPUが要ります。MacユーザーはAPI経由で使う形になります。

LTX-2の使い方が合う人・合わない人

LTX-2のローカル運用が合う人
  • VRAM 32GB以上のGPUを既に持っていて、生成を大量に回すワークフローがある人
  • 素材を外部サービスに上げられない案件を抱えている人
  • LoRAやファインチューニングで、自分のルックを学習させたい人
  • B-rollやインサートなど、6〜10秒の短いカットを量産したい人
  • retakeやlipdubのような編集寄りの機能に、具体的な使い道が見えている人
LTX-2のローカル運用が合わない人
  • GPUがVRAM 32GBに届かず、環境構築に時間を割けない人(クラウドかLTX Desktopから)
  • Macだけで制作している人(ローカル生成はWindows/LinuxのNVIDIA環境が前提)
  • 月に数本しか生成しない人(従量課金のほうが総額で軽くなりやすい)
  • ロゴや読める文字を含むカットをAIで作りたい人(公式が不得手と明記)
  • 既存のクラウドAIでワークフローが完成している人(乗り換える必然性は薄いです)
この記事のまとめ
  • LTX-2の使い方は「ComfyUI・コマンドライン・クラウド」の3ルート。現行の公開ウェイトはLTX-2.3(22B)
  • 公式の最小要件はVRAM 32GB以上・システムメモリ32GB・空き容量100GB。RTX 4090はこれを下回る
  • 環境構築は uv sync。モデルはHugging Faceから個別に落とし、フル精度一式で合計80GB近い
  • ComfyUIのテンプレートなら5ファイル約43GBで、5秒・25fps・1280×720から試せる
  • プロンプトは1段落・現在形・4〜8文。セリフは引用符、文字とロゴは避ける
  • 商用利用は年間売上1,000万ドル未満なら無償側。生成物にライセンサーは権利を主張しない

まずやることを1つに絞るなら、公式のプレイグラウンドで自分の案件に近いプロンプトを1本流してみてください。出力の傾向が自分の作風と合うかどうかは、80GBを落とす前に判断できます。そこで手応えがあってから、LTX DesktopなりComfyUIなりに進めばいいと思います。

LTX-2の使い方は、これからも仕様の更新が続くはずです。手順が通らなくなったら公式リポジトリのREADMEに戻る――このクセさえ付けておけば、たいていのことは自力で追いつけますよ。AI動画ツール全体の選び方は動画生成AIおすすめ完全ガイドにまとめているので、道具の組み合わせを考えるときはそちらもどうぞ。一緒に、使える引き出しを増やしていきましょう。

ABOUT ME
記事URLをコピーしました