自動運転ウォッチ

arXiv の自動運転研究の全数カバー/要約

GAIA-2: 自動運転のための制御可能なマルチビュー生成世界モデル

GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving

本文精読世界モデル生成・再構成シミュレーション

Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Araniほか / arXiv:2503.20523PDF

2025-03-26 投稿

AI が本文を読んで生成(2026-08-04)

1分まとめ

Wayve が、最大5カメラ・448×960解像度の映像を条件付き生成できる潜在拡散型世界モデル GAIA-2 を提案した。ego 行動・3Dバウンディングボックス・メタデータ・CLIP埋め込みなどを条件とし、スクラッチ生成・文脈予測・インペインティング・シーン編集に対応する。

  • GAIA-2は、最大5カメラ・448×960のマルチビュー映像を、ego行動・3Dバウンディングボックス・道路メタデータ・CLIP埋め込みなどの条件付きで生成できる潜在拡散型世界モデルである。
  • 世界モデルは8.4Bパラメータの時空間分解トランスフォーマーで、flow matching により学習され、約2500万シーケンス(各2秒・UK/US/ドイツ)で訓練されている。
  • 定量的評価は、FDD・FID・FVMD・条件付けした3DボックスとOneFormerセグメンテーションのクラス別IoUで行われ、検証ロスが人間の知覚品質と最もよく相関したと報告されている。
  • 評価はn=1024サンプルのスクラッチ生成タスクのみで、既存手法との直接比較やクローズドループ評価は論文内に存在しない。
  • 本手法は、当時は別々だったマルチカメラ一貫性・エージェント制御・環境条件制御を単一フレームワークに統合した点で標準的となり、自動運転向け生成世界モデルの設計の土台を提供した。

課題

自動運転のシミュレーションには、ego車両の行動、他交通参加者の位置・動き・相互作用、天候・時刻・道路構造などの環境条件、マルチカメラ映像の時空間一貫性といった領域固有の条件を細かく制御できる映像生成が求められる。既存のテキスト-to-ビデオや画像-to-ビデオモデルは視覚的リアリズムと時間的一貫性に焦点を当てており、こうした構造化制御を満たさない。自動運転向けの先行手法も、制御できる条件の種類が限定的、マルチカメラ非対応、時空間一貫性が不十分など、要件の一部しか満たしていなかった。

提案手法

GAIA-2は、ビデオトークナイザーと潜在世界モデルからなる。ビデオトークナイザーは、空間32倍・時間8倍の圧縮率で映像を連続潜在表現に変換する。潜在チャネル次元は64で、総圧縮率は約384倍(24フレーム・448×960・3チャネルを3×14×30×64に圧縮)。エンコーダは85M、デコーダは200Mパラメータで、DINO v2蒸留・KL損失・L1/L2/LPIPS損失で訓練され、さらにGAN損失でデコーダがファインチューニングされる。世界モデルは8.4Bパラメータの時空間分解トランスフォーマー(22ブロック、隠れ次元4096、32ヘッド)で、flow matching により訓練される。条件付けは、actionは adaptive layer norm、カメラジオメトリとタイムスタンプは加算、その他の変数は cross-attention で統合される。ego actionは速度と曲率を symlog 変換したもの、動的エージェントは3Dバウンディングボックスを2D平面に投影した特徴量(クラス・位置・向き・寸法など)で、特徴量ドロップアウトとインスタンスレベルのドロップアウトを適用する。メタデータとして国・天候・時刻・制限速度・レーン種別・横断歩道・信号・交差点形状などを条件にできる。さらに、CLIP埋め込みと自社運転モデル由来のシナリオ埋め込みにも対応する。訓練は、スクラッチ生成70%・文脈予測20%・空間インペインティング10%の割合で行われ、各条件変数は80%の確率で独立にドロップされる。

評価と結果

評価は、スクラッチ生成タスクでn=1024サンプルを用いて行われた。指標は、FDD(DINOv2 ViT-L/14、入力は448×952にバイリニアリサイズ)、FID(InceptionV3、299×299)、FVMD、および条件とした3DバウンディングボックスとOneFormerによるセグメンテーションマスクのクラス別IoUである。論文のFigure 13に訓練過程の指標の推移が示されているが、数値の明示的な記載は本文にない。既存手法との定量的比較は行われていない。著者らは、検証ロスが人間の知覚品質と最もよく相関し、全指標が訓練を通じて正の傾向を示したと報告している。

新規性

既存の自動運転向け生成モデルが単一カメラや限定された条件付けしか扱えなかったのに対し、マルチカメラ(最大5視点)・ego行動・動的エージェント(3Dボックス)・環境メタデータ・CLIP/シナリオ埋め込みを単一の潜在拡散モデルで統一的に扱えるようにした点が新規性である。

限界

著者らは、長いホライズンや複雑なシナリオで時間的・意味的に不整合が生じることがあると明記している。また、リアルタイム合成は依然として計算集約的であると述べている。論文には数値による定量的結果の詳細がなく、定性的な例示と傾向のみが示されている。既存手法(DriveDreamer、Drive-WM、UniMLVG、Vistaなど)との直接比較は行われていない。評価はスクラッチ生成タスクのみで、クローズドループの運転評価や下流タスクでの効果は検証されていない。データセットはWayveの内部データであり公開されておらず、再現・第三者検証が困難である。モデル自体も公開されていない。

産業へのインパクト

GAIA-2は、自動運転向け生成世界モデルにおいて、マルチカメラ一貫性・エージェントレベルの制御・多様な条件付けを単一の潜在拡散フレームワークに統合した最初期の大規模モデルの一つである。後続の多くの研究が、マルチビュー生成・3Dボックス条件付け・フローマッチングなどの構成を採用しており、この分野の標準的な設計の土台を提供した。一方で、評価が定性的で数値が乏しいことや、内部データ・非公開モデルによる結果であることは、その後の研究が公開データセットでの定量的比較を重視する流れにつながった。現在ではマルチビュー世界モデルは自動運転研究の標準的なトピックとなっているが、GAIA-2自身の評価手法(FDD・FVMDなど)は広く普及したとは言えない。

← 一覧に戻る