5Hzで考え、20Hzで動く:閉ループ運転のための非同期Fast-Slow Vision-Language-Action推論
1分まとめ
凍結した7B VLMを低頻度の文脈提供器とし、軽量な337Mアクション専門家が毎シミュレーションチックでKVキャッシュと最新フレームに注意を払ってウェイポイントを回帰する非同期構成を提案した。CARLAのLangAuto-Shortでルート完了率を37.0から94.0へ引き上げ、1チックあたりのモデルコストは32msで履歴長に依存しない。
- 凍結した7BのVision-Language-Action(VLA)バックボーンを低頻度の文脈提供器として使い、337Mパラメータのアクション専門家が毎チックでKVキャッシュと現在フレームに注意を向けてウェイポイントを回帰する非同期Fast-Slow構成を提案した。
- CARLA LangAuto-Short(town05、32ルート)で、フレームスキップするLMDriveベースラインのルート完了率37.0を94.0へ、運転スコアを28.8から32.9へ改善した。
- フレームスキップ棄却実験によると、運転スコアの改善は専門家自体に由来し、ルート完了率82.1→94.0と赤信号違反の約3分の1削減は毎チックの新鮮な制御に由来する。
- 評価はCARLAシミュレーションのみで、1構成あたりの実行回数は2回(フレームスキップ棄却と転移は各1回)であり、実車や実データでの評価はない。
- 1チックあたりのモデルコストは32msで履歴長に依存せず、RTX 3090 Tiで20Hz制御を実現したと報告している。
課題
大規模言語モデルを搭載したエンドツーエンド運転エージェントは指示追従とシーン推論を可能にするが、7B規模のモデルの推論レイテンシは車両が要求する制御レート(20Hz)に間に合わない。既存の閉ループエージェントはモデルを1チックおきに呼び出し、間に前回のコマンドを再送することでこのギャップを隠しており、制御出力の半分が最新の観測を無視している。
提案手法
LMDriveをベースに、凍結したLLaMA-7Bバックボーンを「遅いシステム」として、K=4チックごとにインクリメンタルな前方計算でKVキャッシュに4トークンを追加する。アクション専門家(337Mパラメータ、32層、d=512)は「速いシステム」として毎チック動作し、バックボーンの各層のKVキャッシュと現在フレームの視覚トークンにクロスアテンションして、5つのウェイポイントを回帰する。バックボーンは専門家のトークンに注意を払わないため、キャッシュは専門家非依存で再利用できる。学習時はランダム化されたステイルネス(δ)でバックボーンに与える履歴を切り詰め、非同期実行の分布に合わせる。
評価と結果
CARLA 0.9.10のLangAuto-Short town05(32ルート)で評価。ベースラインLMDrive(フレームスキップ、10Hz)はDS=28.8±0.8、RC=37.0±0.4、IS=0.80±0.04。提案法(20Hz)はDS=32.9±0.7、RC=94.0±2.6、IS=0.37±0.02。同じ専門家を10Hzでフレームスキップした棄却実験はDS=34.0、RC=82.1、IS=0.45。オープンループのウェイポイントL1誤差は、バックボーン自身のアクションヘッドの0.123から0.031(δ=0のみでは0.037)へ改善。ゼロショット転移ではtown01でRC=84.3、town02でRC=94.4(ベースラインはそれぞれ40.5、30.7)。モデルレイテンシは履歴長10〜100フレームで一定(32ms)で、ベースラインの89〜169msを下回る。ただし、エンドツーエンドのエージェントステップ中央値は58msで、20Hzの50ms予算をわずかに超え、CARLA同期モードでは壁時計レートは約17Hz。
LangAuto-Short town05(32ルート)での閉ループ評価結果
| 手法 | 制御レート | DS | RC | IS |
|---|---|---|---|---|
| LMDrive(フレームスキップ) | 10Hz | 28.8±0.8 | 37.0±0.4 | 0.80±0.04 |
| FastSlow-LMDrive(フレームスキップ棄却) | 10Hz | 34.0 | 82.1 | 0.45 |
| FastSlow-LMDrive(提案) | 20Hz | 32.9±0.7 | 94.0±2.6 | 0.37±0.02 |
オープンループ検証ウェイポイントL1誤差(m、δ=0同期プロトコル)
学習エポックごとの検証ウェイポイントL1誤差(m)
モデルレイテンシの履歴長依存性(ms)
新規性
既存のDriveVLA-W0の非対称アテンションを非同期実行に拡張し、バックボーンのKVキャッシュを専門家が共有する「速いシステム」として使う点と、ランダム化ステイルネス学習を導入した点が新規性である。
限界
著者による明記あり。CARLAシミュレーションのみで、単一の町(town05)の短いルートで学習。長距離ルート(town03)では危険交渉が転移せず、運転スコアは2.96と低い。ルート完了率の向上に伴い、1kmあたりの車両衝突が3.2から11.2に増加。低レベルPIDコントローラは低速ベースライン用に調整されたものを再利用。主要比較は各構成2回実行、フレームスキップ棄却と転移は各1回実行で、DSの実行間ばらつきは最大1.6。エンドツーエンドのステップ時間58msは20Hz予算を超えており、CARLAの同期モードでの実行レートは約17Hzで、実際の20Hz制御はシミュレータのチック境界で成立している。
産業へのインパクト
日本の自動車メーカー・サプライヤーにとって、VLAバックボーンの推論コストを制御レートから切り離す設計は、車載GPUで20Hz制御を維持しながら言語指示追従を得る現実的な選択肢を示す。ただし、フレームレート不足、シミュレーションのみの検証、安全検証の欠如があり、実車適用には追加の安全対策と実データでの検証が必要である。