自動運転ウォッチ

arXiv の自動運転研究の全数カバー/要約

AutoVLA: 適応的推論と強化学習微調整を備えたエンドツーエンド自動運転のためのVision-Language-Action(VLA)モデル

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

アブストのみエンドツーエンドVLA基盤モデル計画

Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhouほか / arXiv:2506.13757PDF

2025-06-16 投稿・2025-11-05 改訂

AI がアブストラクトのみで生成(2026-08-05)

1分まとめ

AutoVLAは、推論と軌跡生成を単一の自己回帰生成モデルに統合したVLAモデルである。複数ベンチマークで競争力のある性能を示したと主張しているが、アブストラクトには数値がない。

  • 連続軌跡を離散トークン化して言語モデルに統合する方式を採用している。
  • 教師付き微調整で軌跡のみの高速思考とチェーンオブソート推論付きの低速思考を学習する。
  • GRPOによる強化学習微調整で単純場面の不要な推論を削減したと主張している。
  • nuPlan、nuScenes、Waymo、CARLAの4データセットでオープンループとクローズドループの両方を評価したが、アブストラクトに数値は無い。
  • VLAの設計選択肢として、軌跡トークン化と思考モード切替を整理した点に参考価値がある。

課題

既存のVLAモデルは、物理的に実行不能な行動出力、複雑なモデル構造、不必要に長い推論を引き起こすことがある。AutoVLAは、推論と行動生成を単一の自己回帰生成に統一することでこれらの問題に対処する。

提案手法

生の視覚入力と言語指示から直接、意味推論と軌跡計画を行う。連続軌跡を離散化してトークン化し、言語モデルに統合する。教師付き微調整により、軌跡のみの高速思考と、チェーンオブソート推論を付加した低速思考の2モードを学習する。さらにGRPOに基づく強化学習微調整を導入し、単純な場面での不要な推論を減らす。

評価と結果

評価はnuPlan、nuScenes、Waymo、CARLAの実世界・シミュレーションデータセットとベンチマークで、オープンループとクローズドループの両設定で実施されている。アブストラクトは「競争力のある性能」と述べるが、具体的な数値は記載されておらず、本要約では定量結果を報告できない。

新規性

新規性は、推論と軌跡生成を単一の自己回帰生成モデルに統合し、連続軌跡を離散トークン化して言語モデルに組み込んだ点と、高速思考・低速思考の2モードとGRPOによる強化学習微調整を組み合わせた点にある。

限界

著者による明記なし。アブストラクトのみを参照したため、実車評価かどうか、計算コスト、ベースラインとの比較条件は不明である。公開されたデータセットとベンチマーク(nuPlan、nuScenes、Waymo、CARLA)は2025年時点でも広く使われているが、本論文の数値が後続研究で追試されたかは本要約の範囲では検証できない。

産業へのインパクト

日本の自動車メーカー・サプライヤーにとって、VLAの設計パターンとして参考になる。軌跡をトークン化して言語モデルに組み込む方式、高速思考と低速思考の切り替え、GRPOによる微調整は、エンドツーエンド自動運転の実装選択肢を広げた。ただし、本論文だけでは実車搭載への道筋や安全性保証は示されておらず、直接の実装影響は限定的である。

← 一覧に戻る