自動運転ウォッチ

arXiv の自動運転研究の全数カバー/要約

GaussianSeed: 高解像度3D占有(オキュパンシー)予測のための階層的ガウスシーディング

GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction

本文精読占有認識データセット

Xinzhuo Li, Xianghui Pan, Jiayuan Du, Wei Wei, Liuyi Wang, Chengju Liuほか / arXiv:2607.20071PDF

2026-07-22 投稿・2026-07-27 改訂

AI が本文を読んで生成(2026-08-05)

1分まとめ

カメラのみの3D占有(オキュパンシー)予測を、粗密の階層をなすガウスプリミティブの段階的生成として解くGaussianSeedを提案し、0.1m解像度の独自データセットTJScenesで先行スパース手法OPUSを上回るmIoU 12.37%(OPUSは7.87%)を報告している。Occ3D-nuScenesではスパース手法中最良のmIoU 34.12%と全評価手法中最短のレイテンシ41.2msを同時に達成した。

  • カメラのみの占有(オキュパンシー)予測を、粗密階層をなす3Dガウスプリミティブの段階的生成として定式化し、0.1m解像度へスケール可能なGaussianSeedを提案した。
  • Occ3D-nuScenesでスパース手法中最良のmIoU 34.12%と最短のレイテンシ41.2msを達成した(比較対象のOPUSは33.27%/45.1ms)。
  • 新規構築した0.1m解像度データセットTJScenesではmIoU 12.37%を記録し、OPUSの7.87%を上回った。
  • ただしOcc3D-nuScenesの絶対精度はdense手法最良のALOcc 47.50%を下回り、精度だけを見ればdense手法が優位である。
  • TJScenesの比較対象はOPUSのみで、他手法はメモリ超過や初期化の制約で除外されており、第三者の追試も未公表である。

課題

既存のカメラベース3D占有(オキュパンシー)予測は密な3Dボクセル特徴が主流で、解像度を上げるほど計算量とメモリが急増し、0.1m級の精細な幾何推定にはスケールしない。スパース化の試みも、階層的ボクセル枝刈りは初期段階の誤削除が不可逆であり、点集合回帰は必要点数が解像度の3乗で増えるため、高解像度と効率の両立に至っていない。さらに既存ベンチマークは0.4m〜0.2m解像度で縁石などの細部を評価できず、公道中心でオフロード場景が乏しい。

提案手法

GaussianSeedは、多視点画像から3Dガウスプリミティブの集合を予測し、微分可能なボリュームレンダリングで占有格子O∈R^{X×Y×Z×C}へ変換する。各ガウスは平均・スケール・回転クォータニオン・不透明度・セマンティックロジットでパラメータ化され、ボクセルへの寄与はガウス密度の重ね合わせとして計算する。構成は3要素。(i) RBGI(Regression-Based Gaussian Initialization): デコーダ各層のクエリがクロスアテンションで座標オフセットを直接回帰し、双方向チャンファー距離損失でガウス中心をボクセルクラスタ中心へ拘束する。深さ事前やLiDARに依存しない。(ii) HGSD(Hierarchical Gaussian Seed Devolution): 各クエリは1個のガウスから始まり、層が進むごとに親ガウスの平均位置a^{l-1}をアンカーとし、学習オフセットΔmで子ガウスへ分裂する。早期層が大域的構造、後期層が局所詳細を担当する。(iii) GSPE(Gaussian Seed Parameter Encoder): 前層のガウス属性とセマンティクスを3層MLPで符号化し、次層のクエリ埋め込みに残差接続で注入する。各層の出力は独立にレンダリングして密な占有ラベルで監視する。損失はNLL・Lovász・BCE・チャンファー距離の重み付き和。バックボーンはResNet-50、入力は704×256、現在フレーム+過去7フレームの計8フレームを用いる。

評価と結果

評価設定: Occ3D-nuScenes(0.4m解像度)と、新規構築したTJScenes(0.1m解像度、6カメラ・7シーン・27911サンプル、計測範囲±20m×±20m×−2m〜4.4m)。指標はmIoU。レイテンシはNVIDIA L40 GPU単体で計測。Occ3D-nuScenes(論文Table 1)では、スパース手法のSparseOcc 30.60%/80.2ms、GaussianFormer 32.10%/218.7ms、OPUS 33.27%/45.1msに対し、GaussianSeedは34.12%/41.2msで、スパース手法中の最高mIoUと全評価手法中最短レイテンシを同時に達成した。ただしdense手法ではALOccが47.50%/77.3msと最高精度で、絶対精度ではdense手法が上回る。TJScenes(論文Table 2)では、0.1m解像度でOPUS(800クエリ)がmIoU 7.87%・動的クラス平均mIoU_D 5.37%・メモリ1168.01MB・97.8msに対し、GaussianSeedはmIoU 12.37%・mIoU_D 7.60%・メモリ931.93MB・66.7ms。dense手法はメモリ超過で比較不能、GaussianFormerは0.1mグリッドでメモリ爆発、GaussianFormer-2は初期化パイプラインの特化により除外された。アブレーション(Table 3)ではHGSDとGSPEの両方で最良(Occ3D 34.12%・TJScenes 12.36%)。ガウス数の検討(Table 4)ではクエリ800・総ガウス数28800で最良34.12%となり、600クエリでも33.71%と同設定のOPUS(33.27%)を上回った。

TJScenes(0.1m解像度)での比較

手法mIoU (%)mIoU_D (%)メモリ (MB)レイテンシ (ms)
OPUS (N=800)7.875.371168.0197.8
GaussianSeed (提案)12.377.60931.9366.7
出典: 論文Table 2。mIoU_Dは動的クラス(歩行者・車・自転車・二輪車・バス・トラック)の平均。dense手法はメモリ超過のため除外、GaussianFormerは0.1mグリッドでメモリ爆発、GaussianFormer-2は初期化パイプラインの制約で比較不能。レイテンシはNVIDIA L40 GPU上で計測。

Occ3D-nuScenesにおけるスパース手法のmIoU

2829.7531.533.2535SparseOccSparseOcc: 30.630.6OPUSOPUS: 33.2733.27GaussianFormerGaussianFormer: 32.132.1GaussianSeedGaussianSeed: 34.1234.12
出典: 論文Table 1。スパース手法のみを抽出。dense手法はALOccが47.50%と最良。

Occ3D-nuScenesにおけるスパース手法のレイテンシ

062.5125187.5250SparseOccSparseOcc: 80.280.2OPUSOPUS: 45.145.1GaussianFormerGaussianFormer: 218.7218.7GaussianSeedGaussianSeed: 41.241.2
出典: 論文Table 1。NVIDIA L40 GPU単体での計測。dense手法はALOcc 77.3msを除き100ms超。

TJScenes(0.1m解像度)のmIoU比較

03.757.511.2515OPUSOPUS: 7.877.87GaussianSeedGaussianSeed: 12.3712.37
出典: 論文Table 2。比較相手はOPUSのみ。dense手法はメモリ超過、GaussianFormer系は初期化の制約で除外。

新規性

ガウスプリミティブをデコーダ層をまたいで粗密階層として分裂生成するHGSDと、深さ事前を必要としない回帰ベース初期化RBGI、前層パラメータを次層へ継承するGSPEの組み合わせ。GaussianFormer系列のガウス表現を基盤とするため表現自体は既存の延長だが、階層化とクロス層継承を加えた構成が新規性の中核である。

限界

著者による明記なし。論文から読み取れる制約は次の通り。Occ3D-nuScenesのmIoU 34.12%はdense手法最良のALOcc 47.50%を大きく下回り、「最良」の主張はスパース手法に限定される。TJScenesの比較対象はOPUSのみで、0.1m解像度での優位性は単一の競合相手に対する結果である。TJScenesは著者らが構築したデータセットであり、公開ベンチマークとしての第三者評価は未公表。実装詳細では入力解像度を704×256と記す一方、Table 1では256×704と記載されており表記揺れがある。「リアルタイム」の根拠はL40 GPU単体での計測で、車載計算環境での実測ではない。動的オブジェクトにゴースト状のアーティファクトが生じることが著者自身の可視化で示されている。

産業へのインパクト

日本の自動車メーカー・サプライヤーにとって、カメラのみで0.1m解像度の占有(オキュパンシー)予測を約41ms(L40 GPU上)で実行できる枠組みは、駐車・バレーパーキングや低速ロボティクス用途で実装余地がある。ただし公道シーンではdense手法に精度で劣り、比較相手の少ない独自データセット上の結果であるため、採用判断には自社データでの再評価が必要。直接の実装影響は限定的で、階層的ガウス表現という設計思想を自社パイプラインに取り入れる際の参考になると言える。

← 一覧に戻る