論文の概要: Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models
- arxiv url: http://arxiv.org/abs/2607.04500v1
- Date: Sun, 05 Jul 2026 20:58:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.950288
- Title: Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models
- Title(参考訳): ゼロラベルJEPAにおけるクロスドメイン一般化のための地理的多様性がデータ量を上回る
- Authors: Santosh Jaiswal,
- Abstract要約: 自己監督型潜在世界モデルは、人間のラベルなしでの運転シナリオにサプライズスコアを割り当てることができる。
このようなモデルは、ある地理的領域からのデータ駆動を訓練して、その複雑さの概念を、目に見えない都市やセンサの構成に一般化できるかどうかを考察する。
地理的に多様なデータに基づいてトレーニングされたモデルは、同じ量のシングルジオグラフィーデータでトレーニングされたモデルよりも大幅に一般化されていることがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-supervised latent world models can assign a surprise score to driving scenarios without any human labels. A natural follow-up question is whether such a model, trained on driving data from one geographic region, can generalize its notion of complexity to unseen cities and sensor configurations. We study this question through a controlled transfer experiment: we train JEPA-based world models on nuPlan data (Pittsburgh, Boston, Singapore) and evaluate zero-shot on held-out Argoverse 2 validation scenarios from Miami and Austin. We find that models trained on geographically diverse data generalize significantly better than models trained on equal amounts of single-geography data. In a matched-scale ablation at 63,000 scenarios per condition (n=3 seeds each), combined training reduces mean surprise score by 16.5% relative to nuPlan-only training (0.228 +/- 0.015 vs 0.273 +/- 0.008). Notably, training on 200,000 AV2-only scenarios (3x more data from one geography) still produces higher surprise (0.264) than the combined 63K model, suggesting that geographic diversity is a stronger predictor of cross-domain generalization than raw data volume.
- Abstract(参考訳): 自己監督型潜在世界モデルは、人間のラベルなしでの運転シナリオにサプライズスコアを割り当てることができる。
自然のフォローアップ問題は、そのようなモデルが、ある地理的領域からデータを駆動する訓練を受けており、その複雑さの概念を、目に見えない都市やセンサーの構成に一般化できるかどうかである。
我々は、NuPlanデータ(ピッツバーグ、ボストン、シンガポール)上でJEPAベースの世界モデルをトレーニングし、マイアミとオースチンのArgoverse 2バリデーションシナリオでゼロショットを評価する。
地理的に多様なデータに基づいてトレーニングされたモデルは、同じ量のシングルジオグラフィーデータでトレーニングされたモデルよりも大幅に一般化されていることがわかった。
条件毎の63,000シナリオ(n=3シード)でのマッチスケールアブレーションでは、組み合わせトレーニングにより平均サプライズスコアが平均16.5%減少する(0.228 +/- 0.015 vs 0.273 +/- 0.008)。
特に、20,000 AV2 のみのシナリオでのトレーニング(1つの地理からのデータの3倍)は、63K モデルと組み合わせたモデルよりも高いサプライズ(0.264)をもたらしており、地理的多様性は生データ量よりもクロスドメインの一般化の予測因子であることを示唆している。
関連論文リスト
- Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture [0.0]
モデルがラベルなしでシナリオの複雑さを自分自身で発見できるかどうかを問う。
我々は、nuPlan miniデータセットから構造化されたエージェント状態データに基づいて、最小限のJEPA(Joint Embedding Predictive Architecture)をトレーニングする。
トレーニングや評価設定の間、地道なラベルにアクセスすることなく、モデルは、保護されていないターン、横断歩道の相互作用、歩行者の近接といったシナリオに、はるかに高いスコアを割り当てる。
論文 参考訳(メタデータ) (2026-06-21T05:26:58Z) - Zero-Shot Cross-City Generalization in End-to-End Autonomous Driving: Self-Supervised versus Supervised Representations [9.18632648031395]
エンド・ツー・エンド軌道計画におけるゼロショット・クロスシティの一般化について検討する。
自己監督型視覚表現は都市間の移動を改善する。
これらの結果は、エンド・ツー・エンドの自動運転システムを評価するために必要なテストとしてゼロショットの地理的移動を確立する。
論文 参考訳(メタデータ) (2026-03-12T01:19:32Z) - Metadata Conditioned Large Language Models for Localization [25.913929585741034]
メタデータ条件付けは、領域間一般化を犠牲にすることなく、領域内性能を継続的に改善することを示す。
我々のアブレーション研究は、URLレベルのメタデータだけで地理的信号の多くをキャプチャすることを示した。
命令チューニングの後、メタデータ条件付きグローバルモデルはLLaMA-3.2-1B-インストラクトに匹敵する精度を達成する。
論文 参考訳(メタデータ) (2026-01-21T18:20:59Z) - WorldPM: Scaling Human Preference Modeling [130.23230492612214]
我々は、このスケーリングの可能性を強調するために、World Preference Modeling$ (WorldPM)を提案する。
多様なユーザコミュニティをカバーする公開フォーラムから選好データを収集する。
1.5Bから72Bパラメータの範囲で15Mスケールのデータを用いて広範囲なトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-15T17:38:37Z) - No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance [68.18779562801762]
マルチモーダルモデルは、下流の"ゼロショット"のパフォーマンスを線形改善するために、指数関数的に多くのデータを必要とする。
本研究は,大規模な訓練パラダイムの下での「ゼロショット」一般化能力の鍵となる訓練データに対する指数関数的要求を明らかにする。
論文 参考訳(メタデータ) (2024-04-04T17:58:02Z) - Evaluating the Role of Training Data Origin for Country-Scale Cropland Mapping in Data-Scarce Regions: A Case Study of Nigeria [0.6249768559720122]
重要な課題は、トレーニングデータの量、品質、およびターゲット領域への近接がモデルの性能にどのように影響するかを理解することである。
ナイジェリアでは、全国をカバーする1,827のラベル付きサンプルとGeowikiデータセットのサブセットを用いて、これを評価した。
その結果,局所データにより精度が0.246 (RF) と0.178 (LSTM) に向上した。
論文 参考訳(メタデータ) (2023-12-18T01:23:22Z) - Dataset Cartography: Mapping and Diagnosing Datasets with Training
Dynamics [118.75207687144817]
我々はデータセットを特徴付け、診断するモデルベースのツールであるData Mapsを紹介した。
私たちは、トレーニング中の個々のインスタンス上でのモデルの振る舞いという、ほとんど無視された情報のソースを活用しています。
以上の結果から,データ量から品質へのフォーカスの変化は,ロバストなモデルとアウト・オブ・ディストリビューションの一般化に繋がる可能性が示唆された。
論文 参考訳(メタデータ) (2020-09-22T20:19:41Z) - Think Locally, Act Globally: Federated Learning with Local and Global
Representations [92.68484710504666]
フェデレートラーニング(Federated Learning)とは、複数のデバイスに分散したプライベートデータ上でモデルをトレーニングする手法である。
本稿では,各デバイス上でコンパクトな局所表現を共同で学習する新しいフェデレーション学習アルゴリズムを提案する。
また、プライバシが鍵となる実世界のモバイルデータから、パーソナライズされた気分予測のタスクを評価する。
論文 参考訳(メタデータ) (2020-01-06T12:40:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。