論文の概要: Multi-Scale Semantic Mapping in Urban Environments via Observation Calibration and Policy Dependence Regularization
- arxiv url: http://arxiv.org/abs/2609.34833v1
- Date: Mon, 28 Sep 2026 10:26:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:25:53.355173
- Title: Multi-Scale Semantic Mapping in Urban Environments via Observation Calibration and Policy Dependence Regularization
- Title(参考訳): 観測校正と政策依存規則化による都市環境のマルチスケールセマンティックマッピング
- Abstract要約: 本稿では,現実的な都市レイアウト,高忠実度レンダリング,インスタンスレベルのアノテーションを特徴とする大規模都市セマンティックマッピングデータセットを提案する。
対象のカテゴリや視線距離に応じて、信頼できない観測を識別し、緩和するカテゴリ対応適度校正ポリシーを提案する。
- 参考スコア(独自算出の注目度): 8.45578356073474
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Semantic mapping is fundamental to embodied navigation, yet existing methods are developed for indoor environments, where objects exhibit relatively limited scale variation and are observed from a restricted range of viewpoints. Urban environments pose substantially greater challenges: agents must map objects ranging from pedestrians to buildings while navigating large spaces with highly diverse viewing distances. These conditions introduce two key difficulties that existing datasets and methods fail to cover. First, object scale and observation distance can be severely mismatched. For example, small objects may be viewed from far away, whereas large objects may be observed at extremely close range, resulting in unreliable observation likelihoods. Second, objects with substantially different sizes and geometries require distinct mapping behaviors, which are difficult to capture with a single shared value estimator. To investigate these challenges, we introduce a large-scale urban semantic mapping dataset featuring realistic city layouts, high-fidelity rendering, and instance-level annotations spanning multiple object scales. We then propose a category-aware likelihood calibration policy that identifies and alleviates unreliable observations according to object category and viewing distance. Because the calibration and motion policies are optimized toward the same mapping objective, they may learn redundant shortcuts and become excessively coupled. We therefore introduce a mutual-information (MI) regularizer that penalizes their estimated representation dependence and encourages complementary behaviors. To better model heterogeneous mapping strategies across object scales, we further employ category-wise value estimators. We formulate their joint optimization as a Pareto optimization problem to mitigate conflicting gradients across categories.
- Abstract(参考訳): セマンティックマッピングはナビゲーションの具体化に基本的だが、既存の手法は室内環境向けに開発されており、オブジェクトは比較的限られたスケールの変動を示し、限られた範囲の視点で観察される。
エージェントは歩行者から建物までの範囲のオブジェクトをマッピングし、非常に多様な視野で大きな空間をナビゲートしなければならない。
これらの条件は、既存のデータセットとメソッドがカバーできない2つの重要な困難をもたらす。
第一に、物体のスケールと観測距離を著しくミスマッチさせることができる。
例えば、小さな物体は遠くから見ることができ、大きな物体は極めて近い範囲で見ることができ、信頼性の低い観測可能性をもたらす。
第二に、大きく異なるオブジェクトとジオメトリを持つオブジェクトは異なるマッピングの振る舞いを必要とし、単一の共有値推定器でキャプチャすることは困難である。
これらの課題を解明するために、現実的な都市レイアウト、高忠実度レンダリング、複数のオブジェクトスケールにまたがるインスタンスレベルのアノテーションを特徴とする大規模都市セマンティックマッピングデータセットを提案する。
そこで我々は,物体のカテゴリや視線距離に応じて,信頼できない観測を識別し,緩和するカテゴリ対応適度校正政策を提案する。
キャリブレーションとモーションポリシは同じマッピング目標に最適化されているため、冗長なショートカットを学習し、過度に結合する可能性がある。
そこで我々は, 相互情報レギュレータ (MI) を導入し, それらの推定表現依存を罰し, 相補的行動を奨励する。
オブジェクトスケール間の異種マッピング戦略をより良くモデル化するために、カテゴリワイドな値推定器を用いる。
パレート最適化問題としてそれらの共同最適化を定式化し、カテゴリ間の矛盾する勾配を緩和する。
関連論文リスト
- SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios [20.644620102405856]
SA-Homoは、新しいスケール適応型ホモグラフィー推定フレームワークである。
幅広いスケールの差分比で頑健なアライメントを実現する。
実験により、SA-Homoは8$times$スケールの不一致でも高い精度を維持していることが示された。
論文 参考訳(メタデータ) (2026-06-29T14:51:53Z) - Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning [22.665947623978]
オブジェクトセマンティクスによって導かれる2段階の視線推定フレームワークを提案する。
提案手法は, パラメータサイズ7.1Mを維持しながら, 全ベンチマークで高い性能を実現する。
論文 参考訳(メタデータ) (2026-06-28T11:02:21Z) - Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives [72.63181031215858]
そこで本研究では,ゼロショットフロアプランのローカライズ手法を提案する。
我々の重要な洞察は、支配的な幾何学的プリミティブが人間が作った環境でユビキタスであることである。
シミュレーションと実世界の両方のデータセットの実験により、我々のアプローチは、目に見えない環境における最先端の学習ベースの手法よりも優れています。
論文 参考訳(メタデータ) (2026-06-03T12:14:24Z) - Instance-Adaptive Keypoint Learning with Local-to-Global Geometric Aggregation for Category-Level Object Pose Estimation [19.117822086210513]
カテゴリレベルのオブジェクトのポーズ推定は、事前に定義されたカテゴリから未確認のインスタンスの6Dのポーズとサイズを予測することを目的としている。
Instance-Adaptive Keypoint Learningを可能にする新しいカテゴリレベルのオブジェクトポーズ推定フレームワークであるINKL-Poseを提案する。
CAMERA25、REAL275、HouseCat6Dの実験では、INKL-Poseは16.7Mパラメータで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-04-21T14:37:37Z) - UrbanSAM: Learning Invariance-Inspired Adapters for Segment Anything Models in Urban Construction [51.54946346023673]
都市形態は本質的に複雑で、様々な形状と様々なスケールの不規則な物体がある。
Segment Anything Model (SAM) は複雑なシーンのセグメンテーションにおいて大きな可能性を示している。
本研究では,複雑な都市環境の分析に特化して設計されたSAMのカスタマイズ版であるUrbanSAMを提案する。
論文 参考訳(メタデータ) (2025-02-21T04:25:19Z) - Imagining the Unseen: Generative Location Modeling for Object Placement [49.71690795831461]
対象物に対する可塑性境界ボックスの予測を学習する生成的位置モデルを開発する。
我々のアプローチはまずイメージとターゲットオブジェクトクラスをトークン化し、次に自動回帰変換器を通して境界ボックス座標をデコードする。
実験により,OPAデータセットの配置精度が向上することが確認された。
論文 参考訳(メタデータ) (2024-10-17T14:00:41Z) - Disentangled Representation Learning with the Gromov-Monge Gap [65.73194652234848]
乱れのないデータから歪んだ表現を学習することは、機械学習における根本的な課題である。
本稿では,2次最適輸送に基づく非交叉表現学習手法を提案する。
提案手法の有効性を4つの標準ベンチマークで示す。
論文 参考訳(メタデータ) (2024-07-10T16:51:32Z) - Zoom In and Out: A Mixed-scale Triplet Network for Camouflaged Object
Detection [0.0]
本稿では,不明瞭な画像を観察する際の人間の動作を模倣する混合スケール三重項ネットワークbf ZoomNetを提案する。
具体的には、ZoomNetは、ズーム戦略を用いて、設計されたスケール統合ユニットと階層的な混合スケールユニットによって、差別的な混合スケール意味学を学ぶ。
提案したタスクフレンドリなモデルは、4つの公開データセット上の既存の23の最先端手法を一貫して上回っている。
論文 参考訳(メタデータ) (2022-03-05T09:13:52Z) - Improving Few-shot Learning by Spatially-aware Matching and
CrossTransformer [116.46533207849619]
数ショット学習シナリオにおけるスケールと位置ミスマッチの影響について検討する。
本稿では,複数のスケールや場所のマッチングを効果的に行うための,空間認識型マッチング手法を提案する。
論文 参考訳(メタデータ) (2020-01-06T14:10:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。