論文の概要: Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
- arxiv url: http://arxiv.org/abs/2605.08808v1
- Date: Sat, 09 May 2026 08:54:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.898061
- Title: Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
- Title(参考訳): 曲率認識キャプション:3次元シーン理解のための測地的注意の継続
- Authors: Ziyao He, Yingjie Liu, ZhangYangRui, Mingsong Chen, Xuan Tang, Xian Wei,
- Abstract要約: ユークリッド埋め込み空間を適用する既存のアプローチは、きめ細かい局所幾何学的詳細を同時に保存するのに苦労している。
我々は,新しい非ユークリッド測地的注意機構を統合したtextbftextscCurvature-Aware Captioningフレームワークを提案する。
- 参考スコア(独自算出の注目度): 26.656996180165795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate 3D scene description is fundamental to robotic navigation and augmented reality, yet current dense captioning methods face significant limitations in processing sparse point cloud data. % Existing approaches that apply Euclidean embedding spaces struggle to simultaneously preserve fine-grained local geometric details and model exponentially growing global semantic hierarchies, leading to either inaccurate localization or disjointed, shallow scene descriptions. % In this work, we propose a novel \textbf{\textsc{Curvature-Aware Captioning}} framework, integrating novel non-Euclidean geodesic attention mechanisms, to resolve the localization-contextualization conflict. % Specifically, self-attention within Oblique space enforces dimensional homogeneity while establishing long-range dependencies. Bidirectional geodesic cross-attention within Lorentz space models hierarchical semantic relationships across scene instances, enabling simultaneous precision in object localization and coherence in scene descriptions. % Theoretical analysis confirms that the curvature complementarity between the Oblique manifold and Lorentz hyperboloid resolves the Euclidean-hyperbolic conflict, ensuring feature stability via isotropic optimization while preserving inherent hierarchical relationships. Extensive experiments on ScanRefer and Nr3D benchmarks demonstrate state-of-the-art performance, with significant gains in both localization accuracy and descriptive richness.
- Abstract(参考訳): 正確な3Dシーン記述は、ロボットナビゲーションと拡張現実の基礎であるが、現在の高密度キャプション法は、スパースポイントクラウドデータの処理において重大な制限に直面している。
% ユークリッド埋め込み空間を応用した既存のアプローチでは,局所的な微細な幾何学的詳細と指数関数的に成長する大域的意味階層を同時に保存することが困難であり,不正確な局所化あるいは不規則で浅いシーン記述に繋がる。
% 本稿では,非ユークリッドな測地的アテンション機構を統合し,局所化・コンテキスト化の対立を解決するための,新しい‘textbf{\textsc{Curvature-Aware Captioning}}フレームワークを提案する。
具体的には、斜め空間内の自己アテンションは、長距離依存を確立しながら次元的均一性を強制する。
ローレンツ空間内の双方向測地的交叉は、シーンインスタンス間の階層的意味関係をモデル化し、オブジェクトのローカライゼーションとシーン記述のコヒーレンスを同時に行うことができる。
%の理論的解析により、斜交多様体とローレンツ双曲体の間の曲率相補性はユークリッド-双曲的衝突を解消し、固有階層関係を保ちながら等方的最適化による特徴安定性を確保することが確認された。
ScanReferとNr3Dベンチマークの大規模な実験では、ローカライゼーションの精度と記述的リッチネスの両方において、最先端のパフォーマンスが大幅に向上した。
関連論文リスト
- Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition [6.392844932864485]
SympLocは、粗い段階における多レベルアライメントを備えた、新しい粗大な局所化フレームワークである。
既存の最先端のアプローチと比較して、Top-1リコール@10mでは19%改善されている。
論文 参考訳(メタデータ) (2026-04-02T04:13:42Z) - Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds [53.82500407523346]
PointINSは、幾何学的学習を通じてポイントクラウド表現を豊かにする、インスタンス指向の自己組織化フレームワークである。
PointINSは、屋内のインスタンスセグメンテーションで平均+3.5%のmAP改善、屋外のパン光学セグメンテーションで+4.1%のPQゲインを達成している。
論文 参考訳(メタデータ) (2026-03-26T08:31:06Z) - ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting [21.87807066521776]
3次元占有予測は、視覚中心の自律運転における総合的なシーン理解に不可欠である。
近年, 計算オーバーヘッドを低減しつつ, 3次元意味ガウスモデルを用いて占有率をモデル化する研究が進められている。
本稿では,時空間モデリングと時空間モデリングの両立を図るため,新しい時空間ガウススティング(ST-GS)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-20T06:36:30Z) - Cross-Modal Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition [9.411542547451193]
本稿では,密度に依存しない幾何学的推論により3次元位置認識を再定義するフレームワークを提案する。
具体的には、元のシーンポイント雲密度の干渉に免疫する弾性点に基づく暗黙の3次元表現を導入する。
これら2種類の情報を活用することで,鳥眼視と3Dセグメントの両視点から幾何学的情報を融合する記述子を得る。
論文 参考訳(メタデータ) (2025-06-17T07:04:07Z) - HierRelTriple: Guiding Indoor Layout Generation with Hierarchical Relationship Triplet Losses [52.70183252341687]
本稿では,空間的関係学習に着目した階層型三重項に基づく屋内関係学習手法HierRelTripleを提案する。
階層型リレーショナル三重項モデリングフレームワークであるHierRelTripleを導入する。
非条件レイアウト合成、フロアプラン条件付きレイアウト生成、シーン再構成の実験により、HierRelは空間関係のメトリクスを15%以上改善することを示した。
論文 参考訳(メタデータ) (2025-03-26T07:31:52Z) - NeuraLoc: Visual Localization in Neural Implicit Map with Dual Complementary Features [50.212836834889146]
本稿では,補完的な特徴を持つニューラル暗黙マップに基づく,効率的で斬新な視覚的局所化手法を提案する。
具体的には、幾何学的制約を強制し、ストレージ要件を小さくするために、3Dキーポイント記述子フィールドを暗黙的に学習する。
記述子の意味的あいまいさにさらに対処するために、追加の意味的文脈的特徴体を導入する。
論文 参考訳(メタデータ) (2025-03-08T08:04:27Z) - GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane [53.388937705785025]
3Dオープンボキャブラリのシーン理解は、拡張現実とロボット応用の推進に不可欠である。
GOIは2次元視覚言語基礎モデルから3次元ガウススプラッティング(3DGS)に意味的特徴を統合するフレームワークである。
提案手法では,特徴空間内の超平面分割として特徴選択処理を扱い,クエリに関連性の高い特徴のみを保持する。
論文 参考訳(メタデータ) (2024-05-27T18:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。