論文の概要: AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning
- arxiv url: http://arxiv.org/abs/2608.20720v1
- Date: Fri, 21 Aug 2026 03:55:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.373033
- Title: AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning
- Title(参考訳): AffordAny:オープンワールド3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning
- Abstract要約: オープンワールドの3Dサプライズグラウンドでは、3D自由形式のクエリでローカルな関数オブジェクト部品が必要となる。
AffordAnyは、大規模テキスト条件の3D部分監視を構築するためのエンドツーエンドフレームワークである。
また、擬似ラベルによる自己学習により、オープンワールドの一般化も改善する。
- 参考スコア(独自算出の注目度): 32.98412842810076
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-world 3D affordance grounding requires localizing functional object parts in 3D given free-form language queries. Existing methods typically assume pre-built object-centric 3D geometry and closed affordance ontologies, limiting deployment from raw RGB observations. We present AffordAny, an end-to-end framework that uses one monocular RGB image to construct large-scale text-conditioned 3D part supervision, ground affordances with a frozen vision-language model (VLM) guided decoder, and improve open-world generalization through pseudo-label self-training. Our automated pipeline produces a benchmark of 5,334 objects and 10,633 part-level samples spanning 473 categories, an order-of-magnitude increase in categorical diversity over prior work. The decoder progressively fuses frozen Cosmos-2B features with 3D geometry through spatial projection, instruction-conditioned semantic compression, and bidirectional geometry-semantics interaction. Minimal-perturbation pseudo-label self-training further adds new objects without human annotation. Under a systematic generalization protocol evaluating unseen objects, unseen categories, and unseen instruction paraphrases, our approach achieves 0.428 IoU on unseen objects and 0.315 IoU on unseen categories after self-training, with unseen-category mIoU improving by 6.3% relative (p<0.01) and an instruction sensitivity gap of only 0.105, demonstrating effectiveness and robustness of our method.
- Abstract(参考訳): オープンワールドの3Dアプライアンスグラウンドでは、3D自由形式の言語クエリに関数オブジェクト部品をローカライズする必要がある。
既存の方法は、通常、構築済みのオブジェクト中心の3D幾何学とクローズド・アベイランス・オントロジーを仮定し、生のRGB観測から展開を制限する。
AffordAnyは、1つの単眼RGB画像を用いて大規模テキストコンディショニング3D部分監視を構築し、凍結視覚言語モデル(VLM)誘導デコーダによる土地割当を行い、擬似ラベル自己学習によるオープンワールドの一般化を向上するエンドツーエンドフレームワークである。
自動パイプラインは473のカテゴリにまたがる5,334のオブジェクトと10,633の部分レベルのサンプルのベンチマークを生成する。
デコーダは、空間投影、命令条件付きセマンティック圧縮、双方向の幾何学的相互作用を通じて、凍結したコスモス-2B特徴を3次元幾何学で徐々に融合させる。
最小摂動擬似ラベル自己学習は、人間のアノテーションを使わずに新たなオブジェクトを追加する。
提案手法は, 未確認対象, 未確認カテゴリ, 未確認命令パラフレーズの体系的一般化プロトコルを用いて, 自己学習後の未確認対象に対して0.428 IoU, 自己学習後に0.315 IoUを達成し, 未確認カテゴリであるmIoUを6.3%改善し(p<0.01), 命令感度の差は0.105に抑えられた。
関連論文リスト
- UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing [21.246395901914376]
3Dビジュアルグラウンド(3DVG)は、ロボット工学、拡張現実、人間と機械の相互作用など、AIを具現化する上での課題である。
大規模で事前訓練された基礎モデルは、この面で大きな進歩をもたらし、任意のオブジェクトを特定のシーンに配置できるオープン語彙の3DVGを可能にした。
本稿では,この制約された知覚を学習不要な視覚的・幾何学的推論に置き換え,オープンワールドの3DVGをアンロックする。
論文 参考訳(メタデータ) (2026-03-09T09:10:01Z) - TrianguLang: Geometry-Aware Semantic Consensus for Pose-Free 3D Localization [2.3194244059136895]
TrianguLangは3Dローカライゼーションのためのフィードフォワードフレームワークで、推論時にカメラのキャリブレーションを必要としない。
最先端のフィードフォワードテキスト誘導セグメンテーションとローカライゼーションを実現し、ユーザの労力を$O(N)$から1つのテキストクエリに削減する。
モデルは各フレームを1008x1008の解像度で、最適化なしで57ms (sim$18 FPS)で処理し、対話型ロボティクスやARアプリケーションに実用的なデプロイを可能にする。
論文 参考訳(メタデータ) (2026-03-09T08:37:05Z) - On the Feasibility and Opportunity of Autoregressive 3D Object Detection [60.86546723351944]
AutoReg3Dは、検出をシーケンス生成としてキャストする自動回帰型3D検出器である。
さまざまなポイントクラウドやバックボーンに互換性があり、アンカーやNMSなしで、競合するnuScenesのパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-03-09T05:46:53Z) - Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - Beyond 'Templates': Category-Agnostic Object Pose, Size, and Shape Estimation from a Single View [69.6117755984012]
物体の6Dポーズ、サイズ、形状を視覚入力から推定することは、コンピュータビジョンの基本的な問題である。
一つのRGB-D画像から6次元のポーズ,サイズ,密な形状を同時に予測する統合されたカテゴリ非依存フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T17:49:15Z) - Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop [0.0]
Webスケールのイメージテキストペアでトレーニングされた2次元視覚言語モデルは、リッチなセマンティック理解を示し、オープン語彙検出をサポートする。
我々は,2次元基礎モデルの成熟度とカテゴリの多様性を利用して,人間に注釈を付けた3次元ラベルを使わずに3次元オブジェクト検出を行う。
この結果は,スケーラブルな3D知覚のための2次元基礎モデルの未完成の可能性を強調した。
論文 参考訳(メタデータ) (2025-07-06T15:00:13Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - NuGrounding: A Multi-View 3D Visual Grounding Framework in Autonomous Driving [7.007334645975593]
我々はNuGroundingを紹介した。NuGroundingは、自動運転におけるマルチビュー3次元視覚グラウンドのための最初の大規模ベンチマークである。
本稿では,マルチモーダルLLMの命令理解能力と専門的検出モデルの正確な位置推定能力とをシームレスに組み合わせた新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2025-03-28T13:55:16Z) - GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding [53.42728468191711]
Open-Vocabulary 3D object affordance groundingは、任意の命令で3Dオブジェクト上のアクション可能性の領域を予測することを目的としている。
GREAT (GeometRy-intEntion collAboraTive Inference) を提案する。
論文 参考訳(メタデータ) (2024-11-29T11:23:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。