論文の概要: Zero-shot 2D Grounding with Novel Affordance Types
- arxiv url: http://arxiv.org/abs/2608.08929v1
- Date: Sun, 09 Aug 2026 21:44:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.997582
- Title: Zero-shot 2D Grounding with Novel Affordance Types
- Title(参考訳): 新規アフォーマンス型ゼロショット2次元グラウンド
- Abstract要約: 2Dの空き地は、人間が対話できる物体の領域を見つけることを目的としている。
本研究では,NATを用いたゼロショット2Dグラウンドリングを提案し,NATベンチマークを導入する。
次に,AffordAnythingを提案する。AffordAnythingは,アベイランス領域とオブジェクトサブパート間の強い相関によって動機付けられたセグメンテーションキューを利用する,トレーニング不要な手法である。
- 参考スコア(独自算出の注目度): 25.660339638981096
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 2D affordance grounding aims to locate the region of an object that a human can interact with. Existing research focuses on recognizing affordance types seen during training and does not study models' ability to generalize to novel affordances, which is crucial for real-world applications. We propose the task of zero-shot 2D grounding with novel affordance types (NAT) and introduce the NAT benchmarks. We then propose AffordAnything, a training-free method that leverages segmentation cues, motivated by the strong correlation between affordance regions and object subparts. To further improve performance, we develop AffordAnything+, a trainable variant that learns to combine these cues. On the proposed AGD20K-NAT benchmark, our best model AffordAnything+ achieves a substantial improvement of 12.3% (absolute) in IoU@0.4 over the SOTA affordance grounding method, OOAL.
- Abstract(参考訳): 2Dの空き地は、人間が対話できる物体の領域を見つけることを目的としている。
既存の研究は、トレーニング中に見られる価格のタイプを認識することに焦点を当てており、現実の応用に欠かせない新しい価格に一般化するモデルの能力を研究していない。
そこで我々は,NATを用いたゼロショット2Dグラウンドリングの課題を提案し,NATベンチマークを導入する。
次に,AffordAnythingを提案する。AffordAnythingは,アベイランス領域とオブジェクトサブパート間の強い相関によって動機付けられたセグメンテーションキューを利用する,トレーニング不要な手法である。
AffordAnything+は、これらのキューを組み合わせることを学習するトレーニング可能な変種である。
提案した AGD20K-NAT ベンチマークでは,私たちの最良のモデルである AffordAnything+ が SOTA 割当接地法 OOAL に対して IoU@0.4 で 12.3% の大幅な改善を実現している。
関連論文リスト
- Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation [51.210887267509854]
OPDの効率は、トレーニングの初期段階において最終モデルに向けた安定的な更新軌道を確立する、フォレスト・オブ・ザ・イヤーズ(foresight')の形式に起因している、と我々は主張する。
我々は、外挿ステップのサイズを適応的に選択し、現在の更新方向に沿って移動することにより、OPDを高速化するプラグイン・アンド・プレイ・アクセラレーション手法である textbfEffOPD を提案する。
論文 参考訳(メタデータ) (2026-05-12T08:19:15Z) - UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models [35.98585605462306]
RL と UDM を統合した最初のフレームワークである UDM-GRPO を提案する。
提案手法は2つの重要な知見により導かれる: (i) 最終クリーンサンプルをより正確で安定した最適化信号として扱い、 (ii) 拡散前処理による軌道の再構築により、予測経路と事前学習分布との整合性が向上する。
論文 参考訳(メタデータ) (2026-04-20T17:16:50Z) - FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion [18.996022873991596]
FSOD-VFM:Few-Shot Object Detector with Vision Foundation Modelsについて述べる。
FSOD-VFMは、カテゴリに依存しない境界ボックス生成のためのユニバーサルプロポーザルネットワーク(UPN)、正確なマスク抽出のためのSAM2、新しいオブジェクトカテゴリに効率的に適応するためのDINOv2特徴の3つの主要なコンポーネントを統合している。
提案手法では,予測境界ボックスを有向グラフのノードとしてモデル化し,ネットワーク全体の信頼度を伝搬するグラフ拡散操作を適用した。
論文 参考訳(メタデータ) (2026-02-03T05:45:22Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - VoxelKP: A Voxel-based Network Architecture for Human Keypoint
Estimation in LiDAR Data [53.638818890966036]
textitVoxelKPは、LiDARデータにおける人間のキーポイント推定に適した、完全にスパースなネットワークアーキテクチャである。
本研究では,人間の各インスタンス内のキーポイント間の空間的相関を学習するために,スパースボックスアテンションを導入する。
鳥の視線を符号化する2次元格子に3次元ボクセルを投影する際に, 絶対的な3次元座標を利用するために空間符号化を組み込んだ。
論文 参考訳(メタデータ) (2023-12-11T23:50:14Z) - Subequivariant Graph Reinforcement Learning in 3D Environments [34.875774768800966]
本稿では,3次元環境における変分グラフRL(Subequivariant Graph RL)という,形態に依存しないRLの新たなセットアップを提案する。
具体的には、まず3D空間でより実用的で挑戦的なベンチマークを新たに導入する。
拡張状態-作用空間上のポリシーを最適化するために,幾何対称性を注入することを提案する。
論文 参考訳(メタデータ) (2023-05-30T11:34:57Z) - Selective In-Context Data Augmentation for Intent Detection using
Pointwise V-Information [100.03188187735624]
PLMとPVI(pointwise V-information)に基づく新しい手法を導入し,モデル学習におけるデータポイントの有用性を計測する。
提案手法はまず,学習データの小さなシード上でPLMを微調整し,与えられた意図に対応する発話を新たに生成する。
そこで本手法は,大規模言語モデルの表現力を活用し,多様な学習データを生成する。
論文 参考訳(メタデータ) (2023-02-10T07:37:49Z) - One Ring to Bring Them All: Towards Open-Set Recognition under Domain
Shift [39.31881646860522]
我々は、$n$のソースクラスと未知のクラスを予測するために、$n$+1のウェイを学習するための新しいトレーニングスキームを提案する。
対象適応には、単純に重み付きエントロピー最小化を採用し、未ラベル対象領域にソース事前学習モデルを適用する。
提案手法は,複数のベンチマークに適応する際のソースデータを要求する,現在のUNDAアプローチを超越する。
論文 参考訳(メタデータ) (2022-06-07T21:39:54Z) - Sparsity Winning Twice: Better Robust Generalization from More Efficient
Training [94.92954973680914]
スパース対位訓練の代替として, (i) スタティック・スパシティと (ii) ダイナミック・スパシティの2つを紹介した。
いずれの方法も、ロバストな一般化ギャップを大幅に縮小し、ロバストなオーバーフィッティングを緩和する。
我々のアプローチは既存の正規化器と組み合わせて、敵の訓練における新たな最先端の成果を確立することができる。
論文 参考訳(メタデータ) (2022-02-20T15:52:08Z) - Temporal Action Localization Using Gated Recurrent Units [6.091096843566857]
本稿では, Gated Recurrent Unit (GRU) に基づく新しいネットワークと, TALタスクのための2つの新しい後処理手法を提案する。
具体的には、GRU-Splittedモデルと呼ばれる、GRUの出力層に対する新しい設計を提案する。
提案手法の性能を最先端手法と比較して評価する。
論文 参考訳(メタデータ) (2021-08-07T06:25:29Z) - Two-Stream Consensus Network: Submission to HACS Challenge 2021
Weakly-Supervised Learning Track [78.64815984927425]
弱い監督による時間的行動ローカライゼーションの目標は、ビデオの興味ある動作を時間的に特定し、分類することである。
この課題では,2ストリームコンセンサスネットワーク(TSCN)を主要なフレームワークとして採用しています。
この課題では,本手法が今後の学術研究のベースラインとなることを期待して,第2位にランクインした。
論文 参考訳(メタデータ) (2021-06-21T03:36:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。