論文の概要: Harnessing Multimodal Large Language Models for Training-Free Human-Object Interaction Detection
- arxiv url: http://arxiv.org/abs/2610.06394v1
- Date: Mon, 05 Oct 2026 14:16:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 08:40:06.717668
- Title: Harnessing Multimodal Large Language Models for Training-Free Human-Object Interaction Detection
- Title(参考訳): 学習自由物体相互作用検出のためのマルチモーダル大言語モデルのハーネス化
- Abstract要約: 人-物間相互作用(Human-object Interaction,HOI)は、人-物対を局所化し、その相互作用を認識することを目的としている。
近年のMLLM(Multimodal large language model)は、広義のビジュアル・セマンティックな知識を通じて、トレーニング不要なHOI検出への有望な経路を提供する。
本稿では,パッシブMLLM推論をアクティブなインタラクション中心のハーネスに変換するトレーニングフリーフレームワークであるHarnessHOIを提案する。
- 参考スコア(独自算出の注目度): 87.03895636671963
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-object interaction (HOI) detection aims to localize human-object pairs and recognize their interactions. Traditional supervised methods perform strongly but rely on task-specific training. Recent multimodal large language models (MLLMs) offer a promising route to training-free HOI detection through their broad visual-semantic knowledge and versatile perceptual and reasoning capabilities. However, existing approaches largely invoke these capabilities through loosely coordinated inference stages. This fragmented execution restricts the role of interaction hypotheses in guiding visual exploration, leaving key participants overlooked and local ambiguities unresolved. Furthermore, propagating early semantic assumptions through subsequent visual grounding and relation prediction induces self-reinforcing semantic circularity. To resolve these challenges, we propose HarnessHOI, a training-free framework that transforms passive MLLM inference into an active interaction-centric harness. Specifically, we introduce an interaction-guided perception mechanism that projects emerging interaction hypotheses back into the visual space to discover missing participants and refine ambiguous evidence through targeted observation. Furthermore, a relation-agnostic geometric adjudication module reconciles multi-source evidence to establish a unified spatial basis for grounded interaction reasoning across multiple actions and semantic roles. Extensive experiments on HICO-DET and V-COCO demonstrate that HarnessHOI achieves state-of-the-art performance among training-free methods, confirming the effectiveness of the proposed harness for complex interaction understanding. Code will be released upon publication.
- Abstract(参考訳): 人-物間相互作用(Human-object Interaction,HOI)は、人-物対を局所化し、その相互作用を認識することを目的としている。
従来の指導的手法は強いが、タスク固有の訓練に依存している。
最近のMLLM(Multimodal large language model)は、広義の視覚的セマンティック知識と多義的な知覚と推論能力を通じて、トレーニング不要なHOI検出への有望な経路を提供する。
しかし、既存のアプローチは、ゆるやかに調整された推論段階を通じて、これらの機能を主に呼び出す。
この断片化された実行は、視覚的な探索を導く上での相互作用仮説の役割を制限し、主要な参加者は見過ごされ、局所的な曖昧さは未解決のままである。
さらに、後続の視覚的接地と関係予測による初期意味仮説の伝播は、自己強化的意味円性を引き起こす。
これらの課題を解決するために,パッシブMLLM推論をアクティブなインタラクション中心のハーネスに変換するトレーニングフリーフレームワークであるHarnessHOIを提案する。
具体的には、創発的相互作用を視覚空間に投影し、行方不明者を発見し、対象とする観察を通して曖昧な証拠を精査する相互作用誘導知覚機構を導入する。
さらに,複数の行動と意味的役割にまたがる接地的相互作用推論のための統一的な空間的基盤を確立するために,関係に依存しない幾何的偏見モジュールが多元的証拠を照合する。
HICO-DET と V-COCO に関する大規模な実験により,HarnessHOI は訓練不要な手法の最先端性能を実現し,複雑な相互作用理解のためのハーネスの有効性を確認した。
コードは出版時に公開される。
関連論文リスト
- EWAM: Emergent Depth-Wise Specialization in a Unified Embodied Model -- From Semantic Understanding through Visual Foresight to Action [65.7650775259592]
視覚言語行動(VLA)ポリシーは意味理解を重視し、世界行動モデル(WAM)は環境力学の予測表現を学習する。
本研究では,アクション中心の統一型エンボディモデルであるEWAMについて述べる。
論文 参考訳(メタデータ) (2026-09-30T15:35:53Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - PerspAct: Enhancing LLM Situated Collaboration Skills through Perspective Taking and Active Vision [2.32300953742759]
本研究では、ReActフレームワークを用いた多様な視点を明示的に取り入れることで、LLMが他のエージェントの要求を理解し、理解する能力を高めることができるかどうかを評価する。
視線撮影の複雑さを増大させる7つのシナリオからなる、アクティブな視覚探索を紹介します。
提案手法は, 探索戦略と組み合わせることで, モデルの解釈精度と協調的有効性を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-11-11T10:54:15Z) - Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection [51.52749744031413]
人間オブジェクトインタラクション(HOI)検出は、画像内の人間と物体を識別し、その相互作用を解釈することを目的としている。
既存のHOIメソッドは、視覚的手がかりからインタラクションを学ぶために手動アノテーションを備えた大規模なデータセットに大きく依存している。
本稿では,強化意味論を用いた動的スコーリングのための新しいトレーニング不要なHOI検出フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-23T12:30:19Z) - Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models [56.257840490146]
ConCueは、HOI検出における視覚的特徴抽出を改善するための新しいアプローチである。
コンテクストキューをインスタンスと相互作用検出器の両方に統合するマルチトウワーアーキテクチャを用いたトランスフォーマーベースの特徴抽出モジュールを開発した。
論文 参考訳(メタデータ) (2023-11-26T09:11:32Z) - Weakly-Supervised HOI Detection from Interaction Labels Only and
Language/Vision-Language Priors [36.75629570208193]
人-物相互作用検出(Human-object Interaction, HOI)は、人-物対とその相互作用カテゴリを、与えられた自然な画像から抽出することを目的としている。
本稿では,画像レベルのインタラクションラベルのみを用いて,文献における最も弱い監視設定によるHOI検出に取り組む。
まず,非相互作用型人間とオブジェクトの提案を駆使して,バッグ内の正の対の質を高める手法を提案する。
第2に、大きな言語モデルを使用して、人間とオブジェクトのカテゴリ間の相互作用を問合せし、モデルを強調しないよう強制する。
論文 参考訳(メタデータ) (2023-03-09T19:08:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。