論文の概要: EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding
- arxiv url: http://arxiv.org/abs/2605.14742v1
- Date: Thu, 14 May 2026 12:10:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.808045
- Title: EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding
- Title(参考訳): EARL:Egocentric Interaction ReasoningとPixel Groundingのための統一分析誘導強化学習フレームワーク
- Authors: Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang,
- Abstract要約: 本稿では,Egocentric Analysis-guided Reinforcement LearningフレームワークであるEARLを紹介する。
具体的には、EARLは粗い解釈ときめ細かい応答を含む2段階の構文解析フレームワークを採用する。
Ego-IRGBenchの実験では、EARLは65.48%のcIoUをピクセルグラウンドで達成し、以前のRLベースの手法よりも8.37%向上した。
- 参考スコア(独自算出の注目度): 21.745254094130075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding human--environment interactions from egocentric vision is essential for assistive robotics and embodied intelligent agents, yet existing multimodal large language models (MLLMs) still struggle with accurate interaction reasoning and fine-grained pixel grounding. To this end, this paper introduces EARL, an Egocentric Analysis-guided Reinforcement Learning framework that explicitly transfers coarse interaction semantics to query-oriented answering and grounding. Specifically, EARL adopts a two-stage parsing framework including coarse-grained interpretation and fine-grained response. The first stage holistically interprets egocentric interactions and generates a structured textual description. The second stage produces the textual answer and pixel-level mask in response to the user query. To bridge the two stages, we extract a global interaction descriptor as a semantic prior, which is integrated via a novel Analysis-guided Feature Synthesizer (AFS) for query-oriented reasoning. To optimize heterogeneous outputs, including textual answers, bounding boxes, and grounding masks, we design a multi-faceted reward function and train the response stage with GRPO. Experiments on Ego-IRGBench show that EARL achieves 65.48% cIoU for pixel grounding, outperforming previous RL-based methods by 8.37%, while OOD grounding results on EgoHOS indicate strong transferability to unseen egocentric grounding scenarios.
- Abstract(参考訳): エゴセントリックな視覚から人間と環境の相互作用を理解することは、ロボット工学とインボディード・インテリジェントエージェントにとって不可欠であるが、既存のマルチモーダルな大規模言語モデル(MLLM)は、正確な相互作用推論と微細なピクセルグラウンドリングに苦戦している。
本稿では,Egocentric Analysis-guided Reinforcement LearningフレームワークであるEARLを紹介する。
具体的には、EARLは粗い解釈ときめ細かい応答を含む2段階の構文解析フレームワークを採用する。
第1段階は、エゴセントリックな相互作用をホモロジー的に解釈し、構造化されたテキスト記述を生成する。
第2ステージは、ユーザクエリに応答して、テキスト応答とピクセルレベルのマスクを生成する。
この2つのステージを橋渡しするために、クエリ指向推論のための新しい分析誘導特徴合成器(AFS)を介して統合された、セマンティックプリミティブとしてグローバルなインタラクション記述子を抽出する。
テキスト応答,バウンディングボックス,グラウンドマスクなどの異種出力を最適化するために,多面報酬関数を設計し,GRPOを用いて応答ステージを訓練する。
Ego-IRGBenchの実験では、EARLは65.48% cIoUをピクセルグラウンドで達成し、以前のRLベースの手法を8.37%上回った。
関連論文リスト
- Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision [13.21187394955871]
EgoPoint-Thoughtは、egocentric deictic visual grounding専用の、最初の大規模なマルチモーダルデータセットである。
手動のバウンディングボックスペアや密集したセマンティックキャプションを含む、リッチで多義的なアノテーションを提供する。
提案するSV-CoTは,構造的推論プロセスとしてグラウンド化を再構成する新しいベースラインフレームワークである。
論文 参考訳(メタデータ) (2026-03-27T17:49:56Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking [154.2388970262703]
Unified Vision-Language Models (UVLM) は、単一のフレームワーク内での理解と生成の両方をサポートすることで、マルチモーダル学習を促進することを目的としている。
本稿では,解析処理と起案処理を交互に行う新たな思考パラダイムである,インターリーブド・アナライジング・ドレイティング問題解決ループ(AD-Loop)を紹介する。
テキスト思考を視覚的思考とインターリーブすることで、AD-Loopはモデルが理解と出力の両方を反復的に洗練し、真のシナジーを育むことができる。
論文 参考訳(メタデータ) (2026-02-24T23:26:09Z) - Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention [58.05340906967343]
Egocentric Referring Video Object (Ego-RVOS)は、言語クエリで説明されているように、人間のアクションに積極的に関与する特定のオブジェクトを、一人称ビデオに分割することを目的としている。
既存の手法はしばしば苦労し、データセット内の歪んだオブジェクト-アクションのペアリングから急激な相関を学習する。
本稿では,強力なトレーニング済みRVOSをエゴセントリックドメインに適応させるプラグイン因果フレームワークであるCausal-Referring(CERES)を紹介する。
論文 参考訳(メタデータ) (2025-12-30T16:22:14Z) - Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning [63.109585527799005]
GroundingAgentは、タスク固有の微調整なしで動作するビジュアルグラウンドティングフレームワークである。
広く使用されているベンチマークでは、平均ゼロショットグラウンドの精度は65.1%である。
また、強い解釈可能性を提供し、各推論ステップを透過的に照らす。
論文 参考訳(メタデータ) (2025-11-24T03:11:08Z) - ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction [16.338872733140832]
本稿では,Egocentric Interaction Reasoning and pixel Grounding (Ego-IRG) という新しいタスクを提案する。
Ego-IRGは、クエリを入力としてエゴセントリックなイメージを取り入れ、分析、回答、ピクセルグラウンドという3つの重要なステップを通じてインタラクションを解決することを目的とした最初のタスクである。
Ego-IRGBenchデータセットには、160万のクエリとそれに対応するインタラクションに関するマルチモーダルレスポンスを備えた、20万以上のエゴセントリックなイメージが含まれている。
論文 参考訳(メタデータ) (2025-04-02T08:24:35Z) - Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning [0.0]
反復的人間のエンゲージメントは、大規模言語モデル(LLM)の高度な言語処理能力を活用するための一般的かつ効果的な手段である。
思考の反復(IoT)フレームワークを提案する。
静的アプローチや半静的アプローチとは異なり、IoTは進化するコンテキストに基づいて推論パスを動的に適応する。
論文 参考訳(メタデータ) (2024-09-19T09:44:17Z) - Detecting Any Human-Object Interaction Relationship: Universal HOI
Detector with Spatial Prompt Learning on Foundation Models [55.20626448358655]
本研究では,ビジョン・ランゲージ(VL)基礎モデルと大規模言語モデル(LLM)を用いて,オープンワールド環境におけるユニバーサルインタラクション認識について検討する。
我々の設計にはHO Prompt-guided Decoder (HOPD) が含まれており、基礎モデルにおける高次関係表現と画像内の様々なHOペアとの結合を容易にする。
オープンカテゴリの対話認識では,対話文と解釈文の2つのタイプがサポートされている。
論文 参考訳(メタデータ) (2023-11-07T08:27:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。