論文の概要: IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models
- arxiv url: http://arxiv.org/abs/2604.24002v1
- Date: Mon, 27 Apr 2026 03:34:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.721827
- Title: IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models
- Title(参考訳): IntentVLM:ビデオ言語モデルを用いた前方逆モデリングによるオープン語彙意図認識
- Authors: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani,
- Abstract要約: 本稿では,オープン語彙の人間の意図認識のための2段階のビデオ言語フレームワークIntentVLMを提案する。
IntrepidVLMは、意図的理解を目標候補生成に分解することで、認知科学における前方逆モデリングにインスパイアされている。
最先端の結果を最大80%の精度で達成し、特にベースライン性能を30%上回り、人間のパフォーマンスに匹敵する。
- 参考スコア(独自算出の注目度): 5.381126267099941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Improving the effectiveness of human-robot interaction requires social robots to accurately infer human goals through robust intention understanding. This challenge is particularly critical in multimodal settings, where agents must integrate heterogeneous signals including text, visual cues to form a coherent interpretation of user intent. This paper presents IntentVLM, a novel two-stage video-language framework designed for open-vocabulary human intention recognition. The approach is inspired by forward-inverse modeling in cognitive science by decomposing intention understanding into goal candidate generation followed by structured inference through selection, effectively reducing hallucinations in latent reasoning. Evaluated on the IntentQA and Inst-IT Bench datasets, IntentVLM achieves state-of-the-art results with up to 80% accuracy, notably surpassing the baseline performance by 30% and matches human performance. Our findings demonstrate that this structured reasoning approach enhances open-vocabulary intention understanding without catastrophic forgetting, offering a robust foundation for human-centered robotics.
- Abstract(参考訳): 人間とロボットの相互作用の有効性を改善するには、社会的ロボットが頑健な意図的理解を通じて人間の目標を正確に推測する必要がある。
この課題はマルチモーダルな設定において特に重要であり、エージェントはテキストや視覚的手がかりを含む異種信号を統合してユーザ意図の一貫性のある解釈を形成する必要がある。
IntentVLMはオープン語彙の人間の意図認識のために設計された新しい2段階のビデオ言語フレームワークである。
この手法は、意図的理解を目標候補生成に分解し、選択を通じて構造化推論を行い、潜在推論における幻覚を効果的に減少させることによって、認知科学における前方逆モデリングに着想を得ている。
IntentVLMは、IntentQAとInst-IT Benchデータセットに基づいて、最先端の結果を80%の精度で達成する。
この構造的推論アプローチは、破滅的な忘れをせずにオープン語彙的意図の理解を高め、人間中心のロボット工学の堅牢な基盤を提供することを示す。
関連論文リスト
- An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction [0.0]
本研究は,高度な視覚言語モデル,音声処理,ファジィ論理を組み合わせた新しいHRIフレームワークを提案する。
提案システムは,物体検出のためのFlorence-2,自然言語理解のためのLlama 3.1,音声認識のためのWhisperを統合した。
コンシューマグレードハードウェアで行った実験の結果,コマンド実行精度は75%であった。
論文 参考訳(メタデータ) (2026-02-23T09:05:15Z) - Explicit World Models for Reliable Human-Robot Collaboration [13.90528067304433]
私たちは、信頼できるエンボディドAIの問題に対して、根本的に異なるタックを取ります。
我々は人間とロボットの相互作用の動的な、曖昧で主観的な性質を強調した。
論文 参考訳(メタデータ) (2026-01-05T00:58:19Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction [51.130510883952546]
Vision-Language-Action(VLA)モデルは、事前訓練された視覚言語モデル(VLM)を活用して、ロボット制御との認識を両立させる。
カリキュラム学習パラダイムと効率的な推論機構を備えたVLAフレームワークである textbfIntentionVLA を提案する。
提案手法はまず,意図推論,空間的接地,コンパクトな具体的推論を組み合わせ,慎重に設計した推論データを活用する。
論文 参考訳(メタデータ) (2025-10-09T04:49:46Z) - Open-Universe Assistance Games [6.21910767424247]
GOODは、人間との対話中に自然言語形式で目標を抽出する、データ効率のよいオンライン手法である。
GOODはLLMに、異なる複雑な意図を持つユーザをシミュレートするよう促し、その応答を使用して、候補目標に対する確率的推論を実行する。
我々は、テキストベースの食料品ショッピングドメインと、テキスト操作型家庭用ロボット環境におけるGOODの評価を行った。
論文 参考訳(メタデータ) (2025-08-20T23:07:10Z) - HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs [46.59239283399911]
HumanSenseは、MLLMの人間中心の知覚と相互作用能力を評価するために設計されたベンチマークである。
評価の結果,先進的なMLLMには改善の余地が残っており,特に高度なインタラクション指向タスクでは改善の余地があることが判明した。
我々は,Omniモデルの推論能力を高めるために,多段階・モダリティ・プログレッシブ強化学習を採用する。
論文 参考訳(メタデータ) (2025-08-14T12:14:15Z) - DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge [41.030494146004806]
本稿では,逆動力学モデリングを実現するために,包括的世界知識予測を統合した新しいVLAフレームワークであるDreamVLAを提案する。
DreamVLAは、動的領域誘導の世界知識予測を導入し、空間的および意味的な手がかりと統合し、アクション計画のためのコンパクトで包括的な表現を提供する。
実世界とシミュレーション環境での実験では、ドリームVLAが実際のロボットタスクで76.7%の成功率を達成したことが示されている。
論文 参考訳(メタデータ) (2025-07-06T16:14:29Z) - Detecting Any Human-Object Interaction Relationship: Universal HOI
Detector with Spatial Prompt Learning on Foundation Models [55.20626448358655]
本研究では,ビジョン・ランゲージ(VL)基礎モデルと大規模言語モデル(LLM)を用いて,オープンワールド環境におけるユニバーサルインタラクション認識について検討する。
我々の設計にはHO Prompt-guided Decoder (HOPD) が含まれており、基礎モデルにおける高次関係表現と画像内の様々なHOペアとの結合を容易にする。
オープンカテゴリの対話認識では,対話文と解釈文の2つのタイプがサポートされている。
論文 参考訳(メタデータ) (2023-11-07T08:27:32Z) - You Impress Me: Dialogue Generation via Mutual Persona Perception [62.89449096369027]
認知科学の研究は、理解が高品質なチャット会話に不可欠なシグナルであることを示唆している。
そこで我々は,P2 Botを提案する。このP2 Botは,理解を明示的にモデル化することを目的とした送信機受信者ベースのフレームワークである。
論文 参考訳(メタデータ) (2020-04-11T12:51:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。