論文の概要: HINT: Human-Intent Inception for Long-Horizon Robot Manipulation
- arxiv url: http://arxiv.org/abs/2609.02653v2
- Date: Sun, 06 Sep 2026 07:18:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.722815
- Title: HINT: Human-Intent Inception for Long-Horizon Robot Manipulation
- Title(参考訳): HINT:長距離ロボットマニピュレーションのためのヒューマンインテントインセプション
- Authors: Mingyu Mei, Haojie Xu, Shihao Jin, Zibo Dai, Qihao Cheng, Zhengrui Lv, Hongjie Fang, Shirun Tang, Guang Chen, Xinyue Zhao, Huiliang Shen, Zaixing He,
- Abstract要約: HINT(Human-INTent INcepTion)は,人間の操作原理に触発されたエージェントフレームワークである。
HINTは2つの基本方針にまたがって、意図の理解、タスクの進捗、エンドツーエンドの成功を大幅に改善することを示す。
- 参考スコア(独自算出の注目度): 11.55318573740128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humans can perform complex manipulations given a simple intent through an overall instruction, while continuously adapting to evolving visual observations. However, current vision-language action (VLA) models and other action policies struggle to realize this high-level intelligent behavior under dense, evolving visual inputs and sparse language guidance. Visual correlations can then dominate semantic intent, leading actions to follow visual shortcuts rather than human goals. We present HINT (Human-INTent INcepTion), an agentic framework inspired by the human manipulation principles: semantic intent changes sparsely at manipulation-pattern transitions, whereas continuous control primarily depends on the evolving object-hand relationship. HINT invokes semantic reasoning only at pattern transitions to resolve the current subtask and target, then maintains this commitment through multi-view grounding and visual tracking. We explore two visual interfaces-image-space semantic highlighting and attention-prior injection-to communicate the tracked intent to the action policy without introducing additional trainable parameters into the foundation action model. Experiments across three long-horizon tasks and out-of-distribution variants show that HINT substantially improves intent understanding, task progress, and end-to-end success across two foundation policies while preserving low-latency control. Project page: https://robot-hint.github.io/
- Abstract(参考訳): 人間は、視覚的な観察に継続的に適応しながら、全体的な指示を通じて単純な意図で複雑な操作を行うことができる。
しかしながら、現在の視覚言語行動(VLA)モデルや他の行動方針は、密集した進化する視覚的入力とスパース言語ガイダンスの下で、この高レベルの知的行動を実現するのに苦労している。
視覚的相関はセマンティックな意図を支配でき、人間のゴールではなく視覚的ショートカットに従う行動を引き起こす。
HINT(Human-INTent INcepTion)は人間の操作原理にインスパイアされたエージェントフレームワークである。
HINTは、現在のサブタスクとターゲットを解決するために、パターン遷移のみでセマンティック推論を実行し、マルチビューグラウンドとビジュアルトラッキングを通じて、このコミットメントを維持する。
基本アクションモデルにトレーニング可能なパラメータを追加することなく、トラッキングされた意図をアクションポリシーに伝達する2つのビジュアルインターフェース-画像空間セマンティックハイライトとアテンション-プリアインジェクションを探索する。
3つの長期的なタスクとアウト・オブ・ディストリビューションのバリエーションによる実験により、HINTは低レイテンシ制御を維持しながら、2つの基本方針をまたいだ意図の理解、タスクの進捗、エンドツーエンドの成功を大幅に改善することが示された。
プロジェクトページ: https://robot-hint.github.io/
関連論文リスト
- GIVE: Grounding Human Gestures in Vision-Language-Action Models [38.010995423052975]
GIVE (Gesture Intent via Visual-Semantic Enhancement) は、人間のジェスチャー理解によって事前訓練された視覚・言語・アクション(VLA)モデルを強化する効果的なアプローチである。
実世界のHRI実験では、GIVEはベースラインを大幅に上回り、目標オブジェクト認識精度を40%改善し、全体的なタスク成功率を80%向上させた。
論文 参考訳(メタデータ) (2026-06-11T14:59:38Z) - Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation [24.026684861369386]
VLA(Vision-Language-Action)モデルは、最近、言語命令に従うことでロボット学習の可能性を強く示している。
どのオブジェクトが類似の候補と相互作用するか、どこでオブジェクトに作用するか、実行中にターゲットがどのように変化するかを記述するのは難しい。
複雑な対話操作のための動的かつ直感的な意図信号として人間の視線を利用する新しいVLAフレームワークであるGaze2Actを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:37:16Z) - Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models [15.486973209713954]
GTA-VLA(Guide, Think, Act)はインタラクティブなビジョンランゲージ・アクション・フレームワークである。
ユーザがロボットポリシーを明示的な視覚的手がかりでガイドできるようにすることで、空間的に操作可能な具体的推論を可能にする。
論文 参考訳(メタデータ) (2026-05-13T14:58:29Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - Language-Grounded Decoupled Action Representation for Robotic Manipulation [78.42228162226839]
認識と制御を結びつけるために,Language-Grounded Decoupled Action Representation (LaDA) フレームワークを提案する。
LaDAは3つの解釈可能なアクションプリミティブ(翻訳、回転、グリップ制御)の微細な中間層を導入し、低レベルのアクションに対して明示的な意味構造を提供する。
さらに、セマンティックガイダンスによるソフトラベルのコントラスト学習の目的を用いて、類似のアクションプリミティブをタスク間で整列させ、一般化と動きの整合性を高める。
論文 参考訳(メタデータ) (2026-03-13T13:08:26Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation [37.76888706583038]
長距離ロボット操作は、現実世界の展開においてますます重要になっている。
既存のエンドツーエンドおよび階層的なビジョン・ランゲージ・アクションポリシーは、しばしばテキストのみの手がかりに依存している。
ロボットの現在のビューに、ポイント、ボックス、矢印、型付き関係を描画する、不可解な視覚中間体であるVisual Sketchを導入する。
本稿では,サイクリックSee-Think-Sketch-Actワークフローで動作するVLAフレームワークであるAction-Sketcherを紹介する。
論文 参考訳(メタデータ) (2026-01-04T17:53:42Z) - GoViG: Goal-Conditioned Visual Navigation Instruction Generation [69.79110149746506]
本稿では,Goal-Conditioned Visual Navigation Instruction Generation (GoViG)を紹介する。
GoViGは生のエゴセントリックな視覚データのみを活用し、目に見えない非構造環境への適応性を大幅に改善する。
論文 参考訳(メタデータ) (2025-08-13T07:05:17Z) - Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation [52.6091162517921]
INSIGHTは、エゴセントリックなアクション予測のための2段階のフレームワークである。
最初の段階では、INSIGHTは手動オブジェクトの相互作用領域から意味的にリッチな特徴を抽出することに焦点を当てている。
第2段階では、明示的な認知的推論をシミュレートする強化学習ベースのモジュールを導入する。
論文 参考訳(メタデータ) (2025-08-03T12:52:27Z) - Emergent Active Perception and Dexterity of Simulated Humanoids from Visual Reinforcement Learning [69.71072181304066]
本稿では,擬似ヒューマノイドを用いた視覚駆動全身制御フレームワークであるPerceptive Dexterous Control (PDC)を紹介する。
PDCは、タスク仕様のためのエゴセントリックなビジョンのみを運用し、ビジュアルキューによるオブジェクト検索、ターゲット配置、スキル選択を可能にする。
強化学習によるスクラッチからのトレーニングは,能動探索などの創発的な行動を引き起こす可能性があることを示す。
論文 参考訳(メタデータ) (2025-05-18T07:33:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。