論文の概要: RefGuard: Identity-Aware Language-Guided Robot Manipulation via Joint Target-Anchor-Frame Grounding
- arxiv url: http://arxiv.org/abs/2609.06221v1
- Date: Sat, 05 Sep 2026 18:39:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:26:23.236881
- Title: RefGuard: Identity-Aware Language-Guided Robot Manipulation via Joint Target-Anchor-Frame Grounding
- Title(参考訳): RefGuard: 統合目標アンカーフレームグラウンドによる言語誘導型ロボット操作
- Abstract要約: RefGuardは、3変数すべてに対して共同で後続を維持することでコミットメントを遅らせるフレームワークである。
実際のUF850アームでは、RefGuardは曖昧性ストレストライアルではIDスイッチを記録せず、その90.0%で正しく実行される。
3200エピソードの手続きスイートでは、ターゲットの前にアンカーとフレームにコミットするアブレーションにおいて、解決可能な命令の正しい実行を56.6%から80.5%に引き上げている。
- 参考スコア(独自算出の注目度): 11.774477485982958
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language-action (VLA) models have substantially advanced language-guided robot manipulation, yet reliable execution still hinges on identifying which physical object an instruction refers to. In cluttered scenes containing repeated objects, ambiguous anchors, or frame-dependent spatial terms, a robot can execute a geometrically valid action on a semantically compatible but unintended instance; we call this failure an identity switch. The referent is jointly determined by three coupled latent variables: the target, the anchor, and the reference frame, so committing to any one of them before execution turns residual ambiguity into a silent and irreversible error. We propose RefGuard, an identity-aware grounding framework that delays commitment by maintaining a joint posterior over all three variables. RefGuard builds a frame-conditioned object-centric scene graph from RGB-D observations, separating frame-independent geometry from directional relations, and routes the posterior through a decision policy that executes, clarifies, reobserves, or aborts. On a real UF850 arm, RefGuard records no identity switch on any ambiguity-stress trial and executes correctly on 90.0% of them, whereas fine-tuned VLA and LLM (Large Language Model)-based baselines switch identity in 33-46% of the same trials, while retaining 93.3% success on unambiguous scenes and recovering from post-grounding scene changes in 86.7% of trials. On a 3200-episode procedural suite, it raises correct execution on solvable instructions from 56.6% to 80.5% over the ablation that commits to the anchor and frame before the target, while deferring less often (19.5% vs. 43.4%).
- Abstract(参考訳): VLA(Vision-Language-action)モデルには、言語誘導型ロボット操作が大幅に進歩している。
繰り返しオブジェクト、曖昧なアンカー、フレーム依存空間用語を含む散在したシーンでは、ロボットは意味論的に互換性があるが意図しないインスタンス上で幾何的に有効なアクションを実行することができ、この失敗をアイデンティティスイッチと呼ぶ。
参照は、ターゲット、アンカー、参照フレームの3つの結合された潜在変数によって共同で決定されるので、実行前にのいずれかにコミットすると、残余の曖昧さが無声かつ不可逆なエラーになる。
筆者らはRefGuardを提案する。RefGuardは3変数すべてに対して共同で後続を維持することでコミットメントを遅らせるID認識基盤フレームワークである。
RefGuardは、RGB-D観測からフレーム条件のオブジェクト中心のシーングラフを構築し、フレーム非依存の幾何学を方向関係から切り離し、後部を決定ポリシーを通じてルートし、実行、明確化、再観測、中止を行う。
実際のUF850アームでは、RefGuardは任意の曖昧性ストレス試験でIDスイッチを記録せず、その90.0%で正しく実行しているのに対し、細調整されたVLAとLLMベースのベースラインは、同じ試験の33-46%でアイデンティティを切り替え、不明瞭なシーンで93.3%成功し、86.7%の試験で接地後のシーン変更から回復している。
3200段の手続きスイートでは、ターゲットの前にアンカーとフレームにコミットするアブレーション(19.5%対43.4%)に対して、解決可能な命令の正しい実行を56.6%から80.5%に引き上げる。
関連論文リスト
- STAGE: Diagnosing Semantic Transfer at Grounded Execution in Embodied Agents [5.276981655456251]
言語接頭辞は、命令の参照者を特定すること以上のものを必要とする。
この欠落したリンクを意味-作用ギャップとして研究し、命令のセマンティクスは回復可能であるが、ネイティブな連続的なアクションで弱い表現をする。
本稿では、回復したセマンティクスをALLOW、DEFER、ターゲット一貫性、検証された選択決定に変換する軽量な実行時インタフェースであるVISAを紹介する。
論文 参考訳(メタデータ) (2026-09-11T19:24:06Z) - SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure [7.121327089434882]
SRD-GUARDはパラメータフリーでブラックボックスの防御フレームワークで、セマンティックリライトとコンセンサスに基づくリスクアセスメントを通じて隠された意図を公開する。
Llama-3-8B-UncensoredおよびDeepSeek-V4-Flash上で,UNIATTACK,CIPHER,DeepInceptionに対するSRD-GUARDの評価を行った。
論文 参考訳(メタデータ) (2026-09-06T11:26:08Z) - Hiding Directions, Leaking Structure: Breaking ArrowCloak through Low-Rank Structure [11.442729593360738]
TEEシールド推論は、線形代数を信頼できない加速器にオフロードしながら、信頼された実行環境(TEE)においてセンシティブな状態を維持する。
Wang et al. は Game of Arrows (USENIX Security 2025) で、広く採用されている5つの軽量防御がベクトル方向を保存することを示し、この漏れを利用するためにArrowMatchを導入した。
本稿では,ArowCloakを提案する。これは各ベクトルに1つの共有マスク方向の異なる倍数を追加し,その重み付きハードネス引数をLearning with Errors (LWE) に基づける。
この構造を、エンドツーエンドのクエリフリーリカバリアタックである、提案したアタックで活用する。
論文 参考訳(メタデータ) (2026-08-21T20:30:26Z) - StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models [0.5624504968545648]
我々は,立方体-ネット対面推論,閉立方体-towerカウント,隣接する連結成分カウントのベンチマークであるStateSightを紹介する。
各タスクファミリーには300の単一イメージプロンプトがあり、決定論的オラクルラベルと正確なマッチスコアがある。
OpenAI GPT-5.5はAPIモデルの識別子gpt-5.5を使用して、3つのタスクで59.3%、33.3%、28.3%の精度を達成した。
論文 参考訳(メタデータ) (2026-08-15T20:13:12Z) - Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment [42.503300854478795]
Anchor-Alignはロボットのデモにおける視覚言語アクションポリシーを改善している。
凍結したVLMコピーから層幅の表現を蒸留し、このドリフトを防ぐ。
各アクションターゲットを離散的なモーション指向ラベルに変換し、共同で言語とアクション予測を訓練する。
論文 参考訳(メタデータ) (2026-07-15T04:13:54Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations [1.2763567932588586]
ForgetEvalは1000ケースのテンプレート・スイートと385ケースの対向層(手作り+253 LLMのオラクル・バリデーション)
決定論的プリミティブは語彙的・時間的カテゴリーで十分だが、正準化に失敗する。
1000ケースのテンプレートスイートと385ケースの反対層であるForgetEvalを通じて、トレードオフを公開しています。
論文 参考訳(メタデータ) (2026-06-14T16:32:15Z) - Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment [45.205992501478256]
本研究では、フィールド固有の信号に全体的監督を分散させるフレームワークを提案し、それらを責任あるトークンスパンにのみルーティングする。
提案手法は,3次元KPAを0.64から0.93に増加させ,結合上の3次元境界ボックス交点を0.686に増加させ,再計画整合点を0.852に引き上げることで信頼性ギャップを橋渡しする。
論文 参考訳(メタデータ) (2026-04-23T00:01:40Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - IntRec: Intent-based Retrieval with Contrastive Refinement [42.24292951933703]
IntRecは対話型オブジェクト検索フレームワークで、ユーザーのフィードバックに基づいて予測を洗練する。
中心となるIntent State(IS)は、正のアンカー(確認されたキュー)と負の制約(拒絶された仮説)のための二重メモリセットを維持する。
論文 参考訳(メタデータ) (2026-02-19T18:50:53Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。