論文の概要: EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control
- arxiv url: http://arxiv.org/abs/2608.17453v2
- Date: Wed, 19 Aug 2026 13:46:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.274703
- Title: EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control
- Title(参考訳): EATR-Stereo:ヒューマノイド・ビジョン・ランゲージ・アクション・コントロールのためのペアリングステレオエビデンスにおける身体認識型Token Routing
- Authors: Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu,
- Abstract要約: ヘッドマウントステレオカメラによるVLA(Long-Horizon Humanoid Vision-Long-Long-Long-Language-Action)制御には、補完的なビューを活用可能なビジュアルインターフェースが必要である。
本稿では,EATR-Stereoについて述べる。EATR-Stereoは,プライマリビュートークンを格納し,プライマリビュー補助トークンを構成する,エンボディメント対応のトークンルーティングフレームワークである。
- 参考スコア(独自算出の注目度): 17.086370337145826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon humanoid vision--language--action (VLA) control with head-mounted stereo cameras requires visual interfaces that can exploit complementary views while maintaining compatibility with pretrained representations. Existing interfaces often discard complementary stereo evidence or fuse additional observations without preserving the native primary-view pathway and adapting auxiliary information to robot embodiment. We present EATR-Stereo, an embodiment-aware token-routing framework that retains primary-view tokens and constructs primary-aligned Cross-View Auxiliary Tokens (CVATs) by querying the synchronized auxiliary-view token sequence. A body-segmented proprioceptive encoder further conditions token-wise auxiliary usage on robot configuration history, enabling selective incorporation of stereo evidence during action generation. The routed auxiliary stream augments the language and primary-visual context of a pretrained VLA while keeping its vision--language model frozen. On a 33-DoF physical humanoid with a 37-D proprioceptive state, we evaluate nine configurations in over-100-s search--approach--grasp--place--return tasks. EATR-Stereo achieves 60.0% full-task success, 100.0% grasp success, and 80.0% stage success. Under severe asymmetric occlusion, it improves recovery to 80% compared with 30% for CVAT alone. Ablation studies further show the importance of preserving primary tokens and combining cross-view auxiliary features with structured proprioceptive routing. These results demonstrate that selectively routed paired stereo evidence improves spatial grounding for reliable long-horizon humanoid VLA control.
- Abstract(参考訳): ヘッドマウントステレオカメラを用いたLong-Horizon Humanoid Vision-Language-action (VLA)制御では、事前訓練された表現との互換性を維持しながら補完的なビューを活用できる視覚インターフェースが必要である。
既存のインタフェースは、しばしば補完的なステレオ証拠を捨てたり、ネイティブの一次視経路を保ち、補助情報をロボットの体現に適応させることなく、追加の観察を融合させる。
本稿では,プライマリビュートークンを格納し,同期化された補助ビュートークンシーケンスを問合せして,プライマリビュー補助トークン(CVAT)を構成する,エボディメント対応のトークンルーティングフレームワークであるEATR-Stereoを提案する。
身体分離型固有受容エンコーダは、さらに、ロボット構成履歴にトークンワイド補助的使用を条件付け、アクション生成中にステレオエビデンスを選択的に組み込むことができる。
経路付き補助ストリームは、事前訓練されたVLAの言語と一次視覚コンテキストを増大させ、その視覚言語モデルを凍結させ続ける。
我々は,37-Dプロプリオセプティブ状態の33-DoF物理ヒューマノイドを用いて,100秒以上の検索---approach--grasp-place--returnタスクの9つの構成を評価する。
EATR-Stereoは60.0%のフルタスク成功、100.0%の把握成功、80.0%のステージ成功を達成した。
重度の非対称閉塞下では、CVAT単独で30%に比べて80%の回復が向上する。
アブレーション研究は、プライマリトークンの保存の重要性と、クロスビュー補助的特徴と構造的プロセプティブルーティングを組み合わせることの重要性をさらに示している。
これらの結果から, 安定な長方形ヒューマノイドVLA制御のための空間グラウンド化が, 選択的に経路化されたペアステレオエビデンスにより向上することが示唆された。
関連論文リスト
- BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation [6.2182538853159]
内視鏡的逆行性胆管膵管造影(ERCP)は正確な内視鏡ナビゲーションと安定した胆道狭窄を必要とする。
最近のロボットシステムと視覚に基づく支援技術は、オペレーター・エルゴノミクスを改善し、知覚的手がかりを提供する。
本稿では,ビジュモータ学習問題として胆道内視鏡ナビゲーションを定式化するシーン認識型視覚・言語・アクションフレームワークであるBiliVLAを提案する。
論文 参考訳(メタデータ) (2026-06-22T16:11:15Z) - SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment [74.05278327933006]
SAVeは,音声・視覚深度検出フレームワークで,映像の完全学習を行う。
SAVEは、タグ付けアーティファクトをエミュレートするために、オンザフライ、アイデンティティ保存、地域対応の自明な擬似操作を生成する。
クロスモーダルな証拠を捉えるために、SAVeはリップ音声同期もモデル化している。
論文 参考訳(メタデータ) (2026-03-26T08:01:35Z) - Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration [72.84714132070404]
受動的相互作用から視覚環境の能動的探索に移行する枠組みを提案する。
Active-Zeroでは,3つの共進化エージェントが採用されている。 モデルの機能フロンティアに基づいて,オープンワールドリポジトリからイメージを取得する検索だ。
12ベンチマークにわたるQwen2.5-VL-7B-インストラクションについて : Active-Zero 53.97 における推論タスクの平均精度(5.7%の改善)と一般理解における 59.77 について(3.9%の改善)
論文 参考訳(メタデータ) (2026-02-11T17:29:17Z) - Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning [0.0]
この研究は、ライセンスプレートの認識、状態分類、車両抽出を1つの前方パスで特徴付ける新しい統一的なアプローチであるNeural Sentinelを提案する。
我々の主な貢献は、Low-Rank Adaptation (LoRA)を介して適応された微調整のPaliGemma 3Bモデルが、車両画像に関する複数の視覚的疑問に同時に答えられることを示すことである。
このシステムは、予測エラー(ECE)0.048で152msの平均推定遅延を達成し、信頼度の高い推定値を示す。
論文 参考訳(メタデータ) (2026-02-04T16:04:15Z) - SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification [74.36139886192495]
本稿では,AG-ReID のための SD-ReID という新しい生成フレームワークを提案する。
まず、ViTベースのモデルを用いて人物表現を抽出し、個人性や視認性を含む制御可能な条件を抽出する。
次に、安定拡散(SD)モデルを微調整し、これらの制御可能な条件によって導かれる人物表現を強化する。
論文 参考訳(メタデータ) (2025-04-13T12:44:50Z) - MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition [62.89464258519723]
異なるレベルのオーディオ/視覚エンコーダに融合することで、各モードの表現を促進する多層クロスアテンション融合に基づくAVSR手法を提案する。
提案手法は第1位システムを超え,新たなSOTA cpCERの29.13%をこのデータセット上に構築する。
論文 参考訳(メタデータ) (2024-01-07T08:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。