論文の概要: TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning
- arxiv url: http://arxiv.org/abs/2605.07943v1
- Date: Fri, 08 May 2026 16:11:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.191207
- Title: TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning
- Title(参考訳): TAVIS:模倣学習における自我中心型能動視と期待視のベンチマーク
- Authors: Giacomo Spigler,
- Abstract要約: アクティブビジョンは模倣学習の鍵となる能力として登場した。
アプローチを比較したり、アクティブなビジョンが貢献するものを定量化するための共有ベンチマークはありません。
本稿では,能動視覚模倣学習のための評価基盤であるTAVISを紹介する。
- 参考スコア(独自算出の注目度): 1.0152838128195465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Active vision -- where a policy controls its own gaze during manipulation -- has emerged as a key capability for imitation learning, with multiple independent systems demonstrating its benefits in the past year. Yet there is no shared benchmark to compare approaches or quantify what active vision contributes, on which task types, and under what conditions. We introduce TAVIS, evaluation infrastructure for active-vision imitation learning, with two complementary task suites -- TAVIS-Head (5 tasks, global search via pan/tilt necks) and TAVIS-Hands (3 tasks, local occlusion via wrist cameras) -- on two humanoid torso embodiments (GR1T2, Reachy2), built on IsaacLab. TAVIS provides three evaluation primitives: a paired headcam-vs-fixedcam protocol on identical demonstrations; GALT (Gaze-Action Lead Time), a novel metric grounded in cognitive science and HRI that quantifies anticipatory gaze in learned policies; and procedural ID/OOD splits. Baseline experiments with Diffusion Policy and $π_0$ reveal that (i) active-vision generally helps, but benefits are task-conditional rather than uniform; (ii) multi-task policies degrade sharply under controlled distribution shifts on both suites; and (iii) imitation alone yields anticipatory gaze, with median lead times comparable to the human teleoperator reference. Code, evaluation scripts, demonstrations (LeRobot v3.0; ~2200 episodes) and trained baselines are released at https://github.com/spiglerg/tavis and https://huggingface.co/tavis-benchmark.
- Abstract(参考訳): 政策が操作中に独自の視線を制御するアクティブビジョンは、模倣学習の鍵となる能力として現れ、過去1年間に複数の独立したシステムがその利点を示している。
しかし、どのタスクタイプ、どの条件でアクティブビジョンが寄与するかを比較、定量化するための共有ベンチマークはありません。
アイザックラボに構築された2つのヒューマノイド・トルソ・エボディメント(GR1T2, Reachy2)上に、アクティブ・ビジョン・模倣学習のための評価基盤であるTAVIS-Head(5つのタスク、パン/チルトネックによるグローバル検索)とTAVIS-Hands(3つのタスク、手首カメラによるローカル・オクルージョン)の2つの相補的なタスクスイートについて紹介する。
TAVISは3つの評価プリミティブを提供している: 同一のデモに対して、ペア化されたヘッドカム-vs-固定カメラプロトコル、認知科学に基づく新しいメトリクスであるGALT(Gaze-Action Lead Time)、学習ポリシーにおける予測視線を定量化するHRI、手続き的なID/OOD分割である。
Diffusion Policyと$π_0$によるベースライン実験
(i)アクティブビジョンは一般的に役立ちますが、利益は均一ではなく、タスク条件です。
(二)両スイートの分散シフトの制御下において、マルチタスクポリシーが急激に低下すること。
(三)模倣だけでは、人の遠隔操作基準に匹敵する中央値のリードタイムが予想される。
コード、評価スクリプト、デモ(LeRobot v3.0; ~2200のエピソード)、トレーニングされたベースラインはhttps://github.com/spiglerg/tavisとhttps://huggingface.co/tavis-benchmarkでリリースされる。
関連論文リスト
- From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models [14.109112325287208]
本研究は,2つの視点から潜時行動監視に関する研究である。 (i) 画像に基づく潜時行動による軌道の規則化, (ii) 行動に基づく潜時行動による目標空間の統一である。
以上の結果より, 動作に基づく潜在動作は複雑な運動調整において優れるが, 定式化タスク対応は明らかである。
論文 参考訳(メタデータ) (2026-05-06T09:27:07Z) - Data-centric Design of Learning-based Surgical Gaze Perception Models in Multi-Task Simulation [16.689550165317765]
ロボットによる侵襲的最小侵襲手術(RMIS)では、触覚フィードバックと奥行きの手がかりが専門的な視覚的知覚に依存している。
本研究では,ダ・ヴィンチ・シムNowシミュレータ上で4つのドリルで収集した,アクティブ・パッシブ・マルチタスク・サーチ・ギャグ・データセットについて紹介する。
我々は、視線組織におけるスキルとモダリティに依存した差異を定量化し、手術監督のための受動的視線の置換性を評価する。
論文 参考訳(メタデータ) (2026-02-09T22:52:59Z) - SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models [43.77182813030722]
我々は,車両関連行動を中心とした監視映像から構築した実世界検索ベンチマークであるSOVABenchを紹介する。
SOVABenchは、2つの評価プロトコル(ペア内とペア内)を定義し、相互行為の識別と時間方向の理解を評価する。
本稿では,MLLMによる画像とビデオの両方の記述から解釈可能な埋め込みを生成するための学習自由フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T10:58:59Z) - Gaze on the Prize: Shaping Visual Attention with Return-Guided Contrastive Learning [2.736848514829367]
視覚強化学習(RL)エージェントは,少数のピクセルだけがタスク関連である高次元画像データに基づいて,行動を学ぶ必要がある。
このフレームワークは、自己監督信号によって誘導される学習可能な焦点注意機構で視覚的RLを増強する。
提案手法は, サンプル効率の最大2.4倍の改善を実現し, ベースラインの学習に失敗するタスクを解くことができる。
論文 参考訳(メタデータ) (2025-10-09T16:54:11Z) - VOGUE: Guiding Exploration with Visual Uncertainty Improves Multimodal Reasoning [62.09195763860549]
検証可能な報酬(RLVR)による強化学習は、大きな言語モデル(LLM)の推論を改善するが、探索に苦労する。
出力(テキスト)から入力(視覚)空間へ探索をシフトする新しい手法である$textbfVOGUE(Visual Uncertainty Guided Exploration)を紹介した。
本研究は,視覚入力の本質的不確実性における基盤探索が,マルチモーダル推論を改善するための効果的な戦略であることを示す。
論文 参考訳(メタデータ) (2025-10-01T20:32:08Z) - Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive Loss [61.355272240758]
Premier-TACOはマルチタスクの特徴表現学習手法である。
シーケンシャルな意思決定タスクにおいて、数ショットのポリシー学習効率を改善するように設計されている。
論文 参考訳(メタデータ) (2024-02-09T05:04:40Z) - SeCo: Exploring Sequence Supervision for Unsupervised Representation
Learning [114.58986229852489]
本稿では,空間的,シーケンシャル,時間的観点から,シーケンスの基本的および汎用的な監視について検討する。
私たちはContrastive Learning(SeCo)という特定の形式を導き出します。
SeCoは、アクション認識、未トリムアクティビティ認識、オブジェクト追跡に関する線形プロトコルにおいて、優れた結果を示す。
論文 参考訳(メタデータ) (2020-08-03T15:51:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。