論文の概要: ActiveWAM: Evidence-Aware Active Vision for World-Action Models
- arxiv url: http://arxiv.org/abs/2610.01698v1
- Date: Thu, 01 Oct 2026 13:48:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.156523
- Title: ActiveWAM: Evidence-Aware Active Vision for World-Action Models
- Title(参考訳): ActiveWAM:World-Action Modelのためのエビデンス対応アクティブビジョン
- Abstract要約: ActiveWAMは観察と操作を共同で学習する。
実行可能パン/チルト制御と自動生成デモを備えた50タスクのベンチマークであるRoboTwin-AVを紹介する。
- 参考スコア(独自算出の注目度): 1.4637846317054437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Active vision manipulation requires a policy to control both its camera and its end-effectors, yet camera motion determines which evidence remains visible within finite observation windows. Acquiring a new view can displace task-critical cues, while retaining a view forgoes potentially useful observations. We formulate this as an evidence-aware retain--acquire problem and present ActiveWAM, a unified world--action model that learns observation and manipulation jointly. To this end, we propose training-time inversion which constrains a frozen video prior by task-bearing source evidence and visible temporal changes, eliminating the need for test-time inversion or candidate ranking. At deployment, the policy generates bimanual and pan/tilt actions-including stay and reacquisition behaviors-from view-aware history, and updates context from newly measured RGB observations. Future-video prediction serves as a co-training signal, while action generation requires neither future-video decoding nor optimal viewpoint annotations. We introduce RoboTwin-AV, a 50-task benchmark with executable pan/tilt control and automatically generated demonstrations. ActiveWAM improves TAVIS out-of-distribution success by up to 17.0 percentage points over the strongest baselines, achieves 20.0 additional points over Fast-WAM on RoboTwin-AV, and outperforms it by 26.7 points on real-world physical kitchen tasks.
- Abstract(参考訳): アクティブな視覚操作は、カメラとエンドエフェクターの両方を制御するポリシーを必要とするが、カメラモーションは、有限の観測窓の中でどの証拠が見えるかを決定する。
新しいビューを取得することで、タスククリティカルな手がかりを排除し、ビューを保持することで潜在的に有用な観察を防ぎます。
我々はこれをエビデンスを意識した残留問題として定式化し、観察と操作を共同で学習する統一世界行動モデルであるActiveWAMを提示する。
そこで本研究では,課題を含むソースエビデンスと可視時間変化による凍結映像の制約を行うトレーニングタイム・インバージョンを提案し,テストタイム・インバージョンや候補ランキングの必要性を排除した。
配備時に、このポリシーは、ビュー・アウェア・ヒストリから、ビュー・アウェア・ヒストリからの滞在および再取得行動を含む、バイマニュアルとパン/タイルのアクションを生成し、新たに測定されたRGB観測からコンテキストを更新する。
将来のビデオ予測はコトレーニング信号として機能し、アクション生成は将来のビデオデコードも最適な視点アノテーションも必要としない。
実行可能パン/チルト制御と自動生成デモを備えた50タスクのベンチマークであるRoboTwin-AVを紹介する。
ActiveWAMは、最強のベースラインよりも最大17.0ポイント、RoboTwin-AV上でFast-WAMよりも20.0ポイント、現実世界の物理的なキッチンタスクでは26.7ポイント向上している。
関連論文リスト
- CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight [68.8215501687831]
世界行動モデル(WAM)は、行動(意図)と視覚的未来(展望)を共同で予測する
本稿では,シミュレータで摂動動作を実行するCtrlWAMについて述べる。
運転実験では、より正確なアクション予測、生成されたビデオとアクションの緊密な一致、提供されたコマンドのより良い追従が示される。
論文 参考訳(メタデータ) (2026-10-01T00:23:01Z) - Recovering the View: Benchmarking Physical Active Vision for Occlusion Recovery in Robotic Manipulation [41.49608776044367]
物理的なアクティブビジョンは、タスク関連観測が信頼性を損なうと、ロボットが視点を変えることを可能にする。
BAVO-Benchは、クリーン、ステージオクルージョン、ランダム時間オクルージョンによる外部視認性を制御するバイマニュアルアクティブビジョンベンチマークである。
本稿では,共同視点と操作制御のためのアクティブビジョンポリシーであるA-FAR(Active Future-Aware Recovery)を提案する。
論文 参考訳(メタデータ) (2026-09-29T11:33:21Z) - Revision, Not Restart: Revisable Visual Plans for Closed-Loop World-Action Models [11.848736377015113]
修正可能な時間計画(Revisable Temporal Planning)は、視覚的未来を永続的な行動条件として維持し、フィードバック後に修正する。
タイムアウェア・ヒストリーは、観測された証拠を供給し、適応的なポリシーは、新しいノイズから保持、ブリッジリビジョン、または新しいリプランニングを選択する。
結果は、フィードバック駆動型視覚計画修正とクローズドループタスクのパフォーマンスを結びつける。
論文 参考訳(メタデータ) (2026-09-28T15:40:11Z) - Learning to Act under Visual Interruptions with Vision-Language-Action Models [24.391879026948306]
視覚言語アクション(VLA)モデルは、ロボット操作において強力な能力を示している。
それらは通常、タスク実行を通じて利用可能なすべてのカメラストリームで開発され、評価される。
VLAモデルによる視覚的中断を評価するベンチマークであるMAIL-Benchを紹介する。
視覚的入力を欠く場合、まずVLAポリシーを継続するように訓練するMINTを提案する。
論文 参考訳(メタデータ) (2026-09-28T12:06:49Z) - VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - Act2See: Emergent Active Visual Perception for Video Reasoning [70.52373240573856]
VLM(Vision-Language Models)は通常、ビデオの推論に静的な初期フレームに依存している。
本稿では,アクト・ツー・シー(Act2See)という,アクティブな視覚知覚を実現する新しいフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-05-03T00:52:51Z) - LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment [19.95295518800639]
一般的な視覚基盤モデルは、特殊エンボディ化潜在行動モデルより一貫して優れている。
ラテントベースの視覚空間は、ピクセルベースの空間よりも物理アクション空間に整合している。
論文 参考訳(メタデータ) (2026-04-13T16:30:35Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Argus++: Robust Real-time Activity Detection for Unconstrained Video
Streams with Overlapping Cube Proposals [85.76513755331318]
Argus++は、制約のないビデオストリームを分析するための堅牢なリアルタイムアクティビティ検出システムである。
システム全体としては、スタンドアロンのコンシューマレベルのハードウェア上でのリアルタイム処理に最適化されている。
論文 参考訳(メタデータ) (2022-01-14T03:35:22Z) - Anticipative Video Transformer [105.20878510342551]
Precipative Video Transformer (AVT) は、エンド・ツー・エンドの注意に基づくビデオモデリングアーキテクチャである。
我々は,連続した将来のフレームの特徴を予測可能なフレーム特徴エンコーダを学習しながら,ビデオシーケンスにおける次のアクションを予測するためにモデルを共同で訓練する。
論文 参考訳(メタデータ) (2021-06-03T17:57:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。