論文の概要: Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
- arxiv url: http://arxiv.org/abs/2608.30880v1
- Date: Mon, 31 Aug 2026 14:39:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.449929
- Title: Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
- Title(参考訳): Zeva: 一般化可能な身体操作のためのインコンテキスト因果学習
- Abstract要約: 我々は、ポリシーモデルを凍結させながら、ロボット自身の物理的相互作用経験からコンテキスト内学習を可能にする最初のフレームワークであるZevaを紹介する。
シミュレーションと実世界の操作の実験により、ゼヴァは比較されたフロンティアVLAとWAMの中で最高の性能を達成していることが示された。
- 参考スコア(独自算出の注目度): 19.311665344912644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalizable embodied manipulation remains difficult to achieve through pretraining alone, due to unseen physical conditions in the real world. We argue that robots need to learn from their own physical interactions on the fly during real-world deployment and use this knowledge to inform subsequent actions. We present Zeva, the first framework that enables in-context learning from a robot's own physical interaction experience while keeping the policy model frozen. Zeva employs a Causal Interaction Extractor to encode an executed action and its induced state change into a causal interaction signal, which is stored in a dual-timescale causal memory. For subsequent actions, relevant causal interaction signals are retrieved from memory and injected into the frozen policy model as context. Experiments in simulation and real-world manipulation demonstrate that Zeva achieves the best performance among the compared frontier VLAs and WAMs and, more importantly, enables self-evolution during deployment without gradient updates. Its success rate continues to improve as the robot accumulates interaction experience. Furthermore, the acquired interaction experience can generalize across tasks.
- Abstract(参考訳): 一般化可能な具体的操作は、現実世界の見えない物理的条件のために、単独で事前訓練を行うことで達成し難いままである。
ロボットは、現実世界の展開中に自分の物理的相互作用から学習し、この知識を使ってその後の行動を知る必要がある、と我々は主張する。
我々は、ポリシーモデルを凍結させながら、ロボット自身の物理的相互作用経験からコンテキスト内学習を可能にする最初のフレームワークであるZevaを紹介する。
Zevaは、実行された動作とその誘導された状態変化を、デュアルタイムスケールの因果記憶に格納された因果相互作用信号に符号化するために、因果相互作用エクストラクタを使用する。
その後のアクションでは、関連する因果相互作用信号がメモリから検索され、凍結ポリシーモデルにコンテキストとして注入される。
シミュレーションと実世界の操作の実験は、Zevaが比較対象のフロンティアVLAとWAMの中で最高のパフォーマンスを実現し、さらに重要なのは、勾配更新なしでデプロイメント中の自己進化を可能にすることを示した。
ロボットが対話体験を蓄積するにつれて、その成功率は改善され続けている。
さらに、取得したインタラクションエクスペリエンスは、タスク全体にわたって一般化することができる。
関連論文リスト
- One-Shot Learning from Demonstration of Contact-Rich Robotic Manipulation by Identifying Physical Interactions [0.0]
デモから学ぶ(LfD)ことで、ロボットは人間から直接操作タスクを学習できる。
ほとんどのLfD法は、ロボットとその環境の間の物理的相互作用を明示的にモデル化していない。
物理的相互作用がどこでいつ起こるかを明確にするLfD法を提案する。
論文 参考訳(メタデータ) (2026-08-25T15:48:03Z) - EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning [14.891400906901433]
EvoHILは、報酬モデル、アクションジェネレータ、ヴィジュアルドメインを、段階的なヒューマン・イン・ザ・ループ学習プロセスに適合させる統一されたフレームワークである。
タスクの成功、人間確認ラベルとの合意、動作のスムーズさ、ループ中の人間と模倣のベースラインに対する完了時間を改善する。
論文 参考訳(メタデータ) (2026-08-04T16:12:05Z) - Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations [9.01493948952274]
汎用ロボット操作では、ロボットはオープンワールド環境で多様なタスクを実行する必要がある。
HEROは、ゼロ人のデモから自律的な能力の進化を可能にする自己改善型階層型エンボディエージェントである。
論文 参考訳(メタデータ) (2026-07-29T11:51:41Z) - CausalDrive: Real-time Causal World Models for Autonomous Driving [60.66609721457312]
制御可能でリアルタイムなファンデーション駆動の世界であるCausalDriveを紹介します。
CaulDriveは、最初のフロントビューフレーム、エゴ車両の軌道、マクロテキストプロンプトのみで動作する。
本稿では,(1)衝突アーティファクトを著しく緩和した生成的クローズループ評価,(2)ビデオ2Rewardモジュールによる大規模強化学習(RL)後トレーニング,(3)リアルタイムの人間-イン-ザ・ループシミュレーション,の3つのダウンストリームアプリケーションにおける汎用性を実証する。
論文 参考訳(メタデータ) (2026-06-13T15:04:44Z) - VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands [56.029505206531155]
Vision Guided Agile Interaction Control (VAIC)は、現在のコントローラとヒューマノイドロボットのギャップを埋める統合フレームワークである。
まず、特権教師政策は、正確な物体運動学と正確な環境状態を用いて多様な相互作用スキルを習得する。
第二に、デプロイ可能な学生ポリシーは、全体追跡を複数の軸にまたがる速度目標に置き換えることで、これらの能力を蒸留する。
論文 参考訳(メタデータ) (2026-06-08T09:52:55Z) - InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions [58.329946838699044]
人間は、明示的な全身運動のレベルで、物体と全身の相互作用を計画することは滅多にない。
このような事前のスケーリングは、ヒューマノイドがロコ操作スキルの構築と一般化を可能にする鍵となる。
我々は,強化学習による大規模模倣事前学習とポストトレーニングを通じて,統合生成コントローラを学習するフレームワークであるInterPriorを紹介する。
論文 参考訳(メタデータ) (2026-02-05T18:59:27Z) - DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation [78.60543357822957]
高度なロボティクスにとって、接触に富んだ相互作用による有害な操作が不可欠である。
DexHandDiffは,適応的デキスタラス操作のための対話型拡散計画フレームワークである。
当社のフレームワークは, 目標適応度の高いタスクにおいて, 平均70.7%の成功率を実現し, コンタクトリッチな操作における堅牢性と柔軟性を強調した。
論文 参考訳(メタデータ) (2024-11-27T18:03:26Z) - Learning Manipulation by Predicting Interaction [85.57297574510507]
本稿では,インタラクションを予測して操作を学習する一般的な事前学習パイプラインを提案する。
実験の結果,MPIは従来のロボットプラットフォームと比較して10%から64%向上していることがわかった。
論文 参考訳(メタデータ) (2024-06-01T13:28:31Z) - VIRT: Improving Representation-based Models for Text Matching through
Virtual Interaction [50.986371459817256]
本稿では,VIRT と呼ばれる新しいtextitVirtual InteRacTion 機構を提案する。
VIRTは、表現ベースのエンコーダに、対話ベースのモデルのように振舞いを模倣する仮想インタラクションを実行するよう要求する。
論文 参考訳(メタデータ) (2021-12-08T09:49:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。