論文の概要: Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning
- arxiv url: http://arxiv.org/abs/2604.16683v1
- Date: Fri, 17 Apr 2026 20:41:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.127744
- Title: Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning
- Title(参考訳): Rewind-IL:Imitation Learningのためのオンライン障害検出と状態再起動
- Abstract要約: 提案するRewind-ILは,生成アクションチャンク模倣ポリシーのためのトレーニングフリーオンラインセーフガードフレームワークである。
Rewind-ILは、TIDE(Temporal Inter-chunk Discrepancy Estimate)に基づくゼロショット故障検知器と、状態再起動機構を結合する。
オンラインのRewind-ILは、重複するアクションチャンクの自己整合性を監視し、チェックポイントライブラリと類似性を追跡し、失敗すると、実行を最新の検証された安全な状態に戻す。
- 参考スコア(独自算出の注目度): 7.445072780282545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Imitation learning has enabled robots to acquire complex visuomotor manipulation skills from demonstrations, but deployment failures remain a major obstacle, especially for long-horizon action-chunked policies. Once execution drifts off the demonstration manifold, these policies often continue producing locally plausible actions without recovering from the failure. Existing runtime monitors either require failure data, over-trigger under benign feature drift, or stop at failure detection without providing a recovery mechanism. We present Rewind-IL, a training-free online safeguard framework for generative action-chunked imitation policies. Rewind-IL combines a zero-shot failure detector based on Temporal Inter-chunk Discrepancy Estimate (TIDE), calibrated with split conformal prediction, with a state-respawning mechanism that returns the robot to a semantically verified safe intermediate state. Offline, a vision-language model identifies recovery checkpoints in demonstrations, and the frozen policy encoder is used to construct a compact checkpoint feature database. Online, Rewind-IL monitors self-consistency in overlapping action chunks, tracks similarity to the checkpoint library, and, upon failure, rewinds execution to the latest verified safe state before restarting inference from a clean policy state. Experiments on real-world and simulated long-horizon manipulation tasks, including transfer to flow-matching action-chunked policies, demonstrate that policy-internal consistency coupled with semantically grounded respawning offers a practical route to improved reliability in imitation learning. Supplemental materials are available at https://sjay05.github.io/rewind-il
- Abstract(参考訳): 模倣学習は、ロボットがデモから複雑な視覚運動の操作スキルを習得することを可能にするが、特に長距離アクションチャンクポリシーでは、デプロイメントの失敗が大きな障害となっている。
一度実行が実演多様体から退避すると、これらのポリシーは失敗から回復することなく、しばしば局所的に妥当なアクションを生成し続ける。
既存のランタイムモニタでは、障害データ、良質な機能ドリフト下でのオーバートリガー、あるいはリカバリメカニズムを提供することなく障害検出を停止する必要がある。
提案するRewind-ILは,生成アクションチャンク模倣ポリシーのためのトレーニングフリーオンラインセーフガードフレームワークである。
Rewind-ILは、TIDE(Temporal Inter-chunk Discrepancy Estimate)に基づくゼロショット故障検知器を、分割された共形予測で調整し、ロボットをセマンティックに検証された安全な中間状態に戻す状態再起動機構と組み合わせる。
オフラインでは、視覚言語モデルがデモ中のリカバリチェックポイントを識別し、凍結ポリシエンコーダを使用してコンパクトなチェックポイント特徴データベースを構築する。
オンラインのRewind-ILは、重複するアクションチャンクの自己一貫性を監視し、チェックポイントライブラリと類似性を追跡し、失敗すると、クリーンなポリシー状態から推論を再起動する前に、実行を最新の検証された安全な状態に戻す。
実世界の実験と、フローマッチングアクションチョークされたポリシーへの移行を含む、シミュレーションされたロングホライゾン操作タスクの実験は、ポリシーと内部の一貫性が意味論的に根ざした再起動と組み合わせることで、模倣学習の信頼性を向上させるための実践的な方法が提供されることを実証している。
補足資料はhttps://sjay05.github.io/rewind-ilで入手できる。
関連論文リスト
- FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation [43.89036551517797]
VLA(Vision-Language-Action Models)は、複雑な長距離ロボット操作タスクへの一般化において、大きな可能性を証明している。
彼らのパフォーマンスは、通常、軌道単調で障害のないデモンストレーションで訓練されるため、不安定なままである。
我々は、リトライとリセットのパラダイムを通じて、堅牢なエラー回復機能を備えたVLAを実現する新しいフレームワークであるFLAREを提案する。
論文 参考訳(メタデータ) (2026-08-27T05:58:06Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Operational Hallucination and Safety Drift in AI Agents [0.3823356975862005]
ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
論文 参考訳(メタデータ) (2026-07-20T17:01:50Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - A Symbolic Neural CPU for Quantization-Simulated Writeback and Interpretable Program Execution [0.0]
本稿では、リカレント制御、明示的な演算ルータ、軌道監視を組み合わせたトレース制御型シンボリック・ニューラルCPUを提案する。
このモデルは選択した操作、ソースレジスタと宛先レジスタ、レジスタトラジェクトリ、メモリ信号、書き込みセマンティクスを公開する。
これらの結果は、解釈可能で、低精度で制御可能なニューラル実行のための、トレース検証可能なフレームワークを確立する。
論文 参考訳(メタデータ) (2026-07-10T22:55:23Z) - Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents [58.49879338545782]
ロングホライゾンタスクは、現実のロボット展開では一般的なものだが、そのようなタスクの障害検出は未調査のままである。
動作条件付き世界モデルからの潜在表現を用いて、操作軌跡をモニタする故障検出フレームワークであるForesightを提案する。
この結果から, 動作条件付きワールドモデル埋め込みは, 長距離操作における信頼性のある故障監視のためのスケーラブルな表現を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-22T09:32:28Z) - PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation [4.53884951709371]
我々は、デプロイ時の介入のためのアクションチャンク条件付潜時パッチイノベーションモニターを紹介する。
実際のロボットロールアウトデータの実験では、競合するランタイムモニタよりも安定したコンテキスト関連トリガを生成することが示されている。
論文 参考訳(メタデータ) (2026-06-15T13:24:41Z) - Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation [5.524438437366922]
変形可能なオブジェクト操作のための位相条件付き力覚フレームワークを提案する。
FiLM条件のACTエンコーダは、現在のタスクフェーズに基づいて特徴抽出を変調する。
視覚、力、ポーズフィードバックを融合させた多モード位相予測器は、視覚単独では見えない接触障害をリアルタイムで推定する。
論文 参考訳(メタデータ) (2026-05-28T05:59:53Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring [5.437966695589128]
我々は、接地された実行状態上で動作する有界な実施エージェントとして言語誘導の把握を再構築する。
未修正の学習操作プリミティブをラップする物理エージェントループを導入する。
眼内カメラD405を用いた移動マニピュレータのループを検証した。
論文 参考訳(メタデータ) (2026-04-08T08:01:35Z) - Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - Toward Operationalizing Rasmussen: Drift Observability on the Simplex for Evolving Systems [0.0]
障害へのドリフトのモニタリングはユークリッド異常検出によって妨げられる。
ラスムッセンの動的安全モデルは、競合する圧力の下でドリフトを動機付ける。
そこで本研究では,単純度に基づくドリフト可観測性に関するビジョンを提案する。
論文 参考訳(メタデータ) (2026-02-05T09:41:49Z) - Detection and Recovery of Adversarial Slow-Pose Drift in Offloaded Visual-Inertial Odometry [0.0]
エッジサーバにVIOをオフロードする現在のトレンドは、サーバ側の脅威表面を導く可能性がある。
非教師付きラベルなし検出・回復機構を提案する。
ILLIXRテストベッドを用いたリアルオフロードVIO環境におけるアプローチの評価を行った。
論文 参考訳(メタデータ) (2025-09-08T18:31:40Z) - Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent [9.370683025542686]
本稿では,サブタスク境界における障害の検出と修正を行う,アクティブなリプランニングフレームワークを提案する。
AI2-THORシミュレータの実験では,実行障害発生前の意味的および空間的ミスマッチを検出する。
論文 参考訳(メタデータ) (2025-08-15T07:48:51Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。