論文の概要: Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds
- arxiv url: http://arxiv.org/abs/2609.01453v1
- Date: Tue, 01 Sep 2026 15:57:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.82834
- Title: Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds
- Title(参考訳): 模倣学習はデクサラスマニピュレーションにおける時間的ロバスト性を保存するか? : タスク実行速度のエキスパート-ラーナー比較
- Authors: Clinton Enwerem, John S. Baras, Calin Belta,
- Abstract要約: 我々は,同じタスク条件,初期条件ドロー,スピードアップ要因の下で,専門家と学習者を比較した。
ロボットがパーセルを取得し、再配置し、挿入するコンタクトリッチなタスクであるParcelStowで評価をインスタンス化する。
スクリプトの専門家と、専門家のデモンストレーションから訓練されたAction Chunking with Transformers(ACT)ポリシーは、名目上の速度で100%タスクの成功を達成する。
- 参考スコア(独自算出の注目度): 5.99447754429793
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dexterous manipulation policies learned by imitation are typically evaluated for robustness to variation in scenes, objects, or instructions, but their performance across task execution speeds is less often examined. This leaves open how much temporal robustness a learner retains relative to the expert it imitates. We compare an expert and learner under the same task conditions, initial-condition draws, and speedup factors. We instantiate the evaluation in ParcelStow, a contact-rich task in which the robot acquires, reorients, and inserts a parcel. The demonstrations span the speedup range for the manipulation phases after parcel acquisition. A scripted expert and an Action Chunking with Transformers (ACT) policy trained from the expert's demonstrations both achieve 100 percent task success at nominal speed. Their success rates diverge within the demonstrated range: at its maximum, expert success is 84 percent and ACT success is 53 percent. Two ACT policies with different parameter initializations show similar degradation, decreasing by 34 and 48 percentage points from nominal speed to the maximum demonstrated speed, compared with 16 points for the expert. Stage-level analysis shows that 35 of ACT's 47 failures at the maximum demonstrated speed are insertion misalignments. Under the relative-motion handoff, every ACT acquisition retains the parcel through reorientation and transfer in free space, but only 64 percent complete the overall task, compared with 95 percent after expert acquisition. Across all evaluated policies and speeds, none of the 414 acquisitions without force closure completes the task. Equal nominal task success therefore does not imply preservation of expert performance across execution speeds. Code, data, and evaluation scripts are available at https://github.com/coenwerem/parcelstow.
- Abstract(参考訳): 模倣によって学習された有害な操作ポリシーは、通常、シーン、オブジェクト、命令の変動に対する堅牢性のために評価されるが、タスクの実行速度を越えたパフォーマンスは、あまり調査されない。
これにより、学習者がどの程度の時間的堅牢性を維持するかは、それが模倣する専門家に対して明らかになる。
我々は,同じタスク条件,初期条件ドロー,スピードアップ要因の下で,専門家と学習者を比較した。
ロボットがパーセルを取得し、再配置し、挿入するコンタクトリッチなタスクであるParcelStowで評価をインスタンス化する。
デモは、パーセル取得後の操作フェーズのスピードアップ範囲にまたがる。
スクリプトの専門家と、専門家のデモンストレーションから訓練されたAction Chunking with Transformers(ACT)ポリシーは、名目上の速度で100%タスクの成功を達成する。
彼らの成功率は、最大で専門家の成功率は84%、ACTの成功率は53%である。
パラメータの初期化が異なる2つのACTポリシは、専門家の16ポイントと比較して、名目速度から最大示速までの34ポイントと48ポイントの減少を示す。
ステージレベルの分析では、ACTの47の故障のうち最大速度での35は挿入ミスアライメントであることが示されている。
相対移動ハンドオフの下では、すべてのACT買収は、リオリエンテーションと自由空間の移動を通じてパーセルを保持するが、専門家獲得後の95%と比較して、全体のタスクを完了したのは64%に過ぎなかった。
評価されたすべてのポリシーとスピードの中で、強制閉鎖のない414の買収は、そのタスクを完了させません。
したがって、同等なタスク成功は、実行速度を越えた専門家のパフォーマンスの保存を暗示しない。
コード、データ、評価スクリプトはhttps://github.com/coenwerem/parcelstow.comで入手できる。
関連論文リスト
- Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks [39.959375504916494]
本稿では,長期タスクの学習と評価を改定するベンチマークであるBehavior-Skillを提案する。
50世帯のタスクにまたがる1万件のデモから、34のセマンティックスキルカテゴリから235,492のスキルインスタンスが含まれている。
本研究では,長期VLAポリシーの分析と改善のための中間機能プロファイルを公開することで,行動スキルがフルタスク評価を補完することを示す。
論文 参考訳(メタデータ) (2026-08-31T10:03:48Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning [44.701558695482476]
我々は,操作ポリシーの高速化に特化して設計された強化学習フレームワークであるSpeedTuningを紹介する。
SpeedTuningはアクションの最適な実行速度を予測し、基本ポリシーを補完する。
我々は、SpeedTuningが2.4倍のスピードアップで実行速度を大幅に改善する実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-08-10T05:31:41Z) - Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing [0.0]
共有実行モデルの下でメタ決定ポリシーを比較するためのオープンで検査可能なフレームワークであるMetaRoute-Benchを提案する。
タスク対応のコンポジションポリシは79.4%が成功し、強いワークロード固有の静的ポリシでは76.7%が成功している。
静的ポリシーとは対照的に、これは2.7パーセントの改善であり、ペアの95%CIプラスまたはマイナス2.0ポイント、平均コストが4.7%、レイテンシが6.4%向上している。
論文 参考訳(メタデータ) (2026-07-31T07:01:21Z) - Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark [0.0]
本稿では,タスクテキストからヘテロジニアスな操作を構成する,実行可能ベンチマークと予算対応メタルータを紹介する。
結果: 学習成功率は75.9%、静的ルーティングは93.5%、残る49%が安価で34.3ポイントを超える。
論文 参考訳(メタデータ) (2026-07-31T07:00:49Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - TransCurriculum: Multi-Dimensional Curriculum Learning for Fast & Stable Locomotion [50.54752207285298]
TransCurriculumは、アジャイル四足歩行のためのトランスフォーマーベースの多次元カリキュラム学習アプローチである。
シミュレーションでは,Unitree Go1ロボットに対するアプローチを検証し,Go1ハードウェア上でゼロショットでデプロイする。
論文 参考訳(メタデータ) (2026-03-14T23:44:42Z) - Exploring Expert Failures Improves LLM Agent Tuning [74.0772570556016]
本稿では,失敗した専門家の軌道から有益な行動を識別する専門的失敗の探索(EEF)を提案する。
EEFは、未解決のいくつかのサブタスクをうまく解決し、エージェントチューニング性能を改善する。
論文 参考訳(メタデータ) (2025-04-17T17:53:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。