論文の概要: Atomic-Probe Governance for Skill Updates in Compositional Robot Policies
- arxiv url: http://arxiv.org/abs/2604.26689v2
- Date: Tue, 05 May 2026 12:06:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 14:45:21.130124
- Title: Atomic-Probe Governance for Skill Updates in Compositional Robot Policies
- Title(参考訳): 構成ロボット政策におけるスキル更新のための原子プローブガバナンス
- Abstract要約: スキルが置き換えられると、構成結果がどのように変化するかを分析する。
提案手法は原子品質プローブとハイブリッドセレクタで, スキルごとのプローブと選択合成の検証を組み合わせたものである。
原子品質調査は、私たちの知る限り、構成ロボットポリシーにおけるスキル更新管理のための第一原理で、デプロイ可能なプリミティブです。
- 参考スコア(独自算出の注目度): 15.314555403098318
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skill libraries in deployed robotic systems are continually updated through fine-tuning, fresh demonstrations, or domain adaptation, yet existing typed-composition methods (BLADE, SymSkill, Generative Skill Chaining) treat the library as frozen at test time and do not analyze how composition outcomes change when a skill is replaced. We introduce a paired-sampling cross-version swap protocol on robosuite manipulation tasks to characterize this dimension of compositional skill learning. On a dual-arm peg-in-hole task we discover a dominant-skill effect: one ECM achieves 86.7% atomic success rate while every other ECM is at or below 26.7%, and whether this dominant ECM enters a composition shifts the success rate by up to +50pp. We characterize the boundary on a simpler pick task where all atomic policies saturate at 100% and the effect is undefined. Across three tasks we further find that off-policy behavioral distance metrics fail to identify the dominant ECM, ruling out the natural cheap predictor. We propose an atomic-quality probe and a Hybrid Selector combining per-skill probes (zero per-decision cost) with selective composition revalidation (full cost), and characterize its Pareto frontier on 144 skill-update decisions. On T6 the atomic-only probe sits 23pp below full revalidation (64.6% vs 87.5% oracle match) at zero per-decision cost; a Hybrid Selector with m=10 closes most of that gap to ~12pp at 46% of full-revalidation cost. On the cross-task average over 144 events, atomic-only is within 3pp of full revalidation under a mixed-oracle caveat. The atomic-quality probe is, to our knowledge, the first principled, deployment-ready primitive for skill-update governance in compositional robot policies.
- Abstract(参考訳): デプロイされたロボットシステムのスキルライブラリは、微調整、新鮮なデモ、ドメイン適応を通じて継続的に更新されるが、既存の型付け合成メソッド(BLADE、SymSkill、生成スキルチェイン)は、テスト時にライブラリを凍結として扱い、スキルが置き換えられたときに構成結果がどのように変化するかを分析しない。
合成スキル学習のこの次元を特徴付けるために,ロボットスーツ操作タスクにペアサンプリング・クロスバージョンスワッププロトコルを導入する。
1つのECMは86.7%の原子成功率、もう1つのECMは26.7%以下であり、この支配的なECMが組成に入るかどうかは+50pp以下に変化する。
我々は、すべての原子政策が100%飽和し、その効果が未定義である単純なピックタスクにおいて境界を特徴づける。
3つのタスクにわたって、非政治行動距離の指標が支配的なECMを特定できず、天然の安価な予測器を除外する。
そこで本研究では,原子品質プローブとハイブリッドセレクタを用いて,各スキル別プローブ(ゼロ・パー・決定コスト)を選択的組成補正(フル・コスト)と組み合わせ,144のスキル更新決定においてパレートフロンティアを特徴付ける。
T6では、原子のみのプローブは全復号化(64.6%対87.5%のオラクルマッチ)より23pp低く、m=10のハイブリッドセレクタは全復号化コストの46%で12ppに近づいた。
平均144回以上にわたるクロスタスクでは、原子のみが3pp以内である。
原子品質調査は、私たちの知る限り、構成ロボットポリシーにおけるスキル更新管理のための第一原理で、デプロイ可能なプリミティブです。
関連論文リスト
- GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation [63.853929983870955]
本稿では,ジェニー・エンスペクタ法 2.0 (GE-Act 2.0) について紹介する。
制御指向オートエンコーダ(CoAE)、ワンステップビジュアルプランナー(SVP)、逆ダイナミクスモデル(IDM)を組み合わせている。
それらのコンポーネントは、知識に整合した選択最適化(KASO)で共同で訓練され、記録された行動に適合していると判断された予測された未来のみを選択することで、ミスマッチした監視を減らす。
論文 参考訳(メタデータ) (2026-09-04T17:16:48Z) - Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL [31.348699617272732]
Envs-FORGEは、検証者報酬を種ごとの環境合成アクションに変換するプロンプトポリシーである。
シードパス率を推定し、ターゲット学習フロンティア周辺で6つのプロジェクション指向アクションをスコアし、シードごとの混合整数線形プログラムを解決する。
すべての合成法は100個の認証された環境を輸出し、2.27M-2.88M合成トークンを使用する。
論文 参考訳(メタデータ) (2026-08-14T13:54:22Z) - CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning [5.894992157122175]
我々は,アルゴリズムに適合した批評家の適合と高レジデンシャル・トランジションの獲得を交互に行う,批評家誘導のセレクタであるCODSを紹介する。
10%の予算で、CODSは20の有効なD4RLタスク-アルゴリズム細胞に対して96.6%の許容プール性能を維持している。
論文 参考訳(メタデータ) (2026-08-07T19:11:54Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment [53.913175773174636]
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
論文 参考訳(メタデータ) (2026-07-15T17:16:24Z) - EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents [75.01735520608075]
既存のベンチマークは、直観的信念を問うことで、主にリテラル・オブ・マインド(ToM)をテストする。
EnactToMは, 3D 家庭で設定された300個のマルチエージェントタスクの進化ベンチマークである。
ハードスプリットでは、7つの評価されたフロンティアモデルすべてが機能的なタスク完了時に0.0%のPass3を獲得し、リテラルな信念プローブでは平均45.0%であった。
論文 参考訳(メタデータ) (2026-05-11T00:04:19Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Singularity Avoidance in Inverse Kinematics: A Unified Treatment of Classical and Learning-based Methods [0.0]
学習ベースアプローチの急速な発展により古典特異性損なうIKを橋渡しする。
体系的な分類法は、幾何構造と堅牢性を保証することによってメソッドを分類する。
条件の整った目標でも純粋な学習手法が失敗することを示す。
論文 参考訳(メタデータ) (2026-04-15T02:14:01Z) - Belief Dynamics for Detecting Behavioral Shifts in Safe Collaborative Manipulation [3.198214897627444]
ManiSkill共有ワークスペース操作タスクにおいて、制御された非定常性の下でのシステマティックスウィッチ検出について検討する。
10つの検出方法と5つのランダムなシードによって、検出が可能になったことにより、スウィッチ後の衝突が52%減少する。
UA-TOMは、凍結した視覚-言語-行動制御バックボーンを増強する軽量な信念追跡モジュールである。
論文 参考訳(メタデータ) (2026-04-04T02:41:09Z) - Umwelt Engineering: Designing the Cognitive Worlds of Linguistic Agents [0.0]
スタック・スタック・エンジニアリングにおける第3層として言語認知環境の設計を提案する。
2つの実験は、推論の媒質を変えることがそれ自体を変えるという仮説を検証した。
論文 参考訳(メタデータ) (2026-03-29T10:49:50Z) - FORMICA: Decision-Focused Learning for Communication-Free Multi-Robot Task Allocation [0.802904964931021]
ロボット間通信を使わずに高品質なタスクアロケーションを実現する学習ベースのフレームワークを提案する。
提案手法は,解析的平均場近似における系統的誤差を補正するために入札分布を推定する。
我々は予測器をエンドツーエンドに訓練し、予測エラーよりもタスク割り当てレグレを最小化する。
論文 参考訳(メタデータ) (2026-02-20T21:26:46Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Fortytwo: Swarm Inference with Peer-Ranked Consensus [36.94429692322632]
我々は、AI推論において優れたパフォーマンスを達成するために、Swarmの知能原則と分散ペアのランキングコンセンサスを活用する新しいプロトコルFortytwoを提案する。
独自のBradley-Terry-styleアグリゲーションモデルを用いて、Swarm推論が多数決をかなり上回ることを示す。
論文 参考訳(メタデータ) (2025-10-27T23:19:48Z) - Rethinking Bimanual Robotic Manipulation: Learning with Decoupled Interaction Framework [51.39847596489193]
バイオマチックなロボット操作は、ロボティクスコミュニティにおいて、新しくて重要なトピックである。
本稿では,バイマニュアル操作における異なるタスクの特徴を考察した,疎結合なインタラクションフレームワークを提案する。
我々のフレームワークは,SOTA法よりも23.5%向上し,優れた性能を実現している。
論文 参考訳(メタデータ) (2025-03-12T09:28:41Z) - Improving Bias Correction Standards by Quantifying its Effects on Treatment Outcomes [54.18828236350544]
Propensity score matching (PSM) は、分析のために同等の人口を選択することで選択バイアスに対処する。
異なるマッチング手法は、すべての検証基準を満たす場合でも、同じタスクに対する平均処理効果(ATE)を著しく異なるものにすることができる。
この問題に対処するため,新しい指標A2Aを導入し,有効試合数を削減した。
論文 参考訳(メタデータ) (2024-07-20T12:42:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。