論文の概要: When Is a Learned Command Adapter Worth It? Closed-Loop Identification and Counterfactual Auditing of Frozen Locomotion Policies
- arxiv url: http://arxiv.org/abs/2607.21867v1
- Date: Thu, 23 Jul 2026 23:47:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.014102
- Title: When Is a Learned Command Adapter Worth It? Closed-Loop Identification and Counterfactual Auditing of Frozen Locomotion Policies
- Title(参考訳): 学習したコマンドアダプタの価値はいつあるか? : 冷凍ロコモーション政策のクローズドループ同定と偽監査
- Authors: Zongtan Li,
- Abstract要約: 本研究では,グローバルな運用ポイントゲイン,同状態対応ヘッドルーム,クロスフィット固定動作によるデプロイメントゲイン,周波数整合ランダム化ポリシによる状態割り当てゲインを分離するアダプタ要求監査を導入する。
ソースクラスタのリフィットは、これらの量と制約違反をGO/NO-GO/ABSTAIN決定にマップする。
Go2では、アーカイブされたスケール診断では、5.2%の同状態のヘッドルームがあるが、アロケーションの利得は0.55%しか得られていない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Adding a learned adapter to a frozen, command-conditioned locomotion policy is worthwhile only if the interface exposes improvements that are both real and recoverable from deployment-time observations. We introduce an adapter necessity audit that separates global operating-point gain,same-state counterfactual headroom, deployment gain over a cross-fitted fixed action, and state-allocation gain over a frequency-matched randomized policy. Source-cluster learner refits map these quantities and constraint violations to a GO/NO-GO/ABSTAIN decision. Closed-loop command- response identification provides optional decision features. On Go2, an archived scale-prefix diagnostic finds 5.2% same-state headroom but only 0.55% recovered allocation gain. Our confirmatory audit evaluates direct, scale, heading, and yaw interventions on twenty independent clusters for each of three query distributions induced by direct control, VGCC, and MPC, using 200 full learner refits. At 1% deployment and allocation thresholds and a 5% violation tolerance, direct queries return NO-GO, while VGCC and MPC queries ABSTAIN. VGCC has the largest mean deployment gain (1.34%), but its allocation lower bound is 0.09% and its violation upper bound is 6.25%. A deployment-representative twenty-cluster H1 audit also returns NO-GO, whereas a learner-level synthetic control returns GO. The audit therefore tests whether observable signal justifies state-dependent adaptation rather than presuming that an adapter is valuable.
- Abstract(参考訳): フリーズされたコマンド条件のロコモーションポリシに学習済みのアダプタを追加することは、インターフェースが実際の、およびデプロイ時の観察から回復可能な改善を公開する場合にのみ、価値がある。
本稿では,グローバルな運用ポイントゲインと準状態対応ヘッドルーム,クロスフィット固定動作によるデプロイメントゲイン,周波数整合ランダム化ポリシによる状態アロケーションゲインを分離するアダプタ要求監査を導入する。
ソースクラスタ学習者は、これらの量と制約違反をGO/NO-GO/ABSTAIN決定にマップする。
クローズドループのコマンド-レスポンス識別は任意の決定機能を提供する。
Go2では、アーカイブされたスケール修正診断では、5.2%の同状態のヘッドルームがあるが、リカバリしたアロケーションゲインは0.55%に過ぎなかった。
確認監査では, 直接制御, VGCC, MPC によって誘導される3つの問合せ分布に対して, 200 個の完全学習者補正を用いて, 20 個の独立したクラスタ上で直接, 規模, 方向, ヨーの介入を評価する。
1%のデプロイメントとアロケーションしきい値、5%の違反耐性で、直接クエリはNO-GOを返し、VGCCとMPCクエリはABSTAINを返します。
VGCCは展開率が最も高い(1.34%)が、アロケーションの低い上限は0.09%、違反の上限は6.25%である。
デプロイメントに代表される20クラスタのH1監査もNO-GOを返す一方、学習者レベルの合成制御はGOを返す。
したがって、監査は、アダプタが価値があると仮定するのではなく、観測可能な信号が状態依存適応を正当化するかどうかをテストする。
関連論文リスト
- CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training [14.51193578486111]
CLAPはビジネスデータを構造化されたSFTサンプル、意思決定基準サンプル、ホールドアウトセット、リスク診断、リリースゲートレコードに変換する。
匿名化された5つの製造・scenarioバッチでは、QLoRAスタイルのLoRA-SFTが平均利得を抑える。
論文 参考訳(メタデータ) (2026-07-02T08:07:56Z) - Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit [8.665845754660458]
AI生成ビデオ検出のGenVidBenchとAIGVDBenchが事実上のリーダーボードだ。
ほとんどの評価プロトコルは、報告された一般化を拡大できる制御されていない欠点を残している。
20紙の調査では、これをキャッチする標準的な6つのコントロールをすべて適用していない。
それらを監査プロトコルに組み合わせて、6つの代表的な特徴源に適用する。
論文 参考訳(メタデータ) (2026-06-30T00:29:53Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。