論文の概要: Beyond the Clock: Measuring the Value of Adaptive Revision
- arxiv url: http://arxiv.org/abs/2609.00874v1
- Date: Tue, 01 Sep 2026 08:07:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.458854
- Title: Beyond the Clock: Measuring the Value of Adaptive Revision
- Title(参考訳): クロックを超えて - 適応的修正の価値を測定する
- Authors: Ayushi Chadha,
- Abstract要約: 我々は,マネージャが低レベルの計算を統括するコミットメントを維持したり置き換えたりできる階層的潜在推論器について検討する。
3つの事前コミットされた訓練種のうち、学習されたリビジョンタイミングは質的に異なるポリシーを生成する。
コントローラは、その振る舞いを再現可能なタスクパフォーマンスの利点に変えることなく、内部状態でアクションを変更できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As agentic systems become compound systems, increasingly important decisions move above task execution itself: when should a higher-level controller preserve the strategy guiding another process, and when should it revise it? We study this meta-level control problem in a hierarchical latent reasoner whose manager can retain or replace a commitment governing lower-level computation. Across three precommitted training seeds, learned revision timing produces qualitatively different policies, ranging from an almost deterministic early clock to substantially more state conditioned schedule distributions, yet none outperforms the best forced timing policy evaluated on the same frozen checkpoint. This separates state dependence from decision value: a controller can vary its actions with internal state without turning that variation into a reproducible task-performance benefit. A deeper intervention study on the original checkpoint shows that timing itself is consequential and order-sensitive, while exhaustive enumeration reveals that a strong fixed schedule captures most of the measurable value available from timing at this decision budget. Counterfactual PERSIST/REPLAN diagnostics further show why score-level evidence can be misleading when predictability is dominated by decision position rather than within-position discrimination. Together, these results argue that learned meta-level control should be evaluated along three separate axes: whether its score depends on state, whether that dependence changes realized behavior, and whether those changes capture outcome value beyond a strong non-adaptive policy.
- Abstract(参考訳): エージェントシステムが複合システムになるにつれて、タスク実行自体よりも重要な決定がますます多くなっています。
我々は,このメタレベル制御問題を,マネージャが下位レベルの計算を統括するコミットメントを維持したり置き換えたりできる階層的潜在推論器を用いて検討する。
3つの事前コミットされたトレーニング種のうち、学習されたリビジョンタイミングは、ほぼ決定論的アーリークロックから、より状態条件のスケジュール分布まで、定性的に異なるポリシーを生成するが、同じ凍結チェックポイントで評価された最高の強制タイミングポリシーを上回るものはない。
コントローラは、そのバリエーションを再現可能なタスクパフォーマンスの利点に変えることなく、内部の状態でアクションを変更できる。
元のチェックポイントに関するより深い介入調査は、タイミング自体が連続的かつ順序に敏感であることを示し、一方、徹底的な列挙によって、強い固定スケジュールが、この決定予算のタイミングから得られる測定可能な値の大部分をキャプチャすることが明らかになった。
偽のPERSIST/REPLAN診断は、なぜスコアレベルの証拠が、位置内識別よりも判定位置によって予測可能性が支配される場合、誤解を招く可能性があるのかをさらに示している。
これらの結果は、学習したメタレベル制御が3つの異なる軸に沿って評価されるべきであると主張する。
関連論文リスト
- Revelation Control [0.0]
啓示制御(Revelation Control)は、意図された区別が連続的な決定を変更できるため、内部でのみ隠された状態を明らかにする価格設定された介入を選択する問題である。
我々はこの理論を学習システムに展開し、現在宣言されている情報に準ずる状態が将来の訓練に異なる反応をし、異なる行動を好むことができるようにした。
論文 参考訳(メタデータ) (2026-08-24T22:07:57Z) - Why2Speak: Faithful Reasoning for Abstaining Action Policies [0.19336815376402716]
我々は,直接的な意思決定方針,推論方針,教師付き微調整,強化学習を比較した。
最強の直接政策はより高い品質を達成するが、検査する理由を示さない。
監視された微調整は、推論を抑えるか、意思決定の質を向上させることなく維持する一方、強化学習は推論ポリシーを改善するのに失敗する。
論文 参考訳(メタデータ) (2026-08-21T02:00:21Z) - Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies [56.86456077356948]
凍結言語アクション(VLA)ポリシーは、テスト時に徐々に改善されている。
追加のサンプリングは、ポリシーのロールアウト内により優れた振る舞いが存在する場合にのみ有効である。
検索は、関連するアクションがポリシーによって確実に表現されない場合に最も有用である。
論文 参考訳(メタデータ) (2026-08-18T08:11:31Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - Confidence-Gated Robot Autonomy: When Does Uncertainty Actually Help? [0.0]
しきい値付き自律において、不確実性は主に、潜在的なエラーをランク付けする能力によって問題となる。
本研究では,スピアマンランク相関,ペアブートストラップ等価性テスト,行動/遅延合意を用いて不確実性を評価する。
論文 参考訳(メタデータ) (2026-05-18T08:35:27Z) - When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making [68.12864562049957]
身体ロボットシステムは、高レベルの推論をサポートするために、大規模言語モデル(LLM)ベースのエージェントにますます依存している。
エージェントはいつ、いつ、いつ行動すべきか?
本稿では,エンボディエージェントのリソース・アウェア・オーケストレーションのための階層的なフレームワークであるRARRL(Resource-Aware Reasoning via Reinforcement Learning)を提案する。
論文 参考訳(メタデータ) (2026-03-17T15:38:50Z) - The Confidence Gate Theorem: When Should Ranked Decision Systems Abstain? [0.0]
ランク付けされた決定システムは、いつランク付けされたアウトプットに介入するか、いつ停止するかを判断しなければならない。
信頼に基づく棄権が意思決定の質を単調に改善し、いつ失敗するかを考察する。
論文 参考訳(メタデータ) (2026-03-10T17:44:10Z) - STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search [3.587563440886175]
平均的正確性のために訓練された大規模言語モデル(LLM)は、しばしばモード崩壊を示し、複数の応答が妥当なタスクに対して狭い決定行動をもたらす。
我々は、この曖昧な制御を再導入するトレーニング不要のフレームワークであるSTEERを提案する。
2つの臨床トリアージベンチマークにおいて、STEERは温度に基づくサンプリングと静的なペルソナアンサンブルと比較して幅広い行動カバレッジを達成する。
論文 参考訳(メタデータ) (2026-02-02T22:10:32Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - GenDICE: Generalized Offline Estimation of Stationary Values [108.17309783125398]
重要なアプリケーションでは,効果的な推定が依然として可能であることを示す。
我々のアプローチは、定常分布と経験分布の差を補正する比率を推定することに基づいている。
結果として得られるアルゴリズム、GenDICEは単純で効果的である。
論文 参考訳(メタデータ) (2020-02-21T00:27:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。