論文の概要: AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games
- arxiv url: http://arxiv.org/abs/2608.06362v1
- Date: Thu, 06 Aug 2026 17:57:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.814723
- Title: AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games
- Title(参考訳): AV-AIVAT:74xチーパーエージェントの評価
- Abstract要約: アクションインフォームド・バリューアセスメント・ツール(AIVAT)は条件付き平均ゼロ補正によって不完全情報ゲームの分散を低減する。
AIVATと継続的に監視される信頼性シーケンス(CS)を、任意の有意なAIVATに組み合わせる。
- 参考スコア(独自算出の注目度): 36.78901435452895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deciding which of two agents is stronger means playing games until skill outweighs luck, and every game costs money, model inference, or expert time. Since the number of games needed is unknown, fixed-budget evaluations either keep paying after the result is settled or stop before the agents can be told apart, while naive optional stopping with an ordinary confidence interval invalidates the stated level. We make such an evaluation stop as soon as its evidence suffices, with the guarantee intact. The Action-Informed Value Assessment Tool (AIVAT) reduces variance in imperfect-information games through conditional mean-zero corrections, by a median $54\times$ across 15 LLM agent configurations spanning 71,439 paired Heads-Up No-Limit Hold'em (HUNL) hands, but does not say when to stop. We combine AIVAT with continuously monitored Confidence Sequences (CSs) into anytime-valid AIVAT (AV-AIVAT), whose online value model learns only from past games so that no game scores its own correction. At the nominal 95\% level and a target precision of $\pm1$ Big Blind, raw outcomes need a median $74\times$ as many hands as AIVAT-corrected outcomes to stop under the Asymptotic CS (AsympCS). Exact finite-sample certification uses the Empirical-Bernstein CS (EB-CS), which needs an independently justified bound on corrected payoffs. We establish such a bound structurally for Leduc hold'em and characterize a width floor set by the CS's bet cap and that bound, which governs how much of a variance gain becomes earlier stopping; the descriptive HUNL EB-CS runs show a median $1.37\times$ stopping-time ratio. AV-AIVAT turns variance reduction into efficient, auditable early stopping while separating asymptotic screening from exact certification, so an evaluation can stop the moment its evidence suffices and hand a third party everything needed to recheck the verdict at that very stopping time.
- Abstract(参考訳): 2つのエージェントのどちらがより強いかを決めることは、スキルが幸運を上回るまでゲームをすることを意味し、すべてのゲームはお金、モデル推論、または専門家時間を必要とする。
必要なゲーム数は不明であるため、定額評価は結果が決着した後に支払いを継続するか、エージェントが切り離される前に停止するかのいずれかであり、通常の信頼区間での任意停止は、指示されたレベルを無効にする。
我々は、その証拠が十分であればすぐにそのような評価を停止させ、保証はそのままである。
Action-Informed Value Assessment Tool (AIVAT)は、条件付き平均ゼロ補正を通じて、71,439対のHeads-Up No-Limit Hold'em (HUNL)ハンドにまたがる15のLLMエージェント構成に対して、中央値の54\times$で不完全な情報ゲームの分散を減少させるが、いつ停止するかは定かではない。
AIVATと継続的に監視される信頼性シーケンス(CS)を組み合わさって、オンライン価値モデルが過去のゲームからのみ学習し、ゲームが独自の修正を行なわないような、任意の時間価のAIVAT(AV-AIVAT)を組み合わす。
95\%という名目で、目標精度が$\pm1$ Big Blindでは、Asymptotic CS (AsympCS)の下で止まるためには、AIVATが修正した結果と同じくらいの平均的な74\times$の成果が必要である。
特別な有限サンプル認証は、修正されたペイオフに対して独立に正当化された境界を必要とするEmpirical-Bernstein CS (EB-CS) を用いる。
我々は、Leduc hold'em の構造的構造を確立し、CS の賭けキャップによって設定された幅床と、変動利得のどれだけが早く停止するかを規定する境界を特徴付ける。
AV-AIVATは、偏差低減を効率よく監査可能な早期停止に転換し、漸近スクリーニングと正確な認証を分離する。
関連論文リスト
- When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents [8.579680185421324]
更新の受け入れは、エラー制御と学習機会の維持によって評価されなければならない、と我々は主張する。
標準対二項構成は、結果の不一致が稀な場合、この負担を軽減する。
学習力学のストレステストは、モデルバイアスとフィードバック選択誤差を区別する。
論文 参考訳(メタデータ) (2026-09-09T22:25:16Z) - Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation [38.06569764716213]
我々は,Emphbudget-Constrained confidence-scheduled limited response (CS-RNR)を導入する。
CS-RNRは、安全保証がエージェントが実際に展開する戦略に基づいて計算する証明書である最初の相手探索方式である。
論文 参考訳(メタデータ) (2026-07-30T16:57:57Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games [50.880420636090896]
9-player Werewolf環境において,隠れた役割に対する外部信頼状態を維持するための監査可能なフレームワークを構築した。
我々は,その効果を関連づけとして報告し,そのメカニズムを未解決として扱う。
論文 参考訳(メタデータ) (2026-07-12T16:03:30Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - Stopping Reliability in Adaptive Krylov-Shadow Quantum Fisher Information Estimation [0.0]
アダプティブ量子フィッシャー情報(QFI)推定は、精度と明らかな数値安定性を区別する停止規則を必要とする。
区間幅と局所クリロフ安定性に基づく幅のみの経験的停止則は,ポストホック誤差が要求される許容値を超えた場合でも,小さい$(K,M)$で収束を宣言できることを示す。
論文 参考訳(メタデータ) (2026-05-14T04:02:23Z) - Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques [62.94836578759359]
AIVAT推定の不確かさを定量化するために、不確実性がどのように伝播できるかを示す。
実験では,1万本のポーカーハンドのデータセットを用いて,病態と不確実性を示す。
論文 参考訳(メタデータ) (2026-05-14T02:04:26Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Beyond Greedy Exits: Improved Early Exit Decisions for Risk Control and Reliability [14.00844847268286]
早期のDeep Neural Networksは、中間層での予測を可能にすることで、適応推論を可能にする。
我々のフレームワークは、フルモデルのパフォーマンスと比較して、パフォーマンス低下(2%)を最小限に抑えながら、スピードアップ(1.70-2.10x)が一貫した改善を示している。
論文 参考訳(メタデータ) (2025-09-28T06:05:24Z) - Equal Opportunity of Coverage in Fair Regression [50.76908018786335]
我々は、予測の不確実性の下で公正な機械学習(ML)を研究し、信頼性と信頼性のある意思決定を可能にする。
本研究は,(1)類似した結果の異なる集団に対するカバー率が近いこと,(2)人口全体のカバー率が一定水準にあること,の2つの特性を達成することを目的としたカバーの平等機会(EOC)を提案する。
論文 参考訳(メタデータ) (2023-11-03T21:19:59Z) - ApproBiVT: Lead ASR Models to Generalize Better Using Approximated
Bias-Variance Tradeoff Guided Early Stopping and Checkpoint Averaging [7.0626076422397475]
トレーニングの損失と検証の損失をバイアスと分散のプロキシとして捉え、早期停止とチェックポイント平均化を導く。
先進的なASRモデルで評価すると、我々のレシピは2.5%-3.7%と3.1%-4.6%のCER削減をもたらす。
論文 参考訳(メタデータ) (2023-08-05T12:50:54Z) - Improve Agents without Retraining: Parallel Tree Search with Off-Policy
Correction [63.595545216327245]
木探索(TS)における2つの大きな課題に取り組む。
我々はまず、TSと事前学習された値関数による行動選択が、元の事前学習されたエージェントと比較して性能を低下させるという、反直感的な現象を発見し、分析する。
Batch-BFS(Batch-BFS)は,木の各深さのすべてのノードを同時に前進させるGPUワイドファースト検索である。
論文 参考訳(メタデータ) (2021-07-04T19:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。