論文の概要: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
- arxiv url: http://arxiv.org/abs/2610.02808v1
- Date: Fri, 02 Oct 2026 04:59:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.212859
- Title: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
- Title(参考訳): ROUTEAUDIT:Budgeted Multi-Verifier Routingのためのインタラクション・アウェア識別
- Abstract要約: 契約条件付き識別問題として検証器のルーティングを定式化する。
契約格子は、許容可能な橋の順序ごとに座標を平均化する。
ポリシー非依存の応答テープは、ペア化されたシーケンシャルコントラストを特定する。
- 参考スコア(独自算出の注目度): 21.87319355077669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adaptive multi-verifier systems are commonly compared through endpoint quality-cost gaps, even when the verifier catalog, availability, accounting, information filtration, or scorer changes with the policy. We formulate verifier routing as a contract-conditioned identification problem. The contract records request support, verifier catalog, realized availability, resource accounting, online filtration, and post-trace scoring; a matched route contrast changes only the policy coordinate. ROUTEAUDIT adds three measurable objects to this contract. A contract lattice averages coordinate increments over every admissible bridge order and reports the resulting attribution together with its path sensitivity. A policy-independent response tape identifies paired sequential contrasts when adaptive policies reveal different observations. For incomplete matching, request-level bounds use whichever potential outcome remains observed and give a sharp finite-population interval. The protocol commits paid observations and ledger events before the oracle join and returns an attribution certificate for each comparison. On two held-out raw-tail caches, matched static SF+SA equals the cascade, assigning the apparent gains of 0.1797 and 0.1250 over full static to the verifier-set edge. On 1,319 held-out task requests, the learned and RLVR studies report quality 0.9522 and 0.9553 versus 0.9484 for matched static; the RLVR-static paired difference is +0.0068 with a request-paired interval $[0.0015,0.0122]$ and a training-seed-by-request hierarchical interval $[0.0006,0.0131]$. Controlled attribution recovery yields route mean absolute error 0.0011 and endpoint reconstruction error 0.0004. Factorial, bridge-order, and stochastic-provider studies evaluate the certificate interface; RLVR supplies a learned-policy stress test under the same identification contract.
- Abstract(参考訳): 適応型多変量器システムは、検証器カタログ、可用性、会計、情報フィルタリング、スコアラーがポリシーによって変化する場合でも、エンドポイントの品質とコストのギャップを通じて一般的に比較される。
契約条件付き識別問題として検証器のルーティングを定式化する。
契約書は、要求サポート、検証者カタログ、実現可能な可用性、リソース会計、オンラインフィルタリング、およびポストトレーススコアを記録し、一致したルートコントラストはポリシー座標のみを変更する。
ROUTEAUDITはこの契約に3つの測定可能なオブジェクトを追加します。
契約格子は、許容される橋の順序ごとに座標インクリメントを平均化し、その結果の帰属を経路感度とともに報告する。
ポリシーに依存しない応答テープは、アダプティブポリシーが異なる観測結果を示すときに、ペア化されたシーケンシャルコントラストを特定する。
不完全マッチングでは、どの潜在的な結果が観測されたとしても、要求レベルのバウンダリが使われ、鋭い有限人口間隔が与えられる。
プロトコルは、オラクルが参加する前に、有償の観察と台帳イベントをコミットし、各比較に対して属性証明書を返す。
2つのホールドアウトされた生のテールキャッシュでは、マッチした静的SF+SAがカスケードに等しく、検証器セットエッジにフル静的で0.1797と0.1250の利得を割り当てる。
1,319件のタスクリクエストに対して、学習およびRLVR研究は、一致した静的に対して品質 0.9522 と 0.9553 対 0.9484 を報告し、RLVR-静的なペアリング差は+0.0068 であり、要求ペアリング間隔 $[0.0015,0.0122]$ とトレーニング・シード・バイ・要求階層区間 $[0.0006,0.0131]$ である。
制御された帰属回復は経路平均絶対誤差 0.0011 と終点再構成誤差 0.0004 を得る。
RLVRは、同一の識別契約の下で、学習されたストレステストを提供する。
関連論文リスト
- Audit-First VAPO: Risk-Certified Selective Updates under Imperfect Verification [23.835119696596095]
不完全な検証者は、クリップングや正規化がその大きさを束縛している場合でも、有害な更新を割り当てることができる。
Audit-First VAPOを導入し、離散的な方向入力と連続的な等級制御を分離する。
論文 参考訳(メタデータ) (2026-09-27T15:21:45Z) - OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning [23.835119696596095]
無効な結合は、隠された状態を隠蔽し、内因性ポリシーのランダム性を同期させ、または、偽の履歴が分岐した後の誤ったチャンスイベントを発生させる。
本稿では,限界保存,情報状態安全性,ブランチローカルなポリシーランダム性,セマンティックイベントアライメント,トレース・ビオークル・リプレイなどを通じて,許容可能なクラスを定義するフレームワークであるオブザーバセーフ・カウンタファクト・カップリング(O SCC)を紹介する。
我々は, 限界保存結合に対して, ポリシ・ヤコビアン重み付き対角外帰還共分散が雑音変化を決定することを示す勾配対応結合基準を導出する。
論文 参考訳(メタデータ) (2026-09-27T13:10:30Z) - Measurement Boundaries in LLM Financial Agent Evaluation: Fixed-Tape Execution and Multi-Defect Auditing [0.0635655952373977]
本研究では,金融エージェントの評価において,実行性能の解釈と監査スコアの2つの限界について検討する。
StudyAでは、3つの合成セッティング上での独立実行とストレスのある実行を比較することで、実行ルールと新しいモデル応答とポートフォリオフィードバックが混在する。
StudyBでは,従来のタスクをゼロ,1,2の欠陥タスクに,明示的なマルチラベルプロンプトで置き換えることによって,1から2の欠陥からの目標違反リコールの減少は,監査と情報源の組み合わせの5つのうち5つにおいて肯定的である。
論文 参考訳(メタデータ) (2026-09-26T08:54:21Z) - Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [69.06648810271712]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。