論文の概要: COVER: Identifiable Evaluation of Coalition Routing
- arxiv url: http://arxiv.org/abs/2608.28475v1
- Date: Fri, 28 Aug 2026 16:01:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.388659
- Title: COVER: Identifiable Evaluation of Coalition Routing
- Title(参考訳): COVER:Coalition Routingの評価
- Abstract要約: マルチエージェントシステムがチームを変更すると、メッセージと最終回答も変更されるので、エンドツーエンドの精度ギャップはそれ自体がルーティング効果を識別しない。
結果が生成される前に、公開情報境界、下流スタックG、有限の法定チームファミリーを固定する評価契約を導入する。
完全なカバレッジは、そのスタック上の正確な有限括弧のオラクルの後悔条件を特定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a multi-agent system changes its team, it also changes the messages and final answer it produces, so an end-to-end accuracy gap does not by itself identify a routing effect. We introduce method, an evaluation contract that fixes a public information boundary, downstream stack G, and finite legal team family before outcomes are generated. Complete coverage identifies exact finite-benchmark oracle regret conditional on that stack. For any finite collection of frozen policies, executing the union of their distinct selected teams is the minimal assumption-free support for every pairwise policy contrast, though not for absolute oracle regret. Two controlled tables with source-ID-disjoint splits test the instrument. On MuSiQue-12, a pre-specified privileged positive control improves regret from 0.532 to 0.402; a later public-interface control reaches 0.424 versus 0.554 but is retrospective. On HotpotQA-4, a pre-specified public direct scorer improves regret from 0.313 to 0.110. In fixed-stack Llama execution, verified route regret improves by 0.190, while the raw-answer gain is 0.010 with an interval crossing zero. A five-family ToolSandbox variant-shift validation exhaustively evaluates 16 declared teams on 14 untouched task variants (224/224 valid rows): the declared-family oracle reaches 0.768 safe-evidence completion, while the prospectively frozen router gets 0.637 (regret 0.131), failing the predeclared 0.10 criterion. A later retrospective comparator reaches 0.655, matching all-workers with 4.57 versus 5.00 workers on average. Thus COVER exposes selection headroom without manufacturing a routing win. A crossed-stack diagnostic shows absolute scores depend on G but finds no detectable router-by-finalizer interaction. COVER is an auditable measurement methodology, not a claim of stack-invariant or universal agent-routing superiority.
- Abstract(参考訳): マルチエージェントシステムがチームを変更すると、メッセージと最終回答も変更されるので、エンドツーエンドの精度ギャップはそれ自体がルーティング効果を識別しない。
結果が生成される前に、公開情報境界、下流スタックG、有限の法定チームファミリーを固定する評価契約を導入する。
完全なカバレッジは、そのスタック上の正確な有限括弧のオラクルの後悔条件を特定する。
凍結した政策の有限の集まりに対して、それぞれの選択したチームの統合を実行することは、絶対的なオラクルの後悔のためではなく、ペアの方針のコントラストに対して最小限の仮定のないサポートである。
ソースIDが分離された2つの制御テーブルが楽器をテストする。
MuSiQue-12では、事前指定された正の制御が0.532から0.402に改善され、後の公衆インターフェース制御は0.554に対して0.424に達するが、振り返りである。
HotpotQA-4では、事前指定された公開直接スコアラーが0.313から0.110に後悔を改善している。
固定スタックのLlama実行では、検証された経路後悔は0.190向上し、原回答ゲインは0.010で、インターバルクロスゼロとなる。
5ファミリーのツールSandbox変分検証は、14の未修正タスク変分(224/224の有効な行)で16の宣言されたチームを徹底的に評価し、宣言されたファミリーのオラクルは0.768の安全証明完了に達し、予測される凍結ルータは0.637(regret 0.131)となり、事前宣言された0.10の基準を満たさない。
後のレトロスペクティブのコンパレータは0.655に達し、全労働者が平均5.00人に対して4.57人と一致している。
これにより、COVERは、ルーティング勝利を製造せずに選択ヘッドルームを公開する。
クロススタック診断では絶対スコアはGに依存するが、検出可能なルータとファイナライザの相互作用は見つからない。
COVERは監査可能な測定方法であり、スタック不変性やユニバーサルエージェントルーティングの優位性の主張ではない。
関連論文リスト
- LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks [3.789882665982407]
マルチエージェント大規模言語モデル(LLM)システムは、より多くの計算に費やして推論を改善することができる。
この決定は、各設定内に固定されたソルバを保持しながら、すべての問題を4つのプロトコルで実行することで分離する。
論文 参考訳(メタデータ) (2026-08-14T22:35:37Z) - QuoteBench: How Matched Scores Can Hide Command-Path Failures [30.480838412827907]
実行スコアだけでは、ジェネレーションエラーとジェネレーション後に導入された失敗を区別できない。
QuoteBenchはこの境界線を、インシデントから派生した14のファミリーから56のワンショットタスクに対して正確に最終状態の検証を行う。
コマンド発行エージェントの評価は、一致したスコアを本質的なモデル特性として扱うよりも、モデル構成、生成契約、実行経路、操作点、最終状態などを報告すべきである。
論文 参考訳(メタデータ) (2026-08-13T17:57:20Z) - Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents [29.96375986740068]
Harness-IFは、実行証拠から一度に1つの運用ルールをスコアする。
AP-Accは、不正なデフォルトに対してラベル付けされたルールのみをスコアする。
論文 参考訳(メタデータ) (2026-08-12T07:07:57Z) - What Would Fix This RAG Failure? Auditing Counterfactual Response with Paired Evidence Interventions [0.0]
我々はPair-IDを紹介した。Pair-IDは1つのクエリ、検索状態、読み取り定数を格納し、次に2つの操作を横断する。
19,981のベンチマーククエリで11,105のQwen障害が特定され、SHA-256オーダーが1200を選択して、サンプリングされた応答を生成する。
その結果,ハッシュ選択された有資格障害サンプルにおいて有意な速度でエビデンスが発生し,観察された故障から部分的に予測可能であり,読者に条件付きであることが示唆された。
論文 参考訳(メタデータ) (2026-08-09T22:43:27Z) - Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies [33.432377306905735]
タスクベクトル算術は、モデルを修正するためのクローズドフォームな方法を提供するが、クローズドループロボット制御において、その振る舞いの局所性は未だ不明である。
マルチタスク・ビジョン・ランゲージ・アクション(VLA: Multitask Vision-Language-action)ポリシーから,タスク・ベクターごとのタスク・ベクター・サブトラクションのターゲット・アンド・コントロール・監査を行う。
論文 参考訳(メタデータ) (2026-08-05T10:59:53Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion [46.262619407930266]
我々は、専門家のMITRE Center for Threat-Informed Defense mappingsから1,207 CVEのキュレートされた金のデータセットにマルチラベル分類器をトレーニングする。
その結果得られたモデルは、ゼロショットの埋め込み類似性のベースラインと比較して、おおよそdoubles recall@5である。
次に,LLMによるラベリングが金のデータセットを拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-28T10:59:04Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving [0.0]
言語モデルの安全性評価は、サービス構成を固定されたバックグラウンドインフラストラクチャとして扱うことが多い。
我々は4つのアーティファクト支援研究をペアテストプロトコルに合成する。
標準vLLMは、現在のスコアフリップ候補に対して22/55ラベルのフリップを再生し、VLLM_BATCH_INIANT=1を有効にすることで、同じテストを0/55フリップに削減する。
論文 参考訳(メタデータ) (2026-05-26T23:22:55Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。