論文の概要: Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination
- arxiv url: http://arxiv.org/abs/2608.04618v1
- Date: Wed, 05 Aug 2026 09:24:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.799576
- Title: Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination
- Title(参考訳): 多様性以前の合意:不均一言語モデルコーディネーションのための検証-第1相補性
- Authors: Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Jie Li, Ru Zhang,
- Abstract要約: 候補のヘッドルームを置換権限から切り離し、後者を明示的で監査可能なオブジェクトとします。
提案手法であるCon Agreement-Before-Diversityは,フリーフリーでラベルのない決定ルールである。
- 参考スコア(独自算出の注目度): 11.215813718564283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Heterogeneous language-model ensembles expand the space of candidate responses, yet they lack a principled criterion for when a newly generated answer should supersede an already supported one. We decouple candidate headroom from replacement authority, rendering the latter as an explicit, auditable object. Our proposed method, Agreement-Before-Diversity (ABD), is a frozen, label-free decision rule: an anchor answer is retained if two additional trusted samples corroborate it under a fixed equivalence relation; otherwise, it is replaced by a heterogeneous synthesis. For this gating mechanism, we prove two exact identities. The first shows that the accuracy gap relative to unconditional synthesis is determined jointly by the agreement coverage and the anchor's advantage on the protected subset. The second shows that the gap relative to never synthesizing reflects a contrast between authorized recovery and authorized destruction. Neither identity assumes independence or calibrated confidence, and the expected inference cost is approximately eight minus five times the coverage in number of calls. Under blind, exact-ID evaluation, ABD achieves 59.43% on the complete LiveCodeBench-v6 (vs. 52.57% for Single9 and 52.00% for HAC; n = 175) and 75.00% on an untouched GPQA-Diamond split (both controls at 72.78%; n = 180). Furthermore, these identities localize every aggregate difference to an enumerable protected stratum: no discordant items occur among the 3 protected cases on LiveCodeBench, where coverage bounds the gate's contribution to 1.71 points a priori; 13 versus 8 discordant cases among 132 on GPQA-Diamond; and 12 versus 0 among 71 under a frozen anchor perturbation. Diversity supplies potential; verification structure supplies authority.
- Abstract(参考訳): 不均一な言語モデルアンサンブルは、候補応答の空間を広げるが、新しく生成された答えが既にサポートされている応答に取って代わるべきという原則的な基準を欠いている。
候補のヘッドルームを置換権限から切り離し、後者を明示的で監査可能なオブジェクトとします。
提案手法であるABDは,2つの信頼された標本が固定同値関係の下で相関すると,アンカー応答が保持され,それ以外は不均一な合成に置き換えられる。
このゲーティング機構について、2つの正確な同一性を証明する。
1つ目は、非条件合成に対する精度ギャップが、保護された部分集合に対する合意カバレッジとアンカーの優位性によって共同で決定されることである。
第二に、合成しないことに対するギャップは、承認された回復と承認された破壊の対比を反映していることを示している。
どちらのアイデンティティも独立性やキャリブレーションされた信頼を前提とせず、予想される推論コストは通話回数の約5分の1である。
盲目で正確なID評価では、ABDは完全なLiveCodeBench-v6(vs. 52.57%はSingle9、52.00%はHAC、n = 175)で59.43%、未タッチのGPQA-ダイアモンドスプリット(いずれも72.78%、n = 180)で75.00%を達成する。
さらに、これらのアイデンティティは、すべての集合的差を可算性保護層にローカライズする:LiveCodeBenchの3つの保護されたケースでは不協和物は発生せず、このケースでは、ゲートのコントリビューションが1.71ポイントまでの範囲内、GPQA-ダイアモンドの132件では13対8の非協和物、凍結アンカーの摂動下では71件中12対0の非協和物は発生しない。
多様性はポテンシャルを供給し、検証構造は権威を供給します。
関連論文リスト
- When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives [0.0]
我々は,集団知能研究における分散リビジョン結合を運用する。
条件付き不服従は虚偽の前提回復を+17.7ポイント改善することを示す。
介入スタンスシフトと前提保存率を正確さとともに報告することを推奨する。
論文 参考訳(メタデータ) (2026-08-04T14:19:59Z) - PriorProof: A Point-in-Time Measure of Technique Novelty for Formal Proofs [0.23689955632456092]
我々は、形式数学における時間相対的証明-ルート非標準性という、意図的なより狭い構成について研究する。
PriorProofは、その精巧な証明項の依存関係のフットプリントを抽出し、そのフットプリントの重み付けされた推定値をスコアする。
我々は、スコアギャップが解釈可能な信頼性指標を提供する分解可能な時間アンコール信号として、PreferProofを提案する。
論文 参考訳(メタデータ) (2026-07-18T23:10:00Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - The Matching Principle: A Geometric Theory of Loss Functions for Nuisance-Robust Representation Learning [0.5854803320592717]
線形ガウスモデル (Thm.A) における最適性を証明し, 展開のドリフトをゼロにする2次ペナルティに対する範囲被覆の必要性 (Thm.G) を示す。
13ブロック(MLからQwen2.5-7Bまで)のテストは、幾何と展開のドリフトに対する等方性対間違った方向の罰則と一致した。
Sigma_taskを推定し、Sigmaにマッチし、コントロールを実行し、タスクとジオメトリを別々にレポートする。
論文 参考訳(メタデータ) (2026-05-21T17:53:28Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation [0.0]
政策シミュレーションにおいて,大規模言語モデル(LLM)を用いたマルチエージェント検討システムの提案が進んでいる。
評価エージェントは、割り当てられた値の観点に関わらず、同じ選択肢に収束する。
我々は、三段階の審議フレームワークであるAI Councilを提示し、2つの介入をテストするための2つの政策シナリオにわたる120の審議を行う。
論文 参考訳(メタデータ) (2026-04-29T11:47:28Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Conditional Coverage Diagnostics for Conformal Prediction [47.93989136542648]
条件付きカバレッジ推定が分類問題であることを示す。
得られたメトリクスの族をターゲットカバレッジ(ERT)の過剰なリスクと呼びます。
ERTのオープンソースパッケージと、以前の条件付きカバレッジメトリクスをリリースしています。
論文 参考訳(メタデータ) (2025-12-12T18:47:39Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - A Weaker Faithfulness Assumption based on Triple Interactions [89.59955143854556]
より弱い仮定として, 2$-adjacency faithfulness を提案します。
より弱い仮定の下で適用可能な因果発見のための音方向規則を提案する。
論文 参考訳(メタデータ) (2020-10-27T13:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。