論文の概要: Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards
- arxiv url: http://arxiv.org/abs/2608.15980v1
- Date: Mon, 17 Aug 2026 00:19:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.494196
- Title: Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards
- Title(参考訳): 金は誰が? アンノテータープールの解体はアイテムレベルで大きく、小さなリーダーボードに隠されている
- Abstract要約: 評価ベンチマークはアノテータの採用によって構築され、それらのアノテータの同一性は実装の詳細として扱われる。
2,885件のMultiPrefアイテムには、両方のプールが全会一致で配置されているため、ネクタイ破りのコンベンションは一切ない。
しかし、両方のコーパスでは、結果のモデルリーダーボードはビット識別される: Kendall tau = 1.00 で、6つのモデルのうちゼロが置き換えられる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference benchmarks are built by hiring annotators, and the identity of those annotators is treated as an implementation detail. We measure what that detail buys. On the 2,885 MultiPref items where both pools are internally unanimous, so no tie-breaking convention is consulted at all, expert and crowd annotators assign a different majority label to 23.6% and name the opposite winner on 9.2%; on the 246 comparably unanimous MT-Bench cells, benchmark authors and recruited experts differ on 30.5% and reverse on 8.5%. Yet on both corpora the resulting model leaderboards are bit-identical: Kendall tau = 1.00 with zero of six models displaced. That invariance is far weaker evidence than it looks, and we quantify how weak. Switching pools moves a model's win rate by 1.9pp (SD), one adjacent pair in our own leaderboard sits 0.8pp apart and had a 38% chance of swapping, and an item-level bootstrap displaces at least one model in 28% of resamples. The observed zero is the common outcome, not a property of aggregation: on the same measured perturbation, a ten-model leaderboard is displaced with probability 0.86 and a twenty-model leaderboard with probability 0.9997. Reporting a six-model leaderboard is safe; the safety does not generalise, and everything that consumes labels per item is not safe at any size. We make the distinction precise, show that a widely used dataset's stated assumption of no intra-group annotator variability is false, and show that an LLM judge tracks the crowd pool over the expert pool on all three models we test, including one from a different vendor. All code, per-call outputs, and pre-registered decision rules will be released upon acceptance.
- Abstract(参考訳): 評価ベンチマークはアノテータの採用によって構築され、それらのアノテータの同一性は実装の詳細として扱われる。
私たちはその細部が何を買うかを測定する。
2,885のMultiPrefアイテムでは、両方のプールが全会一致であるため、タイブレークのコンベンションが全くないため、専門家と観客のアノテータは23.6%の異なる多数派ラベルを割り当て、反対の勝者を9.2%に指定している。
しかし、両方のコーパスでは、結果のモデルリーダーボードはビット識別される: Kendall tau = 1.00 で、6つのモデルのうちゼロが置き換えられる。
その不変性は見た目よりもはるかに弱い証拠であり、いかに弱いかを定量化します。
プールの切り替えはモデルの勝利率を1.9pp(SD)に、隣のペアが0.8pp離れて座っており、スワップする確率は38%、アイテムレベルのブートストラップは28%のリサンプルで少なくとも1つのモデルに取って代わる。
観測されたゼロは、凝集の特性ではなく、共通の結果である:同じ測定された摂動では、10モデルリーダーボードは確率0.86で、20モデルリーダーボードは確率0.9997で置き換えられる。
6モデルリーダーボードの報告は安全であり、安全は一般化せず、アイテムごとにラベルを消費するものはすべて、どんなサイズでも安全ではない。
我々は,広く使用されているデータセットがグループ内アノテータのばらつきがないという仮定が誤りであることを示すとともに,LLMの審査員が,テスト対象とする3つのモデルすべてにおいて,専門家プール上の群集プールを追跡することを示す。
すべてのコード、呼び出し毎の出力、事前登録された決定ルールは、受け入れ次第解放される。
関連論文リスト
- K-Bench: measuring model performance on real scientific agent requests [0.0]
K-Bench 01は、K-Dense Web上のライブユーザトラフィックからサンプリングされた一ターンリクエストから構築された評価である。
3人の盲目の言語モデル判事が8次元のルーリックに対して毎回得点した。
39,934点中47.6%が8点を下回った。
論文 参考訳(メタデータ) (2026-08-21T20:06:08Z) - Decorrelation Is Not Complementarity: Skill, Not Lineage, Governs Trusted-Monitor Ensembles [0.0]
本研究では,9系統にまたがる24個のオープンウェイトモニターと29倍の検知技術について検討した。
一致したメンバー能力では、クロスラインのパネルは良くない。
相関重み付けされた選択は、サンプルから最高のモニターを選ばない。
論文 参考訳(メタデータ) (2026-08-17T07:10:56Z) - Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations [0.0]
3つのオープンエージェントトレースベンチマークで、エージェントのメインエフェクトが各データセットとチェックタイプにおける全分散の3%未満を占めていることを示す。
3つの推定器に適合する4面の一般化可能性理論の分散分解を通してこれを達成する。
これをデプロイ決定信頼性(DDR:Deployment Decision Reliability)という,分散コンポーネントテーブルを企業購入者が防御できる5つの決定に変換する,ワンページレポートの規律にパッケージ化します。
論文 参考訳(メタデータ) (2026-08-11T18:16:51Z) - On-Policy Self-Distillation without Any Supervision [47.315224514076334]
我々は、内部整合性を通して、モデル自身の世代のみを用いて、政治上の自己蒸留を実現することができることを示す。
教師なしの政治自己蒸留(U-OPSD)を提案する。
論文 参考訳(メタデータ) (2026-08-06T17:18:23Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models [0.0]
マルチモデルLPMシステムは単一モデルの精度を上回ります。
彼らの利益は、ほとんど報告されない量で占められていることを示す。
論文 参考訳(メタデータ) (2026-06-25T17:06:06Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels [0.0]
LLM-as-a-judgeパネルは複数のモデルからの投票を集計する。
私たちは、その信頼性が独立投票の理想にどの程度劣るかを定量化します。
論文 参考訳(メタデータ) (2026-05-28T11:48:17Z) - Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus [0.0]
マルチエージェントLDM委員会は、異なるロールプロンプトの下で同じモデルを複製し、多数決によってアウトプットを集約する。
それぞれのエージェントのチェーン・オブ・シークレットの論理を組み込んで、100 GSM8Kの質問に3つのQwen2.5-14Bのエージェントでペアの類似度を測る。
DALCは、埋め込み幾何学から多様性重量を計算するトレーニングフリーコンセンサスプロトコルであり、GSM8Kでは87%、トークンコストでは84%に達する。
論文 参考訳(メタデータ) (2026-04-04T17:30:23Z) - WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild [57.272096543738336]
WildBenchは、大規模言語モデル(LLM)のベンチマーク用に設計された自動評価フレームワークである。
WildBenchは、100万以上の人間チャットボットの会話ログから慎重に選択された1,024のタスクで構成されている。
We have developed two metrics, WB-Reward and WB-Score which are computeable using Advanced LLMs。
論文 参考訳(メタデータ) (2024-06-07T09:15:44Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。