論文の概要: How Many Humans Are 32 LLM Judges Worth?
- arxiv url: http://arxiv.org/abs/2609.21277v2
- Date: Thu, 24 Sep 2026 14:06:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.27619
- Title: How Many Humans Are 32 LLM Judges Worth?
- Title(参考訳): LLM審査員32人って何人?
- Abstract要約: 我々は,3つのChaosNLIタスクにおいて,固定された32judgeパネルと実験的な人間のラベル分布とをマッチングする。
バイナリエラー診断は1.971$-2.227$の有効票しか持たない。
例えば、$kin5,7$での徹底的な列挙は、正確さと$_H$の両方の基準線を上回り、パネルは常に存在することを示す。
- 参考スコア(独自算出の注目度): 3.842523259301338
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A panel's human-equivalent size is target-specific. Matching a fixed 32-judge panel to empirical human label distributions on three ChaosNLI tasks yields two distinct effective sizes: distributional-error matching gives $ν_{\mathrm{MSE}}=2.304$, $3.750$, and $3.445$, whereas spectral matching gives $ν_H=4.242$, $6.459$, and $6.499$, a gap of $1.72$--$1.89\times$; a binary-error diagnostic credits the same panels with only $1.971$--$2.227$ effective votes. Extrapolating the distributional-error curve at fixed squared mean residual, mean member variance, and normalized mean covariance gives asymptotes of $2.392$, $3.990$, and $3.655$, with 32 judges already reaching $94.0$--$96.3\%$. An exact spectral identity explains the gap: error depends on member energy and on the orientation of residual variation relative to averaging, information that the participation ratio (PR) discards. A realizable hard-label construction confirms that higher spectral diversity can coexist with worse distribution recovery even under equal member energies and nonnegative correlations, and the consensus direction retains $γ_{\mathrm{co}}=43.8\%$, $33.7\%$, and $35.9\%$ of centered residual variance. An external check on CC-1000, a 1,000-item Civil Comments subset with a different panel, gives $ν_H=2.84$. For panel choice, we establish an existence result and one feasible path: exhaustive enumeration at $k\in\{5,7\}$ shows that panels beating the accuracy-top-$k$ baseline on both accuracy and $ν_H$ always exist, and greedily swapping at most two members reaches $24.8$--$56.0\%$ higher $ν_H$ at $0.10$--$1.10$ percentage points higher accuracy. Our dataset and code are available at https://github.com/Chao1208/32judges-votes.
- Abstract(参考訳): パネルの人間と同等の大きさは、ターゲット固有である。
分散エラーマッチングは$ν_{\mathrm{MSE}}=2.304$、$3.750$、$3.445$を与えるが、スペクトルマッチングは$ν_H=4.242$、$6.459$、$6.499$を与える。
固定二乗平均誤差曲線を外挿すると、残差、平均メンバー分散、正規化平均共分散は2.392ドル、3.990ドル、3.655ドルとなる。
誤差は、メンバーエネルギーと平均値に対する残差の向きに依存するが、参加比(PR)が破棄される情報である。
実現可能なハードラベル構造では、高スペクトルの多様性は、均等なメンバーエネルギーと非負の相関の下でも、より悪い分布回復と共存し、コンセンサス方向は、$γ_{\mathrm{co}}=43.8\%$、$33.7\%$、$35.9\%$を維持している。
CC-1000の外部チェックは、異なるパネルを持つ1000文字のCivil Commentsサブセットであり、$ν_H=2.84$である。
パネル選択のために、我々は存在結果と実現可能な1つのパスを確立する: outive enumeration at $k\in\{5,7\}$ 精度-$k$ベースラインを上回り、$ν_H$ が常に存在することを示し、ほとんどの 2 人のメンバでグリードリーにスワップすると、より高い$ν_H$ が 0.10$--1.10$ の精度で2,4.8$--56.0% となる。
データセットとコードはhttps://github.com/Chao1208/32judges-votes.comから入手可能です。
関連論文リスト
- A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation [14.867869624585886]
評価器の構成妥当性を2次元プロファイルとして定式化する。
S と R は独立であり、スカラーの要約がすべての関連する比較を保存することはないことを示す。
これらの結果から, 評価対象構造の変化に対して, 高判定基準は弱い感度で共存できることが示唆された。
論文 参考訳(メタデータ) (2026-08-25T11:32:54Z) - Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps [9.710464466895521]
多数派の置換規則は、クエリの16.2%でシグナルを呼び出しながら、全体的な精度を82.44%から85.62%に向上させる。
HumanEval+/MBPP+では、16.2%のクエリでシグナルを呼び出しながら、多数派の置換規則が全体の精度を82.44%から85.62%に引き上げている。
論文 参考訳(メタデータ) (2026-08-07T08:14:46Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Are Diversity Metrics Measuring Diversity? A Capability-Controlled Audit of Majority-Vote Gain in LLM Ensembles [19.651323641444726]
5つの多様性対策が、最良メンバーに対する多数票獲得の予測因子として、追跡しているか、あるいは主に再表現能力を示すのかを問う。
オラクルゲインはサブセットの100%で陽性であるが、単純な投票では全標準サイズ3サブセットの9.98%で最強の会員に勝っている。
独立した予測器としての厳密な多様性、不一致、ダブルフォールトは、建設によってランク不足する。
論文 参考訳(メタデータ) (2026-07-22T22:34:57Z) - A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition [9.736740880077823]
部分的にラベル付けされたマルチタスク学習は、共有された影響の潜伏者に対する疎外化であることを示す。
s-Aff-Wild2では、フレームのわずか37%が3つのラベル全てを担っているが、これらのクラスは極めて不均衡である。
各タスクのソースが評価分割で選択されると、組み立て結果が報告される。
論文 参考訳(メタデータ) (2026-07-11T04:55:12Z) - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels [0.0]
LLM-as-a-judgeパネルは複数のモデルからの投票を集計する。
私たちは、その信頼性が独立投票の理想にどの程度劣るかを定量化します。
論文 参考訳(メタデータ) (2026-05-28T11:48:17Z) - Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach [53.824673312331626]
Implicit Demography Inference (IDI)モジュールは、k平均クラスタリングを用いて、音声感情認識(SER)におけるバイアスを軽減する
実験により、擬似ラベルIDIはサブグループの格差を減らし、フェアネスの指標を28%以上改善することが示された。
教師なしのIDIは、SERのパフォーマンスが3.6%未満のフェアネス指標を4.6%以上改善する。
論文 参考訳(メタデータ) (2025-05-20T14:50:44Z) - Retiring $\Delta$DP: New Distribution-Level Metrics for Demographic
Parity [47.78843764957511]
デルタDP$のフェアネス指標は、人口格差の違反を正確に測定することはできない。
確率密度関数曲線(ABPC)と累積密度関数曲線(ABCC)の2つの新しいフェアネス指標を提案する。
提案手法では, ABCC/ABPCがゼロ値であること, ABCC/ABPCがゼロ値であること, ABCC/ABPCが階層パリティを保証し, 分類しきい値の調整を行う。
論文 参考訳(メタデータ) (2023-01-31T06:43:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。