論文の概要: Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks
- arxiv url: http://arxiv.org/abs/2607.20864v1
- Date: Thu, 23 Jul 2026 02:45:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.263863
- Title: Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks
- Title(参考訳): シーリング効果に隠れた位置バイアス: LLMベンチマークの置換診断
- Abstract要約: inspect_ai- 評価フレームワークのオープンソース拡張である inspect_permute を紹介します。
質問ごとに全問順順順順順に表示される。
ブートストラップの信頼区間を持つ位置バイアスのchi-squared / Cramer Vシグネチャを報告している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Position bias in multiple-choice LLM evaluation is widely cited as a confound in capability comparisons, but published measurements rely on single answer-order shuffles whose results confound the bias signal with content-level noise and sampling stochasticity. I introduce inspect_permute, an open-source extension to the inspect_ai evaluation framework that runs exhaustive answer-order permutations per question and reports the chi-squared / Cramer V signature of position bias with bootstrap confidence intervals. I apply the tool across four vendors (gpt-4o-mini, claude-haiku-4-5, gemini-2.5-flash, grok-3) on five MMLU subjects, 24,000 API calls under temperature-0 generation, with falsifier predictions pre-registered via a public SHA-256 hash before half the data was observed. Position bias turns out to be statistically detectable only within a roughly 60-95% base-accuracy Goldilocks zone. Below it, processing-load dominance swamps subject-specific signal; above it, ceiling effects compress the variance below the chi-squared test resolution. Detectable cells separate into two mechanism types: monotone A-to-D decrease (processing_load, in low-tier models) and non-monotone D-drop (content_ambiguity, in a narrow capability band). Standard MMLU places every frontier-tier model above the detection band, so absence of signal there should be read as not measurable, not unbiased. Together with the ceiling-effect characterisation in arXiv:2606.26185, this work brackets the detectable region of position-bias measurement and makes the field central question askable in a verifiable form. Package, data, preregistration under MIT.
- Abstract(参考訳): 多重選択LLM評価における位置バイアスは, 性能比較における欠点として広く引用されているが, 結果は, 偏差信号と内容レベルのノイズとサンプリング確率とを混同した単一応答順序シャッフルに依存している。
inspection_permuteは、inspect_ai評価フレームワークのオープンソース拡張で、質問ごとの完全な回答順序順の順列を実行し、ブートストラップの信頼性間隔で位置バイアスのchi-squared / Cramer Vシグネチャを報告します。
4つのベンダー(gpt-4o-mini, claude-haiku-4-5, gemini-2.5-flash, grok-3)で、MMLU被験者5名、温度0世代24,000のAPIコールを適用。
位置バイアスは、約60-95%の基準精度のゴールディロックゾーン内でのみ統計的に検出可能であることが判明した。
その下には、処理負荷の優位性が被写体固有の信号を湿らせ、その上に、天井効果がチ二乗検定の解像度以下の分散を圧縮する。
検出可能な細胞は、モノトンA-to-D減少(低層モデルでは処理_load)と非モノトンD-drop(狭帯域ではcontent_ambiguity)の2つのメカニズムタイプに分けられる。
標準MMLUは検出帯域の上のすべてのフロンティア層モデルを配置するので、信号の欠如は測定不可能であり、バイアスのないものではないと読み取るべきである。
この研究は、arXiv:2606.26185の天井効果の特徴化とともに、位置バイアス測定の検出可能な領域をブラケットし、検証可能な形でフィールド中央質問を問う。
パッケージ、データ、MITによる事前登録。
関連論文リスト
- GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models [19.055058751178056]
ジェネレーティブビジョン言語モデル(VLM)は、人間中心の設定での利用が増えている。
画像が人種や性別などの制御された属性でのみ異なる場合でも、人口統計学的に偏りのある出力を生成することができる。
GGSS--Geodesic-Gated Spherical Steering---Geodesic-Gated Spherical Steering--は、測地線に沿って視覚トークンを操る標準保存介入である。
論文 参考訳(メタデータ) (2026-08-26T04:58:40Z) - Change Detection in Probability Flow ODE: Online Testing in Diffusion Latent Spaces [0.0]
金融市場のトレンド逆転を識別するといった一連のデータタスクは、時間順データの分散シフトを検出することなく、完全に対処することはできない。
条件密度が未知の時間で切り替わる逐次的変化点検出問題を考えるが、事前および後変化分布は閉形式を認めない。
凍結文脈エンコーダを用いた事前変更点データに基づいて訓練された条件拡散モデルは、確率フローODEによる決定論的決定を定義する。
論文 参考訳(メタデータ) (2026-08-24T05:09:24Z) - Laplace-Fisher Gate Identities for Optimal Matrix-Gated Blended Score Estimation [0.0]
Laplace-Fisher Gate Identity (LFGI)
ベイズ逆問題に対する正規化密度評価のための有限参照LFGI推定器
LFGIと既知のモデルエビデンスを用いた実験は、ガウスと非ガウスの両方の設定における絶対的なエビデンス校正をチェックする。
論文 参考訳(メタデータ) (2026-06-23T21:00:32Z) - Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics [0.0]
電波障害の検知器は、通常、調整された分布で測定された単一のAUCで報告される。
アウト・オブ・ディストリビューション・データを見る前に、この楽観主義が予測できるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-20T14:10:59Z) - PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading [0.0]
PlotChainは、大規模言語モデル(MLLM)を評価するための決定論的、ジェネレータベースのベンチマークである。
PlotChainには15のプロットファミリーがあり、450のプロット(家族当たり30)がある。
上位モデルは80.42%(Gemini 2.5 Pro)、79.84%(GPT-4.1)、78.21%(Claude Sonnet 4.5)、GPT-4oは61.59%である。
論文 参考訳(メタデータ) (2026-01-29T06:08:19Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Benchmarking Fraud Detectors on Private Graph Data [70.4654745317714]
現在、多くの種類の不正は、グラフ上で動く自動検出アルゴリズムによって部分的に管理されている。
データ保有者が不正検知器の開発を第三者にアウトソースしようとするシナリオを考察する。
サードパーティは、不正検出をデータ保持者に送信し、これらのアルゴリズムをプライベートデータセットで評価し、その結果を公表する。
本システムに対する現実的なプライバシ攻撃を提案し,評価結果のみに基づいて個人データの匿名化を可能にする。
論文 参考訳(メタデータ) (2025-07-30T03:20:15Z) - CBW: Towards Dataset Ownership Verification for Speaker Verification via Clustering-based Backdoor Watermarking [85.68235482145091]
大規模音声データセットは貴重な知的財産となった。
本稿では,新しいデータセットのオーナシップ検証手法を提案する。
我々のアプローチはクラスタリングに基づくバックドア透かし(CBW)を導入している。
我々は,ベンチマークデータセットに対する広範な実験を行い,本手法の有効性とロバスト性を検証した。
論文 参考訳(メタデータ) (2025-03-02T02:02:57Z) - Less is More: Fewer Interpretable Region via Submodular Subset Selection [54.07758302264416]
本稿では,上述の画像帰属問題を部分モジュラ部分選択問題として再モデル化する。
我々は、より正確な小さな解釈領域を発見するために、新しい部分モジュラー関数を構築する。
正しく予測されたサンプルに対しては,HSIC-Attributionに対する平均4.9%と2.5%の利得で,Deletion and Insertionスコアを改善した。
論文 参考訳(メタデータ) (2024-02-14T13:30:02Z) - Proximity-Informed Calibration for Deep Neural Networks [49.330703634912915]
ProCalは、近接性に基づいてサンプル信頼度を調整する理論的保証を持つプラグアンドプレイアルゴリズムである。
ProCalは、近接バイアスに対処し、バランスの取れた、長い、分布シフトの設定の校正を改善するのに有効であることを示す。
論文 参考訳(メタデータ) (2023-06-07T16:40:51Z) - MAPS: A Noise-Robust Progressive Learning Approach for Source-Free
Domain Adaptive Keypoint Detection [76.97324120775475]
クロスドメインキーポイント検出方法は、常に適応中にソースデータにアクセスする必要がある。
本稿では、ターゲット領域に十分に訓練されたソースモデルのみを提供する、ソースフリーなドメイン適応キーポイント検出について考察する。
論文 参考訳(メタデータ) (2023-02-09T12:06:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。