論文の概要: Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions
- arxiv url: http://arxiv.org/abs/2607.00304v1
- Date: Wed, 01 Jul 2026 01:04:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.675912
- Title: Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions
- Title(参考訳): 評価フロンティアのマッピング:11つの評価条件におけるバイアス-信頼性トレードオフの実証調査
- Abstract要約: 実験ベースを11条件に拡張し、ガンマとHを11条件すべてで測定する。
低評価器結合(ガンマ0.2)の条件は高い測定ノイズを示す。
強い結合(ガンマ>0.9)を持つ条件は低雑音を実現する。
4つのGPT-4o条件はすべての種子にガンマ=0.000とH=1.000を示す。
- 参考スコア(独自算出の注目度): 1.0152838128195467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The bias-reliability tradeoff conjectures that LLM evaluation systems are constrained in (gamma, H, CV) space, where evaluator coupling (gamma), strategy diversity (H), and small-sample measurement reliability (CV(N)) cannot be simultaneously optimized at fixed sample size N. Prior evidence rests on n=5 conditions with complete metrics from a single study. We expand the empirical base to 11 conditions, measuring gamma and H for all 11 (nine with valid weight vectors) and CV(N=5) for seven with sufficient seeds (N >= 5). Five conditions provide the complete (gamma, H, CV) triple. The data confirm the trade-off: conditions with low evaluator coupling (gamma < 0.2) exhibit high measurement noise (CV(N=5) > 1.0), while conditions with strong coupling (gamma > 0.9) achieve low noise (CV(N=5) < 0.16). The correlation r(H, gamma) = -0.989 (n=5, excluding GPT-4o conditions) confirms that evaluator coupling suppresses strategy diversity. Four GPT-4o conditions show gamma=0.000 and H=1.000 across all seeds -- a pattern we attribute to version drift in the June 2026 GPT-4o API. No condition occupies the region {gamma < 0.2, CV(N=5) < 0.3}. We release all per-condition metrics as a standardized benchmark dataset for evaluator comparison.
- Abstract(参考訳): バイアス-信頼性のトレードオフは、LLM評価システムが(ガンマ, H, CV)空間において、評価器結合(ガンマ)、戦略多様性(H)、小サンプル測定信頼性(CV(N))を固定標本サイズNで同時に最適化できないという予想である。
実験ベースを11条件に拡張し,全11種(有効重量ベクトル9種)とCV(N=5種)を十分な種子(N>=5種)で測定した。
5つの条件が完全(ガンマ、H、CV)3倍を与える。
データはトレードオフを確認し, 高い測定ノイズ (CV(N=5) > 1.0) を示す一方, 強い結合条件 (ガンマ=0.9) は低いノイズ (CV(N=5) < 0.16) を達成する。
相関r(H, γ) = -0.989(n=5, GPT-4o条件を除く)は、評価器結合が戦略の多様性を抑制することを証明している。
4つのGPT-4o条件はすべての種にガンマ=0.000とH=1.000を示す。
領域 {gamma < 0.2, CV(N=5) < 0.3} を占有する条件はない。
評価器比較のための標準ベンチマークデータセットとして,条件ごとのメトリクスをすべてリリースする。
関連論文リスト
- Semiparametric Inference for Conditional Shapley Feature Importance [0.0]
本稿では, 条件定式化について検討し, その実条件分布の下で, 対数外特徴を積分する。
そこで本研究では, K-fold cross-fitting とU-statistic correct of the squared loss intervalを提案する。
ピンスカー型境界は、作業コプラクラスを誤って特定するバイアスを定量化し、ワインコプラは条件付きサンプリングが可能である。
論文 参考訳(メタデータ) (2026-09-09T15:19:24Z) - When Single-Dataset Conclusions Fail: A 45-Task Study of Threshold Tuning and Resampling for Imbalanced Classification [0.0]
クラス不均衡処理は、単一のベンチマークデータセットで定期的に評価される。
リークフリーなネスト型クロスバリデーションプロトコルの下では、デフォルト0.5しきい値のプレーンランダムフォレストがF1 = 0.861 +/-0.021に達する。
閾値調整の利点は、不均衡比において非単調である。
論文 参考訳(メタデータ) (2026-08-17T05:58:33Z) - Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion [46.262619407930266]
我々は、専門家のMITRE Center for Threat-Informed Defense mappingsから1,207 CVEのキュレートされた金のデータセットにマルチラベル分類器をトレーニングする。
その結果得られたモデルは、ゼロショットの埋め込み類似性のベースラインと比較して、おおよそdoubles recall@5である。
次に,LLMによるラベリングが金のデータセットを拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-28T10:59:04Z) - Condition-Stratified Robustness Analysis of Post-Hoc Calibration Methods for Probabilistic Classifiers [0.0]
温度スケーリング(TEMP)と等張回帰(ISO)を4つの制御条件で比較した。
ホルム補正制御(H1),ブライアスコア差(H2),キャリブレーション傾斜結果(H3),AUROC差(H4)の4つの仮説群が評価された。
論文 参考訳(メタデータ) (2026-07-13T13:28:31Z) - K-ABENA: K-Adaptive Backpropagation with Error-based N-exclusion Algorithm : (Compensated Loss-Based Sample Exclusion with Unbiased Gradient Estimation) [0.0]
K-ABENAK-Adaptive Backpropagation with Error-based N-exclusionは選択的な計算フレームワークである。
これは、少量の低損失("ミニ")観測を除外することで、イット当たりの計算トレーニングコストを削減する。
ラベル制限下で0.386の精度(ベースライン:0.832)、極端な不均衡下で0.53のAUCに崩壊する。
論文 参考訳(メタデータ) (2026-07-07T06:58:51Z) - A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents [0.0]
MPCI(Multimodal Preference Collapse Index)、評価器付き結合行列(evaluator-indexed coupling matrix)、Jensen-Shannon-rho(JSD)を8つの条件で適用した。
4つの条件は強い結合を示す(N=76, GPT-4o June, qwenrho-plus N=30, symmetric LR, DeepSeek self-eval)。
5月から6月にかけてのGPT-4oドリフトは最も有益な測定であり、診断装置が自身の不安定性を検出する。
論文 参考訳(メタデータ) (2026-06-29T02:55:01Z) - Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model [47.71489969727656]
Conformalized Quantile Regression (CQR)は、最も貧弱なモデル予測で、ビン内で最高のカバレッジを提供する。
局所的妥当性判別(Locally Valid and Discriminative, LVD)フレームワークのみが、有限サンプルの局所的妥当性を提供する。
論文 参考訳(メタデータ) (2026-06-05T18:29:19Z) - Non-Vacuous Certification of Transport MCMC via Oscillation-Controlled Normalizing Flows [3.8549131582427303]
運輸MCMCは、プレコンディションのメトロポリス-ハスティングの提案に正規化の流れを訓練する。
我々は、このようなサンプルに対して、初めて非空白で厳密なスペクトルギャップを定めている。
論文 参考訳(メタデータ) (2026-05-31T07:46:48Z) - BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies [1.3918848543076061]
VLA(Vision-suite-action)ポリシー、RoboMonkey、SEAL、MG-Select、V-GPSなどのメソッドに対するテストタイムスケーリングは、推論時にK候補アクションチャンクをサンプリングし、検証-ベストを実行する。
K-sample VLA推論のための最初の共形吸収層であるBOKBOを提案する。
論文 参考訳(メタデータ) (2026-05-28T23:39:09Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - Potential-energy gating for robust state estimation in bistable stochastic systems [0.0]
ダブルウェル・ダイナミクスによって制御されるシステムにおけるロバストな状態推定法である電位エネルギーゲーティングを導入する。
拡張フィルタ,アンセントフィルタ,アンサンブルフィルタ,適応カルマンフィルタ内にゲーティングを実装した。
論文 参考訳(メタデータ) (2026-02-12T08:43:34Z) - Almost Asymptotically Optimal Active Clustering Through Pairwise Observations [59.20614082241528]
そこで本研究では, ノイズと能動的に収集された応答を用いて, M$アイテムを未知数の$K$個別グループにクラスタリングするための新しい分析フレームワークを提案する。
クラスタリングの精度に対する望ましい信頼性を達成するのに必要なクエリ数の基本的下位境界を確立する。
我々は、一般化された同値比統計の計算可能な変種を開発し、その下限に対する性能ギャップを正確に推定できることを実証的に示す。
論文 参考訳(メタデータ) (2026-02-05T14:16:47Z) - Detecting Unobserved Confounders: A Kernelized Regression Approach [46.52607207396279]
Kernel Regression Confounder Detection (KRCD) は、単一環境下での非線形観測データにおける観測不能なコンバウンディングを検出する新しい方法である。
ゼロからの有意な偏差が観測不能な共起を示すテスト統計学。
合成ベンチマークとツインズデータセットの実験は、KRCDが既存のベースラインを上回るだけでなく、計算効率も優れていることを示した。
論文 参考訳(メタデータ) (2026-01-01T04:26:02Z) - Minimax Instrumental Variable Regression and $L_2$ Convergence
Guarantees without Identification or Closedness [71.42652863687117]
インストゥルメンタル変数(IV)回帰の非パラメトリック推定について検討した。
固定IV解に収束できる新しいペナル化ミニマックス推定器を提案する。
ラックス条件下での推定値に対して強い$L$誤差率を導出する。
論文 参考訳(メタデータ) (2023-02-10T18:08:49Z) - Near-Optimal Non-Parametric Sequential Tests and Confidence Sequences
with Possibly Dependent Observations [44.71254888821376]
我々は、一般的な非データ生成プロセスの下で、最初のタイプIエラーと予測リジェクション時間保証を提供する。
本研究では, 平均処理効果など, 方程式を推定することによって定義されるパラメータの推測に, 結果を適用する方法を示す。
論文 参考訳(メタデータ) (2022-12-29T18:37:08Z) - Near-optimal inference in adaptive linear regression [60.08422051718195]
最小二乗法のような単純な方法でさえ、データが適応的に収集されるときの非正規な振る舞いを示すことができる。
我々は,これらの分布異常を少なくとも2乗推定で補正するオンラインデバイアス推定器のファミリーを提案する。
我々は,マルチアームバンディット,自己回帰時系列推定,探索による能動的学習などの応用を通して,我々の理論の有用性を実証する。
論文 参考訳(メタデータ) (2021-07-05T21:05:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。