論文の概要: Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees
- arxiv url: http://arxiv.org/abs/2608.02455v1
- Date: Mon, 03 Aug 2026 16:30:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.707286
- Title: Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees
- Title(参考訳): Aggregate-then-Calibrate for Human-centered Assessment with theoretical Guarantees
- Abstract要約: 人間の判断のみを用いる方法は、異質な専門知識と一貫性のない評価尺度に悩まされる。
AtC(Aggregate-then-Calibrate)は,これらの相補的な情報源を組み合わせた2段階のフレームワークである。
AtCは、人間のみまたはモデルのみの評価よりも精度と堅牢性を一貫して改善する。
- 参考スコア(独自算出の注目度): 15.471672928989138
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-centered assessment tasks, which are essential for systematic decision-making, rely heavily on human judgment and typically lack verifiable ground truth. Existing approaches face a dilemma: methods using only human judgments suffer from heterogeneous expertise and inconsistent rating scales, while methods using only model-generated scores must learn from imperfect proxies or incomplete features. We propose Aggregate-then-Calibrate (AtC), a two-stage framework that combines these complementary sources. Stage-1 aggregates heterogeneous comparative judgments into a consensus ranking using a rank-aggregation model that accounts for annotator reliability. Stage-2 calibrates any predictive model's scores by an isotonic projection onto the order, enforcing ordinal consistency while preserving as much of the model's quantitative information as possible. Theoretically, we show: (1) modeling annotator heterogeneity yields strictly more efficient consensus estimation than homogeneity; (2) isotonic calibration enjoys risk bounds even when the consensus ranking is misspecified; and (3) AtC asymptotically outperforms model-only assessment. Across semi-synthetic and real-world datasets, AtC consistently improves accuracy and robustness over human-only or model-only assessments. Our results bridge judgment aggregation with model-free calibration, providing a principled recipe for human-centered assessment when ground truth is costly, scarce, or unverifiable.
- Abstract(参考訳): 体系的な意思決定に不可欠な人間中心のアセスメントタスクは、人間の判断に大きく依存し、検証可能な基礎的真理を欠いている。
既存のアプローチはジレンマに直面している: 人間の判断のみを用いた手法は不均一な専門知識と一貫性のない評価尺度に悩まされ、一方モデル生成スコアのみを用いた手法は不完全なプロキシや不完全な特徴から学ぶ必要がある。
AtC(Aggregate-then-Calibrate)は,これらの相補的な情報源を組み合わせた2段階のフレームワークである。
Stage-1は、アノテータの信頼性を考慮に入れたランクアグリゲーションモデルを用いて、異種比較判定をコンセンサスランキングに集約する。
ステージ2は、任意の予測モデルのスコアを等調射影で順に校正し、順序の整合性を強制し、モデルの量的情報の多くを可能な限り保存する。
理論的には,(1)アノテータの不均一性をモデル化すると,同質性よりも厳密なコンセンサス推定が得られ,(2)アイソトニックキャリブレーションは,コンセンサスランキングが誤って特定された場合でもリスクバウンドを享受し,(3)AtCは漸近的にモデルのみの評価を上回っている。
半合成および実世界のデータセット全体にわたって、AtCは、人間専用またはモデル専用アセスメントよりも正確性と堅牢性を一貫して改善する。
本研究の結果は, モデルフリーキャリブレーションによる判断アグリゲーションを橋渡しし, 基礎的真理が高価で, 不十分で, 検証不可能な場合に, 人中心評価の原則的レシピを提供する。
関連論文リスト
- Calibration-Aware Uncertainty Cascades for Efficient Heterogeneous Model Collaboration [18.045450334322545]
不均一なモデルコラボレーションは、予測性能と推論コストのバランスをとるために、異なるモデルの相補的な強みを活用することを目指している。
既存のアプローチでは、ルーティング決定を固定されたタスクとモデルプールに結びつける訓練されたルータや、しきい値が不均一なモデル間で一貫性のあるセマンティクスを欠いている生の自信のカスケードに頼っているのが一般的である。
本稿では,各モデルの信頼性を独立に校正し,検証データを用いてデプロイメントポリシを選択する,シンプルなポストホックフレームワークであるCAUCを提案する。
論文 参考訳(メタデータ) (2026-09-10T12:14:54Z) - Dynamically Allocating Evaluation Effort for Model Ranking [60.00410111594536]
相関アームを用いたマルチアームバンディット構成において,マルチモデル人体評価をベストアーム識別問題として定式化する。
トップパフォーマンスモデル間の差別を改善することを示します。
これにより、評価はより速く、より安価で、より大規模な競争評価目標に適合する。
論文 参考訳(メタデータ) (2026-08-04T10:33:04Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge [51.93484138861584]
視覚生成モデルの急速な開発により、よりスケーラブルで人間に合わせた評価方法の必要性が高まっている。
K-Sort Evalは,後方補正と動的マッチングを統合した信頼性と効率的なVLMに基づく評価フレームワークである。
実験の結果、K-Sort EvalはK-Sort Arenaと一致した評価結果を提供する。
論文 参考訳(メタデータ) (2026-02-10T05:07:46Z) - Improving Minimax Estimation Rates for Contaminated Mixture of Multinomial Logistic Experts via Expert Heterogeneity [49.809923981964715]
凍結したエキスパートとして機能する事前訓練されたモデルを、新しいタスクを学ぶためにトレーニング可能なエキスパートとして機能するアダプタモデルに統合するトランスファー学習手法によって、汚染された専門家の混合(MoE)が動機付けられる。
本研究は, 地絡パラメータがサンプルサイズによって異なる困難な条件下で, パラメータを推定するための一様収束率を特徴付ける。
また、対応するミニマックス下限を定め、これらのレートがミニマックス最適であることを保証する。
論文 参考訳(メタデータ) (2026-01-31T23:45:50Z) - The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comprehensive Empirical Analysis of the CHC-LLM Incompatibility [0.0]
平均的な人間のIQスコアを達成するモデルは、結晶化された知識タスクにおいてゼロに近づいた二分精度を同時に示す。
この切断は、結晶化されたインテリジェンス領域において最も強く現れる。
人工知能の非人間性を認識するネイティブマシン認識アセスメントを開発するための枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-23T05:49:57Z) - What Does It Take to Build a Performant Selective Classifier? [30.90225954725644]
ベイズノイズ,近似誤差,ランキング誤差,統計的ノイズ,実装またはシフト誘起スラックについて検討した。
我々は,合成2モードデータと実世界のビジョンと言語ベンチマークを用いて,その分解を検証した。
その結果, (i)ベイズノイズとモデル容量の制限は, 実質的なギャップを考慮し, (ii) よりリッチで特徴を考慮したキャリブレータのみを有意義に改善し, (iii) データシフトは, 分散的に堅牢なトレーニングを必要とするスラックを別々に導入することを確認した。
論文 参考訳(メタデータ) (2025-10-23T05:48:40Z) - B-RIGHT: Benchmark Re-evaluation for Integrity in Generalized Human-Object Interaction Testing [18.822653709976784]
人間と物体の相互作用(HOI)は人工知能(AI)において不可欠な問題である
HICO-DETのような現在のベンチマークは以下の制限に直面している。
一般対象インタラクションテスト(B-RIGHT)における統合性のベンチマーク再評価という,新たなクラスバランスデータセットを提案する。
論文 参考訳(メタデータ) (2025-01-28T06:04:08Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z) - An Epistemic and Aleatoric Decomposition of Arbitrariness to Constrain the Set of Good Models [7.620967781722717]
最近の研究では、機械学習(ML)モデルがトレーニング手順の微妙な変更に対して非常に敏感であることが示されている。
安定性は, てんかん成分と動脈成分に分解され, 予測の一貫性と信頼性を捉える。
そこで本研究では,既存の精度と公平性の基準と合わせて,てんかんおよび失読の基準を含むモデル選択手法を提案し,良質なモデルの集合を絞り込むことに成功したことを示す。
論文 参考訳(メタデータ) (2023-02-09T09:35:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。