論文の概要: PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
- arxiv url: http://arxiv.org/abs/2606.28322v2
- Date: Tue, 30 Jun 2026 17:30:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.711016
- Title: PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
- Title(参考訳): PerceptionRubrics: 知覚に対するマルチモーダル評価の校正
- Abstract要約: PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
- 参考スコア(独自算出の注目度): 75.70273182182397
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce PerceptionRubrics, a rubric-based evaluation framework that addresses the gap between saturated benchmark scores and real-world brittleness. Shifting evaluation from holistic semantic matching to rigorous atomic auditing, PerceptionRubrics pairs 1,038 information-dense images with over 10,000 instance-specific rubrics. These criteria are derived from golden captions constructed via a novel Circular Peer-Review consensus pipeline and then distilled into a dual-stream system of Must-Right (essential facts) and Easy-Wrong (fine-grained details) rubrics. Crucially, PerceptionRubrics implements a Gated Scoring mechanism: unlike linear averages, failure on mandatory visual facts triggers sharp binary penalties. Extensive evaluation yields critical insights: (1) The Reliability Gap: models often verify fragmented elements correctly yet fail strict conjunctive constraints, exposing brittleness in dense domains; (2) Open-Closed Stratification: contrary to reasoning trends, we reveal a persistent 8% perception deficit between open-source and proprietary frontiers; and (3) Human-Aligned Rigor: our gated metrics substantially out-align conventional benchmarks, validating that strict perceptual fidelity is the prerequisite for reliable generation.
- Abstract(参考訳): PerceptionRubricsは,飽和ベンチマークスコアと実世界の脆さのギャップに対処するルーリックベースの評価フレームワークである。
PerceptionRubricsは、全体論的セマンティックマッチングから厳密な原子監査へ移行し、1万以上のインスタンス固有のルーリックを持つ1,038のインフォメーションセンスイメージをペア化する。
これらの基準は、新しいCircular Peer-Reviewコンセンサスパイプラインを通して構築された黄金のキャプションから導かれ、その後、Mut-Right(重要な事実)とEasy-Wrong(きめ細かい詳細)ルーリックの二重ストリームシステムに蒸留される。
重要なことに、PerceptionRubricsはGated Scoringメカニズムを実装している。
信頼性ギャップ(Reliability Gap):モデルは、しばしば断片化された要素を正しく検証するが、厳密な結合的制約を犯し、密集したドメインの脆さを露呈する。(2)オープン・クローズド・ストラテフィケーション(Open-Closed Stratification): 推論トレンドとは対照的に、オープンソースとプロプライエタリなフロンティア間の持続的な8%の認識障害(Human-Aligned Rigor): ゲートメトリクスは、ほぼ外向きの従来のベンチマークであり、厳密な知覚的忠実性が信頼できる生成の前提条件であることを検証します。
関連論文リスト
- Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - The Evaluation Game: Beyond Static LLM Benchmarking [2.168753020470345]
本稿では,評価者とトレーナーの相互作用を2人プレイヤゲームとして形式化するゲーム理論フレームワークを提案する。
モデルの局所性依存性を示す実証的証拠を提供する。
ベンチマークは静的なプロンプトのセットではなく,評価者のグループアクションの下での軌道である。
論文 参考訳(メタデータ) (2026-05-19T05:22:21Z) - K$α$LOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks [4.297070083645049]
本稿では,「ローカライゼーションファースト」の原理を一般化した統一メタアルゴリズムであるK$LOSを提案する。
合意を査定する前に空間対応を解消することにより,複雑な分類問題を名目上の信頼性に変換する。
論文 参考訳(メタデータ) (2026-03-28T08:54:05Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Rethinking Semi-supervised Segmentation Beyond Accuracy: Reliability and Robustness [10.220692937750295]
信頼性スコア(Reliable Score, RSS)は、予測精度、キャリブレーション、不確実性の測定を調和平均で組み合わせた新しい尺度である。
我々は、半教師付き学習研究と現実世界の展開ニーズをより良く整合させるために、RSSのようなより包括的なメトリクスへの評価プロトコルのシフトを提唱する。
論文 参考訳(メタデータ) (2025-06-06T09:37:45Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。