論文の概要: Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking
- arxiv url: http://arxiv.org/abs/2605.18852v1
- Date: Wed, 13 May 2026 12:18:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:08.669607
- Title: Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking
- Title(参考訳): エージェント評価と安定性を考慮したマルチモーダルLCMのロバストチェックポイント選択
- Authors: Qinwu Xu, Zhuoheng Li, Jessie Salas,
- Abstract要約: 評価の不確実性の下では、チェックポイントの選択を堅牢な決定問題として定式化する。
実世界のキュレートされたデータ、構造化LCMに基づく判断、および多段階ランキングプロトコルを統合する多段階フレームワークを提案する。
我々は、データ品質、特にOCR可読性は、評価の妥当性の重要な決定要因であることを示した。
- 参考スコア(独自算出の注目度): 0.4562811934651716
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Checkpoint selection for multimodal large language models (MLLMs) presents significant challenges when performance differentials are marginal and evaluation signals are prone to noise. Existing methodologies rely heavily on static benchmarks or pointwise scoring, which frequently misalign with in-the-wild usage and lack robust uncertainty estimation, particularly in OCR-heavy scenarios. In this work, we formulate checkpoint selection as a robust decision problem under evaluation uncertainty. We propose a multi-stage framework that integrates curated real-world data, structured LLM-based judgment, and multi-stage ranking protocols. The evaluation system orchestrates progressive refinement via pointwise filtering, listwise ranking, and pairwise comparison. To enhance reliability, we introduce subsampling-based confidence estimation and a percentile-based scoring formulation that captures distributional characteristics while penalizing tail failures. Furthermore, we demonstrate that data quality, specifically OCR readability, is a critical determinant of evaluation validity.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)のチェックポイント選択は、性能差が限界であり、評価信号がノイズに晒される場合、重大な課題を示す。
既存の手法は静的なベンチマークやポイントワイドスコアに大きく依存しており、特にOCR重大なシナリオにおいて、特に不安定な不確実性評価が欠如している。
本研究では,評価の不確実性の下で,チェックポイントの選択をロバストな決定問題として定式化する。
実世界のキュレートされたデータ、構造化LCMに基づく判断、および多段階ランキングプロトコルを統合する多段階フレームワークを提案する。
評価システムは、ポイントワイズフィルタリング、リストワイズランキング、ペアワイズ比較によるプログレッシブリファインメントをオーケストレーションする。
信頼性を高めるために、サブサンプリングに基づく信頼度推定とパーセンタイルに基づくスコアリングの定式化を導入し、テール故障をペナル化しながら分布特性を捉えた。
さらに、データ品質、特にOCR可読性は、評価妥当性の重要な決定要因であることを示す。
関連論文リスト
- LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy [1.3254304182988286]
本稿では,アダプティブ・コンフォーマル・セマンティック・エントロピー(ACSE, Adaptive Conformal Semantic Entropy)を提案する。
我々の不確実性スコアリング機能は、同じプロンプトに対する複数の多様な応答のクラスタリングセマンティックエントロピーに基づいている。
我々のアプローチは、最先端の不確実性定量化ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T20:56:11Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning [2.1461777157838724]
ReasonBENCHは,大規模言語モデル(LLM)推論における基盤不安定性を定量化する最初のベンチマークである。
異なる領域からのタスク全体で、推論戦略とモデルの大部分は高い不安定性を示す。
我々はさらに、解答率と安定性のトレードオフに対するプロンプト、モデル家族、スケールの影響を解析する。
論文 参考訳(メタデータ) (2025-12-08T18:26:58Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - CCE: Confidence-Consistency Evaluation for Time Series Anomaly Detection [56.302586730134806]
本稿では,新しい評価指標である信頼性・一貫性評価(CCE)を紹介する。
CCEは同時に、予測の信頼性と不確実性を測定する。
RankEvalは、さまざまなメトリクスのランキング機能を比較するためのベンチマークです。
論文 参考訳(メタデータ) (2025-09-01T03:38:38Z) - MCQA-Eval: Efficient Confidence Evaluation in NLG with Gold-Standard Correctness Labels [16.300463494913593]
大規模言語モデル (LLM) には堅牢な信頼度推定が必要である。
McQCA-Evalは、自然言語生成における信頼度を評価するための評価フレームワークである。
論文 参考訳(メタデータ) (2025-02-20T05:09:29Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。