論文の概要: Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
- arxiv url: http://arxiv.org/abs/2604.27405v1
- Date: Thu, 30 Apr 2026 04:16:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.921951
- Title: Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
- Title(参考訳): LLM評価のためのモデル内信頼度変化検出
- Authors: Jon-Paul Cacioli,
- Abstract要約: Llama 3から3.1(+1.6点)とQwen 2.5から3(+2.8点)の2つの家庭内ペアが試験された。
完全なベンチマークでは、ほとんどの項目は信頼性のある変更を示さなかった(79%と72%)。
分析可能な項目の中では、大きな効果の大きさで双方向に変化が見られた。
低精度のアイテムは改善され、高精度のアイテムは劣化した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We adapted the Reliable Change Index (RCI; Jacobson and Truax, 1991) from clinical psychology to item-level LLM version comparison on 2,000 MMLU-Pro items (K=10 samples at T=0.7). Two within-family pairs were tested: Llama 3 to 3.1 (+1.6 points) and Qwen 2.5 to 3 (+2.8 points). On the full benchmark, most items showed no reliable change (79% and 72%). However, over half the items were floor/ceiling. Among analysable items, change was bidirectional with large effect sizes: 34% improved and 28% deteriorated for Llama; 47% improved and 39% deteriorated for Qwen (median |delta p| = 0.50 and 0.90). Churn was asymmetric by difficulty: low-accuracy items improved, high-accuracy items deteriorated. Domain-level decomposition revealed family-specific reversals: Llama lost physics while Qwen lost law. Greedy single-shot evaluation missed 42% of reliably changed items and falsely flagged 25% of unchanged items. The aggregate accuracy gain is the net residual of opposing item-level movements. We recommend reporting churn rate alongside aggregate accuracy.
- Abstract(参考訳): 信頼性変化指標(RCI, Jacobson and Truax, 1991)を臨床心理学から2000 MMLU-Pro項目(T=0.7のK=10サンプル)の項目レベルLLMバージョンと比較した。
Llama 3から3.1(+1.6点)とQwen 2.5から3(+2.8点)の2つの家庭内ペアが試験された。
完全なベンチマークでは、ほとんどの項目は信頼性のある変更(79%と72%)を示さなかった。
しかし、半数以上の品物は床/床であった。
分析可能な項目では、大きな効果サイズで双方向に変化し、Llamaは34%、Llamaは28%、Qwenは47%、Qwenは39%改善した(median |delta p| = 0.50, 0.90)。
チャーンは非対称であり、低い精度のアイテムは改善され、高い精度のアイテムは劣化した。
ラマは物理学を失い、クウェンは法を失った。
グリーディ単発評価では、確実に変更されたアイテムの42%を見逃し、変更されていないアイテムの25%を誤ってフラグ付けした。
集約精度ゲインは、反対のアイテムレベルの動きの純残差である。
集計精度とともに、チャーン率の報告を推奨する。
関連論文リスト
- Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations [2.7946918847372277]
大規模言語モデルは、数学的推論ベンチマークにおいて強い性能を示すが、意味を保存する表面摂動に対して驚くほど脆弱である。
我々は677 GSM8K問題に対して,3つのオープンウェイトLLM(Mistral-7B,Llama-3-8B,Qwen2.5-7B)を意味論的に等価な変種と組み合わせて評価した。
3つのモデルはいずれも相当な解答フリップ率(28.8%-45.1%)を示し、数字のパラフレーズは名前スワップよりも一貫して破壊的である。
論文 参考訳(メタデータ) (2026-04-02T05:30:20Z) - Boosting LLMs for Mutation Generation [35.905252475438466]
SMART(Semantic Mutation with Adaptive Retrieval and Tuning)を紹介する。
Defects4J と ConDefects のデータセットから1,991 個の実世界の Java バグを使用した SMART の実証的研究を行った。
その結果、SMARTは変異の妥当性、有効性、効率を大幅に改善することが明らかとなった。
論文 参考訳(メタデータ) (2026-03-25T17:42:17Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Mechanistically Guided LoRA Improves Paraphrase Consistency in Medical Vision-Language Models [2.064612766965483]
医療ビジョンランゲージモデルでは、同じ臨床的疑問の言い換えに対して、異なるイエスまたはノーの回答を与えることができる。
PSF-Med Sadanandan と Behzadan (2025) を用いて MedGemma-4B でこれを研究した。
パラフレーズ整合性と解答精度のバランスをとるために,ローランド適応 (LoRA) アダプタを併用して微調整する。
論文 参考訳(メタデータ) (2026-02-24T23:30:50Z) - Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks [26.89839484242575]
ATLASは大規模言語モデルの適応テストフレームワークである。
フィッシャー情報誘導項目選択によるモデル能力の推定を行う。
測定精度を維持しながら90%の項目削減を実現している。
論文 参考訳(メタデータ) (2025-10-26T03:54:12Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - Uncertainty-Aware Camera Pose Estimation from Points and Lines [101.03675842534415]
Perspective-n-Point-and-Line (Pn$PL) は、2D-3D特徴座標の3Dモデルに関して、高速で正確で堅牢なカメラローカライゼーションを目指している。
論文 参考訳(メタデータ) (2021-07-08T15:19:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。