論文の概要: Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
- arxiv url: http://arxiv.org/abs/2610.01428v1
- Date: Thu, 01 Oct 2026 10:27:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.055499
- Title: Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
- Title(参考訳): 一般化は安定であり正確ではない - LLMのマルチ軸評価
- Abstract要約: 本稿では,個々の例のレベルでの一般化評価,複数入力変種間の一般化評価,モデル行動の異なる側面における一般化評価について述べる。
このフレームワークは,異なるバリエーションとベンチマークで同一入力に対して,モデル動作がどの程度変化するかを測定する。
- 参考スコア(独自算出の注目度): 1.24173886880844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalization in large language models (LLMs) is the ability to produce consistent and semantically stable outputs when the same input is expressed in different ways. Existing work typically evaluates generalization through aggregate accuracy on a single prompt format, task, or set of variations, which conflates robustness with overall benchmark performance. In this work, we show generalization evaluation at the level of individual examples, across multiple input variants, and across different aspects of model behavior, focusing on variability rather than reducing performance to a score that can be improved through narrow training or other ways that obfuscate generalization evaluation. Following this view, we introduce the Stability-Aware Generalization Objective (SAGO), a framework that measures how much model behavior changes for the same input under different variations and benchmarks, capturing variability across several dimensions including generation consistency, internal activations, confidence, and response mirroring. We show that many commonly used models exhibit statistically significant and consistent generalization instability: no model generalizes uniformly, behavioral axes capture independent failure modes, and cross-dataset variation can reverse model rankings.
- Abstract(参考訳): 大規模言語モデル(LLMs)の一般化は、同じ入力が異なる方法で表現されるとき、一貫性とセマンティックに安定した出力を生成する能力である。
既存の作業は通常、単一のプロンプトフォーマット、タスク、またはバリエーションのセットに対して集約された精度で一般化を評価する。
本研究は,個々の事例のレベル,複数の入力変種,モデル行動のさまざまな側面における一般化評価を,狭い学習や,一般化評価を難読化する方法によって改善できるスコアに性能を低下させるのではなく,変動性に焦点をあてるものである。
この考え方に従うと、SAGO(Stable-Aware Generalization Objective)というフレームワークを導入する。このフレームワークは、異なるバリエーションとベンチマークの下で同じ入力に対してモデル動作がどの程度変化するかを測定し、生成一貫性、内部アクティベーション、信頼性、応答ミラーリングなど、様々な次元にわたる変動をキャプチャする。
統計学的に有意かつ一貫した一般化の不安定性を示すモデルが多く存在することを示す。
関連論文リスト
- Position: It's Time to Optimize LLMs for Self-Consistency [50.68587056599734]
多くの重要な障害は、事前および後トレーニングパイプラインの言語モデルに持続する。
これらの失敗は、パイプラインのすべての側面に浸透するモデリングの前提から生じます。
これらの失敗を理解するためのフレームワークとして,自己整合性を提案する。
論文 参考訳(メタデータ) (2026-07-31T19:16:53Z) - The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context [76.36635039699112]
大規模言語モデル(LLM)は、タスク入力に長く、部分的には関係のないコンテキストが伴うような、コンテキストに富んだ環境にますますデプロイされる。
現状のモデルはしばしば、集合レベルでのタスク非関連コンテキストに対して頑健に見える。
しかし、この集合安定性は、指数当たりの不安定性を著しくマスクする。
論文 参考訳(メタデータ) (2026-07-14T17:01:12Z) - Do Generalisation Results Generalise? [19.855708462203097]
複数のOODテストセットにまたがるモデルの性能を細かな実行を通して評価する。
次に、これらのテストセット間のパフォーマンスの部分的相関を評価し、ドメイン内のパフォーマンスを抑える。
OLMo2 と OPT を解析したところ、一般化結果の全体的傾向は見られなかった。
論文 参考訳(メタデータ) (2025-12-08T18:59:51Z) - Measuring (a Sufficient) World Model in LLMs: A Variance Decomposition Framework [0.0]
本研究では,大言語モデル (LLM) が世界モデルを持つかどうかを評価するための形式的枠組みを提案する。
本稿では,ユーザの目的による変動性,ユーザの調音性,モデルの不安定性の3つのコンポーネントに,モデル応答の可変性を測定するための新しい評価手法を提案する。
以上の結果から,より大きなモデルでは,ユーザ目的の変化による出力変動が大きく,より堅牢な世界モデルであることが示唆された。
論文 参考訳(メタデータ) (2025-06-19T20:19:18Z) - ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities [14.13459302125202]
大きな言語モデル(LLM)の一貫性を評価することは、信頼性を確保するために不可欠である。
従来の自己整合性メソッドは、自然言語の微妙な意味的変化や、コードや方程式の関数的シフトを見逃すことが多い。
可逆変換のシーケンスによる一貫性の測定を目的とした木に基づく評価フレームワークであるConsistencyCheckerを提案する。
論文 参考訳(メタデータ) (2025-06-14T07:18:33Z) - Quantifying Uncertainty and Variability in Machine Learning: Confidence Intervals for Quantiles in Performance Metric Distributions [0.17265013728931003]
マシンラーニングモデルは、信頼性と堅牢性が重要であるアプリケーションで広く使用されている。
モデル評価は、しばしば、モデルパフォーマンスの固有の変数をキャプチャできないパフォーマンスメトリクスの単一ポイント推定に依存します。
この貢献は、そのような分布を分析するために量子と信頼区間を使うことを探求し、モデルの性能とその不確実性についてより完全な理解を提供する。
論文 参考訳(メタデータ) (2025-01-28T13:21:34Z) - Cross-functional Analysis of Generalisation in Behavioural Learning [4.0810783261728565]
本稿では,異なるレベルの次元をまたいだ一般化を考慮した行動学習の分析手法であるBluGAを紹介する。
集計スコアは、目に見えない機能(または過剰適合)への一般化を測定する
論文 参考訳(メタデータ) (2023-05-22T11:54:19Z) - Instance-specific and Model-adaptive Supervision for Semi-supervised
Semantic Segmentation [49.82432158155329]
iMAS と呼ばれる半教師付きセマンティックセグメンテーションのためのインスタンス固有およびモデル適応型監視法を提案する。
iMASは、評価された硬さに基づいて、対応する一貫性損失を測定することで、ラベルのないインスタンスから徐々に学習する。
論文 参考訳(メタデータ) (2022-11-21T10:37:28Z) - On the Strong Correlation Between Model Invariance and Generalization [54.812786542023325]
一般化は、見えないデータを分類するモデルの能力をキャプチャする。
不変性はデータの変換におけるモデル予測の一貫性を測定する。
データセット中心の視点から、あるモデルの精度と不変性は異なるテストセット上で線形に相関している。
論文 参考訳(メタデータ) (2022-07-14T17:08:25Z) - Posterior Differential Regularization with f-divergence for Improving
Model Robustness [95.05725916287376]
クリーン入力とノイズ入力のモデル後部差を規則化する手法に着目する。
後微分正則化を$f$-divergencesの族に一般化する。
実験の結果, 後方微分を$f$-divergenceで正規化することで, モデルロバスト性の向上が期待できることがわかった。
論文 参考訳(メタデータ) (2020-10-23T19:58:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。