論文の概要: The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context
- arxiv url: http://arxiv.org/abs/2607.12963v2
- Date: Wed, 15 Jul 2026 17:00:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.651838
- Title: The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context
- Title(参考訳): ロバストネスのイラシオン:タスク関連文脈下でのアグリゲート精度は予測フリップを隠蔽する
- Authors: Yanzhe Zhang, Sanmi Koyejo, Diyi Yang,
- Abstract要約: 大規模言語モデル(LLM)は、タスク入力に長く、部分的には関係のないコンテキストが伴うような、コンテキストに富んだ環境にますますデプロイされる。
現状のモデルはしばしば、集合レベルでのタスク非関連コンテキストに対して頑健に見える。
しかし、この集合安定性は、指数当たりの不安定性を著しくマスクする。
- 参考スコア(独自算出の注目度): 76.36635039699112
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models (LLMs) grow more capable, they are increasingly deployed in context-rich settings where task inputs are often accompanied by long, partially irrelevant context. In a controlled setting, we find that state-of-the-art models often appear robust to task-irrelevant context at the aggregate level: prepending it to benchmark questions causes little change in overall accuracy. This aggregate stability, however, masks significant per-example instability. Even semantically meaningless pseudo-words, formed by randomly combining characters, can markedly shift model predictions on a small fraction of examples, degrading performance on some while improving it on others. This two-sided effect holds consistently across a wide range of models and datasets, yet the affected examples are largely model-specific. We further show that this instability is modulated by context type, context length, test-time compute, and model development stage. Together, our findings reveal context-induced tail risks concealed by aggregate accuracy, motivating per-example reliability evaluation of language models.
- Abstract(参考訳): 大規模言語モデル(LLM)の能力が向上するにつれて、タスク入力に長く、部分的には関係のないコンテキストが伴うような、コンテキストに富んだ設定にデプロイされるようになる。
制御された環境では、現状のモデルは、集合レベルでタスク非関連コンテキストに対して堅牢に現れることが多い。
しかし、この集合安定性は、指数当たりの不安定性を著しくマスクする。
意味的に意味のない疑似単語でさえ、文字をランダムに組み合わせることで生成され、少数の例でモデル予測を著しくシフトさせ、一部の例では性能を低下させ、他の例では改善することができる。
この2面の効果は、広範囲のモデルとデータセットに一貫して持続するが、影響を受ける例は、主にモデル固有のものである。
さらに、この不安定性は、コンテキストタイプ、コンテキストの長さ、テスト時間計算、モデル開発段階によって変調されていることを示す。
本研究により, 単語モデルの信頼度評価を動機として, 集合的精度によって隠蔽された文脈による尾のリスクを明らかにした。
関連論文リスト
- Context-Length Robustness in Question Answering Models: A Comparative Empirical Study [0.0]
本稿では,SQuADとHotpotQAの2つのベンチマークを用いて,大規模言語モデルにおける文脈長頑健性の実証的研究を行った。
モデル精度を全文脈長の関数として評価し,応答を含む信号を保持しながら,無関係な文脈の量を体系的に増加させることで評価する。
その結果、コンテキスト長が増加するにつれて性能が一貫した低下を示し、マルチホップ推論タスクではシングルスパン抽出タスクよりもはるかに大きな低下が観測された。
論文 参考訳(メタデータ) (2026-03-16T17:14:05Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions [0.0]
大規模言語モデル(LLM)は、パラフレーズ付き質問に答えるときに矛盾する振る舞いを示すことが多い。
クローズドブック多重選択QAにおけるクロスパラフレーズ一貫性を評価するベンチマークであるRoParQを紹介する。
また、モデルのロバスト性を定量化する新しい評価指標XParaConを提案する。
論文 参考訳(メタデータ) (2025-11-26T16:40:53Z) - NumPert: Numerical Perturbations to Probe Language Models for Veracity Prediction [7.856998585396422]
本稿では,数値クレームとエビデンスペアの精度予測のための最先端モデルの体系的評価を行う。
その結果、プロプライエタリなシステムの先駆者でさえ、特定の摂動の下で最大62%の精度低下を経験していることが示唆された。
これらの知見は、数値的な事実チェックにおける限界を浮き彫りにして、ロバスト性は現在の言語モデルにとってオープンな課題であり続けていることを示唆している。
論文 参考訳(メタデータ) (2025-11-13T05:09:52Z) - Are vision language models robust to uncertain inputs? [5.249651874118556]
より新しい視覚言語モデルでは、従来のモデルに比べて頑健性が向上したが、それでも厳密な指示に従う傾向にあることを示す。
ImageNetのような自然なイメージでは、パイプラインの変更なしにこの制限を克服することができる。
モデルの内部不確実性を明らかにするために,キャプションの多様性に基づく新しいメカニズムを提案する。
論文 参考訳(メタデータ) (2025-05-17T03:16:49Z) - Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions [75.45274978665684]
VLU(Vision-Language Understanding)ベンチマークには、提供されたコンテキストによってサポートされない仮定に答えが依存するサンプルが含まれている。
サンプル毎にコンテキストデータを収集し,エビデンスに基づくモデル予測を促進するためにコンテキスト選択モジュールをトレーニングする。
我々は,十分なコンテキストを欠いたサンプルを同定し,モデル精度を向上させる汎用なコンテキスト・アワレ認識検出器を開発した。
論文 参考訳(メタデータ) (2024-05-18T02:21:32Z) - Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction [49.15931834209624]
実世界におけるオープン情報抽出モデルの評価をシミュレートする最初のベンチマークを示す。
我々は、それぞれの例が知識不変のcliqueである大規模なテストベッドを設計し、注釈付けする。
さらにロバスト性計量を解明することにより、その性能が全体の傾きに対して一貫して正確であるならば、モデルはロバストであると判断される。
論文 参考訳(メタデータ) (2023-05-23T12:05:09Z) - Language model acceptability judgements are not always robust to context [30.868765627701457]
目標構文評価における言語モデルの性能の安定性について検討する。
モデル判断は、ランダムにサンプル化された言語コンテキストに置かれる場合、一般的には堅牢である。
これらのモデル性能の変化は、コンテキストとテスト入力にマッチする単純な特徴によって説明できないことを示す。
論文 参考訳(メタデータ) (2022-12-18T00:11:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。