論文の概要: FreqBLiMP: Frequency-Controlled Minimal Pairs Reveal Robustness and Fragility of LLMs Under Lexical Rarity
- arxiv url: http://arxiv.org/abs/2609.07153v1
- Date: Mon, 07 Sep 2026 07:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.381556
- Title: FreqBLiMP: Frequency-Controlled Minimal Pairs Reveal Robustness and Fragility of LLMs Under Lexical Rarity
- Title(参考訳): FreqBLiMP:LLMの低周波制御によるロバスト性および破壊性
- Authors: Tyrone White, Yuki Arase,
- Abstract要約: 本稿では,BLiMPの周波数制御拡張であるFreqBLiMPを紹介する。
語彙周波数の減少は文の確率を一貫した単調に低下させるが、全体のコントラスト精度はわずかに低下する。
- 参考スコア(独自算出の注目度): 8.460820813412907
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Minimal-pair benchmarks such as BLiMP evaluate linguistic knowledge by testing whether language models (LMs) prefer acceptable sentences over minimally different unacceptable ones. However, these benchmarks largely ignore lexical frequency variation, despite lexical frequency being a pervasive and highly skewed property of natural language use. Consequently, existing evaluations do not test whether grammatical preferences remain stable when contrasts involve rare lexical items. We introduce FreqBLiMP, a frequency-controlled extension of BLiMP that regenerates all 67 paradigms under explicit Zipf-frequency regimes while preserving each minimal-pair's grammatical contrast. Evaluating multiple open-weight LLM families across scales, we find that decreasing lexical frequency produces a consistent, monotonic decrease in sentence likelihood, but only a modest reduction in overall contrastive acceptability accuracy. However, this aggregate stability masks substantial variation across linguistic phenomena, with LLMs remaining robust on overt morphosyntactic generalization while degrading on phenomena that require lemma-specific information.
- Abstract(参考訳): BLiMPのような最小ペアのベンチマークは、言語モデル(LM)が許容できない最小限の文章よりも許容可能な文を好むかどうかをテストすることによって言語知識を評価する。
しかし、これらのベンチマークは、語彙周波数が自然言語使用の広範かつ高度に歪んだ特性であるにもかかわらず、語彙周波数の変動をほとんど無視している。
既存の評価では、稀な語彙項目を含むコントラストにおいて文法的嗜好が安定しているかどうかを検証していない。
本稿では,BLiMPの周波数制御拡張であるFreqBLiMPを紹介し,各最小ペアの文法的コントラストを保ちながら,明示的なZipf周波数規則の下で67のパラダイムすべてを再生する。
複数のオープンウェイトLLMファミリーをスケールで評価したところ、語彙周波数の減少は文の出現率を一貫した単調に低下させるが、全体的なコントラスト受容率の低下はわずかであることがわかった。
しかし、この集合安定性マスクは言語現象のかなりのバリエーションを覆い、LLMは補題固有の情報を必要とする現象を分解しながら、過度な形態合成の一般化に頑健なままである。
関連論文リスト
- Evaluating LLM Personalization via Semantic Constraint Verification [25.539904066738288]
自然言語推論制約検証(NLICV)を導入する。
NLICVは文の意味を真理条件集合にマッピングし、自然言語推論(NLI)モデルを介してパーソナライズ制約を検証する。
実験によると、NLICVは人間のアノテーションと密接に一致し、LLMの審査員によるレイテンシとトークンコストを大幅に削減している。
論文 参考訳(メタデータ) (2026-06-15T08:04:56Z) - Mind the Unseen Mass: Unmasking LLM Hallucinations via Soft-Hybrid Alphabet Estimation [1.1230191950153754]
ブラックボックスアクセス下の大規模言語モデルの不確実性定量化について検討する。
効果的な意味的アルファベットサイズ - すなわち、サンプルされた応答で表される異なる意味の数 - を推定すると、下流のリスクに有用なプロキシを提供する。
そこで我々は,Good-Turingカバレッジと正規化ラプラシアンの熱カーネルトレースを組み合わせた簡易かつ解釈可能な推定器SHADEを提案する。
論文 参考訳(メタデータ) (2026-04-21T07:16:05Z) - Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation [40.210132040677]
本稿では,23の現代大言語モデル(LLM)の絶対的性能と相対的ランク付けが,制御的,真に等価な語彙的および構文的摂動に与える影響について検討する。
その結果、語彙的摂動は、ほぼすべてのモデルやタスクに対して、実質的、統計的に有意な性能劣化を誘導する一方、構文的摂動はより異質な効果を持ち、時には結果を改善することが示されている。
論文 参考訳(メタデータ) (2026-02-19T12:24:42Z) - Lowest Span Confidence: A Zero-Shot Metric for Efficient and Black-Box Hallucination Detection in LLMs [24.471653720056803]
LLM(Large Language Models)の幻覚は、もっともらしいが非現実的な内容を生成する。
本稿では,最小資源仮定下での幻覚検出のために,LSC(Lowest Span Confidence)と呼ばれる新しいゼロショット法を提案する。
LSCは既存のゼロショットベースラインを一貫して上回り、リソース制約条件下であっても強力な検出性能を提供する。
論文 参考訳(メタデータ) (2026-01-07T12:48:33Z) - Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models [49.435669307386156]
MPR(Multi-stage Prompt Refinement)は、複数のステージにわたる不整形プロンプトを体系的に改善するためのフレームワークである。
MPRは、追加の文脈でプロンプトの明快さを反復的に強化し、最も関連する入力を優先順位付けするためにランク付けされた自己回帰機構を使用する。
幻覚ベンチマークの結果、MPRは原型と比較して85%以上の勝利率を達成した。
論文 参考訳(メタデータ) (2025-10-14T00:31:36Z) - Robustness of Large Language Models to Perturbations in Text [2.2734015467359217]
大規模言語モデル(LLM)は素晴らしいパフォーマンスを示していますが、現実のデータでは避けられないノイズを処理できますか?
この研究は、LLMのテキストのモルフォロジー変化に対するレジリエンスを調査することによって、この重要な問題に取り組む。
以上の結果から, LLM は, 一般の信念とは対照的に, 文中での騒々しい摂動に対して静かであることが明らかとなった。
論文 参考訳(メタデータ) (2024-07-12T04:50:17Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Conformal Language Modeling [61.94417935386489]
生成言語モデル(LM)の共形予測のための新しい手法を提案する。
標準共形予測は厳密で統計的に保証された予測セットを生成する。
我々は,オープンドメイン質問応答,テキスト要約,ラジオロジーレポート生成において,複数のタスクに対するアプローチの約束を実証する。
論文 参考訳(メタデータ) (2023-06-16T21:55:08Z) - Language models are not naysayers: An analysis of language models on
negation benchmarks [58.32362243122714]
我々は,次世代自動回帰言語モデルによる否定処理能力の評価を行った。
LLMには,否定の存在に対する感受性,否定の語彙的意味を捉える能力の欠如,否定下での推論の失敗など,いくつかの制限があることが示されている。
論文 参考訳(メタデータ) (2023-06-14T01:16:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。