論文の概要: Information-Theoretic Limits of Reliability and Scaling in Language Models
- arxiv url: http://arxiv.org/abs/2607.14112v1
- Date: Fri, 08 May 2026 06:06:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.902648
- Title: Information-Theoretic Limits of Reliability and Scaling in Language Models
- Title(参考訳): 言語モデルにおける信頼性とスケーリングの情報理論的限界
- Abstract要約: 大規模言語モデル(LLM)は、十分なスケールのタスクに対して、完全な信頼性が達成可能であるかのように評価される。
この仮定は情報理論的に不当であることを示す。
我々の研究は、ドメイン間のモデルパフォーマンスを管理するリソース・複雑さのトレードオフを形式化します。
- 参考スコア(独自算出の注目度): 6.658166782006281
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are evaluated as though perfect reliability is achievable for any task given sufficient scale. We show this assumption is information-theoretically unjustified. Every generative task has a reliability ceiling that no model can exceed, determined by how much output uncertainty is resolvable from observable context. The gap decomposes into a resolvable component closable with additional context and a subjective component inherent to task ambiguity. Autoregressive generation further degrades this ceiling at a rate governed by the task's dependency kernel, which quantifies inter-token correlations in the output. From these two primitives, we derive a first-principles scaling law where LLM performance is bottlenecked by the scarcer resource: training data or model capacity. This law recovers the Chinchilla scaling law as a special case and provides a structural account of when scaling improves reliability. Beyond scaling, our framework unifies diverse practical phenomena, such as the benefits of retrieval-augmentation and the spectral mechanics of catastrophic forgetting. Our work formalizes the resource-complexity tradeoffs that govern model performance across domains, offering a unified theory of performance limits in generative language models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、十分なスケールのタスクに対して、完全な信頼性が達成可能であるかのように評価される。
この仮定は情報理論的に不当であることを示す。
すべての生成タスクは、観測可能なコンテキストからどれだけの出力不確実性が解決できるかによって決定されるモデルが達成できないような信頼性の天井を持つ。
このギャップは、追加のコンテキストとタスクのあいまいさに固有の主観的なコンポーネントで解決可能なコンポーネントに分解される。
自己回帰生成は、タスクの依存性カーネルが支配する速度でこの天井をさらに劣化させ、出力内のトークン間の相関を定量化する。
これら2つのプリミティブから、LLMのパフォーマンスが不足するリソース、すなわちトレーニングデータやモデルキャパシティによってボトルネックとなる、第一原理のスケーリング法則を導出する。
この法則は、特別事例としてチンチラスケーリング法を回復し、スケーリングが信頼性を向上させる際の構造的説明を提供する。
スケーリング以外にも、検索強化の利点や破滅的忘れ込みのスペクトル力学など、多様な実践的な現象を統合化しています。
我々の研究は、ドメイン間のモデル性能を管理するリソース・複雑さのトレードオフを定式化し、生成言語モデルにおけるパフォーマンス限界の統一理論を提供する。
関連論文リスト
- CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation [9.80652710081054]
CLSGenはバイナリ分類タスクのための新しい微調整フレームワークである。
モデル固有の説明生成能力を犠牲にすることなく、頑健な確率推定を可能にする。
CLSGenで微調整されたモデルは、分類基準において既存のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-04-13T17:58:43Z) - From Garbage to Gold: A Data-Architectural Theory of Predictive Robustness [0.3277163122167433]
本研究では,高次元誤差確率予測器が2種類のノイズを克服することを示す。
本稿では,ロバストネスを効率的に実現する予測器を識別する「プロアクティブデータ中心型AI」を提案する。
データ品質をアイテムレベルの完全性からポートフォリオレベルのアーキテクチャに再定義することで、“ローカル要因”の理論的理論的根拠を提供する。
論文 参考訳(メタデータ) (2026-03-08T18:58:33Z) - Quantifying construct validity in large language model evaluations [0.0]
LLMコミュニティは、ベンチマーク結果を一般的なモデル機能と同義であるかのように報告することが多い。
ベンチマークには、テストセットの汚染やアノテータエラーなど、パフォーマンスを歪ませる問題がある。
ベンチマークが測定したい能力の信頼できる指標であることをどうやって知ることができるのか?
論文 参考訳(メタデータ) (2026-02-17T12:15:57Z) - Breaking the Factorization Barrier in Diffusion Language Models [59.946071582340146]
ベクトル化障壁」は拡散言語モデルの効率的な並列生成を妨げる。
完全分解出力分布を置き換えるための結合離散拡散法を提案する。
我々は, CoDD が多種多様な言語モデルアーキテクチャをシームレスに拡張し, オーバーヘッドを無視できることを示した。
論文 参考訳(メタデータ) (2026-02-09T08:36:39Z) - Toward Faithful and Complete Answer Construction from a Single Document [1.0742675209112622]
EVEは文書基底推論のための構造化されたフレームワークである。
自由形式のプロンプトとは異なり、EVEは、高厳密な推論を抽出、検証、列挙に分解する構造化された検証可能なパイプラインに、生成を制約する。
論文 参考訳(メタデータ) (2026-02-05T18:22:08Z) - SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment [49.86376148975563]
大規模言語モデル(LLM)は、様々なタスクを理解し実行する能力を通じて自然言語処理に革命をもたらした。
教師付き微調整、特にRetrieval-Augmented Generation (RAG)のシナリオでは、しばしば破滅的な忘れが生じる。
本稿では,モデルのセマンティック分布を保存するために,入力シーケンスロジットをアライメントする自己分布アライメント手法であるSelfAugを提案する。
論文 参考訳(メタデータ) (2025-09-04T06:50:47Z) - Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric [99.56567010306807]
大規模言語モデル(LLM)は、学術、産業、そして日々のアプリケーションに欠かせないものになっている。
大規模言語モデル (LLM) 時代における評価の課題の1つは一般化問題である。
従来の性能スコアを補完するメカニズムの解釈可能性向上指標であるモデル利用指数(MUI)を提案する。
論文 参考訳(メタデータ) (2025-04-10T04:09:47Z) - Has LLM Reached the Scaling Ceiling Yet? Unified Insights into LLM Regularities and Constraints [0.0]
大きな言語モデル(LLM)は目覚ましい能力を示していますが、そのスケーラビリティには重要な疑問があります。
本稿では,LLMのスケーリング力学を説明するために,数学的および統計的知見を統合する統一理論フレームワークを開発する。
今後の進歩には、ブルートフォーススケーリングから、アーキテクチャ、データ品質、トレーニングパラダイムの革新に移行する必要があります。
論文 参考訳(メタデータ) (2024-12-21T02:19:07Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Large Language Models with Controllable Working Memory [64.71038763708161]
大規模言語モデル(LLM)は、自然言語処理(NLP)の一連のブレークスルーをもたらした。
これらのモデルをさらに切り離すのは、事前訓練中に内在する膨大な量の世界的知識だ。
モデルの世界知識が、文脈で提示された事実情報とどのように相互作用するかは、まだ解明されていない。
論文 参考訳(メタデータ) (2022-11-09T18:58:29Z) - Toward Certified Robustness Against Real-World Distribution Shifts [65.66374339500025]
我々は、データから摂動を学ぶために生成モデルを訓練し、学習したモデルの出力に関して仕様を定義する。
この設定から生じるユニークな挑戦は、既存の検証者がシグモイドの活性化を厳密に近似できないことである。
本稿では,古典的な反例誘導的抽象的洗練の概念を活用するシグモイドアクティベーションを扱うための一般的なメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-06-08T04:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。