論文の概要: In-Context Learning as Implicit Policy Gradient
- arxiv url: http://arxiv.org/abs/2607.23153v1
- Date: Sat, 25 Jul 2026 11:13:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.004822
- Title: In-Context Learning as Implicit Policy Gradient
- Title(参考訳): 暗黙の政策グラディエントとしてのインコンテキストラーニング
- Authors: Masahiro Kaneko, Timothy Baldwin,
- Abstract要約: 大規模言語モデルは、生成されたサンプルと対応する評価スコアをインコンテキストの例として組み込むことで、出力を反復的に改善することができる。
スコア条件付きインコンテキスト学習(ICL)は,政策勾配最適化と構造的対応を持つことを示す。
- 参考スコア(独自算出の注目度): 47.12608115550359
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has shown that large language models (LLMs) can iteratively improve their outputs by incorporating generated samples and their corresponding evaluation scores as in-context examples. Despite these empirical findings, the theoretical foundations underlying this phenomenon remain poorly understood. In this paper, we show that score-conditioned In-Context Learning (ICL) admits a structural correspondence to policy gradient optimization. We first provide a constructive proof that self-attention mechanisms can implement reward-weighted aggregation analogous to the REINFORCE algorithm under specific weight matrix configurations, and discuss the relationship between this construction and the behavior of pretrained transformers. The correspondence is directional in hidden-state space and holds exactly only under the stated simplifying conditions; we quantify its strength empirically. Within our simplified hidden-state model, we furthermore derive an exact upper bound on the distribution shift induced by a bounded attention update, yielding a trust-region-like analogy to KL-constrained policy optimization. We validate our theory through extensive experiments across multiple LLMs, demonstrating that LLMs effectively utilize score information to shift output distributions toward high-scoring exemplars, and that attention weights exhibit a strong correlation with example scores.
- Abstract(参考訳): 近年の研究では、大規模言語モデル(LLM)は、生成したサンプルと対応する評価スコアを文脈内例として組み込むことで、出力を反復的に改善できることが示されている。
これらの経験的な発見にもかかわらず、この現象の理論的基礎はいまだに理解されていない。
本稿では、スコア条件付きインコンテキスト学習(ICL)がポリシー勾配最適化に構造的対応を持つことを示す。
まず,自己注意機構がReINFORCEアルゴリズムに類似した報酬重み付けを,特定の重み付け行列構成で実現可能であることを示し,この構成と事前学習した変圧器の挙動との関係について考察する。
対応性は隠れ状態空間において指向性を持ち、明記された単純化条件の下でのみ正確に保たれ、その強度を経験的に定量化する。
単純化された隠れ状態モデル内では、さらに、有界注意更新によって引き起こされる分布シフトの正確な上限を導出し、KL制約された政策最適化に信頼領域のような類似性をもたらす。
我々は,複数のLDMの広範な実験を通じて,LCMがスコア情報を有効活用し,出力分布を高階化にシフトさせ,注目重みがサンプルスコアと強い相関を示すことを示した。
関連論文リスト
- SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization [55.63565289584336]
SimRegは埋め込み類似性正規化損失であり、各シーケンス内で同じ基幹ラベルを持つトークン表現をより類似させる。
分析の結果, この機構は多分類マージンを増大させ, より効率的な分類を可能にした。
論文 参考訳(メタデータ) (2026-05-09T08:59:13Z) - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models [38.47027398567909]
Perception-Grounded Policy Optimization (PGPO)は、トークンレベルでのメリットを動的に再評価する、新しいきめ細かなクレジット割り当てフレームワークである。
PGPOは,言語的先行音からの勾配雑音を抑えつつ,視覚的に依存するトークンの学習信号を積極的に増幅することを示す。
理論的および実証的な分析は、PGPOが勾配の分散を効果的に減少させ、訓練の崩壊を防ぎ、頑健で知覚的なマルチモーダル推論のための強力な正則化剤として機能することを確認する。
論文 参考訳(メタデータ) (2026-04-02T09:53:20Z) - A Comedy of Estimators: On KL Regularization in RL Training of LLMs [81.7906270099878]
強化学習(RL)は,大規模言語モデル(LLM)の推論性能を大幅に向上させる
LLMトレーニングのRLの目的は、トレーニングされたポリシーと参照ポリシーの間の逆のKL(Kullback-Leibler)分岐である正規化項を含む。
近年の研究では、KL正則化の実施が目的の正しい勾配を与えていないことが示されており、目的と実施の相違が生じている。
いくつかの推定器構成の勾配について検討し、設計選択が勾配バイアスをどう形成するかを明らかにする。
論文 参考訳(メタデータ) (2025-12-26T04:20:58Z) - Provable Low-Frequency Bias of In-Context Learning of Representations [19.066378730056275]
In-context Learning (ICL) は、大きな言語モデル(LLM)がパラメータを更新せずに入力シーケンスから新しい振る舞いを取得することを可能にする。
近年の研究では、ICLはプロンプトのデータ生成過程(DGP)の構造を内部化することにより、事前学習の段階で学んだ本来の意味を超えることができることが示されている。
本稿では、二重収束の統一的な枠組みを導入することにより、このような現象を初めて厳密に説明する。
この二重収束過程は、スムーズな(低周波)表現に対する暗黙のバイアスをもたらし、解析的に証明し、経験的に検証する。
論文 参考訳(メタデータ) (2025-07-17T21:19:32Z) - CTRLS: Chain-of-Thought Reasoning via Latent State-Transition [57.51370433303236]
チェーン・オブ・シント(CoT)推論は、大規模な言語モデルで複雑な問題を解釈可能な中間ステップに分解することを可能にする。
我々は,遅延状態遷移を伴うマルコフ決定プロセス(MDP)としてCoT推論を定式化するフレームワークであるgroundingSを紹介する。
我々は、ベンチマーク推論タスクにおける推論精度、多様性、探索効率の改善を示す。
論文 参考訳(メタデータ) (2025-07-10T21:32:18Z) - Large Language Models as Computable Approximations to Solomonoff Induction [11.811838796672369]
我々は,大規模言語モデル (LLM) とアルゴリズム情報理論 (AIT) の間の最初の公式な接続を確立する。
我々はAITを活用し、文脈内学習、少数ショット学習、スケーリング法則の統一的な理論的説明を提供する。
我々の枠組みは理論的基礎と実践的LLM行動のギャップを埋め、将来のモデル開発に説明力と実用的な洞察を提供する。
論文 参考訳(メタデータ) (2025-05-21T17:35:08Z) - The Curse of CoT: On the Limitations of Chain-of-Thought in In-Context Learning [56.574829311863446]
CoT(Chain-of-Thought)プロンプトは,大規模言語モデル(LLM)における推論能力の向上によって広く認識されている。
我々は、CoTとその推論変異が、様々なモデルスケールやベンチマークの複雑さに対して、直接応答を一貫して過小評価していることを実証する。
パターンベースICLにおけるCoTの性能を駆動する明示的単純推論の基本的なハイブリッド機構を明らかにする。
論文 参考訳(メタデータ) (2025-04-07T13:51:06Z) - Efficient and Flexible Neural Network Training through Layer-wise Feedback Propagation [49.44309457870649]
レイヤワイドフィードバックフィードバック(LFP)は、ニューラルネットワークのような予測器のための新しいトレーニング原則である。
LFPはそれぞれの貢献に基づいて個々のニューロンに報酬を分解する。
提案手法は,ネットワークの有用な部分と有害な部分の弱体化を両立させる手法である。
論文 参考訳(メタデータ) (2023-08-23T10:48:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。