論文の概要: Sequential Correlations Change In-Context Learning: Effective Context Length and Architectural Mismatch
- arxiv url: http://arxiv.org/abs/2607.03660v1
- Date: Sat, 04 Jul 2026 01:47:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.676803
- Title: Sequential Correlations Change In-Context Learning: Effective Context Length and Architectural Mismatch
- Title(参考訳): 逐次相関は文脈学習を変える:効果的な文脈長とアーキテクチャミスマッチ
- Abstract要約: 線形注意に基づく可解モデルを提案し,現実的なトランスフォーマーアーキテクチャの予測を検証した。
まず、クエリトークンがコンテキストに依存しない場合、コンテキスト内相関が有効なコンテキスト長を誘導する。
第二に、クエリがコンテキストと相関している場合、特に線形の注意に比べてソフトマックスの注意のために、テストエラーが減少する。
- 参考スコア(独自算出の注目度): 34.70343709092236
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern sequence models have a striking capacity for in-context learning (ICL); they can perform new tasks based only on examples given in the prompt. Understanding how this ability emerges requires theory that captures important properties of natural data. Linear regression has served as a useful sandbox for ICL theory, but existing work has largely focused on prompts with independent examples. In this work, we extend this setting to sequentially correlated data, a basic feature of real sequences. We present a solvable model based on linear attention and test our predictions on realistic transformer architectures. We identify two distinct effects: First, when the query token is independent of the context, within-context correlations induce an effective context length: correlated prompts behave like shorter i.i.d. prompts. Second, when the query is also correlated with its context, test error is reduced, particularly for softmax attention when compared to linear attention. These results suggest that correlated prompts alter not only the effective sample size of in-context learning, but also which attention architectures are best matched to the task.
- Abstract(参考訳): 現代のシーケンスモデルは、インコンテキスト学習(ICL)において顕著な能力を持ち、プロンプトで与えられた例に基づいて新しいタスクを実行することができる。
この能力がどのように出現するかを理解するには、自然データの重要な特性を捉える理論が必要である。
線形回帰はICL理論の有用なサンドボックスとして機能してきたが、既存の研究は主に独立した例によるプロンプトに焦点を当てている。
本研究では、この設定を、実数列の基本的特徴であるシーケンシャルな相関データに拡張する。
線形注意に基づく可解モデルを提案し,現実的なトランスフォーマーアーキテクチャの予測を検証した。
まず、クエリトークンがコンテキストに依存しない場合、コンテキスト内相関は効果的なコンテキスト長を誘導する:相関プロンプトは短いi.d.プロンプトのように振る舞う。
第二に、クエリがコンテキストと相関している場合、特に線形の注意に比べてソフトマックスの注意のために、テストエラーが減少する。
これらの結果から, 相関プロンプトは, 文脈内学習の有効なサンプルサイズだけでなく, タスクに最もよく適合するアテンションアーキテクチャも変化することが示唆された。
関連論文リスト
- Fine-Tuning Dynamics of In-Context Factual Recall in Transformers [63.1821972855273]
インコンテキスト学習 -- プロンプトで与えられた例に基づいてタスクを実行する -- は、大きな言語モデルに現れている。
非コンテキスト学習が事実的知識のリコールをどのように活用するかを研究する。
IC-リコールデータを用いた1層トランスの微調整特性の解析を行った。
論文 参考訳(メタデータ) (2026-05-26T23:47:26Z) - Many-Shot CoT-ICL: Making In-Context Learning Truly Learn [58.439517684779936]
In-context Learning (ICL)は、パラメータを更新せずにプロンプト内のデモを条件にすることで、大きな言語モデルを新しいタスクに適応させる。
提案手法は,標準のマルチショット・ルールが転送されないことを示すために,マルチショット・チェーン・オブ・コンテクスト・ラーニング(CoT-ICL)について検討する。
論文 参考訳(メタデータ) (2026-05-13T13:30:12Z) - Investigation into In-Context Learning Capabilities of Transformers [14.14937947207076]
トランスフォーマーは、文脈内学習(ICL)の強力な能力を示した
本研究では,二項分類タスクにおける文脈内学習の体系的研究を行う。
本結果は,文脈内学習がいつ成功し,いつ失敗するかを決定する上で,次元性,信号強度,文脈情報の重要性を強調した。
論文 参考訳(メタデータ) (2026-04-28T16:57:55Z) - A Framework for Quantifying How Pre-Training and Context Benefit In-Context Learning [52.07397258423034]
現実的な設定のクラスにおいて,ICLの性能を解析するための新しいフレームワークを提案する。
我々は、ICL性能と文脈長、および事前訓練と問合せタスク分布のKL分散の正確な関係を導出する。
論文 参考訳(メタデータ) (2025-10-26T09:21:29Z) - Can an LLM Induce a Graph? Investigating Memory Drift and Context Length [11.214847796972705]
最近提案された評価ベンチマークは、大規模言語モデル(LLM)の有効文脈長と忘れ傾向を特徴付けることを目的としている。
我々は、これらのモデルをより複雑な推論タスクで評価し、テキストから構造化された関係知識を誘導する必要があると主張している。
以上の結果から,LLMは記憶のドリフトや文脈記憶を,このような関係推論を行う場合よりもはるかに短い有効長で表現し始めることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-04T01:56:07Z) - Provable In-Context Learning of Nonlinear Regression with Transformers [66.99048542127768]
In-context Learning (ICL) は、パラメータを更新することなくタスク固有のプロンプトを使用して見えないタスクを実行する能力である。
最近の研究はICLの背後にあるトレーニングのダイナミクスを積極的に探求しており、その多くは比較的単純なタスクに重点を置いている。
本稿では、変換器が文脈内学習能力をいかに獲得するかを明らかにすることを目的として、より複雑な非線形回帰タスクについて検討する。
論文 参考訳(メタデータ) (2025-07-28T00:09:28Z) - Contextualize-then-Aggregate: Circuits for In-Context Learning in Gemma-2 2B [51.74607395697567]
In-Context Learning (ICL)は、大規模言語モデル(LLM)の興味深い能力である。
我々は5つの自然主義ICLタスクに対してGemma-2 2Bにおける情報フローを因果介入を用いて同定する。
このモデルでは,2段階戦略を用いてタスク情報を推論し,コンテキスト化-then-aggregateと呼ぶ。
論文 参考訳(メタデータ) (2025-03-31T18:33:55Z) - In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention [52.159541540613915]
本研究では,マルチヘッド型ソフトマックスアテンションモデルを用いて,線形データを用いたコンテキスト内学習を行う方法について検討する。
この結果から,学習内容の学習能力は,そのアーキテクチャと基礎となるデータ分布の集約的効果として,訓練されたトランスフォーマーから出現することが明らかとなった。
論文 参考訳(メタデータ) (2025-03-17T02:00:49Z) - Compositional Exemplars for In-context Learning [21.961094715261133]
大規模な事前学習言語モデル(LM)は、印象的なインコンテキスト学習(ICL)能力を示している。
本稿では,CEIL (Compositional Exemplars for In-context Learning) を提案する。
我々は、感情分析、パラフレーズ検出、自然言語推論、コモンセンス推論、オープンドメイン質問応答、コード生成、意味解析を含む7つの異なるNLPタスクから、CEILを12の分類および生成データセットで検証する。
論文 参考訳(メタデータ) (2023-02-11T14:02:08Z) - Embarrassingly Simple Performance Prediction for Abductive Natural
Language Inference [10.536415845097661]
本研究では,NLIモデルの性能を微調整せずに予測する手法を提案する。
その結果,コサイン類似度手法の精度はパーソン相関係数0.65の分類手法の精度と強く相関していることがわかった。
提案手法は,モデル選択の過程において,大幅な時間節約につながる可能性がある。
論文 参考訳(メタデータ) (2022-02-21T18:10:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。