論文の概要: When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL
- arxiv url: http://arxiv.org/abs/2608.13385v1
- Date: Thu, 13 Aug 2026 15:46:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.581458
- Title: When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL
- Title(参考訳): タスクベクトルはいつ十分か? 暗黙のマルチモーダルICLの実証理論
- Abstract要約: Inlicit Multimodal In-context Learningは、静的タスクベクトルからクエリ条件変換、アテンションルーティングまで、デモを内部の介入に圧縮する。
提案するSelection-Realization hypothesisは,クエリが選択する内部変化のコンパクトなファミリを誘導するものだ。
一致した反事実と正しい実演を対比することにより、明示的なM-ICLの構造を測定し、介入行動を予測するかどうかを調べる。
- 参考スコア(独自算出の注目度): 2.964628733433076
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Implicit multimodal in-context learning compresses demonstrations into internal interventions, ranging from static task vectors to query-conditioned transformations and attention routing. Despite their common goal, these methods differ substantially in how the intervention depends on the query and where it modifies the model, leaving unclear which additional complexity is necessary for a given task. We propose the Selection--Realization Hypothesis. It views demonstrations as inducing a compact family of internal changes from which the query selects, while the model's computation constrains how the selected change can be implemented. We evaluate this account using controlled multimodal tasks in which query dependence varies without changing the underlying task primitives or prompt format. By contrasting correct demonstrations with matched counterfactuals, we measure the structure of explicit M-ICL and test whether it predicts intervention behavior. We find that the success of a static task vector is closely tied to how much of the demonstration-induced change is shared across queries. Additional intervention complexity becomes useful when explicit M-ICL contains query-specific or distributed structure that a local additive shift cannot recover. These relationships extend to natural VQA benchmarks and support cost-aware method selection without access to test performance. Our results provide a unified empirical theory of when demonstrations can be compressed into a task vector and when a more expressive intervention is warranted.
- Abstract(参考訳): Inlicit Multimodal In-context Learningは、静的タスクベクトルからクエリ条件変換、アテンションルーティングまで、デモを内部介入に圧縮する。
共通の目標にもかかわらず、これらの手法は、どのように介入がクエリに依存するか、どこでモデルを変更するかで大きく異なる。
選択-再帰仮説を提案する。
これは、クエリが選択した内部変更のコンパクトなファミリを誘導する一方、モデルの計算は、選択した変更をどのように実装するかを制約する。
本報告では,タスクプリミティブやプロンプトフォーマットを変更することなく,クエリ依存が変化する制御されたマルチモーダルタスクを用いて,このアカウントを評価する。
一致した反事実と正しい実演を対比することにより、明示的なM-ICLの構造を測定し、介入行動を予測するかどうかを調べる。
静的タスクベクタの成功は、クエリ間で、デモによって引き起こされる変更がどの程度共有されているかに密接に結びついていることが分かりました。
明示的なM-ICLは、局所的な付加的なシフトが回復できないクエリ固有構造または分散構造を含むと、追加の介入の複雑さが有用になる。
これらの関係は、自然のVQAベンチマークにまで拡張され、テストパフォーマンスにアクセスせずにコストを意識したメソッド選択をサポートする。
この結果から, 実演をタスクベクトルに圧縮し, より表現力のある介入が保証される場合の統一的実証理論が得られた。
関連論文リスト
- TwinICL: Diagnosing Multimodal In-Context Learning through Paired Counterfactuals [49.800443965874756]
インコンテキスト学習(ICL)は、モデルがデモからタスクを推論することを可能にする。
既存のベンチマークでは、モダリティ間でICLのパフォーマンスを比較するのに必要なテキストと画像のバージョンが一致していないのが一般的である。
我々は、プロシージャで生成されたベンチマークであるTwinICLを紹介し、このようなペアを制御された比較のために提供する。
論文 参考訳(メタデータ) (2026-09-14T04:42:42Z) - When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning [14.102553871638243]
インコンテキスト学習(ICL)は、しばしばデモが正しいインプット・アウトプットの例を提供するために役立つ直感によって動機づけられる。
有効性は保証されていないことを示し、いくつかの正しい実演はICLの精度を低下させることさえできることを示した。
以上の結果から,頑健なICLは実演が正しいかどうかだけでなく,文脈的推論にどのように影響するかを評価する必要があることが示唆された。
論文 参考訳(メタデータ) (2026-05-25T21:52:49Z) - Many-Shot CoT-ICL: Making In-Context Learning Truly Learn [58.439517684779936]
In-context Learning (ICL)は、パラメータを更新せずにプロンプト内のデモを条件にすることで、大きな言語モデルを新しいタスクに適応させる。
提案手法は,標準のマルチショット・ルールが転送されないことを示すために,マルチショット・チェーン・オブ・コンテクスト・ラーニング(CoT-ICL)について検討する。
論文 参考訳(メタデータ) (2026-05-13T13:30:12Z) - Demonstrations, CoT, and Prompting: A Theoretical Analysis of ICL [9.83462430479849]
In-Context Learning (ICL)により、事前訓練されたLLMは、入力出力のデモの小さなセットを条件にすることで、下流タスクに適応できる。
ICLの性能は, (i) 選択された実演の質, (ii) 事前学習モデルの本質的なICL能力, (iii) 分布シフトの程度によってどのように制御されるかを分析する。
論文 参考訳(メタデータ) (2026-03-20T03:33:04Z) - Theoretical Foundations of Prompt Engineering: From Heuristics to Expressivity [0.0]
本研究では,トランスフォーマーのバックボーンをエグゼキュータとして固定し,プロンプトのみを変化させることで得られる機能群について検討する。
一つの固定されたバックボーンがプロンプトだけで対象の行動の幅広いクラスを近似できることを示す。
論文 参考訳(メタデータ) (2025-12-14T13:42:20Z) - Where and What Matters: Sensitivity-Aware Task Vectors for Many-Shot Multimodal In-Context Learning [57.082554323521464]
そこで我々は,STV(Sensitivity-aware Task Vector insert framework)を提案する。
キーとなる洞察は、クエリとコンテキストのペア間でのアクティベーションデルタは一貫した構造パターンを示し、挿入のための信頼できるキューを提供します。
識別されたセンシティブ・アウェア・ロケーションに基づいて、アクティベーション値をクラスタリングし、各ロケーションに対して事前クラスタリングされたアクティベーションバンクを構築し、次に強化学習を適用し、最も適したアクティベーション・バンクを選択する。
論文 参考訳(メタデータ) (2025-11-11T13:42:13Z) - Adaptive Task Vectors for Large Language Models [14.108866468832623]
Adaptive Task Vectors (ATV) は、各入力クエリに条件付きタスクベクトルを動的に生成する、シンプルで効果的なフレームワークである。
ATVは、目に見えないタスクであっても、強力なパフォーマンスと一般化能力を示す。
論文 参考訳(メタデータ) (2025-06-03T22:12:28Z) - Does learning the right latent variables necessarily improve in-context learning? [13.168329639763678]
Transformersのような大規模な自己回帰モデルは、新しい重みを学習することなく、コンテキスト内学習(ICL)によってタスクを解決できる。
本稿では,タスクラテントを明示的に推論する効果について検討する。
タスク関連潜伏変数への偏りは、分配性能を向上させるには至らない。
論文 参考訳(メタデータ) (2024-05-29T15:06:10Z) - Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars [66.823588073584]
大規模言語モデル(LLM)は、現実世界のアプリケーションで印象的な機能を示している。
これらの卓越した作品の品質は、パフォーマンスに大きな影響を与えます。
既存の方法は、先行注文がパフォーマンスに与える影響を適切に説明できない。
論文 参考訳(メタデータ) (2024-05-25T08:23:05Z) - ParaICL: Towards Parallel In-Context Learning [74.38022919598443]
大規模言語モデル(LLM)が自然言語処理の標準となっている。
インコンテキスト・ラーニング(ICL)は、いくつかの実演例の選択に依存している。
パラレルインコンテキスト学習(ParaICL)という新しい手法を提案する。
論文 参考訳(メタデータ) (2024-03-31T05:56:15Z) - Adaptive Discrete Communication Bottlenecks with Dynamic Vector
Quantization [76.68866368409216]
入力に条件付けされた離散化の厳密度を動的に選択する学習を提案する。
コミュニケーションボトルネックの動的に変化する厳密さは、視覚的推論や強化学習タスクにおけるモデル性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2022-02-02T23:54:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。