論文の概要: Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings
- arxiv url: http://arxiv.org/abs/2610.07572v1
- Date: Tue, 06 Oct 2026 01:05:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.740658
- Title: Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings
- Title(参考訳): 2つのベクトルがコンテキスト内デモを置き換える: 埋め込みによる構造化タスク適応
- Abstract要約: In-context Learning (ICL)は、凍結した大規模なマルチモーダルモデルをいくつかのデモ(demos)から新しいタスクに適応させるが、クエリ毎に再エンコードする。
本稿では,既存の入力埋め込みに付加されたタスク固有ベクトルに,デモを置き換えたSTAVE(Structured Task Adaptation)を提案する。
- 参考スコア(独自算出の注目度): 10.069487661887157
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In-context learning (ICL) adapts frozen large multimodal models (LMMs) to new tasks from a few demonstrations (demos), but re-encodes them at every query, where each demo image adds up to hundreds of visual tokens. Demo-free methods remove this cost with a compact task state. However, they add it at locations searched per task or at every decoder layer, where task parameters grow with depth. Moreover, inserted tokens or keys cannot change how the original prompt divides its attention within a layer. To address these issues, we propose Structured Task Adaptation via Embeddings (STAVE), which replaces demos with two task-specific vectors added to existing input embeddings. Specifically, a readout vector updates the answer-producing tokens and a context vector updates the other structural token groups. Both are trained with answer labels on prompts with and without demos. We justify these design choices theoretically using a first-order analysis of the loss and a margin bound. Extensive experiments on six LMMs and five large language models show that STAVE matches or outperforms state-of-the-art methods on multimodal tasks with far fewer task parameters and surpasses 15-shot ICL and prior task vectors on 18 text tasks, all at zero-shot inference cost.
- Abstract(参考訳): In-context Learning (ICL)は、冷凍された大規模なマルチモーダルモデル(LMM)を、いくつかのデモ(demos)から新しいタスクに適応させるが、各デモイメージが数百のビジュアルトークンを追加して、クエリ毎に再エンコードする。
デモフリーメソッドは、このコストをコンパクトなタスクステートで除去する。
しかし、タスクごとに検索された場所や、タスクパラメータが深さとともに成長するすべてのデコーダ層に追加する。
さらに、挿入されたトークンやキーは、元のプロンプトがレイヤー内で注意を分割する方法を変えることができない。
これらの問題に対処するため、既存の入力埋め込みに追加された2つのタスク固有ベクトルでデモを置き換えるSTAVE(Structured Task Adaptation via Embeddings)を提案する。
具体的には、読み出しベクトルが応答生成トークンを更新し、コンテキストベクトルが他の構造トークングループを更新する。
どちらも、デモなしでのプロンプトに関する回答ラベルでトレーニングされている。
理論的には、損失とマージン境界の1次解析を用いてこれらの設計選択を正当化する。
6つのLMMと5つの大きな言語モデルに対する大規模な実験により、STAVEはタスクパラメータがはるかに少ないマルチモーダルタスクにおける最先端の手法に適合し、ゼロショット推論コストで18のテキストタスク上で15ショットのICLおよび以前のタスクベクトルを超えることが示されている。
関連論文リスト
- Where and What Matters: Sensitivity-Aware Task Vectors for Many-Shot Multimodal In-Context Learning [57.082554323521464]
そこで我々は,STV(Sensitivity-aware Task Vector insert framework)を提案する。
キーとなる洞察は、クエリとコンテキストのペア間でのアクティベーションデルタは一貫した構造パターンを示し、挿入のための信頼できるキューを提供します。
識別されたセンシティブ・アウェア・ロケーションに基づいて、アクティベーション値をクラスタリングし、各ロケーションに対して事前クラスタリングされたアクティベーションバンクを構築し、次に強化学習を適用し、最も適したアクティベーション・バンクを選択する。
論文 参考訳(メタデータ) (2025-11-11T13:42:13Z) - Vision-Language Models Create Cross-Modal Task Representations [58.19152818504624]
視覚言語モデル(VLM)は,概念的に等価な入力を共有タスクベクトルに整合させることができる。
このアライメントを,タスクやモデルアーキテクチャのクロスモーダル転送を通じて測定する。
タスクベクトルはベース言語モデルから微調整された視覚言語モデルに変換可能であることを示す。
論文 参考訳(メタデータ) (2024-10-29T17:59:45Z) - Sweeping Heterogeneity with Smart MoPs: Mixture of Prompts for LLM Task Adaptation [43.32632163091792]
大規模言語モデル(LLM)は、テキスト要約や数学的問題など、さまざまなタスクを解く能力を持つ。
計算コストが高いため、現在のトレンドは、プロンプトインストラクションチューニングを使用して、モノリシックで事前訓練されたLLMを、新しい-しかししばしば個別の-下流タスクのためによりよく調整することである。
MoPはマルチタスク、マルチソースシナリオにおいて、プロンプトトレーニングの"干渉"を同時に緩和することができる。
論文 参考訳(メタデータ) (2023-10-04T14:11:12Z) - Universal Few-shot Learning of Dense Prediction Tasks with Visual Token
Matching [26.26540176172197]
任意の密接な予測タスクに対して,ビジュアルトークンマッチング(VTM)を汎用的な数ショット学習として提案する。
VTMは、マッチングアルゴリズムを変調するタスク固有のパラメータの少ないタスクに柔軟に適応する。
我々は,タスクノミーデータセットの挑戦的な変種を用いてVTMを実験し,無意味な高密度な予測タスクを頑健に学習していることを観察した。
論文 参考訳(メタデータ) (2023-03-27T07:58:42Z) - All in Tokens: Unifying Output Space of Visual Tasks via Soft Token [30.6086480249568]
インスタンス分割と深度推定の2つの典型的な視覚的タスクを同時に扱う単一の統一モデルを示す。
本稿では,視覚的タスクの特異性を考慮した新しい手法を提案する。
我々はNYUv2深度推定の特定のタスクに対して0.279 RMSEを達成し、このベンチマークで新しい記録を樹立した。
論文 参考訳(メタデータ) (2023-01-05T18:55:20Z) - Decomposed Prompting: A Modular Approach for Solving Complex Tasks [55.42850359286304]
本稿では,より単純なサブタスクに分解することで,複雑なタスクを解くための分解プロンプトを提案する。
このモジュール構造は、各プロンプトを特定のサブタスクに最適化することを可能にする。
Decomposed Promptingの柔軟性とモジュラリティは、数発のプロンプトで先行作業より優れていることを示す。
論文 参考訳(メタデータ) (2022-10-05T17:28:20Z) - Multi-Task Learning with Multi-Query Transformer for Dense Prediction [38.476408482050815]
本稿では,複数のタスク間の推論を容易にするために,Multi-Query Transformer (MQ Transformer) という単純なパイプラインを提案する。
異なるタスク間での高密度なピクセル単位のコンテキストをモデル化する代わりに、タスク固有のプロキシを使ってクロスタスク推論を行う。
実験の結果,提案手法は有効な手法であり,最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-05-28T06:51:10Z) - Vector-Quantized Input-Contextualized Soft Prompts for Natural Language
Understanding [62.45760673220339]
本稿では,Vector-quantized Input-contextualized Prompt Tuning (VIP)を提案する。
自然言語理解タスクの幅広い範囲において,提案するVIPフレームワークが1.19%の差でPTモデルに勝っている。
論文 参考訳(メタデータ) (2022-05-23T03:51:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。