論文の概要: Learning to Select Visual In-Context Demonstrations
- arxiv url: http://arxiv.org/abs/2603.26775v1
- Date: Tue, 24 Mar 2026 18:07:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.595172
- Title: Learning to Select Visual In-Context Demonstrations
- Title(参考訳): 視覚的インテクストのデモを学習する
- Authors: Eugene Lee, Yu-Chi Lin, Jiajie Diao,
- Abstract要約: インコンテキスト学習(ICL)は、実演品質によって視覚的なタスクに適応する。
主要なデモ選択戦略は、教師なしk-Nearest Neighbor(kNN)探索である。
本稿では,Learning to Select Demonstrations (LSD)を導入し,最適な実演セットを構築するために強化学習エージェントを訓練する。
- 参考スコア(独自算出の注目度): 2.4928287482620273
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) adapt to visual tasks via in-context learning (ICL), which relies heavily on demonstration quality. The dominant demonstration selection strategy is unsupervised k-Nearest Neighbor (kNN) search. While simple, this similarity-first approach is sub-optimal for complex factual regression tasks; it selects redundant examples that fail to capture the task's full output range. We reframe selection as a sequential decision-making problem and introduce Learning to Select Demonstrations (LSD), training a Reinforcement Learning agent to construct optimal demonstration sets. Using a Dueling DQN with a query-centric Transformer Decoder, our agent learns a policy that maximizes MLLM downstream performance. Evaluating across five visual regression benchmarks, we uncover a crucial dichotomy: while kNN remains optimal for subjective preference tasks, LSD significantly outperforms baselines on objective, factual regression tasks. By balancing visual relevance with diversity, LSD better defines regression boundaries, illuminating when learned selection is strictly necessary for visual ICL.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、実演品質に大きく依存する、コンテキスト内学習(ICL)を介して視覚タスクに適応する。
主要なデモ選択戦略は、教師なしk-Nearest Neighbor(kNN)探索である。
単純な方法ではあるが、この類似性優先のアプローチは複雑な事実回帰タスクに準最適であり、タスクの完全な出力範囲を捕捉できない冗長な例を選択する。
我々は,選択を逐次決定問題として再編成し,Learning to Select Demonstrations (LSD)を導入し,最適な実演セットを構築するために強化学習エージェントを訓練する。
DQNとクエリ中心のTransformer Decoderを使って、エージェントはMLLMのダウンストリーム性能を最大化するポリシーを学習する。
kNNは主観的選好タスクに最適だが、LSDは客観的、事実回帰タスクのベースラインを著しく上回っている。
視覚的関連性と多様性のバランスをとることで、LSDは回帰境界をよりよく定義し、視覚的ICLに学習選択が厳密に必要であるときに光る。
関連論文リスト
- Meta-Sel: Efficient Demonstration Selection for In-Context Learning via Supervised Meta-Learning [9.851186633544975]
目的分類のための軽量な教師付きメタ学習手法であるMeta-Selを提案する。
ラベル付きトレーニングデータから(候補、クエリ)ペアの高速で解釈可能なスコアリング関数を学習する。
推測時、セレクタは全候補プール上で1つのベクトル化スコアを実行し、トップkのデモを返す。
論文 参考訳(メタデータ) (2026-02-12T16:11:29Z) - Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models [2.393011821499345]
大規模視覚言語モデル(LVLM)における選択バイアスの存在と性質について検討する。
一般および文脈的プロンプトからアンサンブルバイアスベクトルを推定する推論時間ロジットレベルのデバイアス法を提案する。
本手法はリトレーニングなしでバイアスを軽減し,冷凍LVLMと互換性がある。
論文 参考訳(メタデータ) (2025-09-20T20:45:47Z) - Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution [31.385024956599676]
大規模言語モデル(LLM)は多様な応答挙動、コスト、強度を示す。
我々はLinUCBに基づくアルゴリズムを開発し、将来の文脈予測に頼ることなく、確実にサブ線形後悔を実現する。
私たちのアルゴリズムは理論的に根拠があり、オフラインの微調整やデータセット固有のトレーニングは必要ありません。
論文 参考訳(メタデータ) (2025-06-21T10:01:46Z) - Large Language Models are Demonstration Pre-Selectors for Themselves [57.101804269100185]
大規模言語モデル(LLM)を備えたインコンテキスト学習(ICL)は、トレーニングデータ全体から数ショットのデモを選択することで、強力な数ショットのパフォーマンスを提供する。
FEw yet Essential Demonstration prE-selectoRは、デモの代表的なサブセットを特定する新しい事前選択フレームワークである。
FEwでもEssential Demonstration prE-selectoRは、パフォーマンスを維持しながら、トレーニングデータのサイズを20%以上削減できる。
論文 参考訳(メタデータ) (2025-06-06T12:29:03Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs [107.21334626890713]
MLLM(Multimodal Large Language Models)は、その優れた能力にもかかわらず、幻覚に苦しむ。
本稿では,これらの制約に対処するクロスモーダル階層型直接選好最適化(CHiP)を提案する。
定量的および定性的な分析によってCHiPを評価し,幻覚の低減効果を複数のベンチマークで実証した。
論文 参考訳(メタデータ) (2025-01-28T02:05:38Z) - Your Vision-Language Model Itself Is a Strong Filter: Towards
High-Quality Instruction Tuning with Data Selection [59.11430077029321]
視覚言語モデル(VLM)のための新しいデータセット選択手法であるSelf-Filterを導入する。
第1段階では、VLMと共同で学習する訓練指導の難しさを評価するためのスコアリングネットワークを考案する。
第2段階では、トレーニングされたスコアネットを使用して、各命令の難易度を測定し、最も難しいサンプルを選択し、類似したサンプルをペナルティ化し、多様性を促進する。
論文 参考訳(メタデータ) (2024-02-19T20:08:48Z) - GistScore: Learning Better Representations for In-Context Example
Selection with Gist Bottlenecks [3.9638110494107095]
In-context Learning(ICL)は、大規模言語モデル(LLM)がプロンプトで条件付きで新しいタスクを実行する機能である。
本稿では,教師付き微調整によるサンプルエンコーダの学習手法であるサンプルギストリングを提案する。
我々の微調整モデルでは、既成のレトリバーよりも20%以上向上し、最先端のICL性能が得られている。
論文 参考訳(メタデータ) (2023-11-16T06:28:05Z) - RetICL: Sequential Retrieval of In-Context Examples with Reinforcement Learning [53.52699766206808]
In-Context Learning (RetICL) のための検索式を提案する。
RetICLは数学用語の問題解決と科学的質問応答のタスクに基づいて評価し,一貫した性能や一致,学習可能なベースラインを示す。
論文 参考訳(メタデータ) (2023-05-23T20:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。