論文の概要: Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
- arxiv url: http://arxiv.org/abs/2605.26761v1
- Date: Tue, 26 May 2026 09:31:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.792513
- Title: Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
- Title(参考訳): once-For-All:マルチモーダルインストラクションチューニングのためのTrain-OnceとSelect-Anytimeフレームワーク
- Authors: Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu,
- Abstract要約: 我々は、再利用可能なセレクタを一度トレーニングし、再計算なしで任意のデータセットやモデルに適用するデータ選択フレームワークOFAを提案する。
OFAは凍ったCLIP空間でマルチモーダル命令をクラスタ化し、クラスタ構造から擬似ラベルを導き、ほんの数回だけ軽量セレクタを訓練する。
トレーニングが完了すると、凍結セレクタはデータセットとモデルスケールを直接転送する。
- 参考スコア(独自算出の注目度): 5.733450405369182
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal instruction tuning is the de facto recipe for adapting vision language models (VLMs), yet instruction data are highly redundant, making data selection critical for training efficiency. Existing methods derive selection signals from a specific model or dataset, so whenever the target model or candidate pool changes, the criteria must be recomputed from scratch at substantial cost. To address this, we propose OFA, a data selection framework that trains a reusable selector once and applies it to any dataset or model without recomputation. OFA clusters multimodal instructions in a frozen CLIP space, derives pseudo labels from the cluster structure, and trains a lightweight selector for only a few epochs; samples on which this selector is least confident are selected as the most informative. Once trained, the frozen selector transfers directly across datasets and model scales. The selector is trained once on LLaVA-665K and applied both to LLaVA-665K itself and, without any retraining, to the unseen Vision-Flan-186K. Selecting only 15% of the data, OFA achieves 98.3% of full data performance across 10 downstream benchmarks; on the smaller Vision-Flan-186K, the transferred selector surpasses full data training by 10.6%, confirming that the learned signal generalizes to datasets never seen during selector training. The same selected subsets benefit VLMs at both Qwen2.5-VL-3B and LLaVA-v1.5-7B without per model recomputation, decoupling selection from the target model. These results demonstrate that a single, transferable selector provides an effective and reusable solution for efficient multimodal instruction tuning.
- Abstract(参考訳): マルチモーダル・インストラクション・チューニングは視覚言語モデル(VLM)を適用するためのデファクト・レシピである。
既存の方法は特定のモデルやデータセットから選択信号を取得するため、ターゲットモデルや候補プールが変化するたびに、その基準を相当なコストでスクラッチから再計算する必要がある。
これを解決するために、再利用可能なセレクタを一度トレーニングし、再計算せずに任意のデータセットやモデルに適用するデータ選択フレームワークOFAを提案する。
OFAは凍ったCLIP空間でマルチモーダル命令をクラスタ化し、クラスタ構造から擬似ラベルを導き、いくつかのエポックで軽量セレクタを訓練する。
トレーニングが完了すると、凍結セレクタはデータセットとモデルスケールを直接転送する。
セレクターは一度はLLaVA-665Kで訓練され、LLaVA-665K自体にも再訓練することなく、目に見えないビジョン・フラン-186Kにも適用された。
送信されたセレクタは10の下流ベンチマークで98.3%の完全なデータ性能を達成し、Vision-Flan-186Kでは、全データトレーニングを10.6%越え、学習信号がセレクタトレーニング中に見られないデータセットに一般化されることを確認する。
同じ選択されたサブセットはQwen2.5-VL-3BとLLaVA-v1.5-7Bの両方でVLMの恩恵を受ける。
これらの結果から,効率的なマルチモーダル命令チューニングのための効率よく再利用可能な1つのセレクタが得られた。
関連論文リスト
- ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning [18.989158560585675]
大規模データセットのトレーニングは、計算コストが高く、データの冗長性のために非効率である。
ScalSelectは、線形時間複雑性を持つ訓練不要なマルチモーダルデータ選択法である。
ScalSelectはデータセット全体のトレーニングパフォーマンスの97.5%以上を16%のデータで達成し、一部の設定ではフルデータトレーニングよりも優れています。
論文 参考訳(メタデータ) (2026-02-12T06:38:49Z) - MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning [69.7347209018861]
視覚的インストラクションのチューニングに有用なデータを自動的に識別するMLLM-Selectorを提案する。
モデル性能を向上させるために,VITデータプールの各サンプルの必要なスコアを算出し,サンプルのピボットを同定する。
以上の結果から,データ選択における必要条件と多様性の混合の重要性が指摘され,MLLMセレクタの創出につながった。
論文 参考訳(メタデータ) (2025-03-26T12:42:37Z) - Large-Scale Data Selection for Instruction Tuning [20.45142921023614]
命令チューニングのためのデータ選択アプローチは、通常、小さなプールから小さなデータセットを選択することでテストされる。
しかし、一般的なインストラクションチューニングモデルでは、数十万から数百万のサンプルをトレーニングし、さらに大きなデータプールからサンプリングすることが多い。
この設定では,最近提案された多くの手法はランダムな選択に欠けており,さらに大きなデータプールへのアクセスを与えられると,性能が低下することさえ示している。
表現に基づくデータ選択の変種(RDS+)は、テストされたすべての設定において、より複雑なメソッドよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-03-03T18:37:26Z) - Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection [89.42023974249122]
Adapt-$infty$は、生涯のインストラクションチューニングのための、新しいマルチウェイおよびアダプティブなデータ選択アプローチである。
勾配に基づくサンプルベクトルをグループ化して擬似スキルクラスタを構築する。
セレクタエキスパートのプールから各スキルクラスタの最高のパフォーマンスデータセレクタを選択する。
このデータセレクタは、トレーニングのために各スキルクラスタから最も重要なサンプルのサブセットをサンプリングする。
論文 参考訳(メタデータ) (2024-10-14T15:48:09Z) - MILO: Model-Agnostic Subset Selection Framework for Efficient Model
Training and Tuning [68.12870241637636]
モデル学習からサブセット選択を分離するモデルに依存しないサブセット選択フレームワークMILOを提案する。
実験結果から、MILOはモデルを3ドル(約3,300円)でトレーニングし、ハイパーパラメータを20ドル(約2,300円)でチューニングできます。
論文 参考訳(メタデータ) (2023-01-30T20:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。