論文の概要: DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
- arxiv url: http://arxiv.org/abs/2608.30209v2
- Date: Tue, 01 Sep 2026 08:33:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.659904
- Title: DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
- Title(参考訳): DICS:ビジュアルインストラクション選択のためのデータ固有の一貫性を探る
- Authors: Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye,
- Abstract要約: データ固有の一貫性(Data Intrinsic Consistency、DIC)は、サンプルレベルのコンポーネント間の一貫性を定量化するために設計された自己スコアの指標である。
DICSは、高いサンプル内一貫性とグローバルな分布多様性の間のトレードオフを最適化する適応データ選択手法である。
DIC-6Mは6Mサンプルのマルチモーダル命令コーパスであり、最大規模の視覚的命令選択学習を可能にする。
- 参考スコア(独自算出の注目度): 53.457992197673185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual instruction tuning is crucial for advancing the vision-language alignment and instruction-following capabilities of Vision-Language Models (VLMs). However, identifying optimal subsets under a fixed ratio constraint from rapidly expanding datasets remains a significant bottleneck. While existing methods largely depend on distribution diversity or heuristic filtering, they often overlook the internal coherence within individual samples. To bridge this gap, we propose Data Intrinsic Consistency (DIC), a self-scoring metric designed to quantify the sample-level inter-component consistency. DIC consists of two modules: Visual Information Consistency (VIC), evaluating the alignment between visual content and instructions, and Response Information Consistency (RIC), assessing response coherence relative to the instruction. Building upon DIC, we introduce Data Intrinsic Consistency Selection (DICS), an adaptive data selection method that optimizes the trade-off between high intra-sample consistency and global distributional diversity under varying data budgets. Extensive experiments demonstrate that DICS consistently outperforms state-of-the-art methods across diverse dataset scales and model architectures, surpassing full-dataset fine-tuning while using only 25% of the LLaVA-1.5-665K data. We further curate DICS-6M, a 6M-sample multi-modal instruction corpus that enables the largest-scale visual instruction selection study to date; remarkably, DICS reaches 94.52\% of the official InternVL3-8B-Instruct performance using less than 25\% of its reported training data. Code can be seen at https://github.com/cqu-student/DICS
- Abstract(参考訳): 視覚訓練は視覚言語アライメントと視覚言語モデル(VLM)の指示追従能力の向上に不可欠である。
しかし、急速に拡大するデータセットから、一定の比率の制約の下で最適なサブセットを特定することは、大きなボトルネックである。
既存の手法は分布の多様性やヒューリスティックなフィルタリングに大きく依存しているが、個々のサンプルの内部コヒーレンスを見落としていることが多い。
このギャップを埋めるために,サンプルレベルのコンポーネント間の一貫性の定量化を目的とした自己評価指標であるData Intrinsic Consistency (DIC)を提案する。
DICは、視覚内容と命令の整合性を評価する視覚情報整合性(VIC)と、命令に対する応答整合性を評価する反応情報整合性(RIC)の2つのモジュールから構成される。
DIC上に構築されたデータ固有の一貫性選択(DICS)は,データ予算の変動により,高いサンプル内一貫性とグローバルな分布多様性とのトレードオフを最適化する適応型データ選択手法である。
大規模な実験は、DICSがLLaVA-1.5-665Kデータの25%しか使用せず、さまざまなデータセットスケールやモデルアーキテクチャにわたって、最先端の手法を一貫して上回ることを示した。
さらに6Mサンプルのマルチモーダル・インストラクション・コーパスであるDICS-6Mを,これまでで最大規模のビジュアル・インストラクション・セレクション・スタディを実現する。
コードはhttps://github.com/cqu-student/DICSで見ることができる。
関連論文リスト
- VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning [33.115992843637564]
そこで本研究では,インストラクションチューニング時の視覚入力の限界寄与を計測する基本データ選択フレームワークを提案する。
VisNecは、予測損失と視覚的コンテキストとを比較して、トレーニングインスタンスが視覚的にクリティカルなのか、冗長なのか、あるいは不一致なのかを識別する。
VisNecが選択したLLaVA-665Kデータセットの15%しかトレーニングしていない10のベンチマークでは、完全なデータパフォーマンスの100.2%が達成されている。
論文 参考訳(メタデータ) (2026-03-01T17:26:02Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization [14.304308878028358]
マルチモーダルな大規模言語モデルは、視覚と言語機能を調整するための命令チューニングに大きく依存している。
既存のデータ選択方法は重要かつ多様なサブセットを選択することを目的としているが、それらはしばしば2つの重大な欠点に悩まされる。
我々は,これらの課題を克服するために,データの重要度と多様性を共同で最適化する,新しいデュアルオブジェクトフレームワークであるCoIDOを紹介する。
論文 参考訳(メタデータ) (2025-10-11T09:41:21Z) - Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime [24.425649636862122]
より均一に分散したデータを選択することで、トレーニング効率が向上し、性能が向上することを示す。
具体的には、より均一な(バイアスのない)分布が、データポイント間の最小ペア距離を大きくすることを示す。
理論的には、ニューラルネットワークの近似誤差は、h_min$が増加するにつれて減少する。
論文 参考訳(メタデータ) (2025-06-30T17:58:30Z) - Less is More: High-value Data Selection for Visual Instruction Tuning [127.38740043393527]
本稿では,視覚的命令データの冗長性を排除し,トレーニングコストを削減するために,高価値なデータ選択手法TIVEを提案する。
約15%のデータしか使用していない我々のアプローチは、8つのベンチマークで全データ微調整モデルに匹敵する平均性能を実現することができる。
論文 参考訳(メタデータ) (2024-03-14T16:47:25Z) - Distribution-Aware Prompt Tuning for Vision-Language Models [20.02599087680773]
プロンプトチューニングの鍵は、モデルパラメータを固定した学習可能なベクトルを介して、2つのモード間の特徴空間アライメントである。
この観測に触発されて、視覚言語モデルのための分布認識プロンプトチューニング(DAPT)を提案する。
11のベンチマークデータセットに対する実験により,本手法が一般化可能性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2023-09-06T23:49:11Z) - Diversity-Aware Meta Visual Prompting [111.75306320834629]
DAM-VP(Diversity-Aware Meta Visual Prompting)は、学習済みのモデルを凍結したバックボーンで下流のタスクに転送する効率的なプロンプト手法である。
下流のデータセットを、多様性に富んだ方法で小さなサブセットにクラスタ化し、それぞれのサブセットがそれぞれ独自のプロンプトを持っている。
すべてのプロンプトはメタプロンプトで最適化され、複数のデータセットで学習される。
論文 参考訳(メタデータ) (2023-03-14T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。