論文の概要: Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
- arxiv url: http://arxiv.org/abs/2603.13201v1
- Date: Fri, 13 Mar 2026 17:39:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-16 17:38:12.227174
- Title: Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
- Title(参考訳): 大規模言語モデルのためのインストラクションチューニングにおけるニューロン認識データ選択
- Abstract要約: インストラクションチューニング(IT)は、大規模言語モデル(LLM)の強力な能力を解放するための効果的なアプローチであることが証明されている。
近年の研究では、過剰なITデータがLCMのパフォーマンスを低下させる可能性がある一方で、高品質なITデータの小さなサブセットを慎重に選択することで、その能力を著しく向上させることができることが示されている。
我々はNAITと呼ばれる新しい効率的なフレームワークを提案し、ITデータセットから最も効率的なサブセットデータを特定する。
- 参考スコア(独自算出の注目度): 69.08560711834848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Instruction Tuning (IT) has been proven to be an effective approach to unlock the powerful capabilities of large language models (LLMs). Recent studies indicate that excessive IT data can degrade LLMs performance, while carefully selecting a small subset of high-quality IT data can significantly enhance their capabilities. Therefore, identifying the most efficient subset data from the IT dataset to effectively develop either specific or general abilities in LLMs has become a critical challenge. To address this, we propose a novel and efficient framework called NAIT. NAIT evaluates the impact of IT data on LLMs performance by analyzing the similarity of neuron activation patterns between the IT dataset and the target domain capability. Specifically, NAIT captures neuron activation patterns from in-domain datasets of target domain capabilities to construct reusable and transferable neuron activation features. It then evaluates and selects optimal samples based on the similarity between candidate samples and the expected activation features of the target capabilities. Experimental results show that training on the 10\% Alpaca-GPT4 IT data subset selected by NAIT consistently outperforms methods that rely on external advanced models or uncertainty-based features across various tasks. Our findings also reveal the transferability of neuron activation features across different capabilities of LLMs. In particular, IT data with more logical reasoning and programmatic features possesses strong general transferability, enabling models to develop stronger capabilities across multiple tasks, while a stable core subset of data is sufficient to consistently activate fundamental model capabilities and universally improve performance across diverse tasks.
- Abstract(参考訳): インストラクションチューニング(IT)は、大規模言語モデル(LLM)の強力な能力を解放するための効果的なアプローチであることが証明されている。
近年の研究では、過剰なITデータがLCMのパフォーマンスを低下させる可能性がある一方で、高品質なITデータの小さなサブセットを慎重に選択することで、その能力を著しく向上させることができることが示されている。
したがって、LLMの特定の能力または一般的な能力を効果的に開発するために、ITデータセットから最も効率的なサブセットデータを特定することは、重要な課題となっている。
そこで本研究では,NAITと呼ばれる新しい,効率的なフレームワークを提案する。
NAITは、ITデータセットと対象ドメイン能力との間のニューロン活性化パターンの類似性を分析することにより、LLMのパフォーマンスに対するITデータの影響を評価する。
具体的には、NAITは、ターゲットドメイン機能のドメイン内のデータセットからニューロンの活性化パターンをキャプチャして、再利用可能な、転送可能なニューロン活性化機能を構築する。
次に、候補標本と目標能力の期待活性化特徴との類似性に基づいて最適なサンプルを評価し、選択する。
実験の結果,NAITが選択した10\%のAlpaca-GPT4 ITデータサブセットのトレーニングは,外部の高度なモデルやさまざまなタスクにまたがる不確実性に基づく機能に依存する手法を一貫して上回っていることがわかった。
また,LLMの異なる機能にまたがるニューロン活性化機能の伝達性も明らかにした。
特に、より論理的な推論とプログラム的特徴を持つITデータは、強力な汎用的な転送可能性を持ち、モデルが複数のタスクにまたがるより強力な機能を開発することができる一方、安定したデータのコアサブセットは、基本的なモデルの機能を一貫して活性化し、多様なタスクのパフォーマンスを普遍的に改善するのに十分である。
関連論文リスト
- From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models [73.72877445629383]
Interpretability-Guided Data Selection (IGDS) は、まず周波数リコールと干渉フィルタリングによって因果タスクの特徴を識別するフレームワークである。
我々は,数学的推論,要約,翻訳タスクに関するIGDSをGemma-2,LLaMA-3.1,Qwen3モデルで検証する。
論文 参考訳(メタデータ) (2026-04-28T03:16:24Z) - Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning [8.082936847467638]
本稿では,タスク間相互作用を識別するために,移動学習行列の構築と次元削減を行う分析フレームワークを提案する。
我々は、潜伏能力(例えば、Reasoning、Sentiment Classification、NLU、Arithmetic)を特定するための10のモデルを訓練し、分析し、伝達学習の副作用を発見する。
論文 参考訳(メタデータ) (2025-09-17T01:45:42Z) - Large Language Model as Meta-Surrogate for Data-Driven Many-Task Optimization: A Proof-of-Principle Study [11.452011929848844]
本研究では,マルチタスク最適化を支援するメタサロゲートフレームワークを提案する。
問題群に適合するメタデータを持つ普遍モデルを定義することにより、多タスクフィットネス予測のための統一的なフレームワークを定式化する。
我々のフレームワークは、双対レベルの知識伝達 -- 代理レベルと個別レベルの両方 -- をサポートし、最適化の効率性と堅牢性を高めます。
論文 参考訳(メタデータ) (2025-03-11T11:13:11Z) - LLM-Select: Feature Selection with Large Language Models [64.5099482021597]
大規模言語モデル(LLM)は、データサイエンスの標準ツールに匹敵するパフォーマンスで、最も予測可能な機能を選択することができる。
以上の結果から,LSMはトレーニングに最適な機能を選択するだけでなく,そもそもどの機能を収集すべきかを判断する上でも有用である可能性が示唆された。
論文 参考訳(メタデータ) (2024-07-02T22:23:40Z) - SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection [47.180664081322035]
インストラクションチューニング(IT)を用いた大規模言語モデル(LLM)の調整手法を提案する。
LLMに存在する本質的な不確実性を利用して、余分なリソースを必要とせずに、より効果的に高品質なITデータを選択する。
以上の結果から,より長く,より計算集約的なITデータが,ITの優れた情報源となる可能性が示唆された。
論文 参考訳(メタデータ) (2024-02-26T16:21:53Z) - LESS: Selecting Influential Data for Targeted Instruction Tuning [64.78894228923619]
本稿では,データの影響を推定し,命令データ選択のための低ランクグレーディエント類似度探索を行うアルゴリズムであるLESSを提案する。
LESS選択したデータの5%のトレーニングは、さまざまなダウンストリームタスクにわたる完全なデータセットでのトレーニングよりも優れています。
我々の方法は、意図した下流アプリケーションに必要な推論スキルを識別するために、表面的なフォームキューを超えています。
論文 参考訳(メタデータ) (2024-02-06T19:18:04Z) - Learning Objective-Specific Active Learning Strategies with Attentive
Neural Processes [72.75421975804132]
学び アクティブラーニング(LAL)は、アクティブラーニング戦略自体を学ぶことを提案し、与えられた設定に適応できるようにする。
能動学習問題の対称性と独立性を利用した新しい分類法を提案する。
私たちのアプローチは、筋電図から学ぶことに基づいており、モデルに標準ではない目的に適応する能力を与えます。
論文 参考訳(メタデータ) (2023-09-11T14:16:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。