論文の概要: Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.02460v1
- Date: Thu, 02 Jul 2026 17:27:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.942484
- Title: Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
- Title(参考訳): 注釈なしLDM自己蒸留のためのニューロン認識データ選択
- Abstract要約: 実世界のインタラクションフィードバックや人間ラベルによる監視を伴わない、訓練後の大規模言語モデル(LLM)は依然として困難である。
最近のアノテーションのない自己進化法は、モデル自身の出力を監視信号として利用することでこの問題に対処している。
アノテーションのない自己蒸留のためのデータ中心型フレームワークであるNeuroon-OPSD(Neuroon-OPSD)を提案する。
- 参考スコア(独自算出の注目度): 10.362162923646133
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training large language models (LLMs) without real-world interaction feedback or human-labeled supervision remains challenging, particularly in specialized domains where expert annotations are costly to obtain. Recent annotation-free self-evolution methods address this by using the model's own outputs as supervision signals, constructing a teacher via additional context and aggregating predictions across multiple rollouts through majority voting to produce pseudo-labels. However, these approaches are not without drawbacks: SFT- and GRPO-based variants suffer out-of-domain performance degradation, while reward-based on-policy RL inflates calibration error. In this paper, we propose Neuron On-Policy Self-Distillation (Neuron-OPSD), a data-centric framework for annotation-free self-distillation that leverages internal neuron activations to guide both training-data selection and teacher context construction. The model is then trained via on-policy distillation from the teacher distribution, requiring no ground-truth labels at any stage. Across specialized-domain benchmarks, Neuron-OPSD improves in-domain task performance while preserving cross-domain generalization and mitigating calibration collapse over prior annotation-free baselines. This framework is particularly relevant to settings where online interaction or external supervision is costly or infeasible, and is conceptually distinct from offline RL approaches that rely on logged, reward-labeled trajectories.
- Abstract(参考訳): 実世界の対話フィードバックや人間ラベルによる監督なしに学習後の大規模言語モデル(LLM)は、特に専門家のアノテーションを入手するのにコストがかかる専門分野において、依然として困難である。
最近のアノテーションのない自己進化法では、モデル自身の出力を監視信号として使用し、追加のコンテキストを通じて教師を構築し、多数決によって複数のロールアウトにまたがる予測を集約し、擬似ラベルを生成することでこの問題に対処している。
しかし、これらのアプローチには欠点がない: SFT と GRPO ベースの変種はドメイン外の性能劣化に悩まされ、報酬ベースのオンラインRLはキャリブレーションエラーを膨らませる。
本稿では,内部ニューロンの活性化を利用してトレーニングデータ選択と教師コンテキスト構築の両方をガイドする,アノテーションのない自己蒸留のためのデータ中心のフレームワークであるNeuron-OPSDを提案する。
モデルは、教師の配布からオンライン蒸留を通じて訓練され、どの段階でも地味なラベルは必要とされない。
特殊なドメインベンチマーク全体にわたって、Neuron-OPSDはドメイン内のタスク性能を改善し、ドメイン間の一般化を保ち、以前のアノテーションのないベースラインよりもキャリブレーションの崩壊を緩和する。
このフレームワークは特に、オンラインインタラクションや外部監視がコストがかかる、あるいは実現不可能な設定に関係しており、ログ化された報酬ラベルのトラジェクトリに依存するオフラインのRLアプローチとは概念的に異なる。
関連論文リスト
- On-the-go Forgetting without Explicit Unlearning via ERASE [2.6426981014417046]
ERASEは、モデルウェイトを変更することなく、プライベートデータの観測可能な影響を抑制する、現在進行中の忘れ物のためのフレームワークである。
ERASEが指定されたサブクラスの機能的忘れを確実に達成した場合に、十分な条件を厳格に特徴付ける。
ERASEは、最近の未学習手法よりも、有効性を忘れること、計算効率、保持率の最良のバランスを維持している。
論文 参考訳(メタデータ) (2026-09-05T08:09:27Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks [20.760754362327933]
本稿では、二項分類を超えて誤差拡散を拡張するためのモジュロエラールーティングを提案する。
本手法で訓練したデュアルストリーム興奮抑制アーキテクチャは,MNISTの96.7%を達成している。
強化学習では,EDをPPO(Proximal Policy Optimization)と統合し,Google BraxとCraftaxの継続的制御タスクで評価する。
論文 参考訳(メタデータ) (2026-06-30T14:09:40Z) - DIB-OD: Preserving the Invariant Core for Robust Heterogeneous Graph Adaptation via Decoupled Information Bottleneck and Online Distillation [9.626014518332898]
DIB-ODは、頑健な不均一グラフ適応のための不変コアを保存するために設計された新しいフレームワークである。
本研究では,DIB-ODが最先端の手法,特にタイプ間ドメイン転送において著しく優れていることを示す。
論文 参考訳(メタデータ) (2026-04-13T01:03:44Z) - Heterogeneous Self-Supervised Acoustic Pre-Training with Local Constraints [64.15709757611369]
異種データを扱うための自己教師付き事前学習手法を提案する。
提案手法は、下流の教師付き微調整タスクに対する自己教師付き事前訓練モデルの適応性を大幅に向上させることができる。
論文 参考訳(メタデータ) (2025-08-27T15:48:50Z) - Toward Generalist Semi-supervised Regression via Decoupled Representation Distillation [8.645821347784835]
半教師付き回帰作業のためのエンドツーエンドデカップリング型表現蒸留フレームワーク(DRILL)について紹介する。
提案したDRILLは強力な一般化を持ち、競合する手法よりも優れている。
論文 参考訳(メタデータ) (2025-08-12T22:11:01Z) - ACTRESS: Active Retraining for Semi-supervised Visual Grounding [52.08834188447851]
前回の研究であるRefTeacherは、疑似自信と注意に基づく監督を提供するために教師学生の枠組みを採用することで、この課題に取り組むための最初の試みである。
このアプローチは、Transformerベースのパイプラインに従う現在の最先端のビジュアルグラウンドモデルと互換性がない。
本稿では, ACTRESS を略したセミスーパービジョン視覚グラウンドのためのアクティブ・リトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-07-03T16:33:31Z) - Improving Molecular Representation Learning with Metric
Learning-enhanced Optimal Transport [49.237577649802034]
分子レグレッション問題に対する一般化能力を高めるために,MROTと呼ばれる新しい最適輸送ベースアルゴリズムを開発した。
MROTは最先端のモデルよりも優れており、新しい物質の発見を加速する有望な可能性を示している。
論文 参考訳(メタデータ) (2022-02-13T04:56:18Z) - A Curriculum-style Self-training Approach for Source-Free Semantic Segmentation [91.13472029666312]
ソースフリーなドメイン適応型セマンティックセマンティックセグメンテーションのためのカリキュラムスタイルの自己学習手法を提案する。
提案手法は, ソースフリーなセマンティックセグメンテーションタスクにおいて, 合成-実-実-実-実-実-実-非実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実
論文 参考訳(メタデータ) (2021-06-22T10:21:39Z) - Unsupervised Domain Adaptation for Speech Recognition via Uncertainty
Driven Self-Training [55.824641135682725]
WSJ をソースドメインとし,TED-Lium 3 とSWITCHBOARD を併用したドメイン適応実験を行った。
論文 参考訳(メタデータ) (2020-11-26T18:51:26Z) - Understanding Self-Training for Gradual Domain Adaptation [107.37869221297687]
段階的なドメイン適応は、対象領域へ徐々にシフトするラベルのないデータのみを与えられたソースドメインで訓練された初期分類器を適応させることが目的である。
目標領域への直接適応が非有界誤差をもたらすような設定下において、段階的なシフトを伴う自己学習の誤差に対する最初の非無空上界を証明した。
この理論解析はアルゴリズムの洞察を導き、無限のデータを持つ場合でも正規化とラベルのシャープ化が不可欠であることを強調し、より小さなワッサーシュタイン無限距離のシフトに対して自己学習が特にうまく働くことを示唆している。
論文 参考訳(メタデータ) (2020-02-26T08:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。