論文の概要: PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits
- arxiv url: http://arxiv.org/abs/2607.28982v1
- Date: Fri, 31 Jul 2026 03:20:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.579965
- Title: PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits
- Title(参考訳): PARALLEL: 明示的な制限下での言語モデル学習に対する前頭前頭前野強化によるアプローチ
- Abstract要約: 言語モデル学習における前頭前歯列強化のアプローチ
XSum と CNN/DailyMail の実験では、PARALLEL は ROUGE-1 と ROUGE-2 の96.9--98.6% のスコアを維持している。
その結果、各サンプルをいつ、どのように更新するかの学習が、安定かつ効率的なデプロイ後ストリーム適応をサポートすることがわかった。
- 参考スコア(独自算出の注目度): 3.976291254896486
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent language models achieve strong performance across a variety of tasks, but conventional adaptation applies updates uniformly across training samples regardless of their local update benefit. We propose PARALLEL, a prefrontal-aligned reinforcement inspired approach for language-model learning. Inspired by the complementary roles of goal-related and uncertainty-related control, PARALLEL represents these forms of information as separate controller signals and combines them with the current model representation. A reinforcement-inspired controller assigns sample-dependent update intensity using immediate utility-cost feedback. PARALLEL therefore learns when and how strongly to adapt to each sample, prioritizing beneficial updates while limiting unnecessary parameter changes. PARALLEL uses available updates more efficiently than selective baselines while retaining 94.1--99.2\% of Full-adaptation performance. Beyond multiple-choice reasoning, experiments on XSum and CNN/DailyMail show that PARALLEL retains 96.9--98.6\% of the ROUGE-1 and ROUGE-2 scores achieved by Full adaptation and 98.8--98.9\% of the corresponding ROUGE-L scores. When compared at the same cumulative adaptation time or GPU energy, PARALLEL achieves higher ARC accuracy and exhibits a more stable late-stage adaptation trajectory than Full adaptation in the representative run. These results show that learning when and how strongly to update each sample supports stable and efficient post-deployment stream adaptation while avoiding unnecessary updates.
- Abstract(参考訳): 近年の言語モデルでは,様々なタスクに対して高いパフォーマンスが達成されているが,従来の適応では,ローカル更新のメリットに関わらず,トレーニングサンプルに対して一様に更新が適用されている。
言語モデル学習のためのプレフロントアライン強化型アプローチであるPARALLELを提案する。
PARALLELは、ゴール関連制御と不確実性関連制御の相補的な役割に着想を得て、これらの情報の形式を独立した制御信号として表現し、それらを現在のモデル表現と組み合わせる。
強化インスパイアされたコントローラは、即時ユーティリティコストフィードバックを用いてサンプル依存更新強度を割り当てる。
そのためparALLELは、各サンプルにいつ、どのくらい強く適応するかを学び、有益な更新を優先し、不要なパラメータの変更を制限します。
PARALLELは94.1-99.2\%のフルアダプテーション性能を維持しながら、選択ベースラインよりも効率的に利用可能なアップデートを使用する。
XSum と CNN/DailyMail の実験では、PARALLEL は ROUGE-1 と ROUGE-2 のスコアの96.9-98.6 %、対応するROUGE-L のスコアの98.8-98.9 % を維持している。
同じ累積適応時間またはGPUエネルギーで比較すると、PARALLELはARC精度が高く、代表ランでのフル適応よりも安定な後期適応軌道を示す。
これらの結果は、各サンプルをいつ、どのようにアップデートするかの学習が、不要な更新を回避しつつ、安定した、効率的なデプロイ後ストリーム適応をサポートすることを示している。
関連論文リスト
- Parameter-Efficient Adaptation of Pretrained Language Models for Time-Series Forecasting [2.141079906482723]
我々は,事前訓練したGPT-2バックボーンの埋め込み空間に直接,固定長の時系列パッチを投影する。
我々は, (i) 表現戦略 (連続埋め込みとテキストシリアライゼーション) , (ii) 適応体制 (部分的あるいは完全微調整) および (iv) 入力コンテキスト長の影響を解析した。
論文 参考訳(メタデータ) (2026-09-14T10:30:59Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models [102.20309135516186]
クロスエントロピー(CE)トレーニングは、言語モデルの密集したスケーラブルな監視を提供する。
言語モデル微調整のための特徴マッチング手法を提案する。
この目的を効率的に最適化するために,エネルギーベースファインチューニングを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:57:50Z) - Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols [123.73663884421272]
より強力な事前訓練モデルと改良された適応アルゴリズムによって、わずかなショット転送が革新されている。
FEWTRANSは10種類のデータセットを含む総合的なベンチマークである。
FEWTRANS をリリースすることにより,数発の転写学習研究において再現性の向上を合理化するための厳密な "ルーラー" の提供を目指す。
論文 参考訳(メタデータ) (2026-02-28T05:41:57Z) - STABLE: Gated Continual Learning for Large Language Models [0.0]
STABLEは、シーケンシャルな更新時に忘れることを制限する、ゲート付き連続的なセルフ編集フレームワークである。
各候補編集は3つの指標のうちの1つを用いて安定性の予算に対して評価される。
Qwen-2.5-7Bモデルの実験では、ゲーティングは適応性を保ちながら忘れを効果的に軽減することを示した。
論文 参考訳(メタデータ) (2025-10-17T16:14:05Z) - Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training [47.26632817047513]
大規模言語モデル(LLM)に推論タスクに適用された強化学習は、不安定な勾配推定によってボトルネックとなることが多い。
LLMのオンラインRLポストトレーニングのための適応型サンプリングフレームワークであるReinforce-Adaを提案する。
従来の2段階配置法とは異なり、Reinforce-Adaはオンライン連続除去プロセスにおける推定とサンプリングをインターリーブする。
論文 参考訳(メタデータ) (2025-10-06T16:34:09Z) - Beyond Freezing: Sparse Tuning Enhances Plasticity in Continual Learning with Pre-Trained Models [10.904981532789824]
事前訓練されたモデルによる継続的な学習は、シーケンシャルなタスクにまたがる効率的な適応を大いに約束する。
既存のアプローチはPTMを凍結し、プロンプトやアダプタのような補助モジュールに依存している。
MIST(Mutual Information-Guided Sparse Tuning)は,PTMパラメータのサブセットを選択的に更新するプラグイン・アンド・プレイ方式である。
論文 参考訳(メタデータ) (2025-05-26T13:09:25Z) - Enhancing Training Data Attribution with Representational Optimization [57.61977909113113]
トレーニングデータ属性法は、トレーニングデータがモデルの予測にどのように影響するかを測定することを目的としている。
本稿では,タスク固有表現とモデル整合表現をTDAで明示的に学習することで,このギャップを埋める表現ベースアプローチであるAirRepを提案する。
AirRepは、属性品質に合わせて調整されたトレーニング可能なエンコーダと、グループワイドの影響を正確に見積もるアテンションベースのプール機構の2つの重要なイノベーションを紹介している。
論文 参考訳(メタデータ) (2025-05-24T05:17:53Z) - Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence [60.37934652213881]
ドメイン適応(DA)は、ソースドメインから関連するターゲットドメインへの知識伝達を容易にする。
本稿では、ソースデータフリーなアクティブドメイン適応(SFADA)という実用的なDAパラダイムについて検討する。
本稿では,学習者学習(LFTL)というSFADAの新たなパラダイムを紹介し,学習した学習知識を事前学習モデルから活用し,余分なオーバーヘッドを伴わずにモデルを積極的に反復する。
論文 参考訳(メタデータ) (2024-07-26T17:51:58Z) - ASPEST: Bridging the Gap Between Active Learning and Selective
Prediction [56.001808843574395]
選択予測は、不確実な場合の予測を棄却する信頼性のあるモデルを学ぶことを目的としている。
アクティブラーニングは、最も有意義な例を問うことで、ラベリングの全体、すなわち人間の依存度を下げることを目的としている。
本研究では,移動対象領域からより情報のあるサンプルを検索することを目的とした,新たな学習パラダイムである能動的選択予測を導入する。
論文 参考訳(メタデータ) (2023-04-07T23:51:07Z) - Dynamic Batch Adaptation [2.861848675707603]
現在のディープラーニング適応手法は、各パラメータが使用する効果的な学習率を変化させることで、パラメータ更新のステップサイズを調整している。
バッチサイズと更新ステップの学習率の既知の逆関係により、更新ステップの寸法と構成を動的に決定する新しいトレーニング手順を導入する。
論文 参考訳(メタデータ) (2022-08-01T12:52:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。