論文の概要: Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering
- arxiv url: http://arxiv.org/abs/2610.06950v1
- Date: Sat, 03 Oct 2026 12:57:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.477285
- Title: Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering
- Title(参考訳): 低域活性化ステアリングによるパラメータ効率の良い決定演算子
- Abstract要約: フリーズ言語モデルにスキルを注入するには、現在100万のパラメータと強化学習パイプラインが必要になる。
動作のクローンによって訓練されたSystem-1決定演算子である Methodを導入し、このコストを約2桁削減する。
23Kパラメータのランク4、最強のスキルオペレータの1/58、検索QAのサフィス、LiveMathのニアサフィスである。
- 参考スコア(独自算出の注目度): 9.532858656287921
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Injecting skills into a frozen language model currently costs a million parameters and a reinforcement-learning pipeline. We introduce \method{}, a System-1 decision operator trained by behavior cloning that lowers this cost by roughly two orders of magnitude. The default operator uses 330K parameters to match a 1.33M-parameter operator trained with reinforcement learning, exceeds or achieve comparable performance, while collapsing 3,685-token deliberation into a 6-token decision with no loss in accuracy. A rank-4 variant with 23K parameters, 1/58 of the strongest published skill operator, suffices for SearchQA and near-suffices for LiveMath, where higher rank still helps; the same recipe transfers across five tasks and three backbones, with out-of-distribution gains persisting on LiveMath problems released months after training. The gap to prior work is trainability, and it is set jointly by initialization and architecture: the initialization of prior operators zeroes the gradient of both large factor matrices at the first optimization step, whereas our zero-initialized output projection inside a shared low-rank backbone receives a gradient immediately, which a gradient-flow probe confirms directly. The gain isn't chain-of-thought compression: 23 of 57 LiveMath points beat the base model's best-of-8 sampling, and a logit-lens probe shows the operator amplifies the answer along the model's existing late-layer pathway, not writing it earlier. Gains track the base model's headroom across 13 base--task pairs, and skills compose as approximately linear operators that can be added, interpolated, and hot-swapped at inference time. Code on https://github.com/rlisml/decisionsteer.
- Abstract(参考訳): フリーズ言語モデルにスキルを注入するには、現在100万のパラメータと強化学習パイプラインが必要になる。
動作クローンによって訓練されたシステム1決定演算子である‘method{}’を導入し,このコストを約2桁削減する。
デフォルトの演算子は、330Kパラメータを使用して強化学習で訓練された1.33Mパラメータ演算子にマッチし、同等のパフォーマンスを達成し、3,685の議論を精度を損なうことなく6つの決定に分解する。
23Kパラメーターのランク4、最強のスキルオペレーターの1/58、検索QAのサフィス、LiveMathのニアサフィスでは高いランクがまだ有効であり、同じレシピは5つのタスクと3つのバックボーンにまたがって転送され、トレーニング後にリリースされたLiveMath問題ではアウトオブディストリビューションの増加が持続する。
先行演算子の初期化は、第1の最適化ステップで両大因子行列の勾配をゼロにするのに対し、共有低ランクバックボーン内のゼロ初期化出力プロジェクションは、即座に勾配を受け取り、勾配-フロープローブが直接確認する。
57個のLiveMathポイントのうち23個のLiveMathポイントがベースモデルのベスト・オブ・8サンプリングを破り、ロジトレンズプローブがモデルが既存の遅延層パスに沿って答えを増幅していることを示している。
ゲインは、ベースモデルのヘッドルームを13のベースタスクペアで追跡し、推論時に追加、補間、ホットスワップできるほぼ線形演算子として構成する。
Code on https://github.com/rlisml/decisionsteer.com
関連論文リスト
- Closing the Loop: Practical Training Recipes for Looped Language Models [0.6911410576481534]
ループ言語モデルは、レイヤの共有ブロックを繰り返し適用することで、効果的な深さを増大させる。
既存の大規模なレシピでは、何兆ものトークンを多段階で訓練する必要がある。
ループ型言語モデルの実践的なトレーニングレシピを構築し,3つの主要な結果を得た。
論文 参考訳(メタデータ) (2026-09-30T20:09:58Z) - NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness [76.6324710887112]
NeoHorse-1は、エージェントのポストトレーニングを通じてこの経路を探索するために開発されたエージェントネイティブモデルのファミリーである。
本システムでは,異種モデルプールとインテリジェントなルーティング,予測能力要求,選択されたサービス層,およびその後のユーザ毎のインタラクションを結合する。
論文 参考訳(メタデータ) (2026-09-08T03:14:54Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries [0.0]
神経脱コンパイルにおける微調整の有効性と妥当性に関する系統的研究を行った。
CodeBLEU, compile@k, pass@k の3つの指標を用いて, 3つの基本アーキテクチャにまたがる細かなモデル変異を評価した。
Swiftトレーニングからのクロスリンガル干渉は、4B(-2.66 pp, p)で非常に重要である(ただし8Bでゼロと統計的に区別できないが、スケーリング仮説と一致している)。
論文 参考訳(メタデータ) (2026-07-07T10:36:12Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning [46.765013720309064]
大規模言語モデル(LLM)における長期文脈推論は、チェーン・オブ・ソート(CoT)推論による認知能力の向上を実証している。
このようなモデルのトレーニングは通常、数学やプログラミングのような推論に基づく問題において、検証可能な報酬(RLVR)を用いた強化学習によって行われる。
我々は,教師と学生の両方の役割を同一のベース言語モデルで担う自己蒸留技術であるtextbfSemantic Soft Bootstrapping (SSB) を提案する。
論文 参考訳(メタデータ) (2025-12-04T18:59:18Z) - Diffusion Language Models are Super Data Learners [61.721441061210896]
ユニークなデータが限られている場合、拡散言語モデル(DLM)は、よりエポックなトレーニングによって、常に自己回帰モデル(AR)を上回ります。
本研究の目的は,(1) 任意の次数モデリング,(2) 反復的双方向 denoising からの超高次計算,(3) モンテカルロ増分という3つの複合的要因に起因する。
論文 参考訳(メタデータ) (2025-11-05T08:17:42Z) - Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic [51.41777906371754]
大規模言語モデルは複雑な推論タスクをマスターするために、強化学習のようなコストのかかる最適化を必要とすることが多い。
この研究は、ひとたび学習された推論能力を、コンパクトなタスクベクトルとしてモデル間で抽出し、伝達できることを実証する。
論文 参考訳(メタデータ) (2025-09-01T11:04:51Z) - Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models [15.218318229687242]
大規模言語モデルにおける極端なアクティベーションアウトレイアは量子化性能を著しく低下させる。
生成を積極的に防止する実用的なガイドラインであるOutlier-Safe Pre-Training (OSP)を紹介した。
我々の研究は、アウトリーチはLLMに固有のものではなく、トレーニング戦略の結果であることを示した。
論文 参考訳(メタデータ) (2025-06-24T15:03:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。