論文の概要: Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
- arxiv url: http://arxiv.org/abs/2607.14895v1
- Date: Thu, 16 Jul 2026 12:11:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.090347
- Title: Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
- Title(参考訳): 推論モデル適応のためのインストラクションチューニングとマージの活用
- Abstract要約: RLM(Reasoning Language Model)は、数学やコーディングといった分野において、優れたパフォーマンスを示している。
検証不可能な領域と検証不能な領域の両方に対して、人間が記述したソリューションを用いた大量の未使用の教師なし微調整データが存在する。
本研究では,RLMの性能向上のために,これらのデータを効率的に利用できることを示す。
- 参考スコア(独自算出の注目度): 7.414725419251954
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning language models (RLMs) have demonstrated impressive performance in domains such as mathematics and coding. These domains permit reliable verification of model outputs, which is important for enabling the reinforcement learning that drives RLM performance gains. However, training RLMs on domains that lack reliable verifiers remains challenging. Meanwhile, for both verifiable and unverifiable domains, large amounts of unused supervised fine-tuning data with human-written solutions exist. In this work, we show that these data can be used efficiently to further improve RLM performance. For this, we first use classic instruction tuning, supervised fine-tuning without reasoning traces, on the RLM. Next, we merge our instruction-tuned model with the original reasoning model, recovering its reasoning behavior on the target domain. Our extensive evaluation demonstrates that our technique improves RLM performance in both verifiable and hard-to-verify domains, including coding and text summarization, while preserving RLM capabilities across other domains. Importantly, our method is highly cost-effective, enabling such improvements for less than USD $3.
- Abstract(参考訳): RLM(Reasoning Language Model)は、数学やコーディングといった分野において、優れたパフォーマンスを示している。
これらの領域はモデル出力の信頼性検証を可能にしており、RLM性能向上を駆動する強化学習を可能にする上で重要である。
しかし、信頼性に欠ける領域で RLM を訓練することは依然として困難である。
一方、検証不可能な領域と検証不可能な領域には、人間が記述したソリューションを用いた大量の未使用の微調整データが存在する。
本研究では,RLMの性能向上のために,これらのデータを効率的に利用できることを示す。
そこで我々はまず,RLM 上で古典的命令チューニング (微調整) を,推理的トレースを伴わない教師付き微調整 (教師付き微調整) で使用する。
次に、命令チューニングされたモデルと元の推論モデルとをマージし、対象ドメイン上での推論動作を回復する。
本手法は,符号化やテキスト要約など,検証可能な領域と検証困難な領域の両方において,RTM性能を向上すると同時に,他の領域にまたがるRDM性能を保っていることを示す。
重要な点として,本手法は費用対効果が高く,3ドル以下で実現可能である。
関連論文リスト
- CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents [66.9575676266637]
大規模言語モデル(LLM)エージェントは、長期的、インタラクティブでステートフルな環境にますますデプロイされている。
これらの設定では、間違った購入を返金するなどの1つの間違ったアクションは、不可逆なタスクの失敗を引き起こし、実行前にインターセプトされなければならない。
CASTは、スパースタスクの結果を批判学習と政策最適化のためのアクションレベル監視に変換する、批判に意識したトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-08-31T01:59:51Z) - Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain [0.1529342790344802]
本研究では,任意の領域に対して高品質な合成命令データを構築するための一般的な手法を提案する。
約950億のトークンとChain-of-Thought推論トレースを備えた大規模命令データセットを構築した。
論文 参考訳(メタデータ) (2026-03-02T01:21:54Z) - Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling [21.45871501724415]
高精度な推論モデルエラーを自動的に構築するデータ駆動型手法を提案する。
ラグビーはより強力なLSM-as-judge報酬関数を構築するのに使うことができる。
この拡張は、ゴールドラベルの完全なデータセットなしで複雑な技術的問題を解決するモデルを教えるための扉を開く。
論文 参考訳(メタデータ) (2026-02-06T15:51:52Z) - WeaveRec: An LLM-Based Cross-Domain Sequential Recommendation Framework with Model Merging [24.949880939628386]
WeaveRecは、複数のLoRAモジュールにソースとターゲットのドメインデータをウィービング形式で相互にトレーニングする。
WeaveRecは、ターゲットドメインにおける期待されるエラーの上限を下げることができるという理論的な保証を提供する。
論文 参考訳(メタデータ) (2025-10-30T14:37:15Z) - How Efficient Are Diffusion Language Models? A Critical Examination of Efficiency Evaluation Practices [81.85465545346266]
拡散言語モデル(DLM)は、長期支配的自己回帰(AR)パラダイムに代わる有望な代替として登場した。
しかし、現在のオープンソースのDLMは、しばしばARの速度よりも優れており、現実のユーティリティを制限している。
本研究はDLMの効率に関する系統的研究であり, 先行評価手法の問題点を同定する。
論文 参考訳(メタデータ) (2025-10-21T10:00:32Z) - KARE-RAG: Knowledge-Aware Refinement and Enhancement for RAG [63.82127103851471]
Retrieval-Augmented Generation (RAG)は、大規模言語モデルがより広範な知識ソースにアクセスすることを可能にする。
ノイズの多いコンテンツを処理するために生成モデルの能力を向上させることは、ロバストなパフォーマンスに等しく重要であることを実証する。
本稿では,3つの重要なイノベーションを通じて知識利用を改善するKARE-RAGを提案する。
論文 参考訳(メタデータ) (2025-06-03T06:31:17Z) - General-Reasoner: Advancing LLM Reasoning Across All Domains [64.70599911897595]
強化学習(RL)は近年,大規模言語モデル(LLM)の推論能力の向上に強い可能性を示している。
本稿では,多分野にわたるLSM推論能力の向上を目的とした,新たなトレーニングパラダイムであるGeneral-Reasonerを提案する。
私たちは一連のモデルをトレーニングし、物理学、化学、金融、電子工学など幅広い分野をカバーする幅広いデータセットでそれらを評価します。
論文 参考訳(メタデータ) (2025-05-20T17:41:33Z) - R-PRM: Reasoning-Driven Process Reward Modeling [53.06844294668382]
プロセス・リワード・モデル(Process Reward Models, PRM)は、各推論ステップを評価することによって、有望なソリューションとして登場した。
既存のPRMは評価スコアを直接出力し、学習効率と評価精度の両方を制限する。
推論駆動プロセスリワードモデリング(R-PRM)を提案する。
R-PRMは限られたアノテーションからシードデータを生成し、効果的にモデルの推論能力をブートストラップします。
論文 参考訳(メタデータ) (2025-03-27T09:23:08Z) - Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning [65.23593936798662]
LLM生成データによる微調整により,目標タスクの性能が向上し,非目標タスクの劣化が低減されることを示す。
微調整後のLSMにおける破滅的忘れを緩和するために、トークンの難易度低減に基づく経験的説明を提供する最初の研究である。
論文 参考訳(メタデータ) (2025-01-24T08:18:56Z) - RE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation [37.969478059005574]
テキスト検索のために微調整された大規模言語モデル(LLM)は、いくつかの情報検索ベンチマークで最先端の結果を示している。
本稿では,情報検索の文脈へのリバースエンジニアリング適応の拡張の有効性について検討する。
論文 参考訳(メタデータ) (2024-06-20T22:28:11Z) - Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models [0.8399688944263842]
大きな言語モデル(LLM)は、入力クエリから人間のようなテキストを理解し、生成する能力を持つ。
本研究では、この概念を、レトリーバル拡張生成(RAG)パイプライン内のLLMの統合に拡張する。
データ抽出と文脈理解における微調整がLLMの能力に与える影響を評価する。
論文 参考訳(メタデータ) (2024-06-17T04:35:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。