論文の概要: Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
- arxiv url: http://arxiv.org/abs/2607.14895v1
- Date: Thu, 16 Jul 2026 12:11:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.090347
- Title: Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
- Title(参考訳): 推論モデル適応のためのインストラクションチューニングとマージの活用
- Authors: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev,
- Abstract要約: RLM(Reasoning Language Model)は、数学やコーディングといった分野において、優れたパフォーマンスを示している。
検証不可能な領域と検証不能な領域の両方に対して、人間が記述したソリューションを用いた大量の未使用の教師なし微調整データが存在する。
本研究では,RLMの性能向上のために,これらのデータを効率的に利用できることを示す。
- 参考スコア(独自算出の注目度): 7.414725419251954
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning language models (RLMs) have demonstrated impressive performance in domains such as mathematics and coding. These domains permit reliable verification of model outputs, which is important for enabling the reinforcement learning that drives RLM performance gains. However, training RLMs on domains that lack reliable verifiers remains challenging. Meanwhile, for both verifiable and unverifiable domains, large amounts of unused supervised fine-tuning data with human-written solutions exist. In this work, we show that these data can be used efficiently to further improve RLM performance. For this, we first use classic instruction tuning, supervised fine-tuning without reasoning traces, on the RLM. Next, we merge our instruction-tuned model with the original reasoning model, recovering its reasoning behavior on the target domain. Our extensive evaluation demonstrates that our technique improves RLM performance in both verifiable and hard-to-verify domains, including coding and text summarization, while preserving RLM capabilities across other domains. Importantly, our method is highly cost-effective, enabling such improvements for less than USD $3.
- Abstract(参考訳): RLM(Reasoning Language Model)は、数学やコーディングといった分野において、優れたパフォーマンスを示している。
これらの領域はモデル出力の信頼性検証を可能にしており、RLM性能向上を駆動する強化学習を可能にする上で重要である。
しかし、信頼性に欠ける領域で RLM を訓練することは依然として困難である。
一方、検証不可能な領域と検証不可能な領域には、人間が記述したソリューションを用いた大量の未使用の微調整データが存在する。
本研究では,RLMの性能向上のために,これらのデータを効率的に利用できることを示す。
そこで我々はまず,RLM 上で古典的命令チューニング (微調整) を,推理的トレースを伴わない教師付き微調整 (教師付き微調整) で使用する。
次に、命令チューニングされたモデルと元の推論モデルとをマージし、対象ドメイン上での推論動作を回復する。
本手法は,符号化やテキスト要約など,検証可能な領域と検証困難な領域の両方において,RTM性能を向上すると同時に,他の領域にまたがるRDM性能を保っていることを示す。
重要な点として,本手法は費用対効果が高く,3ドル以下で実現可能である。
関連論文リスト
- Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain [0.1529342790344802]
本研究では,任意の領域に対して高品質な合成命令データを構築するための一般的な手法を提案する。
約950億のトークンとChain-of-Thought推論トレースを備えた大規模命令データセットを構築した。
論文 参考訳(メタデータ) (2026-03-02T01:21:54Z) - Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling [21.45871501724415]
高精度な推論モデルエラーを自動的に構築するデータ駆動型手法を提案する。
ラグビーはより強力なLSM-as-judge報酬関数を構築するのに使うことができる。
この拡張は、ゴールドラベルの完全なデータセットなしで複雑な技術的問題を解決するモデルを教えるための扉を開く。
論文 参考訳(メタデータ) (2026-02-06T15:51:52Z) - General-Reasoner: Advancing LLM Reasoning Across All Domains [64.70599911897595]
強化学習(RL)は近年,大規模言語モデル(LLM)の推論能力の向上に強い可能性を示している。
本稿では,多分野にわたるLSM推論能力の向上を目的とした,新たなトレーニングパラダイムであるGeneral-Reasonerを提案する。
私たちは一連のモデルをトレーニングし、物理学、化学、金融、電子工学など幅広い分野をカバーする幅広いデータセットでそれらを評価します。
論文 参考訳(メタデータ) (2025-05-20T17:41:33Z) - Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning [65.23593936798662]
LLM生成データによる微調整により,目標タスクの性能が向上し,非目標タスクの劣化が低減されることを示す。
微調整後のLSMにおける破滅的忘れを緩和するために、トークンの難易度低減に基づく経験的説明を提供する最初の研究である。
論文 参考訳(メタデータ) (2025-01-24T08:18:56Z) - RE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation [37.969478059005574]
テキスト検索のために微調整された大規模言語モデル(LLM)は、いくつかの情報検索ベンチマークで最先端の結果を示している。
本稿では,情報検索の文脈へのリバースエンジニアリング適応の拡張の有効性について検討する。
論文 参考訳(メタデータ) (2024-06-20T22:28:11Z) - Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models [0.8399688944263842]
大きな言語モデル(LLM)は、入力クエリから人間のようなテキストを理解し、生成する能力を持つ。
本研究では、この概念を、レトリーバル拡張生成(RAG)パイプライン内のLLMの統合に拡張する。
データ抽出と文脈理解における微調整がLLMの能力に与える影響を評価する。
論文 参考訳(メタデータ) (2024-06-17T04:35:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。