論文の概要: AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
- arxiv url: http://arxiv.org/abs/2609.38142v1
- Date: Tue, 29 Sep 2026 17:55:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.819173
- Title: AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
- Title(参考訳): AdviSD: ターゲット型マルチターン自己蒸留によるフロンティアLSMのアドバイス
- Abstract要約: 小さなトレーニング可能なアドバイザは、自然言語アドバイスを使用して凍結した言語モデルエグゼキュータを操縦することができる。
有効な修正から学ぶことは、目標が他の修正よりも有用なアドバイスを好む場合、学習を制限することができることを示す。
提案手法は,フィードバック条件付き助言書からの自己蒸留と結果に基づく強化学習を選択的に組み合わせる。
- 参考スコア(独自算出の注目度): 12.245468063564473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A small trainable advisor can steer a frozen language-model executor using natural-language advice. In addition to learning from task rewards, the advisor can use feedback from completed interactions to improve its advice. However, a plausible correction need not change execution, yet learning from such corrections can still affect the advisor's future decisions in other contexts. In a shared-parameter model, we prove that such corrections can limit learning if their targets favor useful advice less strongly than those of other corrections. Keeping them less often than the rest improves the model's eventual performance compared to learning from every correction. Motivated by this, our method, Advisor Self-Distillation (AdviSD), pairs outcome-based reinforcement learning with self-distillation from a feedback-conditioned copy of the advisor selectively. Reflection proposes corrections, and the advisor scores the same recorded executor response with and without its issued advice, using the magnitude of the difference to select decisions for supervision. This approach does not require executor likelihoods or additional executor rollouts. Experiments with Qwen3-8B advisors for Gemini and Claude show that AdviSD outperforms advisor-GRPO by 4.2-6.4 percentage points on BFCL-v3 and by 3.9-5.1 score points on EnvScaler. The trained advisors generalize to out-of-domain tasks and transfer across different executor versions and model families. AdviSD also beats matched-count random selection, supporting the value of its selection rule.
- Abstract(参考訳): 小さなトレーニング可能なアドバイザは、自然言語アドバイスを使用して凍結した言語モデルエグゼキュータを操縦することができる。
タスク報酬から学ぶことに加えて、アドバイザは、完了したインタラクションからのフィードバックを使ってアドバイスを改善することができる。
しかしながら、妥当な修正は実行を変える必要はないが、そのような修正から学ぶことは、他の文脈におけるアドバイザーの将来の決定に影響を与える可能性がある。
共有パラメータモデルでは、そのような修正が、目標が他の修正よりも有用なアドバイスを好む場合、学習を制限することを証明している。
それらの頻度を他のものよりも低く保つことは、すべての修正から学ぶことと比較して、モデルの最終的なパフォーマンスを改善する。
本手法は,提案手法であるアドバイSD(AdviSD)を用いて,フィードバック条件による自己蒸留と結果に基づく強化学習のペアを選択的に実施する。
リフレクションは修正を提案し、アドバイザーは、差の大きさを利用して、同じ記録された実行者応答を、発行されたアドバイスなしでスコアし、監督のための決定を選択する。
このアプローチでは、エグゼキュータの確率や追加エグゼキュータのロールアウトは必要ありません。
GeminiとClaudeのQwen3-8Bアドバイザーによる実験では、AdviSDはアドバイザGRPOよりもBFCL-v3で4.2-6.4ポイント、EnvScalerで3.9-5.1ポイント向上している。
トレーニングされたアドバイザは、ドメイン外のタスクを一般化し、さまざまなエグゼキュータバージョンとモデルファミリー間で転送する。
AdviSDはまた、マッチした数のランダム選択を破り、その選択ルールの値をサポートする。
関連論文リスト
- What Does Privileged Information Add to On-Policy Self-Distillation? [57.872246350931306]
オンラインの自己蒸留(On-policy self-distillation)により、言語モデルは、答や解決方法を見る、自分自身の凍結したコピーから学ぶことができる。
AMPLE-Mathは、5,319の数学的問題からなる再利用可能なスイートで、同じ答えを6つの推論ビューで共有する。
直接応答型ロールアウトを監督する思考能力のある教師によって、Qwen3-1.7Bの改良の大部分は参照レス蒸留によるものである。
論文 参考訳(メタデータ) (2026-09-17T15:57:10Z) - CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction [12.346416465825627]
信頼できるオン・ポリシィ蒸留(CA-OPD)は、信頼性の高いロールアウト構築と適応的な監視を結合するフレームワークである。
GUIグラウンディングと光学文字認識のためのマルチ教師設定で評価され、CA-OPDはQwen3.5-0.8Bベースラインを大幅に改善する。
論文 参考訳(メタデータ) (2026-09-02T10:11:59Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Aligning Large Language Models by On-Policy Self-Judgment [49.31895979525054]
大規模言語モデルと人間の嗜好を整合させる既存のアプローチは、オンライン学習のために別々の報酬モデル(RM)を必要とするトレードオフに直面しています。
本稿では,オンライン学習を行う新たなアライメントフレームワークSELF-JUDGEを提案する。
また, さらなる評価を行なわずに, サンプリング自体がさらなる性能向上に寄与することを示した。
論文 参考訳(メタデータ) (2024-02-17T11:25:26Z) - MADDM: Multi-Advisor Dynamic Binary Decision-Making by Maximizing the
Utility [8.212621730577897]
逐次二元決定設定において,助言者の集合を最適に選択するための新しい戦略を提案する。
我々は、根拠となる真実にアクセスできず、助言者の信頼性に関する事前の知識もないと仮定する。
論文 参考訳(メタデータ) (2023-05-15T14:13:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。