論文の概要: CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.13387v2
- Date: Mon, 17 Aug 2026 03:10:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.591793
- Title: CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation
- Title(参考訳): CROP:選択型on-policy蒸留における対効果によるタスク関連性
- Abstract要約: オンライン蒸留(CROP)の意義について紹介する。
CROPは、各応答位置を、タスク関連条件変化に対する感度によって測定し、その感度によって、意味保存リライトに対する感度によって調整する。
2つの教師学生設定で、CROPは最強の非CROPセレクタよりも1.92と2.96ポイントの集計性能を改善する。
- 参考スコア(独自算出の注目度): 17.794507489166616
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) supervises a student language model on trajectories sampled from its current policy, but assigns equal credit to response tokens with unequal supervision value. Selective OPD addresses this limitation by allocating supervision non-uniformly across response tokens according to their estimated training value. Most existing criteria, however, focus primarily on optimization need, such as uncertainty or teacher-student disagreement, while task relevance, namely whether the supervision is tied to the semantic content of the current input, remains less directly characterized as a complementary dimension. To address this gap, we introduce Counterfactual Relevance for On-Policy Distillation (CROP), which operationalizes task relevance through a paraphrase-calibrated counterfactual sensitivity margin. For each source prompt, CROP constructs a validated original-paraphrase-counterfactual triplet, holds the student rollout fixed, and measures each response position by its sensitivity to a task-relevant condition change calibrated by its sensitivity to a meaning-preserving rewrite. Matched selection controls show that CROP identifies more useful supervision positions than random or lowest-relevance selection, while component comparisons confirm the value of both counterfactual sensitivity and paraphrase calibration. Across two teacher-student settings, CROP improves aggregate performance by 1.92 and 2.96 points over the strongest non-CROP selector. These results support task relevance as a complementary criterion for selective OPD and establish CROP as a model-internal, contrast-specific method for allocating token-level supervision.
- Abstract(参考訳): オンライン蒸留(OPD)は、現在の政策からサンプリングされた軌道上の学生言語モデルを監督するが、不平等な監督値の反応トークンに等しい信用を割り当てる。
Selective OPDはこの制限に対処し、予測されたトレーニング値に従って、非一様に応答トークンを監督する。
しかし、既存の基準のほとんどは、不確実性や教師と学生の意見の不一致といった最適化の必要性に重点を置いているが、タスク関連性、すなわち、監督が現在の入力のセマンティック内容に結びついているかどうかは、相補的な次元として直接的に特徴づけられていない。
このギャップに対処するために、パラフレーズ校正された対実感度マージンを通してタスク関連を運用するCROP(Counterfactual Relevance for On-Policy Distillation)を導入する。
各ソースプロンプトに対して、CROPは、検証済みの原文対数三重項を構築し、学生のロールアウトを固定し、各応答位置を、意味保存リライトに対する感度によって調整されたタスク関連条件変化に対する感度で測定する。
一致した選択制御は、CROPがランダムまたは最低関連選択よりも有用な監視位置を識別し、一方、コンポーネント比較は、反事実感度とパラフレーズキャリブレーションの両方の値を確認することを示している。
2つの教師学生設定で、CROPは最強の非CROPセレクタよりも1.92と2.96ポイントの集計性能を改善する。
これらの結果は、選択的なOPDのための補完的基準としてタスク関連性をサポートし、トークンレベルの監督を割り当てるためのモデル内部のコントラスト固有の方法としてCROPを確立する。
関連論文リスト
- Adaptive Supervised Anchoring for On-Policy Self-Distillation [15.445625053566244]
オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T05:46:32Z) - Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning [3.9783774144289623]
GRPOのような批判のない方法は、応答レベルの報酬を利点に変換し、トークン間で均一にブロードキャストする。
本稿では,高感度トークンのクレジットを低減するGRPOの簡易拡張であるCSCRを提案する。
long-CoTの数学的推論ベンチマークでは、CSCRはGRPOベースラインを同じ数のポリシー更新で一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-30T09:03:33Z) - Uncertainty-Guided LLM Semantic Augmentation for Heterogeneous Treatment Effect Estimation [9.269164572474216]
不均一な治療効果を推定することは、パーソナライズされたプロモーションや精密な医療など、標的となる介入の中心である。
本研究では, 条件付き平均治療効果 (CATE) に着目した。
提案するCURL(Causal Uncertainty-Guided Representation Learning)は,推定器の不確実性を利用して,事前学習した意味能力を局所不安定単位に割り当てるプラグインアダプタである。
論文 参考訳(メタデータ) (2026-07-29T08:20:17Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners [9.324642081509756]
大規模言語モデル(LLM)推論には、モデル自身のテスト時間状態とトークンレベルの情報の両方に整合した監視が必要である。
近年の独占型自己蒸留は,同じモデルによる学生のロールアウトを,検証済みのソリューションコンテキスト下で評価することによって中等地を探索している。
ロールアウト-参照重なりに応じて検証された解を隠蔽し、エントロピー-ミスマッチトークンのスパースセットに小さなエネルギー空間を適用したPAINTを提案する。
論文 参考訳(メタデータ) (2026-04-29T11:56:07Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - A Systematic Examination of Preference Learning through the Lens of Instruction-Following [83.71180850955679]
新たな合成データ生成パイプラインを用いて48,000の命令追従プロンプトを生成する。
合成プロンプトでは、リジェクションサンプリング(RS)とモンテカルロ木探索(MCTS)の2つの選好データセットキュレーション手法を用いる。
実験により、MCTSが生成した選好ペアにおける共有プレフィックスは、限界はあるが一貫した改善をもたらすことが明らかになった。
高コントラストの選好ペアは一般的に低コントラストのペアよりも優れているが、両者を組み合わせることで最高のパフォーマンスが得られることが多い。
論文 参考訳(メタデータ) (2024-12-18T15:38:39Z) - Claim Check-Worthiness Detection: How Well do LLMs Grasp Annotation Guidelines? [0.0]
ファクトチェックを必要とするテキストセグメントを識別するために、ゼロショットと少数ショットのLCMプロンプトを使用する。
各種領域の5つのCD/CWデータセットに対して,LLMの予測精度と校正精度を評価した。
提案手法により, 最適急進的冗長性はドメイン依存であり, 文脈の追加は性能を向上しないことがわかった。
論文 参考訳(メタデータ) (2024-04-18T13:31:05Z) - Learning Domain Adaptive Object Detection with Probabilistic Teacher [93.76128726257946]
確率的教師(PT)と呼ばれる,シンプルで効果的な枠組みを提案する。
PTは、段階的に進化する教師から未ラベルの目標データの不確実性を捉え、相互に有利な方法で生徒の学習を指導することを目的としている。
また,不確実性誘導型自己学習を促進するために,新しいエントロピー・フォカル・ロス(EFL)を提案する。
論文 参考訳(メタデータ) (2022-06-13T16:24:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。