論文の概要: Hindsight-Guided Rationale Distillation for Rare Disease Diagnosis
- arxiv url: http://arxiv.org/abs/2610.03176v1
- Date: Fri, 02 Oct 2026 11:52:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.354077
- Title: Hindsight-Guided Rationale Distillation for Rare Disease Diagnosis
- Title(参考訳): 近視ガイド下Rationale蒸留法による腎疾患診断
- Abstract要約: 稀な疾患診断のための後眼誘導蒸留法をZebraMapで検討した。
1.5Bの学生は、8Bの教師のチェーン・オブ・ソート・トレースに精通している。
これらのスロットを除去するフィルタは汚染をほぼゼロに低減し、観測された利得を生み出す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study hindsight-guided distillation for rare disease diagnosis on ZebraMap: a 1.5B student is fine-tuned on chain-of-thought traces from a 8B teacher that observes the ground-truth diagnosis during generation. Absolute accuracy remains low for all models - the task is hard at this scale - but within this ceiling a filtered variant (StudentF) achieves a small, statistically significant accuracy advantage over the teacher (p < 0.001), concentrated in better-represented diseases. The unfiltered student does not significantly outperform the teacher (p = 0.129), establishing that contamination filtering - not hindsight distillation alone - drives the gain. The gap traces to an artifact we term GT hallucination. Label-visible generation causes the teacher to embed "ground truth is X" phrases in its reasoning chain; SFT copies the pattern. At inference, the unfiltered student reproduces the phrase in 33.9% of cases, with severe accuracy degradation when the hallucinated label is wrong. A regex filter removing these slots reduces contamination to near-zero, producing the observed gain - though the effect remains small. We precisely quantify this gain-cost tradeoff, document frequency-dependent knowledge transfer absent from the RL-trained teacher, and characterize a calibration gap that SFT does not close - identifying both as directions for future work.
- Abstract(参考訳): 約1.5Bの学生が8B教師のチェーン・オブ・シント・トレースを微調整し, 世代ごとの地味診断を観察した。
しかし、この天井のフィルター付き変種(StudentF)は、教師(p < 0.001)よりも小さく統計的に有意な精度を実現し、表現力の良い疾患に集中している。
教師(p = 0.129)を著しく上回り、汚染ろ過は後発蒸留だけではありません。
このギャップは、私たちがGT幻覚と呼ぶアーティファクトにさかのぼる。
ラベル可視生成により、教師は推論チェーンに"ground truth is X"というフレーズを埋め込む。
推測では、未フィルタリングの学生は33.9%のケースでこのフレーズを再現し、幻覚ラベルが間違っていた場合の精度は著しく低下する。
これらのスロットを除去するRegexフィルタは汚染をほぼゼロに減らし、観測された利得を生み出す。
我々は、このゲインコストのトレードオフを正確に定量化し、RL学習教師から欠落した周波数依存性の知識伝達を文書化し、SFTが閉じていない校正ギャップを特徴付ける。
関連論文リスト
- TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment [70.40748464576045]
強力な教師モデルから小さな学生への蒸留はギャップカースに面している。
教師がより高度に成長するにつれて、複雑な分布は生徒が近似できるものから多様化し、パフォーマンスが低下する。
本研究では,教師がデータを捨てたり,推論品質を劣化させたりすることなく,直接生徒の分布に適応する教師アライメントを提案する。
論文 参考訳(メタデータ) (2026-09-27T10:13:54Z) - Wolff-Parkinson-White Detection at 471:1 Class Imbalance: A Leakage-Controlled Study of the Data Bottleneck [0.0]
Wolff-Parkinson-White症候群 (WPW) は先天性心前駆症であり、臨床的には重要であり、12誘導心電図では欠落することが多い。
PTB-XL と Chapman-Shaoxing-Ningbo の2つの公開 12-lead corpora: 66,951 レコード,142 レコードの WPW は 0.21% (約471:1) である。
事前に規定された1つのリーク制御プロトコルの下では、ホールドアウトフォールドが正確に1回接触し、信号の7つの表現を比較し、分割と評価を固定する。
論文 参考訳(メタデータ) (2026-07-27T20:57:46Z) - Improved Scaling Laws via Weak-to-Strong Generalization in Random Feature Ridge Regression [27.0471650610245]
スケーリング法則に影響を及ぼし,その後にテストエラーが発生するという意味で,潜在的な改善は極めて重要であることを示す。
厳密には、生徒は教師のスケーリング法則によらず、最小限の最適率を達成することができる。
論文 参考訳(メタデータ) (2026-03-05T21:32:59Z) - Hide and Seek with LLMs: An Adversarial Game for Sneaky Error Generation and Self-Improving Diagnosis [51.88592148135258]
本稿では,エラー生成と診断のための動的対向フレームワークであるHie and Seek Game (HSG)を提案する。
HSGには2つの敵対的役割がある: Sneakyは、微妙で偽りの推論エラーを発生させることで「隠す」ことと、それらを正確に検出するために「探す」診断である。
いくつかの数学推論タスクの実験では、HSGはエラー診断を著しく向上し、GPT-4oのようなベースラインよりも16.8%--31.4%高い精度を達成している。
論文 参考訳(メタデータ) (2025-08-05T12:45:21Z) - Knowledge Distillation with Refined Logits [31.205248790623703]
本稿では,現在のロジット蒸留法の限界に対処するため,Refined Logit Distillation (RLD)を導入する。
我々のアプローチは、高性能な教師モデルでさえ誤った予測をすることができるという観察に動機づけられている。
本手法は,教師からの誤解を招く情報を,重要なクラス相関を保ちながら効果的に排除することができる。
論文 参考訳(メタデータ) (2024-08-14T17:59:32Z) - Multi-Granularity Semantic Revision for Large Language Model Distillation [66.03746866578274]
LLM蒸留における多粒性セマンティックリビジョン法を提案する。
シーケンスレベルでは、シーケンス修正と再生戦略を提案する。
トークンレベルでは、蒸留目的関数として、Kulback-Leibler損失を補正する分布適応クリッピングを設計する。
スパンレベルでは、シーケンスのスパン前処理を利用して、スパン内の確率相関を計算し、教師と学生の確率相関を一貫性に制約する。
論文 参考訳(メタデータ) (2024-07-14T03:51:49Z) - Logit Standardization in Knowledge Distillation [83.31794439964033]
教師と学生の共用温度の仮定は、ロジット範囲と分散の点で、ロジット間の厳密な一致を暗示している。
温度をロジットの重み付け標準偏差として設定し、ロジット標準化のプラグアンドプレイZスコア前処理を実行することを提案する。
我々の前処理により、学生はマグニチュードマッチを必要とせず、教師の本質的なロジット関係に集中することができ、既存のロジットベースの蒸留法の性能を向上させることができる。
論文 参考訳(メタデータ) (2024-03-03T07:54:03Z) - Unified and Effective Ensemble Knowledge Distillation [92.67156911466397]
知識蒸留は、複数の教師モデルから知識を抽出し、それを1人の学生モデルにエンコードする。
既存の多くの手法は、ラベル付きデータのみに基づいて学生モデルを学習し、蒸留する。
本研究では,教師モデルのアンサンブルから,ラベル付きデータとラベルなしデータの両方から単一学生モデルを蒸留する,統一的で効果的なアンサンブル知識蒸留法を提案する。
論文 参考訳(メタデータ) (2022-04-01T16:15:39Z) - Teacher's pet: understanding and mitigating biases in distillation [61.44867470297283]
いくつかの研究により、蒸留によって学生の全体的なパフォーマンスが著しく向上することが示されている。
しかし、これらのゲインはすべてのデータサブグループに均一なのでしょうか?
蒸留が特定の部分群の性能に悪影響を及ぼすことを示す。
信頼性の低いサブグループに対して,教師の影響を和らげる手法を提案する。
論文 参考訳(メタデータ) (2021-06-19T13:06:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。