論文の概要: Learning What Matters: Supervising Global Context Pruning with Causal Evidence Sets
- arxiv url: http://arxiv.org/abs/2607.21692v2
- Date: Wed, 29 Jul 2026 14:12:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.69719
- Title: Learning What Matters: Supervising Global Context Pruning with Causal Evidence Sets
- Title(参考訳): 重要なことを学ぶ: 因果的エビデンスセットでグローバルなコンテキストプルーニングを監督する
- Abstract要約: 我々は、選択者が注意と因果依存の相違を継承していることを示す。
教師は無視するために学んだ時代遅れの事実に出席し、同じ証拠を使用するトレーニングの実行に異なる参加をする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse attention prunes a long context to the blocks a model needs, and the usual selector is distilled from a dense teacher's attention. That assumes attention shows which context the answer depends on. We test the assumption on retrieval tasks where the evidence is known exactly, by masking context and measuring whether the answer changes. Attention and causal dependence disagree, and selectors inherit the disagreement. Teachers attend to outdated facts they have learned to ignore, and attend differently across training runs that use the same evidence. In a two-step reference task, attention at the answer position can skip the intermediate step, and how often it skips varies with the training run: selecting one block set per pass, a selector distilled from attention routes at 36% to 98% across teachers, the same selector trained on causal evidence sets reaches 99% or better on every one, and dense accuracy does not say which teacher you have. Where each query selects its own blocks attention also succeeds, but that prunes no context. The causal sets need no annotation: recovered from the frozen teacher by masking alone, they train routers that nearly match annotation-trained ones. Pretrained models show the same conflict. Qwen2.5-3B attends more to an outdated fact than its replacement on 58% of the examples it answers correctly, and restricting Gemma-2-9B to the two relevant sentences raises its accuracy from 56% to 99%. The answer-position readout that distillation uses shows where a model looks, not what its answer depends on; composing attention across layers recovers most of the multi-hop gap, so the readout fails rather than the weights.
- Abstract(参考訳): スパースアテンションはモデルに必要なブロックに長いコンテキストを与え、通常のセレクタは高密度の教師の注意から蒸留される。
それは、その答えがどの文脈に依存するかを示すと仮定する。
本研究では,証拠を正確に把握した検索タスクの仮定を,文脈をマスキングし,回答が変化するかどうかを測定することによって検証する。
注意と因果依存は意見が一致せず、選考者は意見の相違を継承する。
教師は無視するために学んだ時代遅れの事実に出席し、同じ証拠を使用するトレーニングの実行に異なる参加をする。
2段階の参照タスクでは、回答位置の注意は中間ステップをスキップでき、パス毎に1ブロックセットを選択し、教師間で36%から98%の注意経路から蒸留したセレクター、因果的証拠セットで訓練された同じセレクターは、各教師に対して99%以上の精度であり、どの教師がいるかは正確にはわからない。
それぞれのクエリが自身のブロックを選択する場合も成功しますが、その場合コンテキストは必要ありません。
原因セットにはアノテーションは必要ない: 凍結した教師から一人でマスクして回復し、アノテーションで訓練されたものとほぼ一致するルーターを訓練する。
事前訓練されたモデルは、同じ競合を示す。
Qwen2.5-3Bは、正解例の58%で置き換えたよりも古い事実に忠実であり、Gemma-2-9Bを2つの関連文に制限することは、その正確さを56%から99%に引き上げる。
蒸留が使用する答えの読み出しは、モデルがどこに見えるかを示し、その答えが依存するものではなく、レイヤーにまたがる注意がマルチホップギャップの大部分を回復するので、読み出しは重みよりも失敗する。
関連論文リスト
- OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation [15.986808086256792]
プリヴィレグドオン政治蒸留は、教師がリッチで訓練のみの視覚的証拠を用いて学生の軌跡を評価することによってマルチモーダル推論を改善する。
この誤解を招く合意の下では,教師の視覚的矯正的嗜好は失われないことがわかった。
我々は,この分離された視覚的嗜好から直接蒸留ターゲットを再構築するOPD-Ahaを紹介する。
論文 参考訳(メタデータ) (2026-09-15T00:25:28Z) - One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation [3.0867286767516937]
オンライン蒸留は、教師がトークンでトークンをスコアする間、自身の世代で言語モデルを訓練する。
教師はモデル自身であり、テスト時に生徒が持たない特権情報に基づいている。
初期の結果は有望であり、生成したトークンのごく一部で強化学習に匹敵する精度であった。
しかし、信号を生成するのと同じ非対称性もそれをバイアスする。
論文 参考訳(メタデータ) (2026-08-26T15:52:19Z) - Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models [68.52262705081098]
オンライン蒸留は、生徒自身の方針からサンプリングされた軌跡を監督することによって、教師の能力を伝達する。
OPDは,特定の問題に対する回答よりも,教師の推論行動を伝達することがわかった。
論文 参考訳(メタデータ) (2026-08-17T14:46:53Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - Geometric Self-Distillation for Reasoning Generalization [12.38444431260744]
オンライン蒸留は、大規模言語モデルの訓練後の実践的なレシピである。
特権的内容の自己蒸留では、教師と学生は同じプレフィックスで条件付けられた同じモデルである。
我々は,このドリフトを学生の予測行動の運動として扱う幾何学的自己蒸留の目的であるGeoSDを紹介する。
論文 参考訳(メタデータ) (2026-07-07T23:16:19Z) - Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA [40.94400211806987]
言語モデルは、QA(Synthetic Question Aswer)の監督によって、ますます教えられている。
この生成ステップが中立的な前処理ではないことを示す。
このような障害モードは,QA生成時の選択から発生し,トレーニングループを変更することなく低減できることを示す。
論文 参考訳(メタデータ) (2026-06-30T17:35:14Z) - What Am I Missing? Question-Answering as Hidden State Probing [13.065059683491958]
本稿では,推測時間の介入として質問を投げかける手法を提案する。
質問の前後で、学生の隠れた状態を調査する。
介入としての質問応答の成功は,モデルの自己整合性に大きく依存していることが判明した。
論文 参考訳(メタデータ) (2026-05-29T17:27:07Z) - Catching The Correct Answer Trap: Characterising AI Tutor Blind Spots When Analysing Student Reasoning [2.6352293843915606]
我々は,正解トラップ(CAT: correct answer trap)と呼ばれる障害モードについて検討する。
Eedi数学プラットフォームから実際の学生の反応を分析すると、これらの失敗の71%が2つの質問タイプに集中していることが分かる。
論文 参考訳(メタデータ) (2026-04-20T10:53:48Z) - Learning from Diverse Reasoning Paths with Routing and Collaboration [65.77515749498575]
経路品質フィルタリング,条件付きルーティング,ピアラーニングを組み合わせたQR-Distill(Quality-filtered Routing with Cooperative Distillation)を提案する。
従来のシングルパス蒸留法やマルチパス蒸留法よりもQR-ディスティルが優れていることを示す実験がある。
論文 参考訳(メタデータ) (2025-08-23T01:15:57Z) - Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning [62.23671919314693]
大規模言語モデル (LLM) は文脈理解において著しく改善されている。
しかし、長いコンテキストの推論と生成の間に真に重要な情報に出席する能力は、まだペースの遅れています。
本稿では,2段階のフレームワークであるLearning to Focus(LeaF)を導入し,コンバウンディング要因を緩和する。
論文 参考訳(メタデータ) (2025-06-09T15:16:39Z) - RECKONING: Reasoning through Dynamic Knowledge Encoding [51.076603338764706]
言語モデルは、文脈の一部として提供される知識について推論することで、質問に答えることができることを示す。
これらの状況では、モデルは質問に答えるために必要な知識を区別することができない。
我々は、与えられた文脈知識をモデルのパラメータに折り畳み、より堅牢に推論するようにモデルに教えることを提案する。
論文 参考訳(メタデータ) (2023-05-10T17:54:51Z) - Random Teachers are Good Teachers [19.74244993871716]
自己蒸留における教師-学生の学習力学によって引き起こされる暗黙の正規化について検討する。
このような無作為な教師に学生を蒸留する際には,その教師に対して高い精度で蒸留した生徒の強い改善を観察する。
論文 参考訳(メタデータ) (2023-02-23T15:26:08Z) - On student-teacher deviations in distillation: does it pay to disobey? [54.908344098305804]
知識蒸留は「学生」ネットワークのテスト精度を向上させるために広く用いられている。
教師の確率に合うように訓練されているにもかかわらず、生徒は教師の確率から大きく逸脱するだけでなく、パフォーマンスにおいて教師を上回ることもある。
論文 参考訳(メタデータ) (2023-01-30T14:25:02Z) - Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model [18.857225397137686]
我々は,emphmarkup-and-maskと呼ばれるオープンブック質問応答のための新しい方法を提案する。
マークアップフェーズでは、節は自由テキストのマークアップで拡張され、各文は談話コンテキストの外側で独立して立つことができる。
教師として機能する凍結した事前学習言語モデルに一連のプロンプトを送信することで,銀アノテートデータを生成する。
正解を導いた合理性のサブセットをトレーニングすることで、より小さな学生モデルを微調整する。
論文 参考訳(メタデータ) (2022-10-05T18:23:49Z) - Switchable Online Knowledge Distillation [68.2673580932132]
オンライン知識蒸留(OKD)は、教師と学生の違いを相互に活用することで、関係するモデルを改善する。
そこで我々は,これらの疑問に答えるために,スイッチブルオンライン知識蒸留(SwitOKD)を提案する。
論文 参考訳(メタデータ) (2022-09-12T03:03:40Z) - Generalized Knowledge Distillation via Relationship Matching [53.69235109551099]
よく訓練されたディープニューラルネットワーク(いわゆる「教師」)の知識は、同様のタスクを学ぶのに有用である。
知識蒸留は教師から知識を抽出し、対象モデルと統合する。
教師に学生と同じ仕事をさせる代わりに、一般のラベル空間から訓練を受けた教師の知識を借りる。
論文 参考訳(メタデータ) (2022-05-04T06:49:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。