論文の概要: Learning What Matters: Supervising Sparse Attention Routing with Causal Evidence Sets
- arxiv url: http://arxiv.org/abs/2607.21692v1
- Date: Thu, 23 Jul 2026 17:11:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.960097
- Title: Learning What Matters: Supervising Sparse Attention Routing with Causal Evidence Sets
- Title(参考訳): 重要なことを学ぶ: 因果的エビデンスセットによるスパースアテンションルーティングの監視
- Abstract要約: パースアテンションは、各クエリが入力の選択された部分のみを読み取ることを可能にすることで、長いコンテキストのコストを削減します。
我々は,各回答の証拠が正確に分かっている検索タスクにおいて,その仮定を検証した。
注意と因果依存はしばしば一致せず、蒸留したセレクタはミスマッチを継承する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse attention reduces the cost of long contexts by allowing each query to read only selected parts of the input. These selectors are often trained by distilling the attention patterns of a dense teacher, assuming that attention reveals which context the teacher actually uses. We test that assumption on retrieval tasks where the evidence for each answer is known exactly. By masking parts of the context and measuring whether the answer changes, we find that attention and causal dependence often disagree, and distilled selectors inherit the mismatch. Teachers attend to outdated facts they have learned to ignore, and their attention can vary across training runs even when they rely on the same evidence. In a two-step reference task, attention at the answer skips the intermediate step because it was resolved earlier in the forward pass: a selector trained on attention achieves 41% accuracy, while the same selector trained on causal evidence reaches 99% and matches the teacher. These evidence sets require no annotation: recovered from a frozen teacher by masking alone, they train selectors to the same accuracy. We find the same conflict in pretrained models: Qwen2.5-3B gives more attention to an outdated fact than the current one on 58% of conflicting-fact examples despite answering correctly, while Gemma-2-9B rises from 56% to 99% accuracy when restricted to the two relevant sentences. Attention shows where a model looks, not necessarily what its answer depends on; across the regimes we tested, that dependence matched or outperformed attention as a training target.
- Abstract(参考訳): スパースアテンションは、各クエリが入力の選択された部分のみを読み取ることを可能にすることで、長いコンテキストのコストを削減する。
これらのセレクタは、密集した教師の注意パターンを蒸留することで、教師が実際に使用するコンテキストを明らかにすることを前提に、しばしば訓練される。
我々は,各回答の証拠が正確に分かっている検索タスクにおいて,その仮定を検証した。
文脈の一部を隠蔽し、答えが変わるかどうかを測定することで、注意と因果依存はしばしば一致せず、蒸留したセレクタがミスマッチを継承することがわかった。
教師は無視するために学んだ時代遅れの事実に出席し、同じ証拠に頼ったとしても、トレーニングラン毎に注意を向けることができる。
2段階の参照タスクでは、前方パスで早期に解決されたため、回答に対する注意は中間ステップをスキップする:注意に基づいて訓練されたセレクタは41%の精度で、因果的証拠に基づいて訓練された同じセレクタは99%に達し、教師と一致する。
これらのエビデンスセットにはアノテーションが不要で、凍結した教師からマスクだけで回復し、同じ精度でセレクタを訓練する。
Qwen2.5-3Bは、正解にもかかわらず矛盾する実例の58%よりも古い事実に注意を向け、Gemma-2-9Bは2つの関連文に制限された場合に56%から99%の精度で上昇する。
意識は、モデルがどこに見えるかを示し、必ずしもその答えが依存するものではなく、私たちがテストした体制全体において、その依存がトレーニングターゲットとして注目されたり、優れていたりします。
関連論文リスト
- OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation [15.986808086256792]
プリヴィレグドオン政治蒸留は、教師がリッチで訓練のみの視覚的証拠を用いて学生の軌跡を評価することによってマルチモーダル推論を改善する。
この誤解を招く合意の下では,教師の視覚的矯正的嗜好は失われないことがわかった。
我々は,この分離された視覚的嗜好から直接蒸留ターゲットを再構築するOPD-Ahaを紹介する。
論文 参考訳(メタデータ) (2026-09-15T00:25:28Z) - One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation [3.0867286767516937]
オンライン蒸留は、教師がトークンでトークンをスコアする間、自身の世代で言語モデルを訓練する。
教師はモデル自身であり、テスト時に生徒が持たない特権情報に基づいている。
初期の結果は有望であり、生成したトークンのごく一部で強化学習に匹敵する精度であった。
しかし、信号を生成するのと同じ非対称性もそれをバイアスする。
論文 参考訳(メタデータ) (2026-08-26T15:52:19Z) - Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models [68.52262705081098]
オンライン蒸留は、生徒自身の方針からサンプリングされた軌跡を監督することによって、教師の能力を伝達する。
OPDは,特定の問題に対する回答よりも,教師の推論行動を伝達することがわかった。
論文 参考訳(メタデータ) (2026-08-17T14:46:53Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - Geometric Self-Distillation for Reasoning Generalization [12.38444431260744]
オンライン蒸留は、大規模言語モデルの訓練後の実践的なレシピである。
特権的内容の自己蒸留では、教師と学生は同じプレフィックスで条件付けられた同じモデルである。
我々は,このドリフトを学生の予測行動の運動として扱う幾何学的自己蒸留の目的であるGeoSDを紹介する。
論文 参考訳(メタデータ) (2026-07-07T23:16:19Z) - Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA [40.94400211806987]
言語モデルは、QA(Synthetic Question Aswer)の監督によって、ますます教えられている。
この生成ステップが中立的な前処理ではないことを示す。
このような障害モードは,QA生成時の選択から発生し,トレーニングループを変更することなく低減できることを示す。
論文 参考訳(メタデータ) (2026-06-30T17:35:14Z) - What Am I Missing? Question-Answering as Hidden State Probing [13.065059683491958]
本稿では,推測時間の介入として質問を投げかける手法を提案する。
質問の前後で、学生の隠れた状態を調査する。
介入としての質問応答の成功は,モデルの自己整合性に大きく依存していることが判明した。
論文 参考訳(メタデータ) (2026-05-29T17:27:07Z) - Catching The Correct Answer Trap: Characterising AI Tutor Blind Spots When Analysing Student Reasoning [2.6352293843915606]
我々は,正解トラップ(CAT: correct answer trap)と呼ばれる障害モードについて検討する。
Eedi数学プラットフォームから実際の学生の反応を分析すると、これらの失敗の71%が2つの質問タイプに集中していることが分かる。
論文 参考訳(メタデータ) (2026-04-20T10:53:48Z) - Learning from Diverse Reasoning Paths with Routing and Collaboration [65.77515749498575]
経路品質フィルタリング,条件付きルーティング,ピアラーニングを組み合わせたQR-Distill(Quality-filtered Routing with Cooperative Distillation)を提案する。
従来のシングルパス蒸留法やマルチパス蒸留法よりもQR-ディスティルが優れていることを示す実験がある。
論文 参考訳(メタデータ) (2025-08-23T01:15:57Z) - Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning [62.23671919314693]
大規模言語モデル (LLM) は文脈理解において著しく改善されている。
しかし、長いコンテキストの推論と生成の間に真に重要な情報に出席する能力は、まだペースの遅れています。
本稿では,2段階のフレームワークであるLearning to Focus(LeaF)を導入し,コンバウンディング要因を緩和する。
論文 参考訳(メタデータ) (2025-06-09T15:16:39Z) - RECKONING: Reasoning through Dynamic Knowledge Encoding [51.076603338764706]
言語モデルは、文脈の一部として提供される知識について推論することで、質問に答えることができることを示す。
これらの状況では、モデルは質問に答えるために必要な知識を区別することができない。
我々は、与えられた文脈知識をモデルのパラメータに折り畳み、より堅牢に推論するようにモデルに教えることを提案する。
論文 参考訳(メタデータ) (2023-05-10T17:54:51Z) - Random Teachers are Good Teachers [19.74244993871716]
自己蒸留における教師-学生の学習力学によって引き起こされる暗黙の正規化について検討する。
このような無作為な教師に学生を蒸留する際には,その教師に対して高い精度で蒸留した生徒の強い改善を観察する。
論文 参考訳(メタデータ) (2023-02-23T15:26:08Z) - On student-teacher deviations in distillation: does it pay to disobey? [54.908344098305804]
知識蒸留は「学生」ネットワークのテスト精度を向上させるために広く用いられている。
教師の確率に合うように訓練されているにもかかわらず、生徒は教師の確率から大きく逸脱するだけでなく、パフォーマンスにおいて教師を上回ることもある。
論文 参考訳(メタデータ) (2023-01-30T14:25:02Z) - Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model [18.857225397137686]
我々は,emphmarkup-and-maskと呼ばれるオープンブック質問応答のための新しい方法を提案する。
マークアップフェーズでは、節は自由テキストのマークアップで拡張され、各文は談話コンテキストの外側で独立して立つことができる。
教師として機能する凍結した事前学習言語モデルに一連のプロンプトを送信することで,銀アノテートデータを生成する。
正解を導いた合理性のサブセットをトレーニングすることで、より小さな学生モデルを微調整する。
論文 参考訳(メタデータ) (2022-10-05T18:23:49Z) - Switchable Online Knowledge Distillation [68.2673580932132]
オンライン知識蒸留(OKD)は、教師と学生の違いを相互に活用することで、関係するモデルを改善する。
そこで我々は,これらの疑問に答えるために,スイッチブルオンライン知識蒸留(SwitOKD)を提案する。
論文 参考訳(メタデータ) (2022-09-12T03:03:40Z) - Generalized Knowledge Distillation via Relationship Matching [53.69235109551099]
よく訓練されたディープニューラルネットワーク(いわゆる「教師」)の知識は、同様のタスクを学ぶのに有用である。
知識蒸留は教師から知識を抽出し、対象モデルと統合する。
教師に学生と同じ仕事をさせる代わりに、一般のラベル空間から訓練を受けた教師の知識を借りる。
論文 参考訳(メタデータ) (2022-05-04T06:49:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。