論文の概要: Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
- arxiv url: http://arxiv.org/abs/2607.01002v1
- Date: Wed, 01 Jul 2026 14:41:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.939144
- Title: Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
- Title(参考訳): 非リテラル検索ヘッドのロジット寄与スコーディング
- Authors: Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini,
- Abstract要約: 我々は,OV回路出力の投射によって各頭部を解答不能な方向に向けてスコアする書き込み認識検出器であるLogit-Contribution Scoring(LOCOS)を紹介する。
NoLiMaノンリテラル検索ベンチマークの上位LOCOSヘッドを平均で比較すると、3つのモデルファミリーでROUGE-Lは従来の注意に基づく検出よりも低いカウントで崩壊する。
- 参考スコア(独自算出の注目度): 19.588124754970142
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In long-context use, large language models frequently synthesize answers from the meaning of a relevant context span rather than literally copy-pasting them. Identifying which attention heads perform this synthesis matters for interpreting long-context model behavior. Yet existing detectors miss these heads by construction: they reward heads whose attended token matches the generated token, a literal-copy criterion that captures where a head reads but not what it writes through its output-value (OV) circuit, the very mechanism that carries non-literal retrieval. We introduce Logit-Contribution Scoring (LOCOS), a write-aware detector that scores each head by the projection of its OV-circuit output onto the answer-token unembedding direction, contrasting needle and off-needle source positions in a single forward pass. Across three model families (Qwen3, Gemma-3, OLMo-3.1), mean-ablating the top LOCOS heads on the NoLiMa non-literal retrieval benchmark collapses ROUGE-L at lower head counts than prior attention-based detections; on Qwen3-8B, ablating 50 heads drives ROUGE-L from 0.401 to 0.000 while the strongest baseline still retains 0.292. The selected heads are retrieval-specific: parametric recall and arithmetic reasoning stay at baseline under the same ablation. On Qwen3-8B, the same ablation also drops MuSiQue from 0.55 to 0.08 and BABI-Long from 0.62 to 0.20, while a random-heads control stays within 0.05 of baseline.
- Abstract(参考訳): 長期使用においては、大きな言語モデルは、文字通りコピー・ペーストするのではなく、関連するコンテキストの意味から回答をしばしば合成する。
長文モデルの振る舞いを解釈するために、どのアテンションヘッドがこの合成を行うかを同定する。
しかし、既存の検出器は、これらのヘッドを建設によって見逃している: 出席したトークンが生成されたトークンと一致したヘッドを報酬する。
我々は,OV回路出力の投射によって各頭部を1本の前方パスで針とオフニードル源位置とを対比して解答不能方向へ向かわせる書き込み認識検出器であるLogit-Contribution Scoring (LOCOS)を紹介した。
3つのモデルファミリー(Qwen3, Gemma-3, OLMo-3.1)にまたがって、NoLiMaの非リテラル検索ベンチマークの上位LOCOSヘッドを平均で比較すると、従来の注意に基づく検出よりも低い値でROUGE-Lが崩壊する。
パラメトリックリコールと算術推論は、同じアブレーションの下でベースラインに留まる。
Qwen3-8B では、同じアブレーションが MuSiQue を 0.55 から 0.08 に、BABI-Long を 0.62 から 0.20 に、ランダムヘッド制御は 0.05 のベースライン内に留まる。
関連論文リスト
- Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian [0.0]
再建された信号は、すでに注目ヘッドの小さなサブセットに集中していることを示す。
CAMEOスプリットでは、選択も評価データモデルも、暗黙的に記憶されていない。
いずれの手法も、散布前のZhang数からリーククリーン数へ30~36ポイント減少し、事前学習前のかなりの重複と一致している。
論文 参考訳(メタデータ) (2026-06-20T04:35:51Z) - Does RoPE Prevent or Degrade Retrieval Heads? A Mechanistic Analysis Across Model Families [0.0]
検索ヘッダは、以前のコンテキストから現在の位置への情報をコピーする。
回転位置埋め込みは、ベースハイパーパラメータテータで減衰することで、クエリとキーを回転させる。
マルチヘッドとグループドクリーアテンションにまたがる4つのオープンウェイト7-8Bモデルと100倍の範囲のテータを試験した。
論文 参考訳(メタデータ) (2026-06-19T09:23:59Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models [68.48918176385105]
本稿では,質問トークンからテキストや視覚的証拠への注目を収集するマルチモーダル検索ヘッド検出手法を提案する。
マルチモーダル検索ヘッドはスパースであり,本質的であり,因果的に重要であることを示す。
これらの頭部は、視覚的にリッチな文書のランク付けに利用することもできる。
論文 参考訳(メタデータ) (2026-05-26T16:24:29Z) - Pairwise matrices for sparse autoencoders: single-feature inspection mislabels causal axes [2.741152471987327]
標準スパースオートエンコーダプロトコルは、各機能をトップアクティベーションコンテキストからラベル付けし、単一機能ステアリングによって検証する。
本稿では,Qwen3-1.7B-Instruct上での標準ワンコーナプロトコルミスをGemma-2-2B-itで再現した,ペアワイズ行列プロトコルと共変ステアリング係数を提案する。
これら3つの所見はGemmaでモデル特異的な損傷シグネチャを再現し,一致した形状制御はCIを10倍に分離する。
論文 参考訳(メタデータ) (2026-05-04T21:11:21Z) - More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models [5.705685936981751]
チェーン・オブ・シント(CoT)推論と推論調整モデルは通常、慎重に考えることで浅いバイアスを減らすと仮定される。
我々は、複数の選択QAにおける位置バイアスでこれを検証し、異なるストーリーを見つける:任意の推論能力モデルにおいて、探究位置バイアスは、推論軌跡の長さとともにスケールする。
論文 参考訳(メタデータ) (2026-04-21T04:14:13Z) - The Anxiety of Influence: Bloom Filters in Transformer Attention Heads [0.0]
2つのヘッドは180個のユニークなコンテキストトークンであっても偽陽性率0-4%の高精度なメンバシップフィルタとして機能する。
当初ブルームフィルタ (L3H0) と同定された第4の頭部は, コンファウンド制御によりその見かけの容量曲線がシーケンス長のアーティファクトであることが判明し, 一般的なプレフィックスアテンションヘッドに再分類された。
論文 参考訳(メタデータ) (2026-02-19T16:37:16Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - NoLiMa: Long-Context Evaluation Beyond Literal Matching [100.00398424275501]
NoLiMaは、NIAHテストを拡張したベンチマークである。
干し草の山の中に針を見つけるためには、潜伏関係を推測するモデルが必要である。
我々は、少なくとも128Kトークンのコンテキストをサポートすると主張する13の人気のある大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-02-07T18:49:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。