論文の概要: Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.23067v1
- Date: Sat, 25 Jul 2026 06:32:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.986371
- Title: Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models
- Title(参考訳): 大規模言語モデルにおけるコントラスト復号のための注意誘導層選択
- Authors: Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai,
- Abstract要約: TruthfulQAの実験結果から,私たちの戦略,特にAttention-JSDとAttention-Entropy-Minは,DoLaよりも一貫して優れていた。
マルチ・アンサー・メトリックス(MC2,MC3)の有意な利得を観測し,注意分布が事実知識を解くためのより敏感な信号となることを示唆した。
- 参考スコア(独自算出の注目度): 11.265652820490326
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contrastive decoding methods such as DoLa improve the factuality of Large Language Models (LLMs) by contrasting the output distributions of mature and premature layers. However, DoLa's dynamic layer selection relies solely on divergences in output vocabulary distributions. In this work, we propose three attention-guided strategies: Attention-JSD, Attention-Entropy-Max, and Attention-Entropy-Min, which leverage structural information carried by internal self-attention mechanisms as a signal for layer selection. Experimental results on TruthfulQA demonstrate that our strategies, particularly Attention-JSD and Attention-Entropy-Min, consistently outperform the original DoLa. We observe significant gains on multi-answer metrics (MC2 and MC3), suggesting that attention distributions can provide a more sensitive signal for resolving factual knowledge than output vocabulary distributions.
- Abstract(参考訳): DoLaのような対照的な復号法は、成熟層と未熟層の出力分布を対比することにより、LLM(Large Language Models)の事実性を改善する。
しかし、DoLaの動的層選択は出力語彙分布の発散にのみ依存する。
本研究では,アテンション・JSD,アテンション・エントロピー・マックス,アテンション・エントロピー・ミニの3つの戦略を提案する。
TruthfulQAの実験結果から,私たちの戦略,特にAttention-JSDとAttention-Entropy-Minは,DoLaよりも一貫して優れていた。
マルチアンサー・メトリクス(MC2およびMC3)の顕著な利得を観測し、注意分布は、出力語彙分布よりも事実知識を解くためのよりセンシティブな信号を提供できることを示唆した。
関連論文リスト
- A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models [56.03096341469333]
大規模言語モデル(LLM)における大規模アクティベーションの起源について検討する。
モデルファミリ間で一貫して観察されるtextbfMassive Emergence Layer (ME Layer) と呼ばれる特定の層を同定する。
RMSNormとFFNパラメータの両方がME層内で大きな活性化の出現に共同して寄与していることを示す。
本研究では,この制限により,大規模アクティベーショントークンの剛性を簡易かつ効果的に低減する手法を提案する。
論文 参考訳(メタデータ) (2026-05-08T21:37:27Z) - When Does Sparsity Mitigate the Curse of Depth in LLMs [53.137717161619484]
本研究では,分散伝播の規制として空間空間が機能し,深度利用が向上することを示す。
以上の結果から,大規模な言語モデルにおいて,より効率的な深度スケーリングを実現するための重要なメカニズムとして,スパーシリティが明らかとなった。
論文 参考訳(メタデータ) (2026-03-16T15:04:16Z) - Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization [56.083511902353365]
強化学習(Reinforcement Learning, RL)は、一般的に、大規模言語モデルの全世代にわたって一様クレジットを適用する。
この研究は、LSMの内部論理を推論自体の機械的青写真として描画する特権基板として注意を向けている。
クリティカルノードに対するターゲットクレジット割り当てを動的に行う3つの新しいRL戦略を導入する。
論文 参考訳(メタデータ) (2025-10-15T13:49:51Z) - LayerCake: Token-Aware Contrastive Decoding within Large Language Model Layers [53.43862310647276]
大規模言語モデル(LLM)は、自然言語の理解と生成に優れるが、事実の誤りに弱いままである。
本稿では,トークン型と最も影響力のあるトランスフォーマー層を整合させて実データ生成を改善する,トークン認識型コントラストデコーディング手法を提案する。
提案手法は追加のトレーニングやモデル修正を必要とせず,複数のLSMおよび各種ベンチマークの事実性を常に改善することを示す実験である。
論文 参考訳(メタデータ) (2025-07-06T14:35:43Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Pose-Guided Self-Training with Two-Stage Clustering for Unsupervised Landmark Discovery [17.455841673719625]
オブジェクトカテゴリの教師なしランドマーク発見(ULD)は、コンピュータビジョンの問題である。
堅牢な ULD フレームワークの開発を追求するために,拡散モデルとして知られる,近年の自己教師型学習アルゴリズムの可能性を探る。
提案手法は, AFLW, MAFL, CatHeads, LS3Dの4つの挑戦的ベンチマークにおいて, 最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2024-03-24T15:24:04Z) - Extending Token Computation for LLM Reasoning [5.801044612920816]
大規模言語モデル(LLM)は、自然言語処理の進歩において重要な要素である。
LLMは、非効率な注意分布のため、複雑な推論タスクに苦しむことが多い。
本稿では,アテンション機構の最適化を利用して,計算トークンをChain-of-Thoughtプロセスで拡張する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-03-22T03:23:58Z) - Self-Attention Generative Adversarial Network for Speech Enhancement [37.14341228976058]
音声強調のための既存のGAN(Generative Adversarial Network)は、畳み込み操作のみに依存している。
音声強調GANの畳み込み層, 畳み込み層, 畳み込み層, 畳み込み層と、非局所的な注意から適応した自己注意層を提案する。
実験の結果,SEGANに自己注意を導入することで,改善性能の客観的評価指標が一貫した改善につながることが示された。
論文 参考訳(メタデータ) (2020-10-18T22:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。