論文の概要: Late Attention Layers Alone Can Copy Entity Tokens, but Not Without Attending to Their Context
- arxiv url: http://arxiv.org/abs/2609.35663v1
- Date: Mon, 28 Sep 2026 17:23:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 19:49:28.331484
- Title: Late Attention Layers Alone Can Copy Entity Tokens, but Not Without Attending to Their Context
- Title(参考訳): 遅延アテンション層はエンティティトークンをコピーできるが、コンテキストに従わない
- Abstract要約: 大規模言語モデルの後半の2つの異なる層群は、エンティティのコピーに必要かつ十分であることがわかった。
本研究は,コンテキストトークンの指導の下で,エンティティコピーにおける後期層の重要性を実証するものである。
- 参考スコア(独自算出の注目度): 15.57269559575132
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) reliably perform entity copying, in which a model copies tokens referring to an entity, termed entity tokens, from the prompt into its output to answer a question. Although entity copying is straightforward for most LLMs, existing research does not provide a systematic account of which layers specialize in this fundamental task or how other tokens in the same sequence, termed context tokens, influence the model's ability to copy the entity tokens. To address these questions, we conduct experiments on Qwen3-8B using two novel methods: genie-in-a-bottle, which controls exactly which layers can participate in an entity-copying task, and attention lobotomy, which cuts off specific tokens' attention to entity tokens without affecting the remaining attention distribution. We find that two distinct groups of layers in the second half of the model are both necessary and sufficient for entity copying. Moreover, in addition to the decoding position's attention to entity tokens, context tokens' attention to entity tokens also proves necessary for copying the exact tokens, even though context tokens do not store entity information themselves unless they satisfy particular semantic properties. Our findings establish the critical role of late layers in entity copying under the guidance of context tokens, calling for future work on how models propagate and consume entity information.
- Abstract(参考訳): 大型言語モデル(LLM)は、エンティティコピーを確実に実行し、モデルがエンティティを参照するトークンをプロンプトから出力にコピーして質問に答える。
エンティティのコピーはほとんどのLCMでは簡単だが、既存の研究では、どのレイヤがこの基本的なタスクに特化しているか、同じシーケンスにある他のトークンがコンテキストトークンと呼ばれ、エンティティトークンをコピーするモデルの能力に影響を与えるのか、体系的な説明を提供していない。
これらの問題に対処するために、我々は2つの新しい手法を用いてQwen3-8Bの実験を行う: genie-in-a-bottle、どの層がエンティティコピータスクに参加できるかを正確に制御する。
モデル後半の2つの異なるレイヤ群は、エンティティのコピーに必要かつ十分であることがわかった。
さらに、エンティティトークンへのデコード位置の注意に加えて、コンテキストトークンが特定のセマンティックプロパティを満たさない限り、コンテキストトークンはエンティティ情報を自身に格納しないにもかかわらず、エンティティトークンへの注意も正確なトークンをコピーするのに必要であることを証明している。
我々の研究は、コンテキストトークンのガイダンスに基づいて、エンティティのコピーにおける後期層の重要性を確立し、モデルがどのようにエンティティ情報を伝播し消費するかを将来の課題に求めている。
関連論文リスト
- Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers [16.996490884328455]
テキスト・ツー・イメージ拡散変換器(DiT)は,共同注意による画像生成を行う。
大規模なDiTでは、条件付け入力はユーザープロンプトだけでなくチャットテンプレートトークンも含んでいる。
本稿では,これらのトークンが量子化計算にどのように関与するかを調べるために,因果的解釈可能性フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-21T14:29:59Z) - Learning Multi-Aspect Item Palette: A Semantic Tokenization Framework for Generative Recommendation [55.99632509895994]
マルチアスペクトセマンティックトークン化のための新しいアプローチであるLAMIAを紹介する。
単一の埋め込みを使用するRQ-VAEとは異なり、LAMIAは独立的でセマンティックな並列な埋め込みの集合である「アイテムパレット」を学習する。
その結果,提案手法よりも提案手法の精度が大幅に向上した。
論文 参考訳(メタデータ) (2024-09-11T13:49:48Z) - Language Models As Semantic Indexers [78.83425357657026]
本稿では,ジェネレーティブ言語モデルを用いてセマンティックIDを学習するための自己教師型フレームワークLMIndexerを紹介する。
学習したIDの質を検証し,推奨,製品検索,文書検索の3つの課題において有効性を示す。
論文 参考訳(メタデータ) (2023-10-11T18:56:15Z) - What Are You Token About? Dense Retrieval as Distributions Over the
Vocabulary [68.77983831618685]
本稿では,2つのエンコーダが生成するベクトル表現を,モデルの語彙空間に投影することで解釈する。
得られたプロジェクションは、リッチな意味情報を含み、それらの間の接続を描画し、スパース検索を行う。
論文 参考訳(メタデータ) (2022-12-20T16:03:25Z) - RetroMAE v2: Duplex Masked Auto-Encoder For Pre-Training
Retrieval-Oriented Language Models [3.4523793651427113]
本稿では,[] と通常のトークンの両方のコンテキスト化埋め込みにおける意味表現能力の向上を目標とする,二重マスク付き自動エンコーダ DupMAE を提案する。
DupMAEは単純だが経験的競争力があり、デコードコストが小さいため、モデルの表現能力と転送可能性に大きく貢献する。
論文 参考訳(メタデータ) (2022-11-16T08:57:55Z) - LUKE: Deep Contextualized Entity Representations with Entity-aware
Self-attention [37.111204321059084]
両方向変換器に基づく単語と実体の事前学習した文脈表現を提案する。
我々のモデルは、BERTのマスキング言語モデルに基づく新しい事前訓練タスクを用いて訓練される。
また,変換器の自己認識機構の拡張である自己認識機構を提案する。
論文 参考訳(メタデータ) (2020-10-02T15:38:03Z) - Autoregressive Entity Retrieval [55.38027440347138]
エンティティは、知識の表現と集約の方法の中心にあります。
クエリが与えられたエンティティを検索できることは、エンティティリンクやオープンドメインの質問応答のような知識集約的なタスクに基本となる。
本稿では,自己回帰方式でトークン・バイ・トークンを左から右に生成し,エンティティを検索する最初のシステムであるGENREを提案する。
論文 参考訳(メタデータ) (2020-10-02T10:13:31Z) - Token Manipulation Generative Adversarial Network for Text Generation [0.0]
我々は条件付きテキスト生成問題を,make-a-blank と fill-in-blank の2つのタスクに分解し,前者を拡張してより複雑なトークン操作を行う。
提案モデルでは,限界に対処するだけでなく,品質や多様性の面で性能を損なうことなく良好な結果が得られることを示す。
論文 参考訳(メタデータ) (2020-05-06T13:10:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。