論文の概要: Post-Hoc Understanding of Metaphor Processing in Decoder-Only Language Models via Conditional Scale Entropy
- arxiv url: http://arxiv.org/abs/2605.21391v1
- Date: Wed, 20 May 2026 16:45:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.7914
- Title: Post-Hoc Understanding of Metaphor Processing in Decoder-Only Language Models via Conditional Scale Entropy
- Title(参考訳): 条件付きスケールエントロピーを用いたデコーダオンリー言語モデルにおけるメタファー処理の時間後理解
- Authors: Lawhori Chakrabarti, Jennifer Johnson-Leung, Bert Baumgaertner, Aleksandar Vakanski, Min Xian, Boyu Zhang,
- Abstract要約: メタファーは、文脈の意味が基本的なリテラルの意味から分岐するトークンを解決するために言語モデルを必要とする。
本研究では,各層位置における周波数スケールの広帯域変換をウェーブレットから導いた条件付きスケールエントロピー(CSE)を導入する。
CSEを用いて、比喩的トークンは、連続的な層位置におけるリテラルトークンよりもかなり高いスペクトル幅を生じることを発見した。
- 参考スコア(独自算出の注目度): 37.79924630741744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Metaphor requires a language model to resolve a token whose contextual meaning diverges from its basic literal sense. Understanding how transformer models organize this reinterpretation across depth remains an open problem in mechanistic interpretability. We introduce conditional scale entropy (CSE), a wavelet-derived measure of how broadly transformer computation engages across frequency scales at each layer position. Two theorems establish that CSE is invariant to update magnitude, isolating the structural pattern of updates from their intensity. Using CSE, we find that metaphorical tokens produce significantly higher spectral breadth than literal tokens at contiguous layer positions on every decoder-only architecture tested, from 124M to 20B parameters (GPT-2 family, LLaMA-2 7B, GPT-oss 20B). The effect survives cluster-based permutation correction, recurs in the early-to-mid relative depth range across models, and converges with an independent analysis of 200 naturalistic VUA pairs. Specificity controls further show that the effect is not explained by semantic complexity or by matched propositional content. These results identify multi-scale coordination as a consistent signature of metaphorical language processing in the decoder-only architectures examined, and establish CSE as a principled tool for characterizing cross-depth structure in transformers.
- Abstract(参考訳): Metaphorは、コンテキスト意味が基本的なリテラルの意味から分岐するトークンを解決するために、言語モデルを必要とする。
変圧器モデルがどのようにして深度を越えた再解釈を組織するかを理解することは、力学的解釈可能性においてオープンな問題である。
本稿では,各層位置における周波数スケールの広帯域変換処理をウェーブレットから導いた条件付きスケールエントロピー(CSE)について紹介する。
2つの定理は、CSEはマグニチュードを更新するために不変であり、その強度から更新の構造パターンを分離することを証明している。
CSEを用いて,124Mから20Bパラメータ (GPT-2 family, LLaMA-2 7B, GPT-oss 20B) でテストされたデコーダのみのアーキテクチャにおいて,比喩的トークンはリテラルトークンよりもはるかに高いスペクトル幅を生じることがわかった。
この効果はクラスタベースの置換補正に残り、モデル全体にわたる初期から中期の相対深度範囲で再帰し、200の自然主義的なVUAペアの独立解析に収束する。
特異性制御は、その効果が意味的な複雑さや一致した命題の内容によって説明されないことを示す。
これらの結果は、デコーダのみのアーキテクチャにおいて、メタファ言語処理の一貫性のあるシグネチャとしてマルチスケールコーディネートを特定し、CSEをトランスフォーマにおけるクロスディープス構造を特徴付けるための基本ツールとして確立した。
関連論文リスト
- KUET at StanceNakba Shared Task: StanceMoE: Mixture-of-Experts Architecture for Stance Detection [2.5199066832791526]
StanceMoEは、アクターレベルのスタンス検出のための微細調整されたBERTエンコーダ上に構築された、コンテキスト強化型Mixture-of-Experts (MoE)アーキテクチャである。
本モデルでは,補完的な言語信号の取得を目的とした6つの専門モジュールを統合した。
StanceNakba 2026 Subtask Aデータセットで、1,401の注釈付き英語テキストを含む実験が行われた。
論文 参考訳(メタデータ) (2026-04-01T13:24:03Z) - Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models [13.707653566827704]
トランスフォーマーモデルは、ドメインやタスク間で最先端のパフォーマンスを達成するが、その深い階層化表現により、予測の解釈が困難になる。
既存の説明可能性法は最終層属性に依存し、局所的なトークンレベルの属性か、統一せずにグローバルな注意パターンをキャプチャする。
本稿では,各トランスフォーマーブロック内の階層的に統合されたグラディエントを計算し,これらのトークンレベルの属性をクラス固有の注意勾配と融合する階層型属性フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-18T17:03:10Z) - MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging [65.07273789940116]
本稿では,動的ゲノミクストークンと潜在トランスフォーマーをコンテキスト対応事前学習タスクで協調的に最適化する階層型アーキテクチャを提案する。
MergeDNAは3つの人気のあるDNAベンチマークと、微調整やゼロショット評価を伴う複数のマルチオミクスタスクにおいて優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-17T19:27:41Z) - Cross-Layer Discrete Concept Discovery for Interpreting Language Models [13.842670153893977]
クロス層VQ-VAEは、ベクトル量子化を使用して層間の表現をマッピングするフレームワークである。
本手法は,量子化中のトップk温度に基づくサンプリングとEMAコードブック更新を一意に組み合わせる。
論文 参考訳(メタデータ) (2025-06-24T22:43:36Z) - Understanding Token-level Topological Structures in Transformer-based Time Series Forecasting [52.364260925700485]
Transformer-based method has achieved state-of-the-art performance in time series forecasting (TSF)
既存のトランスフォーマーが中間層全体を通してトークン間の固有位相構造を完全に活用しているかどうかは不明である。
トークンレベルのトポロジを明示的にかつ適応的に保存するトランスフォーマーベースの新しいTSF手法であるトポロジ拡張法(TEM)を提案する。
論文 参考訳(メタデータ) (2024-04-16T07:21:39Z) - Inducing Systematicity in Transformers by Attending to Structurally
Quantized Embeddings [60.698130703909804]
トランスフォーマーは、複雑なデータセットでトレーニングされた後、構造と実体の新規な構成に一般化する。
本稿では,SQ-Transformerを提案する。
SQ-Transformerは,複数の低複雑さ意味解析および機械翻訳データセット上で,バニラ変換器よりも強い構成一般化を実現することを示す。
論文 参考訳(メタデータ) (2024-02-09T15:53:15Z) - Graph-Induced Syntactic-Semantic Spaces in Transformer-Based Variational
AutoEncoders [5.037881619912574]
本稿では,トランスフォーマーを用いたVAEにおける構造構文注入のための潜時空間分離法について検討する。
具体的には、グラフベースおよびシーケンシャルモデルの統合により、符号化段階で構文構造をどのように活用するかを検討する。
我々の経験的評価は、自然言語文と数学的表現に基づいて行われ、提案したエンドツーエンドのVAEアーキテクチャにより、潜在空間の全体構造がより良くなることを示している。
論文 参考訳(メタデータ) (2023-11-14T22:47:23Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z) - CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement [5.766499647507758]
さらに、時間周波数(TF)領域における音声強調(SE)のためのコンバータベース計量生成逆ネットワーク(CMGAN)モデルを開発した。
以上の結果から,CMGANは3つの主要な音声強調課題において,既存の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2022-09-22T15:50:21Z) - Inducing Transformer's Compositional Generalization Ability via
Auxiliary Sequence Prediction Tasks [86.10875837475783]
体系的な構成性は人間の言語において必須のメカニズムであり、既知の部品の組換えによって新しい表現を作り出すことができる。
既存のニューラルモデルには、記号構造を学習する基本的な能力がないことが示されている。
本稿では,関数の進行と引数のセマンティクスを追跡する2つの補助シーケンス予測タスクを提案する。
論文 参考訳(メタデータ) (2021-09-30T16:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。