論文の概要: Causal and Interpretable Structures in LLM Compositional Tasks
- arxiv url: http://arxiv.org/abs/2609.35970v1
- Date: Mon, 28 Sep 2026 18:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.913715
- Title: Causal and Interpretable Structures in LLM Compositional Tasks
- Title(参考訳): LLM合成作業における因果的・解釈的構造
- Abstract要約: 循環概念に対応する3つのトークン間の関係を推論する必要があるプロンプトのアンサンブルからのアクティベーションについて検討する。
モデルファミリ全体で、トークン間の結合依存が幾何的に組織されるかにおいて、一貫した階層的に進行する。
また、幾何学的に構造化されているが、次の予測では因果的に不活性なトークン間の他の関係も見いだす。
- 参考スコア(独自算出の注目度): 6.9974836230230055
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are able to solve tasks whose answers depend on not only individual input tokens, but also on relations among them. How is such relational information represented and processed across transformer layers? We study activations from ensembles of prompts that require inferring relationships between three tokens corresponding to a cyclic concept (months, hours, weekdays, and musical notes) to correctly predict the next token. Across model families (Llama, Qwen, Gemma, and Mistral) and cyclic concepts, we find a consistent layerwise progression in how the joint dependence among the tokens is geometrically organized and causally used: intermediate layers use a joint representation based on the inferred relationship between two tokens, while later layers use a joint representation associated with all three tokens to correctly complete the task. We also find other relationships between tokens that are geometrically structured but remain causally inert in the next-token prediction. Crucially, when taken together, these geometric and causal investigations reveal the representation-level mechanism that progressively organizes and composes the relational information to form the answer. More surprisingly, restricting the models to such causally relevant joint representations improves next-token prediction accuracy.
- Abstract(参考訳): 大規模言語モデルは、個々の入力トークンだけでなく、それらの間の関係にも依存するタスクを解くことができる。
このような関係情報は、トランス層にまたがってどのように表現され処理されるのか?
我々は,次のトークンを正確に予測するために,周期的概念(月,時間,平日,音符)に対応する3つのトークン間の関係を推定する必要があるプロンプトのアンサンブルからの活性化について検討した。
モデルファミリ(Llama, Qwen, Gemma, Mistral)とサイクリックな概念は、トークン間の結合依存が幾何的に整理され、因果的に使用されるかという一貫した階層的に進行し、中間層は2つのトークン間の推論された関係に基づいて結合表現を使用し、後層は3つのトークンに関連付けられた結合表現を用いてタスクを正しく完了させる。
また、幾何学的に構造化されているが、次の予測では因果的に不活性なトークン間の他の関係も見いだす。
重要なことに、これらの幾何学的および因果的研究は、関係情報を段階的に整理し、構成し、答えを形成する表現レベルメカニズムを明らかにする。
さらに驚くべきことに、そのような因果関係のある関節表現にモデルを限定することで、次のトーケン予測精度が向上する。
関連論文リスト
- Mapping and Measuring the Behavioral Evolution of Large Language Models [28.603443859513153]
ベンチマークのリーダーボードは、言語モデルのパフォーマンスを概説するが、その振る舞いが他のモデルとどのように関係しているか、世代によって異なる。
1万のプロンプトの共有バンクに対する応答を用いて、6つのファミリーから32モデルの出力挙動を特徴付ける。
論文 参考訳(メタデータ) (2026-08-11T15:07:28Z) - Beyond Triplet Plausibility: Relation Set Completion in Knowledge Graphs [48.16012222834734]
関係集合完了タスク(RSC)と関係集合埋め込みモデル(RelSetE)を導入する。
RSCは、あるエンティティと意味的に互換性のある欠落した関係を推論することを目的としている。
RelSetEは、観測されたエンティティの関係の中で潜在パターンをモデル化し、失われたパターンを推測する。
論文 参考訳(メタデータ) (2026-06-29T06:54:40Z) - Structure Before Collapse: Transient semantic geometry in next-token prediction [33.942301586178914]
Neural Collapseは、バランスの取れたワンホット分類が、モデル表現を互いに等しく遠くにプッシュする、と予測する。
次世代の予測言語モデルは、主にワンホットラベルでトレーニングされる。
トレーニングの初期に意味幾何学が出現し,共有属性によるクラスタ表現が現れる。
論文 参考訳(メタデータ) (2026-06-25T08:33:34Z) - MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging [65.07273789940116]
本稿では,動的ゲノミクストークンと潜在トランスフォーマーをコンテキスト対応事前学習タスクで協調的に最適化する階層型アーキテクチャを提案する。
MergeDNAは3つの人気のあるDNAベンチマークと、微調整やゼロショット評価を伴う複数のマルチオミクスタスクにおいて優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-17T19:27:41Z) - CORG: Generating Answers from Complex, Interrelated Contexts [57.213304718157985]
現実世界のコーパスでは、知識は文書間で頻繁に再帰するが、曖昧な命名、時代遅れの情報、エラーのためにしばしば矛盾を含む。
以前の研究では、言語モデルはこれらの複雑さに苦しむことが示されており、典型的には孤立した単一要因に焦点を当てている。
複数のコンテキストを個別に処理されたグループに整理するフレームワークであるContext Organizer (CORG)を紹介する。
論文 参考訳(メタデータ) (2025-04-25T02:40:48Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z) - The Geometry of Tokens in Internal Representations of Large Language Models [0.0]
変圧器モデルにおけるトークン埋め込みの幾何学と次のトークン予測におけるそれらの役割の関係について検討する。
我々は、本質的な次元、近傍の重なり合い、コサイン類似性などの指標を用いて、これらの経験的測度を層にわたって観察的に調査する。
その結果,トークン埋め込みの幾何学的性質と次のトークン予測のエントロピー損失との相関関係が明らかとなった。
論文 参考訳(メタデータ) (2025-01-17T22:02:17Z) - Integrating a Heterogeneous Graph with Entity-aware Self-attention using
Relative Position Labels for Reading Comprehension Model [14.721615285883429]
異種グラフからの推論知識を外部知識に頼らずにトランスフォーマーアーキテクチャに組み込む新しい注意パターンを導入する。
提案する注目パターンは, 単語トークンに対するグローバルな注意, グラフに関連付けられたトークンに対する強い注意を示すエンティティトークンに対するグラフの注意, 各エンティティトークンとワードトークンの関係のタイプを考慮した3つの重要な要素から構成される。
我々のモデルは、最先端のLUKE-GraphとベースラインのLUKEモデルの両方を2つの異なるデータセットで比較した。
論文 参考訳(メタデータ) (2023-07-19T20:17:37Z) - Linear-Time Modeling of Linguistic Structure: An Order-Theoretic
Perspective [97.57162770792182]
文字列内のトークンのペア間の関係をモデル化するタスクは、自然言語を理解する上で不可欠な部分である。
これらの徹底的な比較は避けられ、さらに、トークン間の関係を文字列上の部分順序としてキャストすることで、複雑さを線形に減らすことができる。
提案手法は,文字列中の各トークンの実際の数を並列に予測し,それに従ってトークンをソートすることで,文字列内のトークンの総順序を決定する。
論文 参考訳(メタデータ) (2023-05-24T11:47:35Z) - Human Pose as Compositional Tokens [88.28348144244131]
本稿では,PoseをPCT(Compincial Tokens)と名づけた構造的表現について述べる。
これはM個の離散トークンによるポーズを表し、それぞれがいくつかの相互依存結合を持つ部分構造を特徴づける。
事前に学習したデコーダネットワークを使用してトークンからのポーズを後処理なしで復元する。
論文 参考訳(メタデータ) (2023-03-21T07:14:18Z) - Relationformer: A Unified Framework for Image-to-Graph Generation [18.832626244362075]
この研究は、オブジェクトとその関係を共同で予測する一段階トランスフォーマーベースの統合フレームワークであるRelationformerを提案する。
我々は、直接セットベースのオブジェクト予測を活用し、オブジェクト間の相互作用を取り入れて、オブジェクト関係表現を共同で学習する。
複数、多種多様な、複数ドメインのデータセット上で、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-03-19T00:36:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。