論文の概要: Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models
- arxiv url: http://arxiv.org/abs/2608.07261v1
- Date: Fri, 07 Aug 2026 14:17:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.529975
- Title: Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models
- Title(参考訳): 両方のホップを知るだけでは不十分な理由:言語モデルにおける2つのホップの一般化を理解する
- Authors: Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo,
- Abstract要約: 大規模言語モデル(LLM)は複雑なマルチホップ問題を解くことができるが、単純な2ホップクエリではファズリングの失敗を示す。
LLMは、第2ホップがトレーニング分布に従えば確実に一般化するが、逸脱した場合は常に失敗することを示す。
本稿では,入力形式間での推論回路の再利用を可能にするリカレントスタイルのトレーニング戦略を提案する。
- 参考スコア(独自算出の注目度): 34.21928044036961
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) can solve complex multi-hop problems yet exhibit puzzling failures on simple two-hop queries: although a model may correctly store each individual hop, it often fails to combine them. To understand the internal mechanisms of this phenomenon, we train transformers from scratch in a controlled symbolic environment. Our experiments reveal a pattern in two-hop generalization: models generalize reliably when the second hop follows the training distribution, but always fail when it deviates. Through mechanistic analysis, we provide a complete explanation for these distinct generalization behaviors: in settings where models generalize successfully, performance is driven by the emergence of consistent intermediate representations for the same entities across contexts, whereas failures on settings where the second hop is out-of-distribution arise from a mismatch across layers: lower layers correctly construct these intermediate representations, but upper layers, while trained on corresponding atomic facts, primarily learn to map them to outputs rather than to reason over them. Driven by this insight, we propose a recurrent-style training strategy, which enables transformers to reuse their reasoning circuitry across input forms and substantially improves generalization on out-of-distribution two-hop queries.
- Abstract(参考訳): 大規模言語モデル(LLM)は複雑なマルチホップ問題を解くことができるが、単純な2ホップクエリではファズリングの失敗を示す。
この現象の内部メカニズムを理解するため、制御されたシンボル環境下でスクラッチからトランスフォーマーを訓練する。
モデルでは、第2ホップがトレーニング分布に従えば確実に一般化するが、それが逸脱した場合は常に失敗する。
メカニスティック分析を通じて、これらの異なる一般化の挙動について完全な説明を提供する: モデルが正常に一般化された場合、性能はコンテキストをまたいだ同じエンティティの一貫性のある中間表現の出現によって引き起こされるが、第2ホップが分布外であるような設定における失敗は層間のミスマッチから生じる: 下層はこれらの中間表現を正しく構成するが、上位層は対応する原子事実に基づいて訓練されているが、主にそれらについて推論するのではなく出力にマッピングすることを学ぶ。
そこで本研究では,入力形式間での推論回路の再利用を可能にする再帰型トレーニング戦略を提案し,分配外2ホップクエリの一般化を大幅に改善する。
関連論文リスト
- DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning [91.94042219655866]
大規模言語モデルは、Chain-of-Thought(CoT)として中間ステップの外部化を可能にすると、多くの推論タスクにおいて強力なパフォーマンスを達成する
我々は,この課題を,モデルが1つの前方パス内で複数の知識を構成しなければならない代表的タスクである2-ホップ推論を通じて研究する。
本稿では,個別の埋め込みチャネルと連続的な隠れ状態チャネルの両方を連続的に持つループアーキテクチャであるDiscoLoopを提案する。
論文 参考訳(メタデータ) (2026-07-01T02:32:02Z) - Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models [66.36240676392502]
CoT(Chain-of- Thought)推論は、LLM(Large Language Models)が複雑な問題を解決するための標準パラダイムとなっている。
近年の研究では、ホップ一般化シナリオの推論性能が急落している。
推論過程におけるEPヘッドを動的に識別・非活性化する軽量な介入法である推論の試験時間補正を提案する。
論文 参考訳(メタデータ) (2026-01-29T03:24:32Z) - Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models [26.603700269575025]
ブリッジエンティティは、後続のホップ応答の前に層間で逐次計算されることを示す。
本稿では,浅い層における広帯域リコールとしてマルチホップ推論をモデル化し,深い注意層における選択的抽出を行うフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T03:13:03Z) - How do Transformers Learn Implicit Reasoning? [67.02072851088637]
制御されたシンボリック環境下でトランスフォーマーをスクラッチからトレーニングすることで、暗黙のマルチホップ推論がどのように現れるかを研究する。
原子三重項によるトレーニングは必要ではなく学習を加速し,第2ホップの一般化は特定の構成構造へのクエリレベル露出に依存する。
論文 参考訳(メタデータ) (2025-05-29T17:02:49Z) - How Do LLMs Perform Two-Hop Reasoning in Context? [76.79936191530784]
2-ホップ推論(英: two-hop reasoning)とは、2つの論理的なステップで結論を導く過程を指す。
近年の大規模言語モデル(LLM)の進歩にもかかわらず、単純な2つのホップ推論の問題を解くのに失敗することは驚くほどある。
我々は、合成二脚推論タスクでスクラッチから3層トランスフォーマーを訓練し、内部情報の流れをリバースエンジニアリングする。
論文 参考訳(メタデータ) (2025-02-19T17:46:30Z) - In-Context Learning with Representations: Contextual Generalization of Trained Transformers [66.78052387054593]
In-context Learning (ICL) は、事前訓練された大規模言語モデルの能力を指し、推論中にいくつか例を挙げると、新しいタスクを学習できる。
本稿では,非線形回帰タスクのレンズによる勾配降下による変圧器のトレーニングダイナミクスについて検討する。
論文 参考訳(メタデータ) (2024-08-19T16:47:46Z) - Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization [22.033370572209744]
我々は、トランスフォーマーがパラメトリック知識よりも暗黙的に推論できるかどうかを研究する。
我々は2つの代表的な推論タイプ、構成と比較に焦点を当てる。
トランスフォーマーは暗黙の推論を学習できるが、それはグルーキングでしか学べない。
論文 参考訳(メタデータ) (2024-05-23T21:42:19Z) - Locate Then Ask: Interpretable Stepwise Reasoning for Multi-hop Question
Answering [71.49131159045811]
マルチホップ推論では、複雑な質問に答えるために複数の文書を集約する必要がある。
既存の方法は通常、マルチホップの質問を単純なシングルホップの質問に分解する。
そこで本研究では,単一ホップ支援文識別と単一ホップ質問生成の両方を組み込む,解釈可能な段階的推論フレームワークを提案する。
論文 参考訳(メタデータ) (2022-08-22T13:24:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。