論文の概要: The Token Before the Value Is the Key: How Hybrid Architectures Organize Induction Circuits
- arxiv url: http://arxiv.org/abs/2609.15545v2
- Date: Tue, 15 Sep 2026 10:47:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.098582
- Title: The Token Before the Value Is the Key: How Hybrid Architectures Organize Induction Circuits
- Title(参考訳): 価値が鍵になる前のトークン:ハイブリッドアーキテクチャが誘導回路をいかに組織化するか
- Abstract要約: ハイブリッド言語モデルは、能力と効率性を改善することができる。
本研究は,事前情報収集,コンテンツごとのソースマッチング,その価値のコピーの確立した帰納的役割について検討する。
本稿では,共通ブロック更新インタフェースを通じてキャリングとマッチングを追跡する層型非依存のペアプローブを提案する。
- 参考スコア(独自算出の注目度): 20.492487157353004
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hybrid language models can improve capability as well as efficiency, raising the question of how architectural complementarity becomes learned computation. We examine the established induction roles of Carrying predecessor information, Matching a source by content, and Copying its value. How are these position-sensitive and content-based computations allocated across heterogeneous layers? We introduce layer-type-agnostic paired probes that track Carrying and Matching through a common block-update interface. In recurrent--global and local--global hybrids, Carrying concentrates in efficient layers and Matching in global receivers. The measured local contribution concentrates on lag one: the token immediately before the historical value. Changing predecessor support through lag-one masking, convolution removal, or early learning-rate reduction can relocate Carrying and Matching between stages. Source-key restoration and fixed-value selection trace the receiver's dependence on the prepared source. These interventions also change natural-text recall, with outcomes depending on configuration and target. Varying local windows and induction-enriched training text changes the early development of functional Carrying and Matching, connecting architectural priors and training evidence to formation timing. Together, the probes and interventions shift the explanatory focus upstream: the organization of Matching follows how Carrying is learned. The token before the value provides a concrete link between a hybrid's architecture, circuit development, and recall. Code is available in https://github.com/ckpassenger/bind-match-copy/tree/main.
- Abstract(参考訳): ハイブリッド言語モデルは、性能と効率を向上し、アーキテクチャの相補性がどのように学習された計算になるかという疑問を提起する。
本研究は,事前情報収集,コンテンツごとのソースマッチング,その価値のコピーの確立した帰納的役割について検討する。
これらの位置感性とコンテンツに基づく計算は、不均一層にどのように割り当てられているか?
本稿では,共通ブロック更新インタフェースを通じてキャリングとマッチングを追跡する層型非依存のペアプローブを提案する。
リカレント-グロバルとローカル-グロバルハイブリッドでは、キャリングは効率的な層とグローバルレシーバーのマッチングに集中している。
測定されたローカルコントリビューションは、ラグ1 – 歴史的価値の直前のトークン – に集中している。
ラグワンマスキング、畳み込み除去、早期学習率の削減による前者のサポートの変更は、ステージ間でのキャリアとマッチングを移動させる可能性がある。
ソースキーの復元と固定値の選択は、レシーバが準備されたソースに依存することをトレースする。
これらの介入は、設定やターゲットに応じて結果とともに、自然文のリコールも変更する。
ローカルウィンドウのバリアリングと誘導リッチなトレーニングテキストは、機能的なキャリングとマッチングの初期の開発を変更し、アーキテクチャの事前とトレーニングエビデンスを形成タイミングに接続する。
調査と介入は共に、説明的焦点を上流へとシフトさせ、マッチングの組織は、キャリーリングがどのように学習されるかに従う。
値の前のトークンは、ハイブリッドアーキテクチャ、回路開発、リコールの間の具体的なリンクを提供する。
コードはhttps://github.com/ckpassenger/bind-match-copy/tree/mainで公開されている。
関連論文リスト
- AGI Maze Prediction Datasets: A Compact Benchmark for Learning World Dynamics with Transformers [0.0]
AGI Maze予測データセットとベンチマークを紹介する。
ベンチマークには、ステップごとの遷移予測、固定水平状態予測、シーケンシャルテキスト保存予測が含まれる。
その結果、構造化されたタスクアラインなワーキングメモリは、追加の潜在能力よりも有用であることが示唆された。
論文 参考訳(メタデータ) (2026-09-02T09:15:33Z) - Unifying Graph Neural Networks Through a Common Layer Equation [75.88127999406392]
7つのコンポーネントを通して被覆されたアーキテクチャを表現する共通層方程式を導入する。
中央の因子化は、伝達銀行によってエンコードされた情報と、メッセージマップによってエンコードされた動きとを分離する。
この統合を明確化し、標準層とコンポーネント割り当ての作業的削減を通じて、チェック可能にする。
論文 参考訳(メタデータ) (2026-08-17T04:37:59Z) - Cross-Sample Relational Fusion: Unifying Domain Generalization and Class-Incremental Learning [83.67663266193308]
CIL(Class-Incremental Learning)は、学習システムにおいて、それまでの知識を維持しつつ、新しいクラスを学ぶことを必要とする。
自動運転車のような現実のシナリオでは、晴れた日に都市部の道路で訓練されたシステムは、後に農村部や高速道路環境で運用する必要がある。
ドメインシフトと破滅的な忘れを同時に解決する統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-09T09:49:13Z) - Dual Consolidation for Pre-Trained Model-Based Domain-Incremental Learning [64.1745161657794]
ドメイン・インクリメンタル・ラーニング(ドメイン・インクリメンタル・ラーニング、ドメイン・インクリメンタル・ラーニング、ドメイン・インクリメンタル・ラーニング、ドメイン・インクリメンタル・ラーニング、Domain-Incremental Learning、DIL)は、異なるドメインにまたがる新しい概念へのモデルの漸進的な適応を含む。
プレトレーニングモデルの最近の進歩は、DILの確かな基盤を提供する。
しかし、新しい概念を学ぶことは、しばしば、事前訓練された知識を破滅的に忘れてしまう。
本稿では,歴史的知識の統一と統合を図るために,デュアルコンソリデータティオン(ドゥクト)を提案する。
論文 参考訳(メタデータ) (2024-10-01T17:58:06Z) - Dual-Path Adversarial Lifting for Domain Shift Correction in Online Test-time Adaptation [59.18151483767509]
テスト時間適応におけるドメインシフト補正のためのデュアルパストークンリフトを導入する。
次に、インターリーブされたトークン予測とドメインシフトトークンのパスとクラストークンのパスの間の更新を行う。
評価実験の結果,提案手法はオンライン完全テスト時間領域適応性能を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2024-08-26T02:33:47Z) - Evolutionary Neural Architecture Search for Transformer in Knowledge
Tracing [8.779571123401185]
本稿では,入力特徴選択を自動化する進化的ニューラルアーキテクチャ探索手法を提案し,ローカル・グローバル・コンテキスト・モデリングのバランシングを実現するためにどの操作を適用すべきかを自動決定する。
2つの最大かつ最も困難な教育データセットの実験結果は、提案手法によって発見されたアーキテクチャの有効性を実証している。
論文 参考訳(メタデータ) (2023-10-02T13:19:33Z) - Deepfake Detection via Joint Unsupervised Reconstruction and Supervised
Classification [25.84902508816679]
本稿では,再建作業と分類作業を同時に行うディープフェイク検出手法を提案する。
この方法は、あるタスクによって学習された情報を他のタスクと共有する。
提案手法は,一般的に使用されている3つのデータセットに対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-11-24T05:44:26Z) - Consistency Learning via Decoding Path Augmentation for Transformers in
Human Object Interaction Detection [11.928724924319138]
変換器のHOI検出を改善するために,クロスパス整合性学習(CPC)を提案する。
提案手法の有効性を実証し, V-COCO, HICO-DETを改良した。
論文 参考訳(メタデータ) (2022-04-11T02:45:00Z) - Robust Person Re-Identification through Contextual Mutual Boosting [77.1976737965566]
本研究では,歩行者の局地化を目的としたコンテキスト相互ブースティングネットワーク(CMBN)を提案する。
歩行者をローカライズし、文脈情報と統計的推測を効果的に活用することで特徴を再検討する。
ベンチマークの実験は、最先端のアーキテクチャと比較してアーキテクチャの優位性を示している。
論文 参考訳(メタデータ) (2020-09-16T06:33:35Z) - Auto-Encoding Twin-Bottleneck Hashing [141.5378966676885]
本稿では,効率よく適応的なコード駆動グラフを提案する。
自動エンコーダのコンテキストでデコードすることで更新される。
ベンチマークデータセットの実験は、最先端のハッシュ手法よりもフレームワークの方が優れていることを明らかに示しています。
論文 参考訳(メタデータ) (2020-02-27T05:58:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。