論文の概要: Scaling Interpretable Transformers with Parity Bottleneck Layers
- arxiv url: http://arxiv.org/abs/2607.20652v1
- Date: Wed, 22 Jul 2026 18:25:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.188497
- Title: Scaling Interpretable Transformers with Parity Bottleneck Layers
- Title(参考訳): パリティボツネック層を用いた解釈可能変圧器のスケーリング
- Authors: Andrew Mack, Kraig Yuheng Tou, Mark Henry, Zhengxun Wu, Lauren Greenspan,
- Abstract要約: GPT-2スケールアーキテクチャを導入し、中間表現は設計によって効率的で広小である。
Deep Parity Bottleneck (DPB) は、学習されたオーバーコンプリート基底をパラメータフリー代数辞書に置き換える。
ParityTransformerの機能は、モデルフォワードがコンストラクションによって通過するのにネイティブであり、SAEsプローブが計算時に実際に使用する機能に対処する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are thought to exhibit the phenomenon of superposition, representing many more features than dimensions in their residual streams. Sparse autoencoders (SAEs) are designed to recover such features post-hoc, but training models that are interpretable by construction has remained impractical, as a per-layer over-complete bottleneck is prohibitively expensive in both memory and compute. To overcome this issue, we introduce the ParityTransformer, a GPT-2-scale architecture whose intermediate representations are efficient and wide / sparse by design. At each layer, a Deep Parity Bottleneck (DPB) replaces a learned over-complete basis with a parameter-free algebraic dictionary, providing a deterministic incoherence guarantee and eliminating the memory requirements that have prevented per-layer interpretable bottlenecks at scale. A DPB is a hierarchically structured sparse bottleneck which efficiently enforces sparsity using a multi-level mixture-of-experts approach: a hardware-aware implementation that closes the cost gap between activation sparse and dense training to a manageable interpretability tax. Empirically, ParityTransformers perform at least as well as post-hoc SAEs on sparse probing tasks, while out-performing on measures of feature absorption, steering effectiveness, and fine-grained causal interventions. Because subsequent computation acts only on features that survive the sparse bottleneck, the ParityTransformer's features are native to the model's forwards pass by construction, addressing the question of whether SAEs probe features the model actually uses during computation. We see this as a step toward training models whose internal representations are interpretable by design rather than recovered post hoc.
- Abstract(参考訳): 言語モデルは、その残留ストリームの次元よりも多くの特徴を表現し、重ね合わせの現象を示すと考えられている。
スパースオートエンコーダ(SAE)は、そのような特徴をポストホックで回復するために設計されているが、階層ごとのオーバーコンプリートボトルネックがメモリと計算の両方において違法に高価であるため、構築によって解釈可能なトレーニングモデルは実用的ではない。
本稿では,GPT-2スケールアーキテクチャであるParityTransformerを紹介する。
各層において、Deep Parity Bottleneck (DPB) は、学習された過剰な基礎をパラメータフリーな代数辞書に置き換え、決定論的不整合を保証するとともに、階層間の解釈可能なボトルネックを大規模に防止するメモリ要件を排除する。
DPBは階層的に構成されたスパースボトルネックであり、多段階のミックス・オブ・エキスパート・アプローチ(アクティベーションスパースと密集したトレーニングの間のコストギャップを埋めて管理可能な解釈可能性税(英語版)に効率よく適用するハードウェア・アウェアの実装である。
経験的には、ParityTransformerはスパース探索タスクにおいて、少なくともポストホットなSAEと同様に、機能吸収、ステアリングの有効性、きめ細かい因果介入の計測に優れる。
その後の計算はスパースボトルネックを乗り越える機能にのみ作用するため、ParityTransformerの機能はモデルフォワードにネイティブなものであり、計算中に実際にモデルが使用している機能にSAEsプローブが取り組むかどうかという問題に対処する。
これは、内部表現が復元されたポストホックではなく、設計によって解釈可能なモデルをトレーニングするためのステップであると考えています。
関連論文リスト
- Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs [18.457250148137494]
本稿では,既設の大規模言語モデルから深度スパースモデルへの変換を行う適応深度スパースフレームワーク(AdaDSF)を提案する。
GPT-NeoX と Qwen2.5 では、言語モデリングとコモンセンス推論について、AdaDSF は高密度の性能を保ちながら、推論FLOP を大幅に削減する。
論文 参考訳(メタデータ) (2026-07-23T13:13:04Z) - Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models [71.59431204970339]
STORMは空間対応のトークン還元フレームワークである。
空間単位上の構造演算に還元を再構成する。
様々なビジョンのMambaバックボーンにまたがって最先端のプルーニング精度を実現する。
論文 参考訳(メタデータ) (2026-06-18T08:31:11Z) - Variable-Width Transformers [57.07167443557886]
本稿では,$times$-shaped > former architectureを提案する。
我々の設計は、パラメータフリーの残留リサイズ機構を利用して、中間層を狭めながら、より広い早期層と後期層を維持している。
平均的な層幅を減らすことで、このアーキテクチャは全体のFLOPを少なくし、KVキャッシュメモリを小さくし、I/Oコストを削減できる。
論文 参考訳(メタデータ) (2026-06-16T17:59:03Z) - The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models [49.67598869075125]
自己回帰型言語モデリングにおいて、確率回路(PC)はTransformer-based large language model(LLM)より遅れている
構造化分解可能なPCは, 変圧器分離ランクをvtree整列パーティションに合わせることができるが, この容量は固定されたルーティング構造に整列したパーティションに限られる。
さらに、分解可能なPCは構造化された分解可能なPCよりも厳密に表現可能であることを証明していますが、効果的に最適化することはオープンな課題です。
論文 参考訳(メタデータ) (2026-05-13T03:22:10Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - FLAT-LLM: Fine-grained Low-rank Activation Space Transformation for Large Language Model Compression [15.784158079414235]
FLAT-LLMは、アクティベーション空間の微細な低ランク変換に基づく、トレーニング不要な構造圧縮手法である。
回復微調整なしで効率よく効果的な重量圧縮を実現し、数分でキャリブレーションを完了できる。
論文 参考訳(メタデータ) (2025-05-29T19:42:35Z) - Dynamic Context Pruning for Efficient and Interpretable Autoregressive Transformers [29.319666323947708]
本稿では,モデル表現性を保ちながら文脈情報を動的に生成する手法を提案する。
本手法では,文脈からどの非形式的トークンをドロップできるかを学習可能なメカニズムを用いて決定する。
我々の参照実装は、推論スループットの増大とメモリの節約を最大2ドルまで達成します。
論文 参考訳(メタデータ) (2023-05-25T07:39:41Z) - PnP-DETR: Towards Efficient Visual Analysis with Transformers [146.55679348493587]
近年、DeTRはトランスフォーマーを用いたソリューションビジョンタスクの先駆者であり、画像特徴マップを直接オブジェクト結果に変換する。
最近の変圧器を用いた画像認識モデルとTTは、一貫した効率向上を示す。
論文 参考訳(メタデータ) (2021-09-15T01:10:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。