論文の概要: Training, Reading, and Editing Legible Transformers
- arxiv url: http://arxiv.org/abs/2607.08946v1
- Date: Thu, 09 Jul 2026 21:15:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.740363
- Title: Training, Reading, and Editing Legible Transformers
- Title(参考訳): 可読変換器の学習・読解・編集
- Abstract要約: トランスは、建設によって可視な演算子から構築することができる。
悪質なペナルティは、有界作用素を決定的検出器に鋭くすることを意味し、代わりにデッド定数に崩壊させる。
単位単位当たりの学習分画は、前処理のハンドセットリザーブド-GELUパーティションをリタイアする。
- 参考スコア(独自算出の注目度): 0.2663471820643486
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A transformer can be built from operators that are legible by construction -- bounded, named units that read as fuzzy set operations rather than dense activations -- but legibility must be pressed for during training, and the pressure has a failure mode. A crispness penalty meant to sharpen a bounded operator into a decisive detector instead collapses it into a dead constant. An identity, E[v(1-v)] = mu(1-mu) - var, shows why -- the penalty is a variance-minimizer blind to the difference between a live detector and a constant -- and names the fix: a per-channel variance floor, the target legibility metric written as a loss, which recovers both legibility and quality. A learned per-unit fraction then retires the hand-set reserved-GELU partition of prior work: given the choice the model keeps no unit as pure GELU and routes 87% of its load-bearing computation through crisp operators. The result is the most legible transformer we have built -- 78% of its feed-forward operands and 50% of its attention value channels are crisp-and-contextual detectors, and per-head legibility rises from 18% in shallow layers to 78% in deep ones. Read in the correct rotated per-layer frame, these units separate a clean detection (what a unit responds to) from a harder naming (what its output decodes to); and because the objective makes each unit crisp and sparse, edits to them are far more local -- 50-184x in the deep layers where the edit sites concentrate -- and can target explicit conjunctions a single neuron cannot express. Finally, a between-unit decorrelation pressure exposes a legibility dial: it trades a circuit's reuse for independence at no quality cost, turning concepts into single, surgically editable units and a prediction into a short explanation read off a handful of named operations. Quality holds at parity with a conventional baseline throughout.
- Abstract(参考訳): トランスは、高密度なアクティベーションではなくファジィセット操作として読み上げられる、有界で名前のついた演算子から構築できるが、訓練中は正当性を押し付けなければならず、圧力は故障モードを持つ。
悪質なペナルティは、有界作用素を決定的検出器に鋭くすることを意味し、代わりにデッド定数に崩壊させる。
E[v(1-v)] = mu(1-mu) - var は、ライブ検出器と定数の違いを無視する分散最小化器である理由を示し、その修正を名前付けている。
モデルが純粋なGELUとして単位を保持していないことを考慮し、負荷分散計算の87%をcrisp演算子にルーティングする。
その結果、私たちが構築した最も信頼性の高いトランスフォーマーであり、フィードフォワードオペランドの78%、注目値チャネルの50%はクロップ・アンド・コンテクスチュアルな検出器であり、頭ごとの可視性は浅い層では18%から深い層では78%に上昇する。
これらのユニットは、正しいローテーションされた層ごとのフレームを読み取ると、クリーンな検出(ユニットが応答するもの)と、より難しい命名(その出力がデコードしたもの)を分離する。
最後に、ユニット間のデコリレーション圧力は、回路の再利用を品質の犠牲なしに独立に交換し、概念を単一の、外科的に編集可能なユニットにし、予測をいくつかの名前付き操作から読み取った短い説明に変換するという、正当性ダイアルを露呈する。
品質は従来のベースラインと同等である。
関連論文リスト
- Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Legible-by-Construction: Attention and End-to-End Transformers [0.2663471820643486]
トランスのフィードフォワード層は明示的なファジィ集合演算から再構築することができる。
隠れたユニットは言語モデルの品質を犠牲にすることなく、名前付き論理演算子として読み上げられた。
125Mパラメータの5つの特別なアテンション設計において、44から62%の値チャネルが正当性を持つ。
論文 参考訳(メタデータ) (2026-07-05T14:08:59Z) - Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits [47.668752416295185]
条件付き共アブレーションは、各単位のアブレーション効果が一次集合が取り除かれたときにどれだけ増大するかを問う。
GPT-2の小型IOI回路では、CoAxはバックアップヘッドのリカバリを0.33から0.91 ROC-AUCに引き上げる。
論文 参考訳(メタデータ) (2026-07-02T09:32:57Z) - Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors [0.2663471820643486]
NC-FFNはGELUベースラインのパープレキシティを結び、各ユニットは明示的な論理形式を持つ。
どちらも、シーケンス量子化器の小さなブロックで解決する。
その結果、パラメータニュートラルな言語モデル品質トランスが実現した。
論文 参考訳(メタデータ) (2026-06-30T15:46:27Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Transformers Can Learn Rules They've Never Seen: Proof of Computation Beyond Interpolation [0.0]
2つの制御された設定で強みのみの仮説をテストする。
実験1では、純粋なXOR遷移規則を持つセルオートマトンを用いる。
実験2では、整数上のシンボリック作用素鎖を1つの作用素対が持ち上がった状態で研究する。
論文 参考訳(メタデータ) (2026-03-17T18:02:28Z) - To Throw a Stone with Six Birds: On Agents and Agenthood [0.0]
Six Birds Theory (SBT)は、マクロな物体を原始体ではなく誘導的閉包として扱う。
SBT内では,タイプ正当性評価を行う。
我々はこの契約を4つのチェック可能なコンポーネントを用いて有限制御システムで運用する。
論文 参考訳(メタデータ) (2026-02-03T10:46:23Z) - GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features [68.14842693208465]
GeneralADは、意味的、ほぼ分布的、産業的設定で動作するように設計された異常検出フレームワークである。
本稿では,ノイズ付加やシャッフルなどの簡単な操作を施した自己教師付き異常生成モジュールを提案する。
提案手法を10のデータセットに対して広範囲に評価し,6つの実験結果と,残りの6つの実験結果を得た。
論文 参考訳(メタデータ) (2024-07-17T09:27:41Z) - Mapping of attention mechanisms to a generalized Potts model [50.91742043564049]
ニューラルネットワークのトレーニングは、いわゆる擬似様相法によって逆ポッツ問題を解くのと全く同じであることを示す。
また、レプリカ法を用いてモデルシナリオにおける自己意図の一般化誤差を解析的に計算する。
論文 参考訳(メタデータ) (2023-04-14T16:32:56Z) - HEAT: Hardware-Efficient Automatic Tensor Decomposition for Transformer
Compression [69.36555801766762]
本稿では,分解可能な指数空間を効率的に探索できるハードウェア対応テンソル分解フレームワークHEATを提案する。
ハードウェア対応のBERT変異体は, エネルギー遅延を5.7倍に低減し, 精度が1.1%以下であることを示す。
論文 参考訳(メタデータ) (2022-11-30T05:31:45Z) - Delta Keyword Transformer: Bringing Transformers to the Edge through
Dynamically Pruned Multi-Head Self-Attention [4.925939498983408]
マルチヘッド自己アテンションはトランスフォーマーネットワークのコアを形成する。
本稿では,トークン間のデータの時間的安定性を利用して推論コストを削減する動的プルーニング手法を提案する。
実験の結果,元の98.4%の精度を維持しながら80%の操作を削減できることがわかった。
論文 参考訳(メタデータ) (2022-03-20T20:59:13Z) - Fault-tolerant parity readout on a shuttling-based trapped-ion quantum
computer [64.47265213752996]
耐故障性ウェイト4パリティチェック測定方式を実験的に実証した。
フラグ条件パリティ測定の単発忠実度は93.2(2)%である。
このスキームは、安定化器量子誤り訂正プロトコルの幅広いクラスにおいて必須な構成要素である。
論文 参考訳(メタデータ) (2021-07-13T20:08:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。