論文の概要: Legible-by-Construction: Attention and End-to-End Transformers
- arxiv url: http://arxiv.org/abs/2607.04319v1
- Date: Sun, 05 Jul 2026 14:08:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.889889
- Title: Legible-by-Construction: Attention and End-to-End Transformers
- Title(参考訳): リーチブル・バイ・コンストラクション:注意とエンド・ツー・エンド・トランス
- Abstract要約: トランスのフィードフォワード層は明示的なファジィ集合演算から再構築することができる。
隠れたユニットは言語モデルの品質を犠牲にすることなく、名前付き論理演算子として読み上げられた。
125Mパラメータの5つの特別なアテンション設計において、44から62%の値チャネルが正当性を持つ。
- 参考スコア(独自算出の注目度): 0.2663471820643486
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A companion paper showed that a transformer's feed-forward layer can be rebuilt from explicit fuzzy set operations - intersection, set-difference, and a self-forgetting sequence quantifier - so its hidden units read as named logical operators at no cost to language-model quality. That left the other half of the transformer opaque. Here we carry the same idea into attention and join the two into one model. The mechanism is minimal: a head's value is passed through a sigmoid, so each value channel becomes a readable detector of whether a feature holds at a token. This adds no parameters and leaves the standard head otherwise untouched. A Boolean variant goes further, restructuring the value into an explicit within-token intersection and negation-capable set-difference. In both designs the output projection is left free, not tied to the vocabulary, which is the load-bearing decision: bounding what a head detects while leaving what it writes unconstrained yields selective detectors, whereas constraining the write does not. A bounded value is shaped into a readable detector by two selectivity pressures - one for sparse firing, one for decisive firing at the rails - and which a design wants is not universal. Across five specialized-attention designs at 125M parameters, 44 to 62 percent of value channels become crisp, contextually selective detectors, and their legibility rises with depth rather than crystallizing only on punctuation. Language-model quality is at parity with a conventional baseline. Finally, we couple the Boolean attention to the legible feed-forward layer and train an end-to-end legible-by-construction language model at benchmark parity: its feed-forward units are named set and quantifier operations throughout, and we can take a token it generates and read the named units that compose to produce it.
- Abstract(参考訳): コンパニオンペーパーでは、トランスフォーマーのフィードフォワード層が、交叉、セットディファレンス、自己鍛造シーケンス量化器といった明示的なファジィ集合演算から再構築可能であることを示し、その隠れたユニットは言語モデルの品質を犠牲にすることなく、名前付き論理演算子として読み取ることができた。
それは変圧器の残り半分を不透明にした。
ここでは、同じアイデアを注目し、2つを1つのモデルにまとめます。
このメカニズムは最小限であり、ヘッドの値はシグモノイドを通して渡されるので、各値チャネルは、ある機能がトークンを保持するかどうかの読み取り可能な検出器となる。
これはパラメータを追加せず、標準のヘッドをそのままにしておきます。
ブール変種はさらに進み、値を明示的な内包交叉と否定可能な集合差分に再構成する。
両方の設計では、出力プロジェクションは自由で、語彙とは結びついておらず、これは負荷を伴わない決定である。
境界値は2つの選択性圧力(1つはスパース発射用、もう1つはレールへの決定的な射撃用)で読み取り可能な検出器に形成され、設計が望むものは普遍的ではない。
125Mパラメータの5つの特別注意設計のうち、44から62%の値チャネルは鮮明で文脈的に選択的な検出器となり、その可視性は句読のみを結晶化するよりも深度で上昇する。
言語モデルの品質は、従来のベースラインと同等です。
最後に、Booleanの注意を正反対のフィードフォワード層に向け、ベンチマークパリティでエンドツーエンドのリーチバイコンストラクション言語モデルをトレーニングします。
関連論文リスト
- StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems [35.74603358195608]
本稿では,送信者の隠れ状態と受信者の入力空間をクローズドフォーム変換により整列する訓練不要の潜時通信手法を提案する。
StateBridgeは26組のモデル・タスク・ペアのうち22組でベストまたはタイト・ベストのスコアを獲得している。
論文 参考訳(メタデータ) (2026-08-13T14:40:59Z) - Training, Reading, and Editing Legible Transformers [0.2663471820643486]
トランスは、建設によって可視な演算子から構築することができる。
悪質なペナルティは、有界作用素を決定的検出器に鋭くすることを意味し、代わりにデッド定数に崩壊させる。
単位単位当たりの学習分画は、前処理のハンドセットリザーブド-GELUパーティションをリタイアする。
論文 参考訳(メタデータ) (2026-07-09T21:15:40Z) - Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors [0.2663471820643486]
NC-FFNはGELUベースラインのパープレキシティを結び、各ユニットは明示的な論理形式を持つ。
どちらも、シーケンス量子化器の小さなブロックで解決する。
その結果、パラメータニュートラルな言語モデル品質トランスが実現した。
論文 参考訳(メタデータ) (2026-06-30T15:46:27Z) - The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems [0.0]
この論文は、好奇心から不合理性の結果を設計規則に変える。
そのフラッグシップとなる結果は、アーキテクチャだけで設定された精度の高い天井を証明している。
同じ引数がサブフィールドにまたがって再キャストされる。
論文 参考訳(メタデータ) (2026-05-21T20:48:35Z) - Direct Semantic Communication Between Large Language Models via Vector Translation [3.81908263930559]
大規模言語モデル(LLM)は、メッセージをプレーントークンとして渡すことで、最も遅延したセマンティクスを破棄する。
我々は、直接意味交換を可能にする学習されたマッピングを用いて、ベクトル変換を介して潜時ブリッジを形成する。
論文 参考訳(メタデータ) (2025-11-06T00:43:29Z) - Semantic Fusion with Fuzzy-Membership Features for Controllable Language Modelling [0.0]
意味融合は、トランスフォーマー言語モデル(LM)をファジィメンバーシップ機能チャネルで拡張する軽量なスキームである。
それぞれのトークンは解釈可能な特徴のベクトルで表され、値が微分可能なメンバシップ関数から次数になる。
このアプローチは、小さなオーバーヘッドのみを追加し、接続された入出力埋め込みと完全に互換性を持ち、条件付き自然言語生成のための解釈可能な経路を提供する。
論文 参考訳(メタデータ) (2025-09-14T22:11:09Z) - Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective [50.261681681643076]
本稿では,SemVarEffectとSemVarBenchというベンチマークを用いて,テキスト・画像合成における入力のセマンティックな変化と出力の因果性を評価する。
本研究は,T2I合成コミュニティによるヒューマンインストラクション理解の探索を促進する効果的な評価枠組みを確立する。
論文 参考訳(メタデータ) (2024-10-14T08:45:35Z) - Activation Scaling for Steering and Interpreting Language Models [55.59689963561315]
モデルにうまく介入することは、内部の動作を解釈するための前提条件である、と我々は主張する。
成功した介入は、間違ったトークンで正しいことを正し、その逆を正すべきである。
勾配に基づく最適化を用いることで、特定の種類の効率的かつ解釈可能な介入を学習(そして後で評価)することができる。
論文 参考訳(メタデータ) (2024-10-07T12:01:32Z) - Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
We present MELLE, a novel continuous-valued token based language modeling approach for text-to-speech synthesis (TTS)。
MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
MELLEは、サンプリングベクトル量子化符号の固有の欠陥を回避し、ロバスト性問題を緩和する。
論文 参考訳(メタデータ) (2024-07-11T14:36:53Z) - Shapley Head Pruning: Identifying and Removing Interference in
Multilingual Transformers [54.4919139401528]
言語固有のパラメータを識別・解析することで干渉を減らすことができることを示す。
固定モデルから同定された注目ヘッドを除去することで、文分類と構造予測の両方において、ターゲット言語の性能が向上することを示す。
論文 参考訳(メタデータ) (2022-10-11T18:11:37Z) - Fast End-to-End Speech Recognition via a Non-Autoregressive Model and
Cross-Modal Knowledge Transferring from BERT [72.93855288283059]
LASO (Listen Attentively, and Spell Once) と呼ばれる非自動回帰音声認識モデルを提案する。
モデルは、エンコーダ、デコーダ、および位置依存集合体(PDS)からなる。
論文 参考訳(メタデータ) (2021-02-15T15:18:59Z) - Improve Variational Autoencoder for Text Generationwith Discrete Latent
Bottleneck [52.08901549360262]
変分オートエンコーダ(VAE)は、エンドツーエンドの表現学習において必須のツールである。
VAEは強い自己回帰デコーダで潜伏変数を無視する傾向がある。
よりコンパクトな潜在空間において暗黙的な潜在特徴マッチングを強制する原理的アプローチを提案する。
論文 参考訳(メタデータ) (2020-04-22T14:41:37Z) - Stacked DeBERT: All Attention in Incomplete Data for Text Classification [8.900866276512364]
変換器から双方向表現を重畳するスタックドデノナイズ(Stacked Denoising Bidirectional Representations)を提案する。
本モデルでは, 感情や意図の分類作業において, 音声テキスト誤りのあるツイートやテキストに現れる非公式/不正テキストにおいて, F1スコアが向上し, 堅牢性が向上したことを示す。
論文 参考訳(メタデータ) (2020-01-01T04:49:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。