論文の概要: Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention
- arxiv url: http://arxiv.org/abs/2608.04678v1
- Date: Wed, 05 Aug 2026 10:44:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.827869
- Title: Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention
- Title(参考訳): Kathleen氏の記事“Autoregressive Generation and Data Scaling without Attention”
- Authors: George Fountzoulas,
- Abstract要約: 我々は, 事前学習をせずに, 450-700Kパラメータの分類に基づく強いベースラインと, バイトレベルのアテンションフリーアーキテクチャを一致させることができることを示した。
我々は「テキストのように読む」ための非パラメトリックなゲーム抵抗楽器FORM DISTANCEを紹介する。
また,4つのアーキテクチャ追加が役に立たないことを報告し,その5分の1のパラメータで,学習テーブルのトップ1の精度の94%に達する計算辞書を作成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Papers 1-2 of the Kathleen series showed that a byte-level, attention-free architecture built from a wavetable encoder and multi-scale reverberant state can match strong baselines on classification at ~450-700K parameters, without pretraining. We ask whether the same ingredients can generate. (1) Scaling: on byte-level language modeling (WikiText-103, raw UTF-8, no tokenizer), the reverberant model beats a parameter-matched transformer at every dataset scale measured (2-512 MB), e.g. 1.84 vs 2.04 bits/byte at 512 MB with ~0.5M parameters; the transformer needs more than 512 MB to match what the attention-free model learns from 32 MB. (2) Measurement: we introduce FORM DISTANCE, a non-parametric, gaming-resistant instrument for "reads like text": nine statistical axes of human text define a reference cloud, and five constructed fakes are all rejected. (3) Generation: decoding policy dominates architecture -- widening the sampler halves the same model's distance (3.17 to 1.52), and a retrieval-augmented decoding scheme takes the frozen model further (1.52 to 1.14) with no training step involved; the ablation attributes the gain to the sparse phrase dose itself, not the selection gate. The gain has a sharp boundary condition: the phrases must come from the model's own training corpus -- a 40x larger foreign library helps not at all, an effect the attention twin shares, consistent with in-context integration being a capability of scale. We also report four architectural additions that did not help, and a computed lexicon reaching 94% of a learned table's top-1 accuracy at one fifth of the parameters. Everything runs offline; all experiments are reproducible on a free Kaggle T4.
- Abstract(参考訳): Kathleenシリーズのペーパー1-2は、波動可能なエンコーダとマルチスケールの残響状態から構築されたバイトレベルの無注意アーキテクチャが、事前トレーニングなしで450-700Kのパラメータの分類の強いベースラインと一致することを示した。
私たちは同じ材料が生成できるかどうか尋ねる。
1)バイトレベルの言語モデリング(WikiText-103,生UTF-8,無トークン化器)では,残響モデルが測定されたデータセットスケール毎にパラメータマッチング変換器(2~512MB),eg 1.84 vs 2.04bits/byteを0.5Mパラメータで512MB,アテンションフリーモデルが32MBから学習するものと一致させるために512MB以上を必要とする。
2)測度:本研究では,「テキストのように読む」ための非パラメトリックなゲーム抵抗楽器であるFORM DISTANCEを紹介した。
(3)デコードポリシがアーキテクチャを支配し、サンプルが同じモデルの距離を半減する(3.17〜1.52)とともに、検索強化デコードスキームは、トレーニングステップを伴わずに、凍結モデルをさらに(1.52〜1.14)進める。
フレーズはモデル自身のトレーニングコーパスから来なければならず、40倍大きな外国図書館は役に立たない。
また,4つのアーキテクチャ追加が役に立たないことを報告し,その5分の1のパラメータで,学習テーブルのトップ1の精度の94%に達する計算辞書を作成した。
すべての実験は無料のKaggle T4上で再現可能である。
関連論文リスト
- Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models [0.0]
2つの実験は、保持された汚染のない合成コーパス上の3つの因子全てを横断する。
実験1では,規則数Nが10から160に増加するにつれて,命令追従減衰を測定する。
実験2では, 2k-to-512k-tokenのコンテキストラグ上での精度, 虚偽の前提条件, ファクトファクトファクトファクチャリングの測定を行った。
論文 参考訳(メタデータ) (2026-07-21T16:31:35Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Bag of Dims: Training-Free Mechanistic Interpretability via Dimension-Level Sign Patterns [0.0]
我々は、すでにトレーニング不要でアーキテクチャ全般的な機能ベースを提供しているトランスフォーマー隠蔽状態の標準基底を示す。
このBag of Dimsフレームワークを、言語にまたがる7つのモデルで検証する。
論文 参考訳(メタデータ) (2026-06-10T19:34:31Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Compute Optimal Tokenization [79.3815358070537]
圧縮速度によって制御されるトークンの情報粒度がスケーリングの傾向にどのように影響するかを検討する。
所望の圧縮速度の設定を可能にする50Mから7Bパラメータまで,988の潜在トークン化モデル(BLT)を訓練する。
実験の結果, モデルパラメータは, 一般に認識されるトークンではなく, バイト単位のデータサイズに比例してスケールすることがわかった。
論文 参考訳(メタデータ) (2026-05-02T01:53:22Z) - Learning the Signature of Memorization in Autoregressive Language Models [3.6048665052465663]
我々は,任意のコーパス上の任意のモデルを微調整することで,ラベル付きデータを無制限に生成する,最初のトランスファー可能な学習攻撃を導入する。
これにより、シャドーモデルボトルネックが取り除かれ、深層学習時代へのメンバシップ推論がもたらされる。
論文 参考訳(メタデータ) (2026-04-03T17:17:51Z) - Trained Persistent Memory for Frozen Encoder--Decoder LLMs: Six Architectural Methods [0.0]
凍結した言語モデルにおける永続メモリは、厳しいリソース制約の下でも実現可能であることを示す。
3つのインジェクションポイントと4つの書き込みメカニズムにまたがる6つのアーキテクチャ手法を実装した。
我々は、大規模モデル、大規模データ、大規模メモリによる完全なエンドツーエンドトレーニングが、より強力な結果をもたらすと論じている。
論文 参考訳(メタデータ) (2026-03-17T11:51:21Z) - Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens [62.56027815951259]
現在のオーディオ言語モデルは、主にテキストファーストであり、事前訓練されたテキストLLMバックボーンを拡張するか、意味のみのオーディオトークンに依存する。
本稿では,大規模音声に次トーケン予測を適用したネイティブオーディオ基礎モデルの系統的研究を行った。
論文 参考訳(メタデータ) (2026-02-18T18:32:46Z) - TernaryLM: Memory-Efficient Language Modeling via Native 1-Bit Quantization with Adaptive Layer-wise Scaling [0.39287497907611874]
本稿では, ネイティブな1ビット3次量子化 -1, 0, +1 を用いた 132M パラメータトランスフォーマアーキテクチャである TernaryLM を提案する。
この結果から,ネイティブな1ビットトレーニングが,効率的なニューラルネットワークモデルにとって有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-02-07T05:35:17Z) - Differentiable Model Compression via Pseudo Quantization Noise [99.89011673907814]
本稿では,モデルパラメータに独立な擬似量子化雑音を加えて量子化演算子の効果を近似する。
本手法が,画像分類,言語モデリング,音声ソース分離などのベンチマークやアーキテクチャにおいて,最先端の量子化技術を上回ることを実験的に検証した。
論文 参考訳(メタデータ) (2021-04-20T14:14:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。