論文の概要: Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting
- arxiv url: http://arxiv.org/abs/2608.27339v2
- Date: Mon, 31 Aug 2026 12:02:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.308858
- Title: Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting
- Title(参考訳): 並列盲点を超えて - ブロック描画における情報フローとモデルギャップ
- Abstract要約: ブロックのドラフトアは、前のターゲットトークンが実現する前に、1つのフォワードパスでいくつかのトークンを提案します。
彼らの拒絶は2つの損失を混合する: ブロック内パス情報不足と観測可能な情報の完全なモデリングである。
我々は2つを情報フロアで分離し、指定された条件付き順序で最小限の拒絶を期待する。
4つのドメインにわたるターゲットロールアウトと4つのオープンウェイトターゲット、フロンティアAPIターゲットから両方を推定すると、3つの結果が得られます。
- 参考スコア(独自算出の注目度): 25.736847957620185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Block drafters propose several tokens in one forward pass, before earlier target tokens are realised. Their rejection mixes two losses: missing within-block path information and imperfect modelling of observable information. Accepted length cannot distinguish them. We separate the two with an information floor, the minimum expected rejection at a specified conditioning order; rejection above this floor is the model gap. Estimating both from target rollouts across four domains, four open-weight targets, and a frontier API target yields three findings. First, the all-parallel floor reaches $0.286$ at the final slot on Qwen3-4B, limiting even the best proposal to $71\%$ per-slot acceptance. Second, one realised token removes $86$--$100\%$ of this floor, a locality also recovered by an independent mutual-information analysis. Third, current drafters remain far above their floors: the final-slot model gap accounts for $43$--$64\%$ of DFlash rejection and $85$--$92\%$ of DSpark's oracle-conditioned rejection. These findings separate the value of short-range conditioning from proposal quality.
- Abstract(参考訳): ブロックのドラフトアは、前のターゲットトークンが実現する前に、1つのフォワードパスでいくつかのトークンを提案します。
彼らの拒絶は2つの損失を混合する: ブロック内パス情報不足と観測可能な情報の完全なモデリングである。
長さは区別できない。
我々はこれら2つを、所定の条件付き順序で最小限の期待された拒絶である情報フロアで分離し、このフロアの上の拒絶はモデルギャップである。
4つのドメインにわたるターゲットロールアウトと4つのオープンウェイトターゲット、フロンティアAPIターゲットから両方を推定すると、3つの結果が得られます。
まず、Qwen3-4Bの最終スロットで全並列フロアが0.286ドルに達し、最高の提案でさえスロット毎の受け入れが711\%に制限される。
第二に、実現したトークンは、このフロアから86$--100\%の値を取り除き、独立な相互情報分析によって局所性も回復する。
最終スロットモデルギャップは43$--$64\%のDFlash拒絶と85$--$92\%のDSparkのオラクル条件の拒絶である。
これらの知見は、短距離条件付けの価値と提案品質を区別するものである。
関連論文リスト
- Variable-Granularity Tokenization for High-Resolution Object Detection [0.0]
ViT検出器は、学習ステージの前に均一なトークングリッドを固定する。
エンコーダより前の画素から各領域ごとのパッチ粒度を設定できる,トレーニングフリーなトークンライザであるVGTokを紹介する。
論文 参考訳(メタデータ) (2026-08-27T18:39:32Z) - Certify or Refuse: A Cross-Model Map for Selective Risk Control with Coverage Floors under Covariate Shift [4.621071191322703]
自動化フロアを導入することで、選択的な予測者が達成したカバレッジを達成できることを示します。
認証は実行可能性フロンティアと2リソースの複雑性マップを取得し、定数まで加算する。
レートは局所的であり、レギュラーフロンティアマージン、局所登録閾値以下、格子条件を必要とする。
論文 参考訳(メタデータ) (2026-08-11T13:10:55Z) - Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation [9.526730541200038]
我々は,Block Sparse Flash Attention (BSFA)ルートが4つのアーキテクチャをまたいだリプレイによって16セル中13セルの出力決定が変化することを示す。
次に、マッチングされたプローブカードを用いて、密閉された偽物監査を導入する。
ブロックIDを公開する任意のモデルにデプロイ可能なオープンな測定フレームワークを提供する。
論文 参考訳(メタデータ) (2026-08-03T04:12:02Z) - Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware [0.0]
大規模言語モデルのシングルストリーム自動回帰復号化は、メモリ帯域幅によって制限される。
小さなドラフトモデルは、自動回帰的に$K$トークンを提案し、ターゲットモデルは、これらすべてを1回のバッチパスでスコアする。
本稿では、CUDA/MPS/CPUの実装と、5つのドラフト/ターゲットバックエンド構成に関する実証的研究を紹介する。
論文 参考訳(メタデータ) (2026-07-19T15:01:35Z) - More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning [54.65906330923846]
対象中心のスロット表現は、事前学習された視覚モデルに代わる構造化された代替物であることを示す。
トークンの16倍の高密度なパッチグリッドは、グローバル機能に匹敵するパフォーマンスはない。
明示的な2D空間目標とネイティブ解像度レンダリングにより、全システムは68.7$pm$4.2%まで上昇し、特権付き3Dオーラクルの上界の直ぐ下にある。
論文 参考訳(メタデータ) (2026-07-10T10:35:24Z) - Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters [3.9513930662588863]
ブロック(DLMスタイル)のドラフトラは、全ブロックを並列に予測し、高速だがフルブロックのクロスエントロピーでトレーニングする。
最近の受け入れ認識の目的は、全ブロック損失を再重み付けすることで、この問題に対処する。
AUFは、ドラフト作成者が最初に予測した失敗を通してのみ、クロスエントロピーのサポートを維持することで、損失側のプレフィックスセンシティブな監視を近似する。
論文 参考訳(メタデータ) (2026-07-02T08:44:04Z) - Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation [0.0]
言語モデルのロールアウトにおいて、どのトークンが最終回答が正しいか間違っているかを尋ねる。
我々は、この仮定がストック推論エンジンのコストを3パスの設計で測定する。
6つの構成と3つのモデルにまたがって、リフィーディングはレプリカフロアよりも14-28ポイント高いレートでクレジットの見積もりを変更する。
論文 参考訳(メタデータ) (2026-06-14T06:09:16Z) - Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Borda Regret Minimization for Generalized Linear Dueling Bandits [65.09919504862496]
本稿では,ボルダスコアが最も高い項目を識別することを目的とした,デュエルバンディットに対するボルダ後悔最小化問題について検討する。
本稿では,多くの既存モデルをカバーする一般化線形デュエルバンドモデルのリッチクラスを提案する。
我々のアルゴリズムは$tildeO(d2/3 T2/3)$ regretを達成し、これも最適である。
論文 参考訳(メタデータ) (2023-03-15T17:59:27Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。