論文の概要: Breaking the Space Barrier and its Application to Language Model Inference
- arxiv url: http://arxiv.org/abs/2610.09139v1
- Date: Tue, 06 Oct 2026 21:29:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.614025
- Title: Breaking the Space Barrier and its Application to Language Model Inference
- Title(参考訳): 空間障壁を破るとその言語モデル推論への応用
- Abstract要約: 機械は、それを破るトークンを禁止して構造化された出力を強制する。
Qwen3.5-2Bと4Bの16GBのApple M2 Proでは、lguidanceのMLXに対して、このハードウェアの標準設定であるスキーマ制約抽出は同じ答えで1.2-1.3倍早く終了する。
あるサーバでは、テーブルがメモリを使い果たした16の文法を持ち、16のツール呼び出しエージェントは2.5倍早く終了する。
- 参考スコア(独自算出の注目度): 2.8766374696553823
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are more and more often asked for structured output: JSON that follows a schema, or a tool call with typed arguments. A small machine, an automaton, enforces the format by forbidding the tokens that would break it. We observe that this machine has a rare property: from any of its states, each token leads along exactly one path. Graphs in which only a few paths join any two points are a classical object of complexity theory, and our theoretical result settles an open question about them: one can decide whether such a graph connects two points while verifying that it really has few paths, with very little memory. Precisely, the problem lies in the classes ReachUL, LOGDCFL, C=L and SC2, and needs only O(log2 n/ log log n) space, below the classical O(log2 n) of Savitch's theorem. The constructions behind the proofs become an inference engine: text the format forces is written without running the model, the mask is recomputed on the GPU without any table, recursive formats use a small stack, every output stays valid under a token limit, and independent fields are decoded in parallel and verified. On one 16 GB Apple M2 Pro with Qwen3.5-2B and 4B, against MLX with llguidance, the standard setup for this hardware, schema-constrained extraction finishes 1.2- 1.3x sooner with the same answers, a grammar costs 3 MB instead of up to 1.5 GB, one server holds sixteen grammars where tables run out of memory, and sixteen tool-calling agents finish 2.5x sooner.
- Abstract(参考訳): 言語モデルは、スキーマに従うJSONや、型付き引数を持つツールコールといった、構造化された出力を求めることが多い。
小さなマシン、すなわちオートマトンは、それを壊すトークンを禁止してフォーマットを強制する。
この機械には希少な性質があり、どの状態からでも、それぞれのトークンは正確に1つの経路に沿って導かれる。
そのようなグラフが2つの点を結び付けているかどうかを判断し、そのグラフが実際には経路がほとんどなく、記憶がほとんどないかどうかを検証できる。
正確には、問題はReachUL, LOGDCFL, C=L と SC2 のクラスにあり、サヴィッチの定理の古典的な O(log2 n) の下にある O(log2 n/ log log n) 空間のみを必要とする。
テキスト フォーマットフォースはモデルを実行せずに書かれ、マスクはテーブルなしでGPU上で再計算され、再帰的なフォーマットは小さなスタックを使用し、すべての出力はトークン制限の下で有効であり、独立フィールドは並列にデコードされ、検証される。
Qwen3.5-2Bと4Bの16GBのApple M2 ProとMLXの標準設定では、このハードウェアの標準設定では、スキーマ制約付き抽出は同じ答えで1.2-1.3倍早く終了し、文法のコストは1.5GBではなく3MB、テーブルがメモリを使い果たした16の文法を持ち、16のツール呼び出しエージェントは2.5倍早く終了する。
関連論文リスト
- Constraints Are Graphs, Not Chains: Exact Decoding for Diffusion Language Models [3.449257598670055]
拡散言語モデル(dLLM)は任意の順序でマスキング位置を予測するが、厳密な制約付きデコーダは制約を逐次言語としてエンコードする。
有限領域関係を因子グラフとして表現する学習自由デコーダであるFacterDLMを紹介する。
論文 参考訳(メタデータ) (2026-09-26T19:40:43Z) - ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning [1.827510863075184]
ClosureBenchはグラフ関係推論のための構築的なベンチマークである。
証明済みの真実だ
1.5Bのオープンウェイトからフロンティアシステムへのモデルの評価を行った。
論文 参考訳(メタデータ) (2026-08-18T18:36:21Z) - Separating quantum circuits from classical LLMs [2.986556069071589]
低深度量子計算と古典言語モデルアーキテクチャの非条件分離を実証する。
我々の研究は、大規模言語モデルの時代における量子優位の研究を始める。
論文 参考訳(メタデータ) (2026-08-04T17:28:24Z) - Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices [13.483546044414581]
大規模言語モデル(LLM)はますますエッジデバイスにデプロイされている。
LUTベースの推論は、並列推論中にメモリ帯域幅を弱める。
Vec-LUTはベースラインを最大4.2倍に上回る。
論文 参考訳(メタデータ) (2025-12-06T14:14:01Z) - Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling [24.04649159686283]
投機的復号化(英: Speculative decoding)は、推測と検証のパラダイムを通じて推論を加速するアプローチである。
トケンリサイクルは、候補トークンを隣接行列に格納し、幅優先探索アルゴリズムを用いる。
既存の列車なしの手法を30%上回り、広く認められた訓練方法さえも25%上回っている。
論文 参考訳(メタデータ) (2024-08-16T12:20:56Z) - SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices [18.81344021150902]
SpecExecは単純な並列デコード方式で、LLMファミリ向けのターゲットモデルイテレーション毎に最大20個のトークンを生成することができる。
我々は,RAMオフロードが4~6トークン/秒,量子化が4ビット,あるいは16ビット重みが2~3トークン/秒の一般GPU上で50B以上のパラメータLLMを推定した。
論文 参考訳(メタデータ) (2024-06-04T17:53:36Z) - BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models [77.0501668780182]
Retrieval augmentationは、大規模言語モデルにおける多くの重要な問題に対処する。
検索拡張言語モデル(LM)の実行は遅く、大量の検索されたテキストを処理するため、スケールが困難である。
1ビットベクトルを用いて各トークンを前処理するバイナリトークン表現(BTR)を導入する。
論文 参考訳(メタデータ) (2023-10-02T16:48:47Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z) - Speculative Decoding with Big Little Decoder [108.95187338417541]
Big Little Decoder (BiLD) は、幅広いテキスト生成アプリケーションの推論効率と遅延を改善するフレームワークである。
NVIDIA T4 GPUでは、当社のフレームワークは最大2.12倍の高速化を実現し、生成品質の最小化を実現している。
私たちのフレームワークは完全にプラグアンドプレイで、トレーニングプロセスやモデルアーキテクチャの変更なしに適用できます。
論文 参考訳(メタデータ) (2023-02-15T18:55:29Z) - Self-Supervised Log Parsing [59.04636530383049]
大規模ソフトウェアシステムは、大量の半構造化ログレコードを生成する。
既存のアプローチは、ログ特化や手動ルール抽出に依存している。
本稿では,自己教師付き学習モデルを用いて解析タスクをマスク言語モデリングとして定式化するNuLogを提案する。
論文 参考訳(メタデータ) (2020-03-17T19:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。