論文の概要: What Does a Token Cost? A Mixture-of-Agents Measurement of Sufficient Per-Token Compute
- arxiv url: http://arxiv.org/abs/2610.02491v1
- Date: Thu, 01 Oct 2026 21:11:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.087736
- Title: What Does a Token Cost? A Mixture-of-Agents Measurement of Sufficient Per-Token Compute
- Title(参考訳): トーケンコストとは何か? : トーケン当量計算の高精度混合計測
- Abstract要約: 投機的復号化やモデルルーティングといった手法は、この計算の多くが不要であるという前提で構築されている。
我々は、Mixture-of-Agents (MoA)レンズを用いて、個々のトークンが実際に必要とする計算を測定する。
トークンの十分な計算量として成功する最小エージェントの推論コストを定義する。
- 参考スコア(独自算出の注目度): 10.440767626442737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models spend the same amount of computation on every token they generate, regardless of how difficult each token is to produce. Methods such as speculative decoding and model routing are built on the premise that much of this computation is unnecessary, yet the computation an individual token actually requires has not been measured. We measure it through a Mixture-of-Agents (MoA) lens: a panel of fifteen language models of increasing capacity, drawn from three families, in which every agent attempts to reproduce a reference sequence token by token, conditioned on the correct preceding tokens. We define the inference cost of the smallest agent that succeeds as the token's sufficient compute, which upper-bounds what the token requires. On three core benchmarks, a 0.5B agent reproduces 92--95\% of reference tokens. Across Qwen, OLMo, and R1-distilled panels, the most expensive 10\% account for 64--80\% of estimated FLOPs. On all 500 MATH-500 problems, the MoA-derived map helps model routing reduce projected latency from 7.59 to 5.12 seconds while slightly improving accuracy, relative to the best confidence-routing baseline. The MoA-map helps drafting use 32.6\% fewer draft tokens and approximately 20\% lower projected latency than fixed-window drafting at similar accuracy. These comparisons reveal remaining allocation headroom, motivating controllers that exploit sufficient-compute structure.
- Abstract(参考訳): 大規模言語モデルは、各トークンの生成がどれだけ難しいかに関わらず、生成するトークンごとに同じ量の計算に費やします。
投機的復号化やモデルルーティングといった手法は、この計算の多くが不要であるという前提で構築されているが、個々のトークンが実際に必要とする計算は測定されていない。
我々は,Mixture-of-Agents (MoA) レンズを用いて測定する: キャパシティが増大する15の言語モデルからなるパネルで,各エージェントがトークンによって参照シーケンストークンを再現しようとする3つのファミリから抽出する。
トークンの十分な計算量として成功する最小エージェントの推論コストを定義する。
3つのコアベンチマークでは、0.5Bエージェントが参照トークンの92-95%を再現する。
Qwen、OLMo、R1を蒸留したパネルで、最も高価な10\%は推定されたFLOPの64--80\%である。
500 MATH-500の全ての問題に対して、MoA由来のマップは、予測されたレイテンシを7.59秒から5.12秒に短縮するのに役立ち、信頼性の高いベースラインに対する精度をわずかに向上させる。
MoAマップはドラフト作成に役立ち、ドラフトトークンを32.6\%削減し、同じ精度で固定ウィンドウのドラフトよりも約20\%遅れる。
これらの比較は、十分な計算構造を利用するコントローラを動機付け、残余のアロケーションヘッドルームを明らかにしている。
関連論文リスト
- Total Cost of Agency: Exact Attribution of Memory Injection Cost in Multi-Agent LLM Workflows [0.8770825039504507]
マルチエージェントワークフローのコストをプロンプト、推論、メモリインジェクション、ミスペナルティ、コンテキスト蓄積コンポーネントに分解する。
ワードカウントプロキシからトークンを推定するのではなく、直接トークンを注入する。
論文 参考訳(メタデータ) (2026-09-20T18:23:47Z) - One Size Does Not Fit All: Setting Inference Depth from the Questions a Deployment Actually Asks [0.0]
本稿では,事前にプロンプトの範囲が分かっている場合に,そのコストのどれだけが避けられるかを測定する。
モデルは凍結されており、使用されている唯一の監督は、通常のトラフィックに対するモデル自身の出力である。
論文 参考訳(メタデータ) (2026-09-12T20:49:48Z) - Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models [67.72077328700088]
本稿では,2次元の異なるデコーダのみの高密度変圧器モデルについて検討した。
Token-1B モデルは低FLOP 方式ではバイトモデル (End-Of-Token-1B と Bytes-1B) より優れていたが、最終的には高原となる。
100Kトークンの順序ではなく256バイトの小さな語彙で操作することで、ログダンピング時にトップクランケーションの必要性を回避することができる。
論文 参考訳(メタデータ) (2026-09-11T00:17:22Z) - Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware [0.0]
大規模言語モデルのシングルストリーム自動回帰復号化は、メモリ帯域幅によって制限される。
小さなドラフトモデルは、自動回帰的に$K$トークンを提案し、ターゲットモデルは、これらすべてを1回のバッチパスでスコアする。
本稿では、CUDA/MPS/CPUの実装と、5つのドラフト/ターゲットバックエンド構成に関する実証的研究を紹介する。
論文 参考訳(メタデータ) (2026-07-19T15:01:35Z) - Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language Models [0.6916773850242582]
LLaDA2.1のような仮設拡散言語モデルは、自身の生成エラーを修正するためにToken-to-Token編集に依存している。
本稿では,その位置をマスク状態にリセットするToken-to-Mask(T2M)再マスクを提案する。
8つのベンチマークで、T2Mは正確なトークンレベルの出力を必要とするタスクの精度を改善する。
論文 参考訳(メタデータ) (2026-04-20T18:43:28Z) - Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production [55.76222360698305]
我々は,言語モデルが入力トークン毎に使用する計算ステップの数を動的かつ自律的に拡張できるような,教師付きトレーニング目標のクラスを探索する。
任意のトークンに対して、モデルは don't know> 出力を出力することで、追加の計算ステップを要求できる。
CYBモデルでは精度が向上し,トークンレベルの複雑性とコンテキストに処理時間を適用することができる。
論文 参考訳(メタデータ) (2025-10-13T21:07:05Z) - TokenButler: Token Importance is Predictable [8.514853311344458]
大規模言語モデル(LLM)はトークン履歴を保存するためにキーバリューキャッシュ(KV)に依存しており、トークンの効率的な復号を可能にする。
以前の研究では、トークンの小さなサブセットのみが、各デコードステップに有意義に寄与することが示されている。
TokenButlerは、これらの重要なトークンを識別することを学ぶ、高粒度でクエリ対応の予測器である。
論文 参考訳(メタデータ) (2025-03-10T16:41:14Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z) - Matryoshka Query Transformer for Large Vision-Language Models [103.84600181927884]
我々は,Materyoshka Query Transformer (MQT)を導入し,推論中に画像をmビジュアルトークンにエンコードする。
単一のモデルを一度トレーニングし、フレキシブルかつ劇的に、推論時の視覚トークンの数を削減します。
MQT-LLAVAは,LLaVAの固定576の代わりに最大256トークンを用いて,11ベンチマークでLLaVA-1.5のパフォーマンスと一致した。
論文 参考訳(メタデータ) (2024-05-29T17:39:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。