論文の概要: A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives
- arxiv url: http://arxiv.org/abs/2608.28846v1
- Date: Fri, 28 Aug 2026 20:33:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.767808
- Title: A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives
- Title(参考訳): 効率的なllm推論のための周期的段差スキップの厳密整合監査--重層と急速層--訓練された経路代替品の補足的分析
- Authors: Prateek Kumar Sikdar, Arpan Ghosh,
- Abstract要約: SWIFTは4細胞中3細胞において最も精度が高い方法である。
ConfLayersは至るところで支配的であり、特にGSM8Kは1.5Bで大きな赤字を抱えている。
また、補助分析として、LayerRouteとLayerDropという2つの訓練されたルーティング手法についても検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Layer-skipping methods for efficient LLM inference decide, at some granularity, which transformer layers to execute for a given input. We present a rigor-matched, three-seed audit of two periodic-step, search-based methods that make this decision online at inference time and re-evaluate it every few generation steps: a confidence-gated early-exit baseline (ConfLayers) and genuine self-speculative decoding (SWIFT, Xia et al. 2024), together with vanilla autoregressive decoding, across two model scales (Qwen2.5-0.5B and Qwen2.5-1.5B) and two tasks (GSM8K reasoning and CNN/DailyMail summarization). SWIFT is the strongest method on accuracy in three of four cells; ConfLayers is dominated everywhere, with particularly large deficits on GSM8K at 1.5B. Once online-search overhead is separated from pure inference cost, SWIFT's true inference speed is faster than ConfLayers's in all four cells (5-21%), reversing the naive wall-clock ranking in three of them. ConfLayers's search overhead is small and stable (1-2% of cost), while SWIFT's is larger and more variable (up to 28.7%). We additionally examine two trained-routing methods, LayerRoute (Sikdar, 2026) and LayerDrop (Fan et al. 2020), as a supplemental analysis because they operate at coarser decision granularities. Under a verified protocol with genuine per-input gating, a genuine full-model baseline, and genuine inference-time compute skipping, both show modest speedups (1.08-1.33x) but accuracy well below the periodic-step methods, including a near-total collapse for LayerRoute on GSM8K at 1.5B (0.003 mean exact-match across three seeds). We release the full audit protocol as a template for rigor-matched efficiency comparisons.
- Abstract(参考訳): 効率的なLCM推論のためのレイヤスキッピング法は、ある粒度で決定され、与えられた入力に対してトランスフォーマー層が実行される。
本稿では,2つのモデルスケール (Qwen2.5-0.5BとQwen2.5-1.5B) と2つのタスク (GSM8K推論とCNN/DailyMail総和) にまたがって,信頼に満ちた早期退避ベースライン (ConfLayers) と真の自己投機的復号 (SWIFT, Xia et al 2024) と,バニラ自己回帰復号 (Qwen2.5-0.5BとQwen2.5-1.5B) と,この決定をオンラインで行う2つの周期的な3段階の探索手法の厳密な監査を提示する。
SWIFTは4つの細胞のうち3つの細胞で最も精度が高い方法であり、ConfLayersは、特にGSM8Kに1.5Bで大きな欠陥がある。
オンライン検索のオーバーヘッドが純粋な推論コストから分離されると、SWIFTの真の推論速度は、すべての4つのセル(5-21%)のConfLayersよりも速い。
ConfLayersの検索オーバーヘッドは小さく安定(コストの1-2%)、SWIFTはより大きく、より可変(最大28.7%)である。
さらに、粗い決定粒度で機能するため、補助分析としてLayerRoute (Sikdar, 2026) とLayerDrop (Fan et al 2020) の2つの訓練方法を検討した。
真正のインプット・ゲーティング、真正のフルモデルベースライン、真正の推論時計算スキップを備えた検証済みのプロトコルでは、どちらもモデスト・スピードアップ(1.08-1.33x)を示すが、GSM8K上のLayerRouteの約10分の1の崩壊(0.003平均3つの種子の正確なマッチ)を含む周期的な手法よりはるかに低い精度である。
我々は、厳密な整合性比較のためのテンプレートとして、完全な監査プロトコルをリリースする。
関連論文リスト
- Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method [4.977982322940808]
精度目標の下で文書コーパス上で自然言語のye/no述語を評価することは、LLMベースのデータ処理の基盤となる。
すべてのドキュメント(オラクル)で LLM を呼び出すことは禁じられているので、カスケードはオラクルと高速なプロキシをペアにします。
私たちは、クエリレベルの困難コンパス、最小のオラクル上の低いバウンドは、プロキシベースのカスケードが作成可能な任意のプロキシベースのカスケード、プロキシのソフトトレーニングラベルの3つの目的のために、初めて、ドキュメントごとの信頼性を使用する。
論文 参考訳(メタデータ) (2026-06-06T10:32:16Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - Understanding Asynchronous Inference Methods for Vision-Language-Action Models [0.0]
Vision-Language-Action(VLA)モデルは汎用ロボット制御への有望な経路を提供するが、その推論遅延は、生成されたアクションが非同期に実行されるときに観察の安定化を引き起こす。
Inference-time Inpainting (IT-RTC), training-time delay Simulation (TT-RTC), future-state-aware conditioning (VLASH), light residual correction (A2C2) の2つの手法が同時に提案されている。
制御条件下でのこれらの4つの手法の系統的な比較について述べる。
論文 参考訳(メタデータ) (2026-05-04T18:01:15Z) - Dr.LLM: Dynamic Layer Routing in LLMs [55.11953638340419]
Dr.LLMは、事前訓練されたモデルに軽量な層ごとのルータを装備し、ブロックをスキップ、実行、繰り返すように決定する、適合性のあるフレームワークである。
ARC(logic)とDART(math)では、Dr.LLMは平均で5つのレイヤを保存しながら、最大3.4%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-10-14T17:51:26Z) - Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems [20.846301581161978]
マルチエージェントシステムにおける障害帰属は、批判的だが未解決の課題である。
現在の手法では、これを長い会話ログ上のパターン認識タスクとして扱う。
A2P Scaffoldingは、パターン認識から構造化因果推論タスクへの障害帰属を変換する。
論文 参考訳(メタデータ) (2025-09-12T16:51:15Z) - Certified Robustness Under Bounded Levenshtein Distance [55.54271307451233]
畳み込み型分類器のリプシッツ定数をレヴェンシュテイン距離に対して計算する最初の方法を提案する。
我々の方法であるLipsLevは、それぞれ18.80ドル%と13.93ドル%の精度を1ドルと2ドルで得ることができる。
論文 参考訳(メタデータ) (2025-01-23T13:58:53Z) - Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching [56.286064975443026]
拡散変圧器内の多数の層をキャッシュ機構で計算することで、モデルパラメータを更新しなくても容易に除去できる。
本稿では,拡散変圧器の動的手法でキャッシングを学習するL2C(Learningto-Cache)を提案する。
実験の結果,L2C は DDIM や DPM-r など,キャッシュベースの従来の手法と同等の推論速度で性能を向上することがわかった。
論文 参考訳(メタデータ) (2024-06-03T18:49:57Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。