論文の概要: JustFit: Just-in-Time State Management for Local LLM Serving
- arxiv url: http://arxiv.org/abs/2609.17475v2
- Date: Sun, 20 Sep 2026 19:37:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.881742
- Title: JustFit: Just-in-Time State Management for Local LLM Serving
- Title(参考訳): JustFit: ローカルLLMサービングのためのJust-in-Time状態管理
- Abstract要約: Qwen3.8-27B MXFP4を24GBのM4 Pro MacBookに搭載し、JustFitは2つのリクエストで327,680の保持位置に達した。
各形状は、要求毎に16,384個の出力を3つの新しいプロセスで完了する。
画像エンコーディングは、生の196,608入力のテキストリクエストを保存しながら進行することができる。
- 参考スコア(独自算出の注目度): 5.210656026160777
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Local agents need memory for model execution and working history. We present JustFit, an MLX runtime that coordinates their overlapping allocations: KVExec executes and checkpoints four-bit KV with bounded workspace, PhaseSwap loads phase-dependent components, and StateTrans preserves history across execution modes. With Qwen3.8-27B MXFP4 on a 24 GiB M4 Pro MacBook, JustFit reaches 327,680 retained positions across two requests, 10.67 times the evaluated baseline's 30,720-position single-request record. One request completes the full 262,144-position native window at median 5.986 tokens/s. Each shape completes 16,384 outputs per request in three fresh processes: B1 uses one cold build and two prefix extensions; B2 uses three ordered prefix extensions (Section 4). Image encoding can proceed while preserving a live 196,608-input text request. A controlled, repetitive 32K+6K workload reaches median 18.284 tokens/s at 15,626 MiB; a separate AIME 2026 evaluation scores 29/30. Coordinating execution and state lifetimes makes longer histories feasible on personal hardware.
- Abstract(参考訳): ローカルエージェントはモデル実行と作業履歴のためにメモリを必要とする。
KVExecは4ビットのKVをバウンドワークスペースで実行し、チェックポイントし、フェーズSwapはフェーズ依存のコンポーネントをロードし、StateTransは実行モードで履歴を保存する。
Qwen3.8-27B MXFP4が24GBのM4 Pro MacBookに搭載されたことにより、JustFitは2つの要求で327,680の保持位置に達した。
1つのリクエストは、中央値5.986トークン/秒で262,144位置のネイティブウィンドウを完了させる。
B1は1つのコールドビルドと2つのプレフィックス拡張を使用し、B2は3つの順序付きプレフィックス拡張を使用する(Section 4)。
画像エンコーディングは、生の196,608入力のテキストリクエストを保存しながら進行することができる。
制御された32K+6Kのワークロードは、中央値18.284トークン/sで15,626MiBに達し、別々のAIME 2026評価スコアは29/30である。
実行と状態寿命の調整は、パーソナルハードウェア上で長い履歴を可能にする。
関連論文リスト
- FESC: Remodeling Long-Context Private Inference with Encrypted State-Space Models [21.63908755417832]
本稿では,Factized Encrypted Scan-Contract (FESC)について述べる。
FESCは、単一のGPU上でネイティブなエンドツーエンド実行を$L geq 1,024$で完了する最初のプライベートな長期ドキュメント推論システムである。
論文 参考訳(メタデータ) (2026-08-18T07:20:09Z) - QSimAdv: A Late-Bound, Vendor-Agnostic Architecture for High-Performance Quantum-Circuit Simulation [1.435000056979246]
QSimAdvは共通カーネルではなく遅延バインディングである。
この設計はNVIDIA GH200とAMD MI250X/EPYCシステムで実現している。
論文 参考訳(メタデータ) (2026-08-11T23:17:29Z) - RoPE-Aware Bit Allocation for KV-Cache Quantization [52.099459337231345]
Block-GTQはTurboQuant-MSE上に構築されたキーキャッシュ量子化のためのビットアロケータである。
これは、RoPEクエリキーのロジットを10モデル診断パネルに保存する。
128Kコンテキストでfp16 FlashAttention2より1.34倍高速で動作する。
論文 参考訳(メタデータ) (2026-06-23T00:17:48Z) - MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research [39.68394140712043]
MobileGymは、日常的なモバイル利用のための軽量で完全に制御可能な環境である。
階層化された状態モデルと宣言的なタスク定義フレームワークは、状態のプログラマビリティとタスク作成を大規模に実践的に保ちます。
単一のプログラム的判断メカニズムは、決定論的評価評価と高密度報酬の両方を提供する。
論文 参考訳(メタデータ) (2026-05-25T17:59:49Z) - quantum-safe: Bridging the Post-Quantum Production Gap with a Hybrid-by-Default Python Cryptography Library [0.0]
量子セーフ(quantum-safe)は、量子後暗号における3つの重要なギャップを全て埋めるPythonである。
9つのPQCライブラリを8つの生産レベルディメンションでスコア付けします。
完全なX25519 + ML-KEM-768ハンドシェイクはDocker/Linuxで243秒で完了する。
論文 参考訳(メタデータ) (2026-05-16T16:05:11Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - Native LLM and MLLM Inference at Scale on Apple Silicon [0.8122270502556375]
MLX をネイティブに構築した Apple Silicon 上で,効率的な LLM と MLLM 推論のためのフレームワーク vllm-mlx を提案する。
テキストモデルでは、Qwen3-0.6BからNemotron-30Bまでの範囲で、ラマよりも21%から87%高いスループットを達成する。
マルチモーダルモデルでは,入力形式によらず,同一画像をコンテンツハッシュで識別することで,冗長な視覚符号化を不要とするコンテンツベースキャッシングを導入する。
論文 参考訳(メタデータ) (2026-01-27T03:11:02Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - ParallelComp: Parallel Long-Context Compressor for Length Extrapolation [51.68913021512016]
超長い文脈(テキスト長 >128K)の補間は、大きな言語モデル(LLM)にとって大きな課題である。
本研究では,メモリボトルネックを効果的に克服する並列長コンテキスト圧縮手法であるParallelCompを提案する。
チャンクスループットが1.76倍向上し、プリフィル段階では23.50倍の高速化を実現し、性能損失を無視できる。
論文 参考訳(メタデータ) (2025-02-20T07:10:43Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - LoCoCo: Dropping In Convolutions for Long Context Compression [77.26610232994508]
本稿では,Long Context Compression(LoCoCo)のための新しいアプローチであるDropping In Convolutionsを提案する。
LoCoCoは、固定サイズキーバリュー(KV)キャッシュのみを使用し、推論と微調整の両方のステージで効率を向上させることができる。
論文 参考訳(メタデータ) (2024-06-08T01:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。