論文の概要: SEIS: Self-Evolving Inference Systems
- arxiv url: http://arxiv.org/abs/2610.04646v1
- Date: Sat, 03 Oct 2026 16:36:48 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:22:41.431328
- Title: SEIS: Self-Evolving Inference Systems
- Title(参考訳): SEIS: 自己進化型推論システム
- Abstract要約: 推論システムは、いかに速く、いかに安価に言語モデルを提供できるかを決定する。
本研究では,システム全体をエンドツーエンドに最適化するために,総合的なアプローチを採用し,エージェントによる自己進化を適用します。
私たちのSEIS(Self-Evolving Inference Systems)は、人間の介入なしに、ミニスラングエンジン全体を自律的に最適化します。
- 参考スコア(独自算出の注目度): 17.028921540694213
- License:
- Abstract: Inference systems determine how fast and how cheaply language models can be served, so making them faster has direct practical value. However, prior work focuses mostly on optimizing certain parts such as kernels or memory within the large system. In this work, we take a holistic approach and apply agentic self-evolution to optimize the whole system end-to-end. Our SEIS (Self-Evolving Inference Systems) autonomously optimizes the entire mini-sglang engine without human intervention through iterative sessions with inherited experiences and code changes. Serving Qwen3-0.6B on H100, the resulting engine reaches 3.27X the throughput of the original mini-sglang implementation and beats SOTA engines like vLLM, TensorRT-LLM, and SGLang in the single-request workload. The correctness of the optimized inference engine by SEIS is tested in terms of numerical difference and downstream accuracy on math and long-context retrieval tasks. The code and session histories show that the speedup comes from redesigning the whole engine and that building on earlier sessions beats independent attempts. These results suggest that agentic self-evolution can optimize a complex system end-to-end. The evaluation also has to evolve with the engine, and letting agents evolve it is a natural next step.
- Abstract(参考訳): 推論システムは、いかに速く、いかに安価に言語モデルを提供できるかを決定する。
しかしながら、以前の作業は主に、大規模なシステム内のカーネルやメモリなどの特定の部分の最適化に重点を置いていた。
本研究では,システム全体をエンドツーエンドに最適化するために,総合的なアプローチを採用し,エージェントによる自己進化を適用します。
我々のSEIS(Self-Evolving Inference Systems)は、継承された経験とコード変更による反復的なセッションを通じて、人間の介入なしに、ミニスラングエンジン全体を自律的に最適化します。
H100上でQwen3-0.6Bを実行したエンジンは、オリジナルのミニスラング実装のスループットの3.27倍に達し、単一要求のワークロードでvLLM、TensorRT-LLM、SGLangといったSOTAエンジンに勝っている。
SEISによる最適化推論エンジンの正確性は、数学および長文検索タスクにおける数値差と下流精度の観点から検証する。
コードとセッションの履歴によると、スピードアップはエンジン全体を再設計することによるもので、初期のセッションでのビルドは独立した試みに勝っている。
これらの結果はエージェント的自己進化が複雑なシステムをエンドツーエンドに最適化できることを示唆している。
評価はエンジンとともに進化させる必要があり、エージェントがそれを進化させるのは自然な次のステップである。
関連論文リスト
- AutoPSO: A Metaframework for Automated Particle Swarm Optimization [29.701425030709505]
粒子群最適化はメタヒューリスティックとして広く用いられており、その単純さと小さなパラメータセットで評価されている。
既存のアプローチの多くは問題固有で手作りであり、クロスタスクの一般化は不十分である。
我々は、カスタマイズされたPSOアルゴリズムを構築するための高度に自動化されたメタフレームであるAutoPSOを提案する。
論文 参考訳(メタデータ) (2026-07-29T03:34:41Z) - optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents [80.59925936278162]
本稿では,自己進化型メモリアーキテクチャであるEvolveMemについて述べる。
このクローズループの自己進化はAutoResearchプロセスを実現している。システムは自力で独自のアーキテクチャ上で反復的な研究サイクルを実行し、手動構成のチューニングを置き換える。
論文 参考訳(メタデータ) (2026-05-13T17:12:44Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - Towards Efficient Agents: A Co-Design of Inference Architecture and System [66.59916327634639]
本稿では,エージェントアクセラレーションのための統合フレームワークであるAgentInferを提案する。
問題をAgentCollab、AgentSched、AgentSAM、AgentCompressの4つの相乗的コンポーネントに分解する。
BrowseComp-zhとDeepDiverベンチマークの実験では、これらの手法の相乗的コラボレーションを通じて、AgentInferは非効率なトークン消費を50%以上削減することを示した。
論文 参考訳(メタデータ) (2025-12-20T12:06:13Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces [9.880183350366792]
並列プログラムのパフォーマンスを改善する上で重要な課題は、タスクをプロセッサやデータに効率的にメモリにマッピングすることだ。
生成最適化によるマッパー開発を自動化するフレームワークを提案する。
提案手法では,9つのベンチマークで1.34倍の高速化を実現している。
論文 参考訳(メタデータ) (2024-10-21T04:08:37Z) - VeLO: Training Versatile Learned Optimizers by Scaling Up [67.90237498659397]
私たちは、ディープラーニングの成功の背後にある同じスケーリングアプローチを活用して、汎用性を学びます。
私たちは、パラメータの更新を取り込み出力する小さなニューラルネットワークであるディープラーニングのためのインジェクションをトレーニングします。
学習したメタトレーニングコード、関連するトレインテストデータ、およびvelo-code.ioのベースラインを備えた広範なベンチマークスイートをオープンソースとして公開しています。
論文 参考訳(メタデータ) (2022-11-17T18:39:07Z) - Woodpecker-DL: Accelerating Deep Neural Networks via Hardware-Aware
Multifaceted Optimizations [15.659251804042748]
Woodpecker-DL (WPK) はハードウェア対応のディープラーニングフレームワークである。
WPKは、グラフ最適化、自動検索、ドメイン固有言語(DSL)、システムレベルの探索を使って推論を高速化する。
最大P100 GPUでは、cuDNNが5.40、TVMが1.63、エンドツーエンドモデル推論がTeslaRTより1.18倍高速であることを示す。
論文 参考訳(メタデータ) (2020-08-11T07:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。