論文の概要: Token-Operations-Oriented Inference Optimization Techniques for Large Models
- arxiv url: http://arxiv.org/abs/2606.20295v1
- Date: Thu, 18 Jun 2026 14:33:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.917874
- Title: Token-Operations-Oriented Inference Optimization Techniques for Large Models
- Title(参考訳): 大規模モデルのためのToken-Operations-Oriented Inference Optimization Techniques
- Authors: Shiguo Lian, Kai Wang, Zhaoxiang Liu, Wen Liu, Minjie Hua, Yutong Liu, Jiangze Yan, Xin Wang, Cong Wang, Yilin Zhang, Yi Shen, Jieyun Huang, Fang Zhao, Huanlin Gao, Ping Chen, Xinyu Yang, Kaikai Zhao, Yao Zhao, Xinggang Wang, Huishuai Zhang, Dongyan Zhao, Junping Du, Tao Chen, Xiang Gao, Qinghuai Ma,
- Abstract要約: 大規模モデル推論最適化は、大規模モデルサービスのスケーラブルで低コストで高度に安定した運用をサポートするための重要な基盤となる。
本稿では,マルチモデルフュージョン,モデル最適化,コンピュータモデルフュージョン,コンピュータネットワークモデルフュージョンからなる4層技術アーキテクチャを初めて提案する。
- 参考スコア(独自算出の注目度): 97.15115857661591
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large model inference optimization serves as a key foundation for supporting the scalable, low-cost, and highly stable operation of large model services. Centered on token-oriented inference optimization technology, this paper proposes for the first time a four-layer technical architecture consisting of Multi-model Fusion, Model Optimization, Compute-Model Fusion, and Compute-Network-Model Fusion. It systematically reviews the key technologies and current industry status across these four levels and analyzes the application value of related technologies in real-world business scenarios. This paper provides a practical technical path for reducing token production costs, improving token service efficiency, ensuring the stability of token supply, and driving the transition of large model services from being merely callable to being operable.
- Abstract(参考訳): 大規模モデル推論最適化は、大規模モデルサービスのスケーラブルで低コストで高度に安定した運用をサポートするための重要な基盤となる。
本稿では,トークン指向推論最適化技術を中心に,マルチモデルフュージョン,モデル最適化,Compute-Model Fusion,Compute-Network-Model Fusionからなる4層技術アーキテクチャを提案する。
この4つのレベルにわたる主要な技術と現在の業界の現状を体系的にレビューし、実世界のビジネスシナリオにおける関連する技術の応用価値を分析します。
本稿では,トークン製造コストの削減,トークンサービスの効率の向上,トークン供給の安定性確保,大規模モデルのサービス移行を単に呼び出し可能から運用可能にするための実践的な技術パスを提供する。
関連論文リスト
- BERT4beam: Large AI Model Enabled Generalized Beamforming Optimization [77.17508487745026]
本稿では,ビームフォーミング最適化のための大規模AIモデルについて検討する。
本稿では、BERT4エンコーダと呼ばれる変換器(BERT)からの双方向エンコーダ表現に基づく新しいフレームワークを提案する。
本フレームワークをベースとして,単一タスクとマルチタスクのビームフォーミング最適化のためのBERTベースの2つのアプローチを提案する。
論文 参考訳(メタデータ) (2025-09-14T02:49:29Z) - TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making [75.29820290660065]
本稿では,効果的な具体的意思決定のための思考中心推論最適化(TCPO)を提案する。
モデルの中間的推論プロセスの整合性を強調し、モデル劣化の問題を緩和する。
ALFWorld環境での実験では、平均成功率は26.67%であり、RL4VLMよりも6%向上している。
論文 参考訳(メタデータ) (2025-09-10T11:16:21Z) - CRACI: A Cloud-Native Reference Architecture for the Industrial Compute Continuum [0.0]
本稿では,産業計算連続体のためのクラウドネイティブな参照アーキテクチャであるCRACIを紹介する。
分離されたイベント駆動モデルを促進し、連続体をまたいだ柔軟な非階層的なデータフローを可能にする。
論文 参考訳(メタデータ) (2025-09-09T08:24:08Z) - A Survey on Inference Optimization Techniques for Mixture of Experts Models [50.40325411764262]
大規模Mixture of Experts(MoE)モデルは、条件計算によるモデル容量と計算効率の向上を提供する。
これらのモデル上で推論をデプロイし実行することは、計算資源、レイテンシ、エネルギー効率において大きな課題を示す。
本調査では,システムスタック全体にわたるMoEモデルの最適化手法について分析する。
論文 参考訳(メタデータ) (2024-12-18T14:11:15Z) - ORLM: A Customizable Framework in Training Large Models for Automated Optimization Modeling [15.67321902882617]
本稿では,オープンソースのLLMをトレーニングし,モデリングやソルバコードの開発を最適化する実行可能なパスを提案する。
この研究は、実用的なOR問題の解決においてLLMを評価するための最初の産業ベンチマークであるIndustrialORも導入した。
論文 参考訳(メタデータ) (2024-05-28T01:55:35Z) - Majority Kernels: An Approach to Leverage Big Model Dynamics for Efficient Small Model Training [32.154166415680066]
蒸留、圧縮、量子化といった手法は、高性能な大きなモデルを利用してより小さな性能のモデルを誘導するのに役立つ。
本稿では、単一トレーニングランが同時に、より大きなパフォーマンスモデルをトレーニングし、より小さなデプロイメントモデルを導出できるという仮説を考察する。
論文 参考訳(メタデータ) (2024-02-07T17:07:41Z) - When Parameter-efficient Tuning Meets General-purpose Vision-language
Models [65.19127815275307]
PETALは、一意のモード近似技術によって達成される全パラメータの0.5%しか必要とせず、トレーニングプロセスに革命をもたらす。
実験の結果,PETALは現状の手法をほとんどのシナリオで上回るだけでなく,完全な微調整モデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-16T17:13:08Z) - Empirical Analysis of the Strengths and Weaknesses of PEFT Techniques
for LLMs [1.867982979635437]
各種PEFT手法のベンチマークを行い、異なるデータスケールでモデル性能を評価する。
一般的な信念とは対照的に、PEFT手法は低データシナリオにおいて完全なチューニングよりも遅く収束することを実証的に証明する。
さらに,モデルのどの部分を訓練するかを選択的に選択することで,これらのPEFT手法をさらに最適化する。
論文 参考訳(メタデータ) (2023-04-28T17:39:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。