論文の概要: Studying quantization trade-offs for efficient inference deployment in machine translation
- arxiv url: http://arxiv.org/abs/2607.29397v2
- Date: Tue, 04 Aug 2026 16:14:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.855722
- Title: Studying quantization trade-offs for efficient inference deployment in machine translation
- Title(参考訳): 機械翻訳における効率的な推論展開のための量子化トレードオフの研究
- Authors: Jim Zhao, Sohir Maskey, Koen Oostermeijer, Douglas Orr, Teryn Jones,
- Abstract要約: 本研究では,EuroLLM citepmartins2025eurollm と Hy-MT2 citepzheng2026hy という2つの翻訳モデルの量子化トレードオフについて検討した。
- 参考スコア(独自算出の注目度): 6.265237910291255
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deploying large language models in realistic server environments poses challenges, as the system needs to provide high-quality responses with low latency. Quantization is a common approach to reduce the memory footprint and improve inference efficiency, yet its impact on latency and throughput is rarely evaluated under controlled, orchestration-level workloads. In this work we study the quantization trade-offs of two translation model families, EuroLLM \citep{martins2025eurollm} and Hy-MT2 \citep{zheng2026hy} across five models ranging from 1.7B to 22B for efficient deployment on a single A100 or H100 GPU. We demonstrate that combining a document-chunking strategy with W4A8 or W8A8 quantization improves the latency-throughput Pareto-curve under a wide range of workloads. Furthermore, since standard machine translation (MT) benchmarks rely on isolated sentences and fail to capture long-context dynamics, we introduce a document-level evaluation from WMT24++ to assess how text chunking strategies affect translation quality under quantization. Our results reveal that standard segment-level evaluation can fail to predict the interaction between quantization and long-context document translation. While Hy-MT2 remains robust under quantization, EuroLLM shows strong sensitivity and translation quality collapses rapidly for all considered quantization formats. Overall, our experiments show that the trade-off between inference efficiency and translation quality depends not only on the quantization format, but also on the choice of text chunking strategy.
- Abstract(参考訳): システムが低レイテンシで高品質なレスポンスを提供する必要があるため、現実的なサーバ環境に大規模な言語モデルをデプロイすることは課題となる。
量子化は、メモリフットプリントを削減し、推論効率を改善するための一般的なアプローチであるが、レイテンシとスループットへの影響は、制御されたオーケストレーションレベルのワークロード下ではめったに評価されない。
本研究では、2つの翻訳モデルファミリーであるEuroLLM \citep{martins2025eurollm} と Hy-MT2 \citep{zheng2026hy} の量子化トレードオフを、1つのA100またはH100 GPU上の効率的なデプロイのために1.7Bから22Bまでの5つのモデルで検討する。
文書チャンキング戦略をW4A8やW8A8量子化と組み合わせることで、幅広いワークロード下での遅延スループットのPareto-curveを改善することが実証された。
さらに、標準機械翻訳(MT)ベンチマークは孤立文に依存し、長文のダイナミックスを捕捉できないため、WMT24++による文書レベルの評価を導入し、テキストチャンキング戦略が量子化の下での翻訳品質に与える影響を評価する。
この結果から,標準的なセグメントレベルの評価では,量子化と長文文書翻訳の相互作用を予測できないことがわかった。
Hy-MT2 は量子化下でも頑健であるが、EuroLLM では量子化フォーマットのすべてに対して強い感度と翻訳品質が急速に低下している。
全体として、推論効率と翻訳品質のトレードオフは、量子化フォーマットだけでなく、テキストチャンキング戦略の選択にも依存することを示した。
関連論文リスト
- The Uneven Impact of Post-Training Quantization in Machine Translation [6.398727997282354]
資源制約のあるハードウェア上での大規模言語モデル(LLM)の展開には量子化が不可欠だが、多言語タスクに対するその意味は未解明のままである。
我々は,1.7Bから70Bパラメータの5つのLLMを用いて,55言語にわたる機械翻訳におけるPTQの大規模評価を行った。
分析の結果,4ビットの量子化は高リソース言語では翻訳品質を保ちがちであるが,低リソース言語やタイポロジーに富んだ言語では,特に2ビット設定では顕著な劣化が発生することがわかった。
論文 参考訳(メタデータ) (2025-08-28T15:22:31Z) - "Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization [67.3213104337679]
量子化は大規模言語モデル(LLM)推論を高速化するための強力なツールであるが、異なるフォーマット間での精度と性能のトレードオフは依然として不明である。
FP8,INT8,INT4の量子化を学術ベンチマークや実世界のタスクで評価し,これまでで最も包括的な実証的研究を行った。
論文 参考訳(メタデータ) (2024-11-04T18:21:59Z) - Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models [57.80514758695275]
機械翻訳(MT)の品質を評価するために,大規模言語モデル(LLM)を用いることで,システムレベルでの最先端のパフォーマンスを実現する。
我々はtextbftexttError Analysis Prompting (EAPrompt) と呼ばれる新しいプロンプト手法を提案する。
本手法は,多次元品質指標 (MQM) とtextitproduces を用いて,システムレベルとセグメントレベルの両方で説明可能かつ信頼性の高いMT評価を行う。
論文 参考訳(メタデータ) (2023-03-24T05:05:03Z) - Measuring Uncertainty in Translation Quality Evaluation (TQE) [62.997667081978825]
本研究は,翻訳テキストのサンプルサイズに応じて,信頼区間を精度良く推定する動機づけた研究を行う。
我々はベルヌーイ統計分布モデリング (BSDM) とモンテカルロサンプリング分析 (MCSA) の手法を適用した。
論文 参考訳(メタデータ) (2021-11-15T12:09:08Z) - Improving Multilingual Translation by Representation and Gradient
Regularization [82.42760103045083]
表現レベルと勾配レベルの両方でNMTモデルを正規化するための共同手法を提案する。
提案手法は,オフターゲット翻訳の発生率の低減とゼロショット翻訳性能の向上に有効であることを示す。
論文 参考訳(メタデータ) (2021-09-10T10:52:21Z) - Verdi: Quality Estimation and Error Detection for Bilingual [23.485380293716272]
Verdiはバイリンガルコーパスのための単語レベルおよび文レベルの後編集作業推定のための新しいフレームワークである。
バイリンガルコーパスの対称性を活用し,NMT予測器にモデルレベル二重学習を適用した。
我々の手法は競争の勝者を圧倒し、他の基準法よりも大きなマージンで上回る。
論文 参考訳(メタデータ) (2021-05-31T11:04:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。