論文の概要: Workload-Driven Optimization for On-Device Real-Time Subtitle Translation
- arxiv url: http://arxiv.org/abs/2607.09957v2
- Date: Thu, 16 Jul 2026 17:45:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.199202
- Title: Workload-Driven Optimization for On-Device Real-Time Subtitle Translation
- Title(参考訳): オンデマンドリアルタイム字幕翻訳のためのワークロード駆動最適化
- Abstract要約: 本報告では,台湾における短い入力,短いアウトプット,バッチサイズワン推論,低レイテンシ,プライバシー制約下での日本語と中国語の字幕翻訳について検討する。
元の151k-token語彙を64k-tokenサブタイトルドメイントークン化器に置き換え、埋め込み空間を移行し、埋め込みキャリブレーションによりモデルを適応させる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This report studies on-device English-to-Traditional-Chinese subtitle translation for Taiwan under short inputs, short outputs, batch-size-one inference, low latency, and privacy constraints. These conditions limit the value of optimizations designed for long-context or high-throughput language-model serving. Starting from LMT-60-0.6B, preliminary profiling suggests that vocabulary projection becomes a more important decode-time cost after GGUF quantization reduces the relative cost of Transformer blocks. We replace the original 151k-token vocabulary with a 64k-token subtitle-domain tokenizer, migrate the embedding space, and adapt the model through embedding calibration followed by full supervised fine-tuning. On an OpenSubtitles2024 test set, LocalSubs achieves a 59.2% tie-excluded win rate against Google Translate under GPT-4o pairwise judging. Performance is strongest on short cues and declines as cue length increases. In a separate preliminary Apple M2 Metal profiling run, LocalSubs shows a 1.63x speedup over a 151k-vocabulary baseline. The code is available on https://github.com/aiden1020/localsubs .
- Abstract(参考訳): 本報告では,台湾における短い入力,短いアウトプット,バッチサイズワン推論,低レイテンシ,プライバシー制約下での日本語と中国語の字幕翻訳について検討する。
これらの条件は、長いコンテキストや高スループットの言語モデル提供のために設計された最適化の値を制限する。
LMT-60-0.6B から、予備プロファイリングにより、GGUF の量子化によりトランスフォーマーブロックの相対コストが減少し、ボキャブラリ投影がより重要なデコード時間コストとなることが示唆された。
元の151k-token語彙を64k-tokenサブタイトルドメイントークン化器に置き換え、埋め込み空間を移行し、埋め込みキャリブレーションとフル教師付き微調整によりモデルを適応させる。
OpenSubtitles2024 テストセットでは、LocalSubs は GPT-4o の対決で Google Translate に対して59.2% の勝利率を達成した。
キューの長さが増加するにつれて、ショートキューやダウンでパフォーマンスが最強となる。
別の予備的なApple M2 Metalプロファイリング実行では、LocalSubsは151k語彙のベースライン上で1.63倍のスピードアップを示している。
コードはhttps://github.com/aiden1020/localsubsで入手できる。
関連論文リスト
- Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs [16.121226347387246]
音声大言語モデル(Audio LLMs)は、強い多言語機能にもかかわらず、コードスイッチング音声の書き起こしにおける体系的な失敗を示す。
選択された応答が混合言語コンテンツを保存する選好ペアを構成するモデルに、直接選好最適化を適用した。
このアライメントにより、MERは89.6%(分配中)と20.0%(分配外)まで減少する。
論文 参考訳(メタデータ) (2026-05-13T16:15:33Z) - Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Languages are Modalities: Cross-Lingual Alignment via Encoder Injection [0.8461674097042394]
本稿では、トークン化器を変更したり、デコーダを再訓練したりすることなく、命令調整されたデコーダを条件とした効率的な言語・モダリティ手法を提案する。
LLINKはバイリンガル検索を大幅に改善し、ベースモデルよりも81.3%の嗜好を得る。
改良は, トークン化インフレーションの低減と, より強いクロスリンガルアライメントに起因することが判明した。
論文 参考訳(メタデータ) (2025-10-31T07:43:21Z) - CMU's IWSLT 2025 Simultaneous Speech Translation System [10.40867923457809]
本稿では,CMU による IWSLT 2025 同時音声翻訳タスクの提出について述べる。
我々のエンドツーエンドの音声テキストシステムは、大まかに因果関係のWav2Vec 2.0音声エンコーダ、アダプタ、およびQwen2.5-7B-Instructをデコーダとして統合する。
実験の結果,英語-中国語で44.3BLEU,英語-ドイツ語で25.1BLEUを達成した。
論文 参考訳(メタデータ) (2025-06-16T06:56:21Z) - Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation [0.0]
本稿では,ウクライナのフツル方言に大規模な言語モデルを適用するための最初の取り組みを紹介する。
我々は、9852語対標準ウクライナ語の文対と7320語の単語マッピングの辞書の並列コーパスを作成しました。
論文 参考訳(メタデータ) (2025-06-09T10:30:35Z) - Anticipating Future with Large Language Model for Simultaneous Machine Translation [27.613918824789877]
同時機械翻訳(SMT)は、ストリーミング入力の発話を受け取り、ターゲットテキストを漸進的に生成する。
我々は、$textbfA$nticipating $textbfF$uture (TAF)による$textbfT$ranslationを提案する。
その中核となる考え方は、大きな言語モデル(LLM)を使用して将来のソース語を予測し、過剰なリスクを伴わずに機会的に翻訳することである。
論文 参考訳(メタデータ) (2024-10-29T19:42:30Z) - Language-Informed Beam Search Decoding for Multilingual Machine Translation [24.044315362087687]
言語インフォームドビームサーチ(Language-informed Beam Search, LiBS)は、市販の言語識別(LiD)モデルをビームサーチデコードに組み込んだ汎用デコードアルゴリズムである。
その結果、提案したLiBSアルゴリズムは平均で+1.1 BLEUと+0.9 BLEUをWMTおよびOPUSデータセットで改善し、ターゲット外レートを22.9%から7.7%、65.8%から25.3%に削減した。
論文 参考訳(メタデータ) (2024-08-11T09:57:46Z) - LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation [84.38105530043741]
我々は,Language Converter Strategy (LCS) という,シンプルだが効果的な戦略を提案する。
ターゲット言語をトップエンコーダ層に埋め込むことで、LCSはエンコーダの混乱を緩和し、デコーダの安定した言語表示を保証する。
MultiUN、TED、OPUS-100データセットの実験結果は、LCSがターゲット外の問題を著しく軽減できることを示している。
論文 参考訳(メタデータ) (2024-06-05T02:52:17Z) - Building Accurate Translation-Tailored LLMs with Language Aware Instruction Tuning [57.323716555996114]
オフターゲット翻訳は、特に低リソース言語では未解決の問題である。
最近の研究は、翻訳命令の機能を強調するために高度なプロンプト戦略を設計するか、LLMの文脈内学習能力を活用している。
本研究では,LLMの命令追従能力(特に翻訳方向)を向上させるために,2段階の微調整アルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-03-21T13:47:40Z) - Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation [50.00235162432848]
我々は22Kパラレル文と12Mパラメータしか持たないALMAモデルを訓練する。
ALMA-Rと呼ばれる結果のモデルは、WMTコンテストの勝者とGPT-4のパフォーマンスと一致または上回ることができる。
論文 参考訳(メタデータ) (2024-01-16T15:04:51Z) - Rejuvenating Low-Frequency Words: Making the Most of Parallel Data in
Non-Autoregressive Translation [98.11249019844281]
知識蒸留(KD)は、非自己回帰翻訳(NAT)モデルを訓練するための合成データを構築するために一般的に用いられる。
低周波対象語に対するアライメントを向上するために,逆KDを提案する。
その結果,提案手法は翻訳品質を大幅に向上させることができることがわかった。
論文 参考訳(メタデータ) (2021-06-02T02:41:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。