論文の概要: Quality-Aware Self-Correcting Speech Translation on an Edge Device
- arxiv url: http://arxiv.org/abs/2610.07545v1
- Date: Tue, 06 Oct 2026 00:21:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.722751
- Title: Quality-Aware Self-Correcting Speech Translation on an Edge Device
- Title(参考訳): エッジデバイスにおける品質を考慮した自己補正音声翻訳
- Abstract要約: 本稿では,Jetson Nano (4GB) 上で動作する完全オフライン音声音声音声変換パイプラインについて述べる。
多言語BERTトランスレータは品質推定(QE)ゲートとして機能し、信頼度が予め定義されたしきい値以下になると二次パス補正をトリガーする。
- 参考スコア(独自算出の注目度): 12.042300183299487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a fully offline speech-to-speech translation pipeline that runs on a Jetson Nano (4 GB) and corrects its own weak translations without retraining. A Whisper-tiny ASR feeds an Opus-MT translator; multilingual BERT cosine similarity acts as a Quality Estimation (QE) gate, triggering a secondary-pass correction when confidence falls below a pre-defined threshold $τ$. We compare three correction methods: QE reranking (M1), Minimum Bayes-Risk decoding (M2), and constrained beam search (M3). On 1,012 FLORES-200 sentences (English-Spanish), M2 at $τ=0.90$ produces statistically significant improvements over greedy decoding on BLEU (+0.67, p<0.001), ChrF (+0.51, p<0.001), and COMET (+0.0020 at N=3, p=0.002); M1 yields no significant gains, and M3 is significantly worse than baseline (p>0.99). Our central finding is that QE functions effectively as a gate but poorly as a ranker: removing the QE model from candidate selection (M1$\to$M2) does not hurt quality and frees 680 MB from the critical path. Using a gain-to-edit ratio adapted from the post-editing-effort literature, we further show that smaller candidate pools (N=3) yield more surgical corrections with better semantic adequacy, while larger pools (N=10) maximise lexical reward. We release the system and demonstrate live translation across six language pairs.
- Abstract(参考訳): 本稿では,Jetson Nano (4GB) 上で動作する完全オフライン音声音声音声変換パイプラインについて述べる。
マルチリンガルBERTコサイン類似性は品質推定(QE)ゲートとして機能し、信頼度が予め定義された閾値$τ$を下回ったときに二次パス補正を引き起こす。
QE復位法(M1)、最小ベイズ・リスク復号法(M2)、制約ビーム探索法(M3)の3つの補正法を比較した。
1,012 FLORES-200文(英語-スペイン語)では、M2 at $τ=0.90$はBLEU (+0.67, p<0.001), ChrF (+0.51, p<0.001), COMET (+0.0020 at N=3, p=0.002), M1は有意な利得を得られず、M3はベースライン (p>0.99) よりも著しく劣る。
我々の中心的な発見は、QEはゲートとして効果的に機能するが、ランサーとして不十分である: 候補選択からQEモデルを取り除く(M1$\to$M2)ことは品質を損なわず、クリティカルパスから680MBを解放する。
さらに, 編集後効用文献に適合するゲイン・ツー・エジット比を用いて, より小さい候補プール (N=3) の方が, 意味的精度が良く, より大きいプール (N=10) は語彙的報酬を最大化できることを示した。
システムを公開し、6つの言語対のライブ翻訳を実演する。
関連論文リスト
- TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis [0.9861185030860833]
TriAgentは、コンテキストの粒度によって成文化されたマルチエージェント委員会である。
3方向のディバージェンス指数は粒度の不一致を測る。
コード、レキシコン、SCDがリリースされる。
論文 参考訳(メタデータ) (2026-07-22T06:20:32Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators [53.91199933655421]
大規模言語モデル(LLM)は、機械翻訳(MT)の品質評価の裁判官として大きな可能性を秘めている。
非インパクト的なエラーをフィルタリングするアイデアに基づいて、ユニバーサルでトレーニング不要なフレームワークである$textbfMQM-APEを紹介します。
実験の結果,GEMBA-MQMに対する誤差の信頼性と品質の両方が一貫して改善されていることがわかった。
論文 参考訳(メタデータ) (2024-09-22T06:43:40Z) - Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024 [61.189875635090225]
大規模言語モデル (LLM) は現在,自動音声認識 (ASR) や機械翻訳 (MT) ,さらにはエンドツーエンド音声翻訳 (ST) など,さまざまなタスクを探索中である。
論文 参考訳(メタデータ) (2024-06-24T16:38:17Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Mismatching-Aware Unsupervised Translation Quality Estimation For
Low-Resource Languages [6.049660810617423]
XLMRScoreは、XLM-RoBERTa (XLMR)モデルで計算されたBERTScoreの言語間対応である。
WMT21QE共有タスクの4つの低リソース言語対に対して提案手法を評価する。
論文 参考訳(メタデータ) (2022-07-31T16:23:23Z) - BitextEdit: Automatic Bitext Editing for Improved Low-Resource Machine
Translation [53.55009917938002]
自動編集によりマイニングしたビットクストを改良することを提案する。
提案手法は,5つの低リソース言語ペアと10の翻訳方向に対して,最大8個のBLEUポイントでCCMatrixマイニングビットクストの品質を向上することを示す。
論文 参考訳(メタデータ) (2021-11-12T16:00:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。