論文の概要: Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation
- arxiv url: http://arxiv.org/abs/2609.26536v1
- Date: Tue, 22 Sep 2026 14:57:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.711847
- Title: Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation
- Title(参考訳): Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation (英語)
- Abstract要約: グループ相対ポリシー最適化(GRPO)による共同認識と翻訳の微調整を提案する。
我々は、モデル生成した転写文に翻訳条件を付け、転写文と翻訳文の双方をスコアし、3つのトークン利点戦略を比較した。
CoT GRPO は CoVoST 2 と FLEURS で直接 ST GRPO を 1.77 と 0.83 で上回っている。
- 参考スコア(独自算出の注目度): 10.554478796710038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In LLM-based speech translation, transcription-based chain-of-thought (CoT) suffers from a mismatch between reference transcripts used in supervised fine-tuning (SFT) and model-generated transcripts at inference. To address this, we propose joint recognition and translation fine-tuning via group relative policy optimization (GRPO). We score both transcripts and translations, with translation conditioned on model-generated transcripts, and compare three token advantage strategies. Using Qwen2.5-Omni-3B across four languages, we evaluate CoT against direct speech translation (Direct ST) under SFT and GRPO, training on CoVoST 2 and testing on CoVoST 2 and FLEURS. CoT GRPO outperforms Direct ST GRPO by 1.77 and 0.83 average BLEU points on CoVoST 2 and FLEURS. Compared to CoT SFT, GRPO boosts BLEU by 0.82 and 0.67 points and reduces word error rate (WER) by 8.8% and 7.2% relatively. These results highlight reinforcement fine-tuning as an effective method to mitigate the training-inference mismatch, jointly improving recognition and translation.
- Abstract(参考訳): LLMに基づく音声翻訳では、転写に基づくチェーン・オブ・シークレット(CoT)は、教師付き微調整(SFT)で使用される参照転写と推論時のモデル生成転写とのミスマッチに悩まされる。
そこで我々は,グループ相対ポリシー最適化(GRPO)による共同認識と翻訳の微調整を提案する。
我々は、モデル生成した転写文に翻訳条件を付け、転写文と翻訳文の双方をスコアし、3つのトークン利点戦略を比較した。
4言語にわたるQwen2.5-Omni-3Bを用いて、SFTおよびGRPOによる直接音声翻訳(Direct ST)に対するCoTの評価、CoVoST 2でのトレーニング、CoVoST 2およびFLEURSでの試験を行った。
CoT GRPO は CoVoST 2 と FLEURS で直接 ST GRPO を 1.77 と 0.83 で上回っている。
CoT SFTと比較すると、GRPOはBLEUを0.82ポイント、0.67ポイント、ワードエラー率(WER)を8.8%、相対的に7.2%向上させる。
これらの結果は、トレーニングと推論のミスマッチを緩和し、認識と翻訳を共同的に改善する効果的な方法として強化微調整を強調した。
関連論文リスト
- Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - NL in the Middle: Code Translation with LLMs and Intermediate Representations [56.77064674776534]
大きな言語モデル(LLM)はバグのあるコード翻訳を生成する。
翻訳精度を向上させるための有望な道の1つは中間表現である。
LLMに基づくコード翻訳が中間表現の恩恵を受けるかどうかを検討する。
論文 参考訳(メタデータ) (2025-07-11T14:29:21Z) - R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning [23.721573333602677]
本稿では,R1-Translator (R1-T1)について紹介する。
提案手法は3つの革新を先導する:(1)より広いMTシナリオ(例えば、マルチリンガルMT、ドメインMT)への推論に基づく翻訳の拡張、(2)コンテキスト認識パラフレーズやバック翻訳のようなハイブリッドな人間の戦略を反映する6つの専門家によるCoTテンプレートの定式化、(3)RLによるCoT発見の実現。
論文 参考訳(メタデータ) (2025-02-27T03:57:00Z) - Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning [32.883836078329665]
MLLM(Multimodal Large Language Models)は、音声テキスト翻訳(S2TT)タスクにおいて大きな成功を収めている。
本稿では,大規模言語モデルの機械翻訳機能を活用し,S2TTタスクに適応する3段階のカリキュラム学習戦略を提案する。
実験結果から,提案手法は15時間14ドルの言語対で最先端の平均性能を実現することが示された。
論文 参考訳(メタデータ) (2024-09-29T01:48:09Z) - Prosody in Cascade and Direct Speech-to-Text Translation: a case study
on Korean Wh-Phrases [79.07111754406841]
本研究は,韻律が重要な役割を果たす発話を明瞭にするための直接S2TTシステムの能力を評価するために,コントラスト評価を用いることを提案する。
本結果は,カスケード翻訳モデルよりも直接翻訳システムの価値を明確に示すものである。
論文 参考訳(メタデータ) (2024-02-01T14:46:35Z) - CTC-based Non-autoregressive Speech Translation [51.37920141751813]
非自己回帰音声翻訳における接続性時間分類の可能性について検討する。
我々は、CTCによって誘導される2つのエンコーダからなるモデルを構築し、ソースおよびターゲットテキストを予測する。
MuST-Cベンチマークの実験では、我々のNASTモデルは平均BLEUスコアが29.5であり、スピードアップは5.67$times$である。
論文 参考訳(メタデータ) (2023-05-27T03:54:09Z) - WACO: Word-Aligned Contrastive Learning for Speech Translation [11.67083845641806]
音声翻訳(E2E)は、ソース音声を直接ターゲットテキストに変換することを目的としている。
既存のST手法は、訓練用に極小の音声テキストデータしか利用できない場合、性能が良くない。
極めて低音源の音声からテキストへの翻訳をシンプルかつ効果的に行うためのワードアラインド・コントラスト学習(WACO)を提案する。
論文 参考訳(メタデータ) (2022-12-19T10:49:35Z) - On the Complementarity between Pre-Training and Back-Translation for
Neural Machine Translation [63.914940899327966]
事前学習(PT)と後方翻訳(BT)は単言語データを利用するためのシンプルで強力な方法である。
本稿では,PTとBTの相補性について検討する。
我々は、WMT16英語-ルーマニア語と英語-ロシア語ベンチマークで最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2021-10-05T04:01:36Z) - BERTTune: Fine-Tuning Neural Machine Translation with BERTScore [7.0471949371778795]
本稿では,最近提案したBERTScore評価基準に基づいて,新しい学習目標を用いた微調整ニューラルマシン翻訳モデルを提案する。
BERTScoreは、n-gramベースのメトリクスの典型的な制限を克服するコンテキスト埋め込みに基づくスコアリング関数である。
4つ以上の多様な言語ペアの実験は、BLEUスコアの最大0.58pp (3.28%)、強いベースラインを微調整する際のBERTScoreの最大0.76pp (0.98%)の改善を達成した。
論文 参考訳(メタデータ) (2021-06-04T02:13:59Z) - Rejuvenating Low-Frequency Words: Making the Most of Parallel Data in
Non-Autoregressive Translation [98.11249019844281]
知識蒸留(KD)は、非自己回帰翻訳(NAT)モデルを訓練するための合成データを構築するために一般的に用いられる。
低周波対象語に対するアライメントを向上するために,逆KDを提案する。
その結果,提案手法は翻訳品質を大幅に向上させることができることがわかった。
論文 参考訳(メタデータ) (2021-06-02T02:41:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。