論文の概要: Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
- arxiv url: http://arxiv.org/abs/2607.29287v1
- Date: Fri, 31 Jul 2026 10:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.69733
- Title: Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
- Title(参考訳): 思考による翻訳:多ドメイン機械翻訳のための強化学習による難易度適応推論
- Abstract要約: 本稿では,直観的推論と意図的推論の推論を学習するリソースレーショナルフレームワークであるTwT(Translation with Thought)を提案する。
TwTは,(1)DeepSeek-R1から抽出し,GPT-4oで書き直してヒトライクな推論経済を反映させる,(2)翻訳品質と推論効率を最適化するためのハイブリッド報酬を用いた強化学習の2段階で訓練されている。
- 参考スコア(独自算出の注目度): 19.884019376360456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-domain machine translation (MDMT) poses a unique challenge due to varying levels of linguistic complexity across domains. Inspired by human translators' ability to adapt reasoning effort based on difficulty, we propose TwT (Translation with Thought), a resource-rational framework that learns to modulate inference between intuitive and deliberate reasoning. TwT is trained in two stages: (1) supervised fine-tuning on difficulty-aware long chain-of-thought traces distilled from DeepSeek-R1 and rewritten by GPT-4o to reflect human-like reasoning economy, and (2) reinforcement learning with a hybrid reward to optimize translation quality and reasoning efficiency. Evaluated on 15 benchmarks spanning in-domain and out-of-domain settings, as well as 3 seen and 59 unseen languages, with ablations across three backbone models, TwT-7B and TwT-14B outperform much larger SOTA reasoning models in translation quality, while reducing token usage by 32--60\%. These results confirm that aligning translation behavior with cognitive principles enables robust generalization, high translation quality, and efficient reasoning in MDMT.
- Abstract(参考訳): マルチドメイン機械翻訳(MDMT)は、ドメイン間の言語的複雑さのレベルが異なるため、ユニークな課題である。
難易度に基づいて推論に適応する人間翻訳者の能力に触発され,直感的推論と意図的推論の推論を学習するリソース・レーショナル・フレームワークであるTwT(Translation with Thought)を提案する。
TwTは,(1)DeepSeek-R1から抽出し,GPT-4oで書き直してヒトライクな推論経済を反映させる,(2)翻訳品質と推論効率を最適化するためのハイブリッド報酬を用いた強化学習の2段階で訓練されている。
3つのバックボーンモデル、TwT-7BとTwT-14Bは、翻訳品質においてずっと大きなSOTA推論モデルより優れており、トークン使用率を32-60-%削減している。
これらの結果は, MDMTにおける翻訳行動と認知原理の整合性によって, 堅牢な一般化, 高翻訳品質, 効率的な推論が可能であることが確認された。
関連論文リスト
- ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation [63.89730738735446]
機械翻訳のための2段階反射内在化アルゴリズムであるReflectMTを提案する。
提案手法は,強化学習を通じて,モデルの「翻訳-反射-精製」機能を開発する。
WMT24のようなデータセットに対する実験結果から、推論時のモデルのファーストパス変換がマルチステップ推論のLRMよりも優れていることが示された。
論文 参考訳(メタデータ) (2026-04-21T06:48:41Z) - Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation [68.85147984815778]
本稿では, EA-RLVR(Entity-Anchored Reinforcement Learning with Verifiable Rewards)を提案する。
EA-RLVRは、検証可能なエンティティレベルの報酬信号の監視をアンカーし、最適化を安定させるために軽量な構造ゲートを組み込む。
EA-RLVRをXC-Translate上で評価し、エンティティ翻訳精度とドメイン外一般化の両面で一貫した改善を観察する。
論文 参考訳(メタデータ) (2026-04-18T07:15:43Z) - On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning [63.41902113656453]
長いチェーン・オブ・ソート(CoT)軌道上でのSFT(Supervised Fine-Tuning)は、大きな推論モデルを構築する上で重要なフェーズとなっている。
2つの競合モデルによって生成された2つの検証されたCoT軌道源を用いて比較研究を行う。
textttDeepSeek-R1-0528データ上のSFTは、トレーニング損失を著しく低減するが、一般化性能は著しく低下する。
論文 参考訳(メタデータ) (2026-04-02T07:00:54Z) - Unlocking Reasoning Capability on Machine Translation in Large Language Models [57.60641851466707]
推論指向の大規模言語モデル(RLM)は、明示的な中間推論を生成することにより、数学やコーディングといったタスクに強い利益をもたらす。
WMT24++ベンチマークを用いて,オープンおよびクローズドヘビー級のRCMを系統的に評価した。
明示的な推論を可能にすることは、言語やモデル間の翻訳品質を一貫して低下させる。
論文 参考訳(メタデータ) (2026-02-16T14:05:59Z) - Test-Time Scaling of Reasoning Models for Machine Translation [16.317481079574065]
テスト時間スケーリング(TTS)は、数学やコーディングといった様々なタスクにおける推論モデル(RM)の性能を向上させる。
本稿では,推論時間の増大により翻訳品質が向上するかどうかを考察する。
論文 参考訳(メタデータ) (2025-10-07T21:15:18Z) - ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models [76.28894983518164]
小型言語モデル (SLM) は大規模言語モデル (LLM) に代わる費用対効果がある。
彼らはしばしば、限られた能力と間違いや一貫性のない答えを生み出す傾向があるため、複雑な推論に苦しむ。
本稿では、垂直領域における堅牢かつ自己充足的推論のための強化学習フレームワークであるReaLMを紹介する。
論文 参考訳(メタデータ) (2025-08-17T14:50:23Z) - R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning [23.721573333602677]
本稿では,R1-Translator (R1-T1)について紹介する。
提案手法は3つの革新を先導する:(1)より広いMTシナリオ(例えば、マルチリンガルMT、ドメインMT)への推論に基づく翻訳の拡張、(2)コンテキスト認識パラフレーズやバック翻訳のようなハイブリッドな人間の戦略を反映する6つの専門家によるCoTテンプレートの定式化、(3)RLによるCoT発見の実現。
論文 参考訳(メタデータ) (2025-02-27T03:57:00Z) - LLM-based Translation Inference with Iterative Bilingual Understanding [52.46978502902928]
大規模言語モデル(LLM)の言語間機能に基づいた,新しい反復的バイリンガル理解翻訳法を提案する。
LLMの言語横断的能力により、ソース言語とターゲット言語を別々にコンテキスト理解することが可能になる。
提案したIBUTは、いくつかの強力な比較法より優れている。
論文 参考訳(メタデータ) (2024-10-16T13:21:46Z) - Large Language Model for Multi-Domain Translation: Benchmarking and Domain CoT Fine-tuning [55.107329995417786]
大規模言語モデル(LLM)は、目覚ましい一般的な理解と生成能力を示している。
我々は、25のドイツ語$Leftrightarrow$ Englishと22の中国語$Leftrightarrow$ Englishテストセットを特徴とするマルチドメイン翻訳のベンチマークを確立する。
本稿では,LLMの内在的マルチドメインインテリジェンスを活用し,翻訳性能を向上させるためのドメインチェーン・オブ・シント(CoT)ファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2024-10-03T16:15:04Z) - Exploiting Curriculum Learning in Unsupervised Neural Machine
Translation [28.75229367700697]
複数の粒度から擬似バイテキストを徐々に活用するカリキュラム学習手法を提案する。
WMT 14 En-Fr, WMT 16 En-De, WMT 16 En-Ro, LDC En-Zh 翻訳タスクの実験結果から,提案手法はより高速な収束速度で一貫した改善を実現することが示された。
論文 参考訳(メタデータ) (2021-09-23T07:18:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。