論文の概要: Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation
- arxiv url: http://arxiv.org/abs/2608.28496v1
- Date: Fri, 28 Aug 2026 16:22:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.393853
- Title: Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation
- Title(参考訳): Ladders in Chaos: テストタイムのスケーリングがLLM機械翻訳を改善
- Authors: Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae,
- Abstract要約: 大規模言語モデル(LLM)の2種類のテストタイムスケーリングは、効果的で広く採用されているパラダイムとして現れている。
シーケンシャルサンプリングは高い性能の天井を持ち、より多様性があり効果的なサンプルプールを提供することを示す。
逐次スケーリングが機械翻訳を改善するメカニズムを説明する。
- 参考スコア(独自算出の注目度): 25.665966179023744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Two forms of test-time scaling for Large Language Models (LLMs) have emerged as effective and widely adopted paradigms: sequential, in which later answer attempts depend on earlier ones, and parallel, such as i.i.d. sampling with reranking. In this study, we investigate their properties in translation. First, our study shows that sequential sampling has a higher performance ceiling, providing a more diverse and effective pool of samples, particularly under smaller sampling budgets. Second, we interrogate the nature of test-time scaling through a multidimensional manual analysis. Human analysis of the Best-of-$N$ translations demonstrates that sequential sampling substantially improves translation fluency and naturalness, but can degrade accuracy when inference budgets are large. Finally, we suggest an explanation of the mechanism through which sequential scaling improves machine translation. Our controlled analysis partially attributes the success of sequential self-improvement to the model's access to a larger target-side context. Ablation experiments on sequential sampling demonstrate its robustness across different sampling temperatures, while also revealing sensitivity to context construction, suggesting directions for future improvement.
- Abstract(参考訳): 大規模言語モデル(LLM)に対する2種類のテスト時間スケーリングは、シーケンシャル(シーケンシャル)と、リグレードによるサンプリング(英語版)のような、後続の解答の試みが以前のものに依存している)という、効果的で広く採用されているパラダイムとして登場した。
本研究では,翻訳におけるそれらの特性について検討する。
まず, シーケンシャルサンプリングは高い性能の天井を持ち, より多彩で効果的なサンプルプールを提供する。
第2に,多次元手動解析によるテスト時間スケーリングの性質を疑問視する。
Best-of-N$翻訳の人間による分析は、シーケンシャルサンプリングは翻訳の流速と自然性を大幅に改善するが、推論予算が大きいと精度が低下することを示した。
最後に、逐次スケーリングが機械翻訳を改善するメカニズムについて説明する。
制御された分析は、モデルがより大きなターゲット・サイド・コンテキストにアクセスできるように、逐次自己改善の成功を部分的に考慮している。
逐次サンプリングにおけるアブレーション実験は、異なるサンプリング温度で頑健さを示すとともに、コンテキスト構築に対する感受性を示し、今後の改善の方向性を示す。
関連論文リスト
- LatentMT: Machine Translation with Latent Reasoning [30.307790715793942]
機械翻訳のための潜時推論ループLMの最初の体系的研究であるLatntMTを紹介する。
32の翻訳方向で、LatentMTは3倍から5倍のモデルに匹敵する性能を達成している。
LatentMTは、より大規模な非遅延推論モデルよりも低いトレーニングと推論計算を必要とする。
論文 参考訳(メタデータ) (2026-07-21T01:38:23Z) - A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models [25.248923429171498]
我々は,慣れ親しんだ信頼感に基づくリメイキングの軟化,誘惑型バージョンを用いることで,多様性を向上できることを示す。
以上の結果から,dLLMsの簡便,効率的,多種多様なサンプリングが可能であることが示唆された。
論文 参考訳(メタデータ) (2026-04-10T21:36:01Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Improving Network Interpretability via Explanation Consistency Evaluation [56.14036428778861]
本稿では、より説明可能なアクティベーションヒートマップを取得し、同時にモデル性能を向上させるフレームワークを提案する。
具体的には、モデル学習において、トレーニングサンプルを適応的に重み付けするために、新しいメトリクス、すなわち説明整合性を導入する。
そこで,本フレームワークは,これらのトレーニングサンプルに深い注意を払ってモデル学習を促進する。
論文 参考訳(メタデータ) (2024-08-08T17:20:08Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - A Preference-driven Paradigm for Enhanced Translation with Large Language Models [33.51585908894444]
大規模言語モデル(LLM)は,少数の並列データのみを用いて,優れた翻訳性能を実現する。
SFTは単にトークンレベルで参照翻訳を模倣するようにモデルに指示し、参照に存在するノイズに弱い。
この高原を克服するために、Planet-Luceモデルに基づく嗜好に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2024-04-17T11:52:47Z) - Iterative Translation Refinement with Large Language Models [25.90607157524168]
本稿では,翻訳を自己修正するために,大規模言語モデルを反復的に提案する。
また,評価における課題と,人間のパフォーマンスと翻訳との関係についても論じる。
論文 参考訳(メタデータ) (2023-06-06T16:51:03Z) - Prompting Large Language Model for Machine Translation: A Case Study [87.88120385000666]
我々は機械翻訳戦略の推進に関する体系的研究を行っている。
本稿では,プロンプトテンプレートと実演例選択の要因について検討する。
本稿では,モノリンガルデータの利用と,クロスリンガル,クロスドメイン,文-文書間伝達学習の実現可能性について検討する。
論文 参考訳(メタデータ) (2023-01-17T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。