論文の概要: Precision over Scale: A Polish-Silesian Benchmark and a Translation System Outperforming Open-Source and Commercial Models
- arxiv url: http://arxiv.org/abs/2610.01082v2
- Date: Sat, 03 Oct 2026 23:37:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.512765
- Title: Precision over Scale: A Polish-Silesian Benchmark and a Translation System Outperforming Open-Source and Commercial Models
- Title(参考訳): スケールの精度:ポーランド・シベリアベンチマークと翻訳システムによるオープンソースおよび商用モデルの性能向上
- Abstract要約: ニューラルシステムとルールベースシステムを用いて,ポーランド・エジプトのMTについて検討した。
ルールベースのシステムは、SiLTTとBOUQuETデータセットで一貫して最強であることを示す。
キュレートされたデータセットに微調整された翻訳Gemmaは、強い神経ベースラインよりも改善されるが、方言設定ではルールベースのシステムを超えない。
- 参考スコア(独自算出の注目度): 20.2080501644984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dialectal machine translation remains challenging due to limited data and strong linguistic variation not captured by standard benchmarks, which often assume standardized and well-edited text. We study Polish-Silesian MT using neural and rule-based systems, evaluating on SiLTT - a new Pol-Szl testset, alongside established BOUQuET and FLORES benchmarks. Results show our rule-based system is consistently strongest on SiLTT and BOUQuET datasets and that TranslateGemma fine-tuned on a curated dataset improves over strong neural baselines but does not surpass the rule-based system in dialectal settings. We release SiLTT and our best neural model to support further research.
- Abstract(参考訳): 標準的なベンチマークでは得られない限られたデータと強い言語的変化のため、しばしば標準化され、よく編集されたテキストを仮定するため、辞書機械翻訳は依然として困難である。
ニューラルシステムとルールベースシステムを用いてポーランド・エジプトのMTを研究し、確立したBOUQuETとFLORESベンチマークとともに、新しいPol-SzlテストセットであるSiLTTを評価した。
その結果、我々のルールベースシステムはSiLTTとBOUQuETデータセットで一貫して最強であり、キュレートされたデータセットで微調整されたTranslateGemmaは、強い神経ベースラインよりも改善されるが、方言設定ではルールベースシステムを超えないことがわかった。
我々はSiLTTと最良のニューラルモデルをリリースし、さらなる研究を支援します。
関連論文リスト
- Generating Adversarial Texts for Machine Translation via GRPO [9.016860740260679]
既存のテキストの書き直しに拡張性のある強化学習に基づくアプローチを提案する。
WMT25では,文法と可読性を保ちながら,平均COMET翻訳品質を0.63から0.48に大幅に低下させる。
未確認のWMT19-WMT24ベンチマークの評価により、この挙動がトレーニングデータを超えて一般化されることが確認された。
論文 参考訳(メタデータ) (2026-09-05T12:06:59Z) - Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets [2.0199251985015434]
データセットとベンチマークのスケーラブルで高品質な翻訳を可能にするために,完全に自動化されたフレームワークを提案する。
このアプローチを適用して、人気のあるベンチマークとデータセットを8つの東欧と南欧の言語に翻訳します。
論文 参考訳(メタデータ) (2026-02-25T18:58:25Z) - Unlocking Reasoning Capability on Machine Translation in Large Language Models [57.60641851466707]
推論指向の大規模言語モデル(RLM)は、明示的な中間推論を生成することにより、数学やコーディングといったタスクに強い利益をもたらす。
WMT24++ベンチマークを用いて,オープンおよびクローズドヘビー級のRCMを系統的に評価した。
明示的な推論を可能にすることは、言語やモデル間の翻訳品質を一貫して低下させる。
論文 参考訳(メタデータ) (2026-02-16T14:05:59Z) - Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation [49.82863380286994]
In-context Learningは、低リソース機械翻訳にLarge Language Modelsを適用する新しい方法を提供するかもしれない。
本研究では,Long-context モデルを用いた数千例のサンプルに対して,数ショット設定以上の低リソース機械翻訳ICLのスケーリングについて検討する。
JavaneseとSundaneseに関する我々の実験は、追加のコンテキストからのゲインがすばやく飽和し、最大コンテキストウィンドウの近くで分解可能であることを示している。
論文 参考訳(メタデータ) (2026-02-04T17:02:22Z) - Low-Resource English-Tigrinya MT: Leveraging Multilingual Models, Custom Tokenizers, and Clean Evaluation Benchmarks [6.177998679139308]
ニューラルネットワーク翻訳(NMT)の進歩にもかかわらず、Tigrinyaのような低リソース言語はいまだに保存されていない。
本稿では,多言語事前学習モデルを用いた翻訳学習手法について検討し,形態的に豊かな低リソース言語に対する翻訳品質を向上させる。
論文 参考訳(メタデータ) (2025-09-24T15:02:57Z) - KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization [64.1520245849231]
本稿では,KIT の低リソーストラック IWSLT 2025 への提出について述べる。
ケースドシステムとエンド・ツー・エンド(E2E)音声翻訳システムを開発した。
事前訓練されたモデルに基づいて、リソースを効率的に活用するためのさまざまな戦略でシステムを微調整します。
論文 参考訳(メタデータ) (2025-05-26T08:38:02Z) - Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data [64.4458540273004]
言語モデル(LLM)の単言語データと本質的な多言語知識のみを活用するセルフプレイフレームワークを提案する。
実験により、このアプローチは大規模並列データに基づいて訓練されたモデルの性能と一致するだけでなく、非英語翻訳の方向でも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-20T16:20:30Z) - GliLem: Leveraging GliNER for Contextualized Lemmatization in Estonian [0.21485350418225246]
GliLemはエストニア人のための新しいハイブリッド補題システムである。
本稿では,事前学習したGliNERモデルの柔軟性を活用し,Vabamorfの補間精度を向上させる。
論文 参考訳(メタデータ) (2024-12-29T22:02:00Z) - Neural Inverse Text Normalization [11.240669509034298]
逆テキスト正規化のための効率的かつ堅牢なニューラルソリューションを提案する。
言語の専門家が手作業でカリキュラムを作成する必要なく、他の言語に簡単に拡張できることが示される。
プリトレーニングと融合したトランスベースモデルは、複数のデータセットで一貫して低いwerを達成する。
論文 参考訳(メタデータ) (2021-02-12T07:53:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。