論文の概要: The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar
- arxiv url: http://arxiv.org/abs/2606.26015v1
- Date: Wed, 24 Jun 2026 16:36:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.396788
- Title: The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar
- Title(参考訳): 低リソース言語におけるテキストデトックス化のための Tatoxa システム-- Tatar の場合
- Abstract要約: タトキサ (Tatoxa) は、タタール語でテキストをデトキシ化するための最先端のシステムである。
本稿では,低リソース環境下での微調整と評価を目的としたテキストデトキシフィケーションのための新しいデータセットについて紹介する。
言語間移動実験は、文化的に近いロシア語を含む他の言語からの移動が、ネイティブなタタール語の訓練よりも著しく悪いことを示唆している。
- 参考スコア(独自算出の注目度): 43.128536728679016
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text detoxification, the automated detection and mitigation of abusive and harmful content, is essential for ensuring the safety of online communities and protecting users. However, low resource languages such as Tatar have received little research attention. In this paper we present Tatoxa, a novel state-of-the-art system for text detoxification in the Tatar language. Comparative experiments show that the proposed approach outperforms existing open source and proprietary commercial LLMs on key quality metrics. We also introduce a new dataset for text detoxification in Tatar, designed for fine tuning and evaluation in low resource settings. Finally, cross lingual transfer experiments indicate that transfer from other languages, including the culturally close Russian, performs significantly worse than training on native Tatar data even when a large Russian corpus is available.
- Abstract(参考訳): テキスト・デトキシフィケーション(テキスト・デトキシフィケーション、テキスト・デトキシフィケーション)は、悪質で有害なコンテンツを自動検出・緩和する手法であり、オンライン・コミュニティの安全確保とユーザー保護に不可欠である。
しかし、タタール語のような低資源言語はほとんど研究の対象になっていない。
本稿では,タタール語におけるテキストのデトックス化のための新しい最先端システムであるTatoxaについて述べる。
比較実験により、提案手法は、主要な品質指標において、既存のオープンソースおよびプロプライエタリな商用LCMよりも優れていることが示された。
また,低リソース環境下での微調整と評価を目的としたテキストデトキシフィケーションのための新しいデータセットも導入した。
最後に、言語間移動実験により、文化に密接なロシア人を含む他の言語からの移動は、大規模なロシア人コーパスが利用可能である場合でも、タタールのネイティブデータでの訓練よりも著しく悪化していることが示された。
関連論文リスト
- Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics [69.2321983942375]
本研究では,n-gram-based metricであるBLEUと,文字-based metricであるChrF++を比較して,EMRL設定におけるMT評価を行う。
本研究は,3つのELRL(Magahi,Bhojpuri,Chhattisgarhi)にまたがる幻覚,反復,原文複写,ダイアクリティック(textitmatra)の変化など,各指標が翻訳物にどう反応するかを検討する。
最近の研究はChrF++にのみ依存することが多いが、BLEUは絶対スコアが低いにもかかわらず、解釈可能性を改善するための補完的な語彙精度の洞察を提供する。
論文 参考訳(メタデータ) (2026-02-19T14:56:42Z) - Text Detoxification in isiXhosa and Yorùbá: A Cross-Lingual Machine Learning Approach for Low-Resource African Languages [0.0]
Toxic Languageは、安全なオンライン参加のための大きな障壁の1つだが、アフリカ言語では堅牢な緩和ツールが不足している。
本研究は,2つの低資源アフリカ言語isiXhosaとYorbの自動テキストデトックス化(中和に有害な)について検討した。
論文 参考訳(メタデータ) (2026-01-09T08:28:58Z) - Low-Resource English-Tigrinya MT: Leveraging Multilingual Models, Custom Tokenizers, and Clean Evaluation Benchmarks [6.177998679139308]
ニューラルネットワーク翻訳(NMT)の進歩にもかかわらず、Tigrinyaのような低リソース言語はいまだに保存されていない。
本稿では,多言語事前学習モデルを用いた翻訳学習手法について検討し,形態的に豊かな低リソース言語に対する翻訳品質を向上させる。
論文 参考訳(メタデータ) (2025-09-24T15:02:57Z) - Evaluating Text Style Transfer: A Nine-Language Benchmark for Text Detoxification [66.69370876902222]
本研究は,9言語にわたるテキストデトックス化システムの評価に関する総合的多言語研究である。
我々は,現代のニューラルベース評価モデルの有効性を,プロンプトベースLCM-as-a-judgeアプローチと併用して評価する。
本研究は,より信頼性の高い多言語TST評価パイプラインを設計するための実用的なレシピを提供する。
論文 参考訳(メタデータ) (2025-07-21T12:38:07Z) - Chain-of-Translation Prompting (CoTR): A Novel Prompting Technique for Low Resource Languages [0.4499833362998489]
Chain of Translation Prompting (CoTR)は、低リソース言語における言語モデルの性能を高めるために設計された新しい戦略である。
CoTR再構成は、まず入力コンテキストを低リソース言語から高リソース言語に翻訳する。
本稿では,この手法の有効性を低リソースのインディア言語であるMarathiのケーススタディを通じて実証する。
論文 参考訳(メタデータ) (2024-09-06T17:15:17Z) - Toxicity Classification in Ukrainian [11.847477933042777]
ラベル付きバイナリ毒性分類コーパスは、アノテーションプロセスのリソース集約性を考えると、すべての言語で利用できない。
本研究では,英語コーパスからの翻訳,キーワードを用いた有毒なサンプルのフィルタリング,クラウドソーシングによる注釈付けなどにより,言語間知識伝達技術を調査し,ラベル付きコーパスを作成することにより,このギャップを埋めることを目的とする。
論文 参考訳(メタデータ) (2024-04-27T09:20:13Z) - Exploring Methods for Cross-lingual Text Style Transfer: The Case of
Text Detoxification [77.45995868988301]
テキスト・デトックス化(text detoxification)とは、テキストのスタイルを有害から中立に移行させる作業である。
本稿では,言語間テキストのデトックス化戦略を大規模に検討する。
論文 参考訳(メタデータ) (2023-11-23T11:40:28Z) - No Language Left Behind: Scaling Human-Centered Machine Translation [69.28110770760506]
低レベルの言語と高レベルの言語のパフォーマンスギャップを狭めるためのデータセットとモデルを作成します。
何千ものタスクをトレーニングしながらオーバーフィッティングに対処するために,複数のアーキテクチャとトレーニングの改善を提案する。
本モデルでは,従来の最先端技術と比較して,BLEUの44%の改善を実現している。
論文 参考訳(メタデータ) (2022-07-11T07:33:36Z) - Methods for Detoxification of Texts for the Russian Language [55.337471467610094]
我々は、攻撃的言語と戦うために、ロシア語のテキストを自動で解毒する研究を初めて紹介する。
我々は、局所的な修正を行う教師なしアプローチと、事前訓練された言語GPT-2モデルに基づく教師なしアプローチの2種類のモデルをテストする。
以上の結果から, 改良の余地はあるものの, 脱毒に有効であることが明らかとなった。
論文 参考訳(メタデータ) (2021-05-19T10:37:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。