論文の概要: Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages
- arxiv url: http://arxiv.org/abs/2603.27651v1
- Date: Sun, 29 Mar 2026 11:55:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.05612
- Title: Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages
- Title(参考訳): Budget-Xfer:アフリカ語への言語間移動のための予算制約付きソース言語選択
- Authors: Tewodros Kederalah Idris, Roald Eiselen, Prasenjit Mitra,
- Abstract要約: 言語間変換学習は低リソース言語でNLPを実現する。
Budget-Xferはマルチソース言語間移動を定式化するフレームワークである。
アフリカの3言語を対象として,名前付きエンティティ認識と感情分析にまたがる4つのアロケーション戦略を評価した。
- 参考スコア(独自算出の注目度): 12.074798555934855
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-lingual transfer learning enables NLP for low-resource languages by leveraging labeled data from higher-resource sources, yet existing comparisons of source language selection strategies do not control for total training data, confounding language selection effects with data quantity effects. We introduce Budget-Xfer, a framework that formulates multi-source cross-lingual transfer as a budget-constrained resource allocation problem. Given a fixed annotation budget B, our framework jointly optimizes which source languages to include and how much data to allocate from each. We evaluate four allocation strategies across named entity recognition and sentiment analysis for three African target languages (Hausa, Yoruba, Swahili) using two multilingual models, conducting 288 experiments. Our results show that (1) multi-source transfer significantly outperforms single-source transfer (Cohen's d = 0.80 to 1.98), driven by a structural budget underutilization bottleneck; (2) among multi-source strategies, differences are modest and non-significant; and (3) the value of embedding similarity as a selection proxy is task-dependent, with random selection outperforming similarity-based selection for NER but not sentiment analysis.
- Abstract(参考訳): 言語間変換学習は、高ソースソースからのラベル付きデータを活用することで、低リソース言語に対してNLPを可能にするが、既存のソース言語選択戦略の比較では、トレーニングデータ全体の制御は行わず、言語選択効果とデータ量効果との相違がある。
Budget-Xferは、予算制約のあるリソース割り当て問題としてマルチソース言語間転送を定式化するフレームワークである。
固定されたアノテーション予算Bを与えられたフレームワークは、どのソース言語をどのソース言語に含めるか、どのくらいのデータを割り当てるかを共同で最適化します。
複数言語モデルを用いて3つのアフリカ目標言語(Hausa, Yoruba, Swahili)に対して、名前付きエンティティ認識と感情分析にまたがる4つのアロケーション戦略を評価し、288の実験を行った。
以上の結果から,(1) マルチソース転送は,構造的予算不利用ボトルネックによる単一ソース転送(Cohen's d = 0.80 - 1.98)よりも有意に優れ,(2) マルチソース戦略では差は小さく,非重要であり,(3) 選択プロキシとしての類似性を組み込む価値はタスク依存であり,ランダム選択はNERの類似性に基づく選択よりも優れるが,感情分析には勝っていないことが示唆された。
関連論文リスト
- Bridging the Data Gap: Creating a Hindi Text Summarization Dataset from the English XSUM [2.893226191913102]
本研究では、包括的なヒンディー語テキスト要約データセットを作成するための費用対効果の高い自動化フレームワークを提案する。
英語 Extreme Summarization (XSUM) データセットを情報源として,高度な翻訳手法と言語適応手法を採用する。
結果として得られたデータセットは、オリジナルのXSUMコーパスの複雑さを反映した多種多様なマルチテーマリソースを提供する。
論文 参考訳(メタデータ) (2026-01-04T14:38:58Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Revisiting Projection-based Data Transfer for Cross-Lingual Named Entity Recognition in Low-Resource Languages [8.612181075294327]
本手法は, クロスリンガルNERに有効な手法であることを示す。
本稿では,対象候補を抽出したソースエンティティとマッチングする新しい形式化されたプロジェクション手法を提案する。
これらの知見は、低リソース言語におけるクロスリンガルなエンティティ認識のためのモデルベース手法の代替として、プロジェクションベースのデータ転送の堅牢性を強調している。
論文 参考訳(メタデータ) (2025-01-30T21:00:47Z) - CROP: Zero-shot Cross-lingual Named Entity Recognition with Multilingual
Labeled Sequence Translation [113.99145386490639]
言語間NERは、整列した言語間表現や機械翻訳結果を通じて、言語間で知識を伝達することができる。
ゼロショット言語間NERを実現するために,クロスランガル・エンティティ・プロジェクション・フレームワーク(CROP)を提案する。
多言語ラベル付きシーケンス翻訳モデルを用いて、タグ付けされたシーケンスをターゲット言語に投影し、ターゲットの原文にラベル付けする。
論文 参考訳(メタデータ) (2022-10-13T13:32:36Z) - A Dual-Contrastive Framework for Low-Resource Cross-Lingual Named Entity
Recognition [5.030581940990434]
クロスランガルな名前付きエンティティ認識(NER)は、低リソース言語におけるデータ空白問題を緩和できるため、最近研究ホットスポットになっている。
本稿では,言語間NERのための2言語コントラストフレームワーク ConCNER について述べる。
論文 参考訳(メタデータ) (2022-04-02T07:59:13Z) - Distributionally Robust Multilingual Machine Translation [94.51866646879337]
本稿では,分散的ロバストな最適化に基づくMNMT(Multilingual Neural Machine Translation)の新しい学習目標を提案する。
この目的を,反復的最適応答方式を用いて,大規模翻訳コーパスに対して実用的に最適化する方法を示す。
本手法は,多対一の翻訳設定と多対多の翻訳設定の両方において,平均と言語毎のパフォーマンスにおいて,強いベースライン法より一貫して優れる。
論文 参考訳(メタデータ) (2021-09-09T03:48:35Z) - On the Language Coverage Bias for Neural Machine Translation [81.81456880770762]
言語カバレッジバイアスは、ニューラルネットワーク翻訳(NMT)において重要である。
実験を慎重に設計することにより、トレーニングデータにおける言語カバレッジバイアスの包括的分析を行う。
本稿では,言語カバレッジバイアス問題を軽減するための,シンプルで効果的な2つのアプローチを提案する。
論文 参考訳(メタデータ) (2021-06-07T01:55:34Z) - AdvPicker: Effectively Leveraging Unlabeled Data via Adversarial
Discriminator for Cross-Lingual NER [2.739898536581301]
エンコーダがラベル付きソースコードからエンティティドメインの知識を学習する逆学習フレームワークを設計する。
提案手法は, このデータ選択プロセスの恩恵を強く受け, 既存の最先端手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-06-04T07:17:18Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。