論文の概要: Improving Language Identification for Code-Switched Utterances with Integer Linear Programming
- arxiv url: http://arxiv.org/abs/2609.05099v1
- Date: Fri, 04 Sep 2026 13:30:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:24.041227
- Title: Improving Language Identification for Code-Switched Utterances with Integer Linear Programming
- Title(参考訳): 整数線形計画法によるコードスイッチ付き発話の言語識別の改善
- Abstract要約: 本稿では,コードスイッチング(CS)識別のための最先端技術であるMaskLIDを再検討する。
MaskLIDはトレーニングを必要とせず、任意の言語の組み合わせを検出する。
a) MaskLIDの大きな問題、(b) 基礎となる最適化アルゴリズムを線形プログラムとして再構成すること、(c) これらの改善はいずれもベースラインシステムを大幅に改善する。
- 参考スコア(独自算出の注目度): 19.883639598026253
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Automatic identification of code-switched (CS) utterances remains a challenge for language identification (LID) systems, causing such texts to be underrepresented in the training data of Large Language Models. In this paper, we revisit MaskLID, a state-of-the art approach for CS identification, which requires no training and detects arbitrary language combinations. We make three main contributions: (a) we reveal, and address, a major issue of MaskLID: its overreliance on word-level language association scores; (b) we reformulate the underlying optimization algorithm as an Integer Linear Program, enabling us to experiment with a large set of clear and interpretable constraints; (c) each of these improvements vastly improves the baseline system, as we illustrate in experiments involving 10~diverse languages, where we observe a strong boost in performance on CS benchmarks. We release our code and data for reproducibility.
- Abstract(参考訳): Code-switched (CS) 発話の自動識別は、言語識別 (LID) システムにとって依然として課題であり、そのようなテキストは大規模言語モデルの訓練データでは不足している。
本稿では,CS識別のための最先端技術であるMaskLIDを再検討し,学習を必要とせず,任意の言語の組み合わせを検出する。
主な貢献は3つあります。
(a)maskLIDの重要課題である単語レベルの言語関連得点への過度依存を明らかにする。
b) 基礎となる最適化アルゴリズムを整数線形プログラムとして再構成し, 明確かつ解釈可能な制約の集合を実験できるようにした。
(c) それぞれの改良はベースラインシステムを大幅に改善し、CSベンチマークの性能向上を観測する10-diverse言語に関する実験で示されるように、ベースラインシステムを大幅に改善する。
再現性のためのコードとデータをリリースします。
関連論文リスト
- Code-Switching Information Retrieval: Benchmarks, Analysis, and the Limits of Current Retrievers [32.12010196874932]
CSR-L(Code-Switching Retrieval benchmark-Lite)を導入し、人間のアノテーションを用いてデータセットを構築し、混合言語クエリの真の自然性を捉える。
コードスイッチングが基本的なパフォーマンスボトルネックとして機能し、堅牢な多言語モデルの有効性を低下させることを示す。
論文 参考訳(メタデータ) (2026-04-19T22:01:41Z) - What Language is This? Ask Your Tokenizer [32.28976119949841]
言語識別(LID)は多くの多言語自然言語処理パイプラインの重要なコンポーネントである。
我々は,UnigramLMトークン化アルゴリズムに基づくシンプルで効率的なLID手法UniLIDを紹介する。
我々の定式化は、データと計算効率が良く、既存のモデルを再訓練することなく、新しい言語の漸進的な追加をサポートしています。
論文 参考訳(メタデータ) (2026-02-19T18:58:39Z) - Beyond Language Barriers: Multi-Agent Coordination for Multi-Language Code Generation [8.896718697354187]
XL-CoGenは、複数のプログラミング言語で高品質なコードを生成する。
中間表現、コード生成、翻訳、自動修復を統合する。
論文 参考訳(メタデータ) (2025-09-24T09:18:08Z) - DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching [8.14614722074297]
言語識別(Language Identification、LID)は多言語NLPにおける中核的なタスクである。
本研究はDIVERS-BENCHを導入し,多分野にわたる最先端のLIDモデルの包括的評価を行った。
これらの結果から, モデルが評価されたデータセットに対して高い精度を達成する一方で, ノイズや非公式な入力に対して, 性能が著しく低下することが明らかとなった。
論文 参考訳(メタデータ) (2025-09-22T13:32:31Z) - Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training [58.696660064190475]
コンテクスト内の異なる言語間を交互に交換するコードスイッチの存在が、多言語機能の鍵であることに気付きました。
事前学習における言語アライメントのためのコードスイッチングのパワーをよりよく探求するために,合成コードスイッチングの戦略について検討する。
論文 参考訳(メタデータ) (2025-04-02T15:09:58Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention [71.12193680015622]
大規模言語モデル(LLM)は自然言語処理において顕著な能力を示している。
LLMは異なる言語間で大きな性能差を示す。
Inference-Time Cross-Lingual Intervention (INCLINE) を提案する。
論文 参考訳(メタデータ) (2024-10-16T11:23:03Z) - CodeGRAG: Bridging the Gap between Natural Language and Programming Language via Graphical Retrieval Augmented Generation [58.84212778960507]
CodeGRAGは、制御フローとそれらのデータフローに基づいて、コードブロックのグラフィカルなビューを構築し、プログラミングドメインの知識をよりよく解釈する。
CodeGRAGはLLMのコード生成能力を大幅に改善し、言語間コード生成のパフォーマンス向上も実現している。
論文 参考訳(メタデータ) (2024-05-03T02:48:55Z) - AdaCCD: Adaptive Semantic Contrasts Discovery Based Cross Lingual
Adaptation for Code Clone Detection [69.79627042058048]
AdaCCDは、その言語でアノテーションを使わずに、新しい言語のクローンコードを検出する新しい言語間適応手法である。
5つのプログラミング言語からなる多言語コードクローン検出ベンチマークを構築し,AdaCCDの言語間適応性を評価する。
論文 参考訳(メタデータ) (2023-11-13T12:20:48Z) - Multi-level Contrastive Learning for Cross-lingual Spoken Language
Understanding [90.87454350016121]
コントラスト学習のための難解なサンプルを, あらゆるレベルで生成するコードスイッチング手法を開発した。
言語間知識伝達にラベルセマンティクスを利用するラベル認識ジョイントモデルを開発した。
論文 参考訳(メタデータ) (2022-05-07T13:44:28Z) - XDBERT: Distilling Visual Information to BERT from Cross-Modal Systems
to Improve Language Understanding [73.24847320536813]
本研究では,事前学習したマルチモーダル変換器から事前学習した言語エンコーダへの視覚情報の蒸留について検討する。
我々のフレームワークは,NLUの言語重み特性に適応するために学習目標を変更する一方で,視覚言語タスクにおけるクロスモーダルエンコーダの成功にインスパイアされている。
論文 参考訳(メタデータ) (2022-04-15T03:44:00Z) - Cross-Lingual Adaptation for Type Inference [29.234418962960905]
弱い型付き言語間で深層学習に基づく型推論を行うための言語間適応フレームワークPLATOを提案する。
強く型付けされた言語からのデータを活用することで、PLATOは、バックボーンのクロスプログラミング言語モデルの難易度を改善する。
論文 参考訳(メタデータ) (2021-07-01T00:20:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。