論文の概要: Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders
- arxiv url: http://arxiv.org/abs/2603.19771v1
- Date: Fri, 20 Mar 2026 09:02:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.06496
- Title: Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders
- Title(参考訳): ここにも存在しない:多言語エンコーダにおけるコードミキシングテキストの言語間表現ダイナミクス
- Authors: Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Jasabanta Patro,
- Abstract要約: 我々は、並列英語、ヒンディー語、ローマ字のコード混合文の統一的な三言語コーパスを構築した。
標準モデルは英語とヒンディー語をうまく一致させるが、コード混合入力はどちらの言語にもゆるやかに結びついている。
- 参考スコア(独自算出の注目度): 0.9523331544264052
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Multilingual encoder-based language models are widely adopted for code-mixed analysis tasks, yet we know surprisingly little about how they represent code-mixed inputs internally - or whether those representations meaningfully connect to the constituent languages being mixed. Using Hindi-English as a case study, we construct a unified trilingual corpus of parallel English, Hindi (Devanagari), and Romanized code-mixed sentences, and probe cross-lingual representation alignment across standard multilingual encoders and their code-mixed adapted variants via CKA, token-level saliency, and entropy-based uncertainty analysis. We find that while standard models align English and Hindi well, code-mixed inputs remain loosely connected to either language - and that continued pre-training on code-mixed data improves English-code-mixed alignment at the cost of English-Hindi alignment. Interpretability analyses further reveal a clear asymmetry: models process code-mixed text through an English-dominant semantic subspace, while native-script Hindi provides complementary signals that reduce representational uncertainty. Motivated by these findings, we introduce a trilingual post-training alignment objective that brings code-mixed representations closer to both constituent languages simultaneously, yielding more balanced cross-lingual alignment and downstream gains on sentiment analysis and hate speech detection - showing that grounding code-mixed representations in their constituent languages meaningfully helps cross-lingual understanding.
- Abstract(参考訳): 多言語エンコーダベースの言語モデルは、コードミキシング分析タスクに広く採用されているが、コードミキシングインプットを内部でどのように表現しているか、あるいはそれらの表現が混合される構成言語に有意義に結びついているかどうかについては、驚くほどほとんど分かっていない。
ヒンディー語をケーススタディとして、並列英語、ヒンディー語(Devanagari)、ロマンティック・コード混合文の統一三言語コーパスを構築し、標準多言語エンコーダおよびCKA、トークンレベルのサリエンシ、エントロピーに基づく不確実性解析を通じて、コード混在の変種を探索する。
標準モデルは英語とヒンディー語をうまく一致させるが、コードミキシングされた入力はどちらの言語とも疎結合であり、コードミキシングされたデータの事前トレーニングは、英語とヒンディー語のアライメントを犠牲にして、英語と混在したアライメントを改善する。
解釈可能性分析は、さらに明確な非対称性を明らかにしている: モデルは、英語支配のセマンティックな部分空間を通して、コード混合のテキストを処理し、一方、ネイティブスクリプトのヒンディーは、表現の不確実性を減少させる補完的な信号を提供する。
これらの結果から,コード混在表現を両言語に同時に近づけることにより,感情分析とヘイトスピーチ検出において,よりバランスの取れた言語間アライメントと下流ゲインが得られるという,三言語間アライメントの目標が導入された。
関連論文リスト
- Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference [2.172419551358714]
大規模言語モデル(LLM)は多言語的文脈においてますます適用されているが、言語間で一貫した論理的に根ざしたアライメントの能力は未定である。
本稿では、論理に基づく前提-仮説ペアを生成する多言語自然言語推論のフレームワークを提案し、それらを類型的に多様な言語に翻訳する。
コードスイッチングは劣化せず、性能も向上し、翻訳によって引き起こされる語彙の変化が正規化信号として機能することを示唆している。
論文 参考訳(メタデータ) (2025-08-20T14:30:34Z) - Disentangling Codemixing in Chats: The NUS ABC Codemixed Corpus [11.518751071307745]
コードミキシングは、単一の言説の中で複数の言語からの言語要素をシームレスに統合する。
著者ラベル付きで、人間の会話や関係をモデル化するのに適した公開コーパスが不足している。
本研究では,厳格なプライバシと倫理基準を維持しつつ,文脈におけるコードミキシングを理解するためのラベル付き汎用コーパスについて紹介する。
論文 参考訳(メタデータ) (2025-05-31T01:09:04Z) - Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training [58.696660064190475]
コンテクスト内の異なる言語間を交互に交換するコードスイッチの存在が、多言語機能の鍵であることに気付きました。
事前学習における言語アライメントのためのコードスイッチングのパワーをよりよく探求するために,合成コードスイッチングの戦略について検討する。
論文 参考訳(メタデータ) (2025-04-02T15:09:58Z) - Modular Sentence Encoders: Separating Language Specialization from Cross-Lingual Alignment [50.80949663719335]
多言語文エンコーダ(MSE)は、多言語言語モデルを訓練し、異なる言語からの文を共有意味空間にマッピングすることで一般的に得られる。
MSEは、パラメータ共有による単言語表現精度の喪失である多言語性の呪いを受ける。
我々は、異なる言語間タスクの矛盾する要求を解決するために、2つの異なるタイプのデータで言語間アダプタを訓練する。
論文 参考訳(メタデータ) (2024-07-20T13:56:39Z) - Understanding Cross-Lingual Alignment -- A Survey [52.572071017877704]
言語間アライメントは多言語言語モデルにおける言語間の表現の有意義な類似性である。
本研究は,言語間アライメントの向上,手法の分類,分野全体からの洞察の要約といった手法の文献を調査する。
論文 参考訳(メタデータ) (2024-04-09T11:39:53Z) - The Effect of Alignment Objectives on Code-Switching Translation [0.0]
我々は、ある言語から別の言語への単言語文の翻訳が可能な単一の機械翻訳モデルを訓練する方法を提案している。
このモデルは、人間の意味でのバイリンガルモデルと見なすことができる。
論文 参考訳(メタデータ) (2023-09-10T14:46:31Z) - Leveraging Language Identification to Enhance Code-Mixed Text
Classification [0.7340017786387767]
既存のディープラーニングモデルは、コード混合テキストの暗黙の言語情報を活用できない。
本研究の目的は,低リソースのCode-Mixed Hindi- Englishデータセット上でのBERTモデルの性能向上である。
論文 参考訳(メタデータ) (2023-06-08T06:43:10Z) - Zero-Shot Cross-lingual Semantic Parsing [56.95036511882921]
7つのテスト言語に対する並列データを持たないゼロショット問題として,言語間セマンティックパーシングについて検討した。
英文論理形式ペアデータのみを用いて解析知識を付加言語に転送するマルチタスクエンコーダデコーダモデルを提案する。
このシステムは、ゼロショット解析を潜時空間アライメント問題としてフレーム化し、事前訓練されたモデルを改善し、最小のクロスリンガル転送ペナルティで論理形式を生成することができる。
論文 参考訳(メタデータ) (2021-04-15T16:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。