論文の概要: The Latin Substrate: How Language Models Represent and Mediate Script Choice
- arxiv url: http://arxiv.org/abs/2605.31363v1
- Date: Fri, 29 May 2026 14:36:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.668913
- Title: The Latin Substrate: How Language Models Represent and Mediate Script Choice
- Title(参考訳): ラテン基板:言語モデルがどのように表現され、スクリプトの選択を仲介するか
- Abstract要約: 私たちは、同じ言語のスクリプトがレイヤー間で分離しやすくなっていることを示しています。
私たちは、スクリプトの選択を因果的に仲介する、レイト層アテンションヘッドの小さなセットをローカライズします。
- 参考スコア(独自算出の注目度): 10.624509426092597
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many languages are written in multiple scripts, requiring large language models (LLMs) to generate equivalent linguistic content in distinct orthographic forms. While prior work suggests that LLMs route information through shared latent representations, how they internally mediate script variation remains poorly understood. We study this question by first examining per-layer output distributions with the logit lens, which reveals consistent latent romanization during transliteration, and then through representational and mechanistic analyses of script generation. At the representational level, we show that scripts of the same language become increasingly separable across layers and that a simple linear steering direction can flip a model's output script while largely maintaining semantic content. The vector generalizes asymmetrically to writing systems unseen during construction, flipping non-Latin output to Latin reliably, but mapping Latin output into varied non-Latin scripts. At the mechanistic level, we localize a small set of late-layer attention heads that causally mediate script choice. These heads transfer across unrelated languages and writing systems, suggesting that script routing is implemented by language-agnostic components. Across both analyses, we observe a consistent directional asymmetry: non-Latin output is produced by a compact, identifiable gate, while Latin-script output emerges from diffuse contributions across the network. Collectively, our findings hint that LLMs organize script variation around shared latent representations while exhibiting a privileged substrate toward Latin script.
- Abstract(参考訳): 多くの言語は複数のスクリプトで書かれており、異なる正書法形式で等価な言語コンテンツを生成するために大きな言語モデル(LLM)を必要とする。
以前の研究では、LLMは共有潜在表現を通して情報をルーティングすることを示唆していたが、スクリプトのバリエーションを内部的にどのように仲介するかは理解されていない。
本研究は,まず,文字変換中に一貫した潜在ロマン化を示すロジットレンズを用いて層間出力分布を解析し,次に,スクリプト生成の表現的および機械的解析を通して検討する。
表現レベルでは、同じ言語のスクリプトがレイヤー間で分離されやすくなり、単純なリニアステアリング方向がモデルの出力スクリプトを反転させ、セマンティックコンテンツの大部分を維持できることが示される。
ベクトルは、建設中に見えないシステムに非対称に一般化し、非ラテン語の出力を確実にラテン語に反転させるが、ラテンの出力を様々な非ラテン語のスクリプトにマッピングする。
メカニスティックレベルでは、スクリプト選択を因果的に仲介するレイトレイヤーアテンションヘッドの小さなセットをローカライズする。
これらのヘッドは、言語に依存しないコンポーネントによってスクリプトルーティングが実装されていることを示唆している。
非ラテン出力はコンパクトで識別可能なゲートによって生成され、ラテン文字出力はネットワーク全体の拡散寄与から生じる。
総括的に,LLMはラテン文字に対して特権的基質を示しながら,共有潜在表現のスクリプト変動を整理していることを示す。
関連論文リスト
- One Language, Two Scripts: Probing Script-Invariance in LLM Concept Representations [0.0]
Sparse Autoencoders (SAEs) が学習した特徴が抽象的な意味を表すのか、それともテキストの書き方と結びついているのかを検討する。
異なるセルビア文字で同一の文が高度に重なり合う特徴を活性化し、ランダムなベースラインをはるかに超えていることがわかった。
この結果から,SAE機能は表面トークン化以上の抽象レベルでセマンティクスをキャプチャできる可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-09T19:31:20Z) - Linear Script Representations in Speech Foundation Models Enable Zero-Shot Transliteration [70.84108518476744]
我々は,スクリプトが多言語音声モデルのアクティベーション空間に線形に符号化されていることを示し,推論時にアクティベーションを変更することで,出力スクリプトを直接制御できることを示した。
本稿では,Whisperの全モデルサイズにまたがる競合性能を観測し,音声認識出力のスクリプトに対するポストホック制御を実現する手法を提案する。
論文 参考訳(メタデータ) (2026-01-06T10:45:04Z) - Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders [51.380449540006985]
大規模言語モデル(LLM)は多くの言語を処理できるが、どのようにして内部的にこの多様性を表現しているのかは不明だ。
言語固有のデコーディングと多言語表現を共有できるのでしょうか?
層間トランスコーダ(CLT)と属性グラフを用いて内部メカニズムを解析する。
論文 参考訳(メタデータ) (2025-11-13T22:51:06Z) - RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs [18.27925188037189]
大きな言語モデル(LLM)は、英語中心のコーパスで主に訓練されているにもかかわらず、強い多言語のパフォーマンスを示す。
LLMはこのような多言語機能をどのように達成しますか?
非ローマ文字で書かれた言語に着目し、多言語処理における潜在的ブリッジとしてのロマン化の役割について検討する。
論文 参考訳(メタデータ) (2025-02-11T10:10:26Z) - Prompting with Phonemes: Enhancing LLMs' Multilinguality for Non-Latin Script Languages [37.61699757912346]
そこで本研究では,音声の書き起こしを補完信号として活用し,スクリプト不変表現を誘導する手法を提案する。
In-context Learning (ICL) における音素文字と正書法文字がそれぞれ異なる例を検索することを示す。
これにより、提案したMixed-ICL検索戦略のモチベーションが得られ、両者のさらなる集約により性能が大幅に向上する。
論文 参考訳(メタデータ) (2024-11-04T18:59:51Z) - Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts [50.40191599304911]
非ラテン文字で書かれた低リソース言語に対するLLMの性能向上にも効果があるか検討する。
本稿では,(1) の原文,(2) ラテン文字,(3) の両文を対象とする3つのプロンプトテンプレートを提案する。
本研究の結果から,翻訳の有効性はタスクタイプやモデルサイズによって異なることが明らかとなった。
論文 参考訳(メタデータ) (2024-07-02T14:51:20Z) - Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment [50.27950279695363]
転送性能は、低リソースのターゲット言語が高リソースのソース言語とは異なるスクリプトで書かれている場合、しばしば妨げられる。
本論文は,この問題に対処するために翻訳を用いた最近の研究に触発されて,翻訳に基づくポストプレトレーニングアライメント(PPA)手法を提案する。
論文 参考訳(メタデータ) (2024-06-28T08:59:24Z) - MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling [70.34758460372629]
多様な言語にまたがる一貫した大きさのセグメントで同一情報をエンコードする新しいパラダイムを導入する。
MYTEは99の言語すべてに対して短いエンコーディングを生成する。
これにより、多言語LMの性能が向上し、多言語間でのパープレキシティギャップが減少する。
論文 参考訳(メタデータ) (2024-03-15T21:21:11Z) - TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models [50.40191599304911]
本稿では,mPLM を微調整する TransliCo を提案する。
Furinaは様々なゼロショット・クロスリンガル・トランスファータスクにおいてオリジナルのGlot500-mより優れていることを示す。
論文 参考訳(メタデータ) (2024-01-12T15:12:48Z) - Does Transliteration Help Multilingual Language Modeling? [0.0]
多言語言語モデルに対する音訳の効果を実証的に測定する。
私たちは、世界で最もスクリプトの多様性が高いIndic言語にフォーカスしています。
比較的高いソースコード言語に悪影響を及ぼすことなく、低リソース言語にトランスリテラゼーションが有効であることに気付きました。
論文 参考訳(メタデータ) (2022-01-29T05:48:42Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。