論文の概要: Skill Issue: Are Skills Language-Invariant in LLMs?
- arxiv url: http://arxiv.org/abs/2608.25832v1
- Date: Wed, 26 Aug 2026 14:12:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.856556
- Title: Skill Issue: Are Skills Language-Invariant in LLMs?
- Title(参考訳): スキルの問題: スキルはLLMに不変か?
- Abstract要約: 大規模言語モデルは、言語間で一貫性のない知識にアクセスするが、異なる言語と対話する際に、そのスキルセットにどの程度の違いがあるのか?
この研究は、知識と一般的なベンチマーク性能から言語間スキルを矛盾なく定量化する。
TextArenaの多言語拡張を構築し,空間的推論,不完全な情報,リソース割り当て,繰り返しインタラクションを含む8言語と6ゲームにわたる3つのオープンウェイトモデルを評価する。
- 参考スコア(独自算出の注目度): 31.061737447193988
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models access knowledge inconsistently across languages, but to what extent do they differ in their skill sets when interacting with different languages? This work quantifies cross-lingual skill inconsistency orthogonally from knowledge and general benchmark performance. We do this via multilingual self-play: two instances of the same model compete in a text-based game, each interacting through a different language interface. Since the model, opponent, rules, state space, and available actions remain fixed, this setting isolates the effect of language on the model's realized behavior. We build a multilingual extension to TextArena and evaluate three open-weight models across eight languages and six games covering spatial reasoning, imperfect information, resource allocation, and repeated interaction. We find that the same model can exhibit markedly different playing strength across languages, with systematic variation in win--loss margins, invalid actions, and strategic tendencies. Detailed analyses reveal language-specific failures in spatial reasoning, card-conditioned decisions, and optimal move selection. In some settings, changing only the intermediate reasoning language recovers much of the lost performance, suggesting that language can affect different stages of the decision process. These results show that skill discrepancies are a measurable major roadblock in the development of truly multilingual models. Better understanding these discrepancies can help us design models that perform more equitably across languages.
- Abstract(参考訳): 大規模言語モデルは、言語間で一貫性のない知識にアクセスするが、異なる言語と対話する際に、そのスキルセットにどの程度の違いがあるのか?
この研究は、知識と一般的なベンチマーク性能から直交する言語間スキルの不整合を定量化する。
同じモデルの2つのインスタンスがテキストベースのゲームで競合し、それぞれが異なる言語インターフェースを介して相互作用します。
モデル、相手、ルール、状態空間、利用可能なアクションが固定されているため、この設定はモデルが実現した振る舞いに対する言語の影響を分離する。
TextArenaの多言語拡張を構築し,空間的推論,不完全な情報,リソース割り当て,繰り返しインタラクションを含む8言語と6ゲームにわたる3つのオープンウェイトモデルを評価する。
我々は,同じモデルが,勝利率,不正行動,戦略的傾向の体系的変化など,言語間で著しく異なるプレイ力を示すことを見出した。
詳細な分析により、空間推論、カード条件決定、最適な移動選択における言語固有の失敗が明らかになった。
ある設定では、中間の推論言語だけを変更すると、失った性能の多くを回復し、言語が決定プロセスの異なる段階に影響を与える可能性があることを示唆する。
これらの結果は,真の多言語モデルの開発において,スキルの相違が大きな障害となることを示している。
これらの違いをよりよく理解することは、言語間でより公平に機能するモデルを設計するのに役立ちます。
関連論文リスト
- Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning [75.46846056993418]
推論言語モデルは、それらが引き起こされる言語に関係なく、主に英語で理にかなっている。
これは、英語を話さないユーザにとってアクセス不能であり、元の質問の意図を失うリスクがあり、ターゲット言語でより容易に表現される知識を忘れてしまう。
本研究では,L2推論を推進し,ユーザのプロンプトの言語でモデルが一貫した推論を行えるようにし,プロンプトと応答の間に言語内ブリッジを構築する。
論文 参考訳(メタデータ) (2026-09-09T16:56:25Z) - Language Steering for Multilingual In-Context Learning [10.932074928744568]
非英語での大規模言語モデルのパフォーマンスは、英語よりもかなり劣っている。
トレーニング不要な言語ステアリングアプローチである言語ベクトルを提案する。
テスト対象のタスクや言語にまたがるベースライン上でのマルチランガル・イン・コンテクスト学習における一貫した改善を示す。
論文 参考訳(メタデータ) (2026-02-02T16:52:09Z) - False Friends Are Not Foes: Investigating Vocabulary Overlap in Multilingual Language Models [53.01170039144264]
多言語コーパスで訓練されたサブワードトークンライザは、言語間で重複するトークンを自然に生成する。
トークンの重複は言語間転送を促進するのか、それとも言語間の干渉を導入するのか?
相反する語彙を持つモデルでは、重なり合う結果が得られます。
論文 参考訳(メタデータ) (2025-09-23T07:47:54Z) - Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models? [59.970391602080205]
多言語トレーニングにも拘わらず、LRMはテスト時に高リソース言語での推論をデフォルトとする傾向にある。
文化的推論は、推論タスクのパフォーマンスを低下させるが、文化的なタスクに恩恵を与える一方、安全性評価は言語固有の振る舞いを示す。
論文 参考訳(メタデータ) (2025-05-23T02:46:18Z) - Language Specific Knowledge: Do Models Know Better in X than in English? [9.923619418000488]
コードスイッチングは、異なる言語間で同じ発話、思考、会話を交互に行う一般的な現象である。
我々はこの現象を表すために言語特化知識(LSK)という用語を作った。
英語以外の言語でチェーン・オブ・シークレット・推論を用いることで,言語モデルの性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-21T00:31:13Z) - Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages [15.203789021094982]
大規模言語モデル(LLM)では、複数の言語がどのように学習され、エンコードされているか?
Llama-3-8BとAya-23-8Bでスパースオートエンコーダを訓練し、抽象文法の概念が多くの言語で共有される特徴方向に符号化されることを実証する。
論文 参考訳(メタデータ) (2025-01-10T21:18:21Z) - Could We Have Had Better Multilingual LLMs If English Was Not the Central Language? [4.655168524016426]
大規模言語モデル(LLM)は、トレーニング対象の言語に対して強力な機械翻訳能力を示す。
我々の研究は、Llama2の翻訳能力について論じている。
実験の結果,7B Llama2モデルはこれまでに見たすべての言語に翻訳すると10 BLEU以上になることがわかった。
論文 参考訳(メタデータ) (2024-02-21T16:32:38Z) - The Less the Merrier? Investigating Language Representation in
Multilingual Models [8.632506864465501]
多言語モデルにおける言語表現について検討する。
我々は、コミュニティ中心のモデルが、低リソース言語で同じ家系の言語を区別する上で、より良い性能を発揮することを実験から観察した。
論文 参考訳(メタデータ) (2023-10-20T02:26:34Z) - Language Model Tokenizers Introduce Unfairness Between Languages [98.92630681729518]
トークン化段階では,モデルが呼び出される直前に,異なる言語に対する扱いの相違が生じることを示す。
文字レベルとバイトレベルのモデルも、いくつかの言語ペアの符号化長の4倍以上の差を示している。
我々は、多言語で公平なサブワードトークン化器を用いて、将来の言語モデルを訓練するべきだと仮定する。
論文 参考訳(メタデータ) (2023-05-17T14:17:57Z) - Cross-Lingual Ability of Multilingual Masked Language Models: A Study of
Language Structure [54.01613740115601]
本稿では,構成順序,構成,単語共起の3つの言語特性について検討する。
我々の主な結論は、構成順序と単語共起の寄与は限定的である一方、構成は言語間移動の成功にとってより重要であるということである。
論文 参考訳(メタデータ) (2022-03-16T07:09:35Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。