論文の概要: Hidden Language Consistency Phenomena in Reasoning LLMs
- arxiv url: http://arxiv.org/abs/2608.08447v1
- Date: Sun, 09 Aug 2026 03:30:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.833104
- Title: Hidden Language Consistency Phenomena in Reasoning LLMs
- Title(参考訳): LLMにおける隠れ言語一貫性現象
- Abstract要約: 8言語でPolyMathベンチマークを用いた推論モデルを用いて,タスクの難易度,タスク精度,思考言語整合性(TC),回答言語整合性(AC)について検討した。
出力言語による一貫性は入力と整合性を維持し、不整合性を維持し、徐々に劣化し、突然崩壊する。
この分解効果により、モデルが内部支配言語に移行するにつれて、精度を保存したり、より困難なレベルで改善したりすることができる。
- 参考スコア(独自算出の注目度): 5.949792018279574
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual reasoning models are commonly evaluated by whether they arrive at the correct answer, but not by whether they preserve the intended language while reasoning and responding. This omission conceals important multilingual behaviors that emerge as tasks become harder. In this paper, we study task difficulty, task accuracy, thinking-language consistency (TC), and answer-language consistency (AC) across reasoning models using PolyMath benchmark in eight languages and four difficulty levels. We uncover four findings: (1) language consistency exhibits four difficulty-dependent behaviors: output-language consistency remains aligned with input, remains misaligned, degrades gradually, or collapses abruptly. (2) We identify the language consistency breakdown effect, where increasing difficulty can cause a sudden drop in output-language consistency, especially in less strongly represented and non-Latin-script languages. (3) Due to this breakdown effect, accuracy can be preserved or even improved at a harder difficulty level as the model shifts to its internal dominant language. (4) Quantization can improve or degrade output-language consistency independently of its effect on accuracy, with GPTQ and AWQ often outperforming AutoRound under tolerance-based voting with ε = 1.0. These results show that multilingual capability cannot be characterized by accuracy alone; reliable evaluation should jointly consider task accuracy, language consistency, and task difficulty for multilingual benchmarks.
- Abstract(参考訳): 多言語推論モデルは、正しい答えに達するかどうかによって評価されるが、推論と応答をしながら意図した言語を保存するかどうかによって評価される。
この省略は、タスクが難しくなるにつれて現れる重要な多言語行動を隠す。
本稿では,8つの言語と4つの難易度を持つPolyMathベンチマークを用いて,課題難易度,課題精度,思考言語整合性(TC),推論モデル間の応答言語整合性(AC)について検討する。
1) 言語整合性は4つの困難に依存した動作を示す: 出力言語整合性は入力と整合性を維持し、不整合性を維持し、徐々に劣化し、突然崩壊する。
2) 難易度が増大すると, 出力言語の一貫性が急激に低下し, 特に表現力の低い言語や非ラテン文字言語では, 言語整合性の低下が生じる。
(3) この分解効果により, モデルが内部支配言語に移行するにつれて, 精度を保存・改善することができる。
(4) GPTQ と AWQ は ε = 1.0 による耐性ベースの投票では AutoRound よりも優れている。
これらの結果から,マルチ言語能力は精度だけでは特徴づけられず,信頼性の高い評価は,多言語ベンチマークにおけるタスク精度,言語整合性,タスク難易度を共同で考慮すべきであると考えられる。
関連論文リスト
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models [45.78252494839804]
VLA(Vision-Language-Action)モデルは、言語条件のロボット操作において強力な性能を示している。
LIBEROベンチマークを10言語に翻訳することで,VLAモデルの最初の体系的多言語評価を行う。
論文 参考訳(メタデータ) (2026-06-10T10:36:20Z) - LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance [77.58408743830314]
強化学習は大規模言語モデルにおける多段階推論の強化に有効であることが証明されている。
しかし、その利点は多言語文脈に完全には翻訳されていない。
我々は、言語条件付きヒントを利用して、英語以外の推論タスクの探索をガイドする新しいフレームワークを開発する。
論文 参考訳(メタデータ) (2026-05-21T14:47:52Z) - Language as a Latent Variable for Reasoning Optimization [45.35129925776798]
LLMは英語中心のバイアスを減らすので、驚くべき傾向が現れます。
モデルの内部推論経路を構造的に修飾する潜在変数として機能する言語を仮定する。
言語変化を暗黙的な探索信号として扱うRLフレームワークであるpolyGRPOを提案する。
論文 参考訳(メタデータ) (2026-04-23T12:19:14Z) - On the Entity-Level Alignment in Crosslingual Consistency [62.33186691736433]
SubSubとSubInjは、主題の英語翻訳を言語間のプロンプトに統合し、実際のリコール精度と一貫性を大きく向上させた。
これらの介入はモデルの内部ピボット言語処理を通じて概念空間における実体表現のアライメントを強化する。
論文 参考訳(メタデータ) (2025-10-11T16:26:50Z) - A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages [48.68444770923683]
マルチリンガル・チェーン・オブ・ソート(CoT)推論の最初の包括的研究について述べる。
LRMがターゲット言語ですぐに考えることができる場合、言語コンプライアンス、解答精度、解答一貫性を計測する。
思考の痕跡の質と有効性は、素早い言語によって大きく異なることがわかった。
論文 参考訳(メタデータ) (2025-10-10T17:06:50Z) - Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning [85.7304930030649]
本稿では,言語一貫性報酬と言語間思考アライメント報酬によって訓練されたM-Thinkerを提案する。
M-Thinkerは2つのマルチ言語ベンチマークで100%近い言語一貫性と優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-08T17:55:02Z) - Controlling Language Difficulty in Dialogues with Linguistic Features [9.426180715334667]
言語アノテートされた対話データに基づく大規模言語モデル(LLM)の訓練は、言語習熟度を正確に調節することができる。
提案手法は,高い対話品質を維持しつつ,言語能力の優れた制御性を実現する。
論文 参考訳(メタデータ) (2025-09-18T02:22:43Z) - Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models? [59.970391602080205]
多言語トレーニングにも拘わらず、LRMはテスト時に高リソース言語での推論をデフォルトとする傾向にある。
文化的推論は、推論タスクのパフォーマンスを低下させるが、文化的なタスクに恩恵を与える一方、安全性評価は言語固有の振る舞いを示す。
論文 参考訳(メタデータ) (2025-05-23T02:46:18Z) - Language Mixing in Reasoning Language Models: Patterns, Impact, and Internal Causes [54.96891982093408]
RLM(Reasoning Language Model)は、チェーン・オブ・シント・プロセスを利用して構造化中間ステップを生成することで、複雑なタスクに優れる。
言語混合、すなわちプロンプト以外の言語からのトークンを含む推論ステップがアウトプットで観測され、性能に影響することが示されている。
本研究では, RLMにおける言語混合に関する最初の体系的研究を行い, そのパターン, 影響, 内部要因を15言語にわたって検討した。
論文 参考訳(メタデータ) (2025-05-20T18:26:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。