論文の概要: More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs
- arxiv url: http://arxiv.org/abs/2608.30463v1
- Date: Mon, 31 Aug 2026 08:49:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.321839
- Title: More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs
- Title(参考訳): より有能で忠実でない: LLMにおける数学的(不)可解性検出の多言語的解析
- Abstract要約: 解けない問題と解けない問題の最初の多言語ベンチマークを導入する。
我々は最先端の大規模言語モデルの可解性検出能力を解析する。
We found that Solvability Belief is encodeed as a largely universal, language-agnostic feature。
- 参考スコア(独自算出の注目度): 5.831893840514845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Solvability detection is one of the most challenging aspects of mathematical reasoning for Large Language Models (LLMs). While prior work has studied this capability extensively, these analyses have been limited to English. Consequently, it remains unclear whether multilingual failures arise from differences in internal Solvability Belief or from language-dependent failures to express it. To address this gap, we introduce the first multilingual benchmark of paired solvable and unsolvable mathematical problems, extending ReliableMath to French and Greek. Using this, we train multilingual probes predicting Solvability Belief and analyze the solvability detection capabilities of state-of-the-art LLMs behaviorally, representationally, and in terms of faithfulness. We find that Solvability Belief is encoded as a largely universal, language-agnostic feature, and that higher-resource languages such as English, despite achieving stronger mathematical reasoning performance, exhibit lower solvability-detection faithfulness.
- Abstract(参考訳): 可解性検出は、Large Language Models (LLMs) の数学的推論の最も難しい側面の1つである。
以前の研究でこの能力は広く研究されてきたが、これらの分析は英語に限られていた。
その結果、多言語的失敗は、内部の可解性信念の違いから生じるのか、あるいはそれを表現するために言語に依存した失敗から生じるのかは、いまだ不明である。
このギャップに対処するために、ペアで解決可能で解決不可能な数学問題の最初の多言語ベンチマークを導入し、ReliableMathをフランス語とギリシャ語に拡張する。
これを用いて, 可解性を予測した多言語プローブを訓練し, 現状LLMの可解性検出能力を, 行動, 表現, 忠実度の観点から分析する。
その結果,ソルビビリティ・ベルイフは言語に依存しない言語としてエンコードされており,数学的推論性能が向上したにもかかわらず,英語などの高リソース言語は解答・検出忠実度が低下していることが判明した。
関連論文リスト
- LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance [77.58408743830314]
強化学習は大規模言語モデルにおける多段階推論の強化に有効であることが証明されている。
しかし、その利点は多言語文脈に完全には翻訳されていない。
我々は、言語条件付きヒントを利用して、英語以外の推論タスクの探索をガイドする新しいフレームワークを開発する。
論文 参考訳(メタデータ) (2026-05-21T14:47:52Z) - Beyond Translation: Evaluating Mathematical Reasoning Capabilities of LLMs in Sinhala and Tamil [1.0499611180329804]
大きな言語モデル(LLM)は、英語で強い数学的推論を示す。
しかし、これらの機能が真の多言語推論や、SinhalaやTamilのような低リソース言語での翻訳ベースの処理に依存しているかどうかは不明だ。
6種類の数学問題の分類法を用いて4つの顕著な大言語モデルを評価する。
論文 参考訳(メタデータ) (2026-02-16T07:08:37Z) - Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners [48.68444770923683]
大きな推論モデル(LRM)は、数学的推論タスクにおいて高い性能を達成する。
LRMは、これらのテキスト推論ステップを完了する前に、正しい答えに到達することが多い。
この現象は英語で研究されてきたが、多言語的行動はほとんど分かっていない。
論文 参考訳(メタデータ) (2026-01-06T13:20:17Z) - Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models? [18.99223776816893]
推論言語モデル(RLM)は複雑な推論タスクにおいて高いパフォーマンスを達成するが、それでも多言語推論のギャップに悩まされている。
本稿では多言語推論のギャップが言語理解の失敗に大きく起因していることを示す。
本稿では,多言語入力を英語に翻訳する簡易かつ効果的な手法である選択翻訳を提案する。
論文 参考訳(メタデータ) (2025-10-31T08:17:59Z) - MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning [6.8892368960722346]
数学的問題解決と推論のための並列多言語ベンチマークであるMathMistを紹介する。
MathMistには、7つの言語にまたがる21万以上の質問回答ペアが含まれている。
我々は,オープンソースの中小LCM,プロプライエタリシステム,多言語推論型モデルなど,多様なモデル群を体系的に評価する。
論文 参考訳(メタデータ) (2025-10-16T04:59:52Z) - A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages [48.68444770923683]
マルチリンガル・チェーン・オブ・ソート(CoT)推論の最初の包括的研究について述べる。
LRMがターゲット言語ですぐに考えることができる場合、言語コンプライアンス、解答精度、解答一貫性を計測する。
思考の痕跡の質と有効性は、素早い言語によって大きく異なることがわかった。
論文 参考訳(メタデータ) (2025-10-10T17:06:50Z) - From Logic to Language: A Trust Index for Problem Solving with LLMs [0.0]
本稿では,Large Language Models (LLM) の理解と対比を目的とした統合フレームワークを提案する。
形式言語と自然言語で対応可能な問題空間を定義し,記述する。
そこで, ベクトル値信頼度指数Qを導入し, 解の品質を反映し, 形式解のバイナリ正当性を自然言語解の連続性スペクトル特性と区別する。
論文 参考訳(メタデータ) (2025-07-21T19:50:45Z) - Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing [66.04926909181653]
我々は人為的不確実性について論じる。つまり、直感的で信頼に値する不確実性コミュニケーションは、ユーザに対してある程度の言語的信頼とパーソナライズを必要とする。
我々は、不確実性に関する人間と機械のコミュニケーションにおけるユニークな要因を指摘し、機械の不確実性通信に影響を与えるデータのバイアスを分解する。
論文 参考訳(メタデータ) (2025-07-11T14:07:22Z) - Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models [55.14276067678253]
本稿では,Large Language Models (LLMs) における言語間関係の弱点を効率的に同定するための新しい手法を提案する。
この手法を用いて16言語で6,000以上のバイリンガルペアからなる新しいデータセットを構築し、最先端のモデルにおいても弱点を明らかにする効果を実証した。
さらに,言語的類似性と言語間の弱点との関係について検討し,言語的関連言語が類似した演奏パターンを共有することを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T12:31:27Z) - When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners [111.50503126693444]
言語固有のアブレーションは多言語推論性能を継続的に向上させることを示す。
トレーニング後のアブレーションと比較して、トレーニング不要のアブレーションは、計算オーバーヘッドを最小限に抑えながら、同等または優れた結果が得られる。
論文 参考訳(メタデータ) (2025-05-21T08:35:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。