論文の概要: Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning
- arxiv url: http://arxiv.org/abs/2605.28277v1
- Date: Wed, 27 May 2026 10:20:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.970106
- Title: Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning
- Title(参考訳): LLMはテキストから世界モデルを構築するか?空間推論の多言語診断
- Authors: Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao,
- Abstract要約: MentalMapは6レベル機能階層(L0-L5)を持つ多言語診断ベンチマークである。
MentalMapは、100 ProcTHORの家庭シーンから構築され、8つのタイプ型的に多様な言語と構造化されたテキストコントロールをカバーし、1,950個の評価セルに39のタスクファミリを含んでいる。
- 参考スコア(独自算出の注目度): 12.488349000317003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Whether large language models (LLMs) construct internal spatial world models from pure-text descriptions remains contested, and whether such capabilities transfer across languages has not been systematically studied. We introduce MentalMap, a multilingual diagnostic benchmark with a six-level capability hierarchy (L0-L5) spanning atomic spatial facts to generative world-graph construction, together with four diagnostic axes probing frame of reference, reading-direction bias, reasoning-effort allocation, and hallucination. MentalMap is built from 100 ProcTHOR household scenes, covers eight typologically diverse languages plus a structured-text control, and contains 39 task families across 1,950 evaluation cells. Evaluating thirteen LLMs across scales and model families, we identify a universal L3 reasoning cliff: no model retains even half of its L0 performance on viewpoint reasoning once baseline atomic accuracy exceeds 40%. The cliff persists across languages, scales, and prompting strategies, while structured-output failures and reasoning patterns vary substantially across models. Human evaluation under the identical pure-text protocol reproduces the same failure pattern, suggesting that the bottleneck arises from text-only working memory constraints rather than being specific to current LLM architectures. Our findings reframe pure-text spatial reasoning as a multi-axis world-modeling problem and motivate multimodal and scratchpad-augmented reasoning as future directions.
- Abstract(参考訳): 大言語モデル(LLM)が純粋テキスト記述から内部空間世界モデルを構築するか、言語間での伝達能力が体系的に研究されていないかが議論されている。
我々は,6レベル機能階層(L0-L5)を持つ多言語診断ベンチマークであるMentalMapを紹介する。
MentalMapは、100 ProcTHORの家庭シーンから構築され、8つのタイプ型的に多様な言語と構造化されたテキストコントロールをカバーし、1,950個の評価セルに39のタスクファミリを含んでいる。
基準線原子精度が40%を超えると、L0性能の約半分はモデルに保持されない。
崖は言語、スケール、そして戦略を継続するが、構造化アウトプットの失敗と推論パターンはモデルによって大きく異なる。
同一の純粋テキストプロトコルの下での人間による評価は、同じ障害パターンを再現し、ボトルネックは現在のLLMアーキテクチャに固有のものではなく、テキストのみで動作するメモリ制約から生じることを示唆している。
本研究は,多軸世界モデリング問題として純粋テキスト空間推論を再構成し,将来の方向性としてマルチモーダルおよびスクラッチパッド拡張推論を動機付けるものである。
関連論文リスト
- MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing [1.3700362496838856]
大規模言語モデル(LLM)における幻覚は、信頼性の高いデプロイメントにとって重要な障壁である。
多言語幻覚を検出する新しい3段階積み重ねフレームワークであるMultiHaluDetを紹介する。
本フレームワークは,HluEvalおよびTriviaQAベンチマークで98.55%のAUROCに到達し,最先端検出性能を実現する。
論文 参考訳(メタデータ) (2026-05-24T07:50:03Z) - Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish [12.286855282078305]
GPT-4o, GPT-4, Claude3.5Sonnet, LLaMA3.1, MistralLarge2, LLaMA-2Chat13B, Mistral7B Instructを評価した。
我々のベンチマークは、オープンドメイン質問応答、文書要約、英語からXへの翻訳、文化的根拠のある対話の4つのタスクにまたがっている。
論文 参考訳(メタデータ) (2025-11-05T22:09:53Z) - Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models [1.175067374181304]
単一発話における言語とスクリプトの交替であるコードスイッチングは、多言語NLPの根本的な課題である。
ほとんどの大規模言語モデル(LLM)は、混合言語入力、限られたCSWデータセット、評価バイアスに悩まされている。
この調査は、CSWを意識したLSM研究の総合的な分析を初めて提供する。
論文 参考訳(メタデータ) (2025-10-08T14:04:14Z) - MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models [0.0679877553227375]
本稿では,大規模言語モデルにおける純粋空間推論の分離と評価を目的としたベンチマークであるMazeEvalを紹介する。
我々は,英語とアイスランド語で同一の迷路にまたがる8つの最先端LLMを評価し,空間能力の言語間移動を評価する。
論文 参考訳(メタデータ) (2025-07-27T19:33:45Z) - Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering [73.73820209993515]
KoLasSimpleQAは,Large Language Models (LLMs) の多言語事実能力を評価する最初のベンチマークである。
既存の研究に触発されて、単一知識点カバレッジ、絶対的客観性、独特な答え、時間的安定性といった特徴を備えた質問セットを作成しました。
その結果,2つの領域間に大きな性能差が認められた。
論文 参考訳(メタデータ) (2025-05-22T12:27:02Z) - MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation [86.7047714187813]
MMLU-ProXは29の言語をカバーするベンチマークであり、英語のベンチマーク上に構築されている。
それぞれの言語バージョンは11,829の同一の質問で構成されており、直接言語間比較を可能にする。
効率的な評価ニーズを満たすため,言語毎の質問数は658件である。
論文 参考訳(メタデータ) (2025-03-13T15:59:20Z) - MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning [63.80739044622555]
自然言語ナラティブで指定されたソフト推論タスクの言語モデルを評価するデータセットである MuSR を紹介する。
このデータセットには2つの重要な特徴がある。まず、ニューロシンボリック合成-自然生成アルゴリズムによって生成される。
第二に、私たちのデータセットインスタンスは、実世界の推論の領域に対応する無料のテキスト物語です。
論文 参考訳(メタデータ) (2023-10-24T17:59:20Z) - L2CEval: Evaluating Language-to-Code Generation Capabilities of Large
Language Models [102.00201523306986]
大規模言語モデル(LLM)の言語間コード生成能力を体系的に評価するL2CEvalを提案する。
モデルのサイズ、事前学習データ、命令チューニング、異なるプロンプトメソッドなど、それらのパフォーマンスに影響を与える可能性のある要因を分析する。
モデル性能の評価に加えて、モデルに対する信頼性校正を計測し、出力プログラムの人間による評価を行う。
論文 参考訳(メタデータ) (2023-09-29T17:57:00Z) - LIMIT: Language Identification, Misidentification, and Translation using
Hierarchical Models in 350+ Languages [27.675441924635294]
現在のシステムは世界の7000の言語の大部分を正確に識別することはできない。
まず、350以上の言語で50Kの多言語・並列児童話のコーパスMCS-350をコンパイルする。
言語識別のための新しい誤予測分解階層モデル LIMIt を提案する。
論文 参考訳(メタデータ) (2023-05-23T17:15:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。