論文の概要: The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning
- arxiv url: http://arxiv.org/abs/2605.31404v1
- Date: Fri, 29 May 2026 15:09:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.687498
- Title: The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning
- Title(参考訳): 剣と盾とアキレス腱--ナビゲーション計画における空間推論のための大規模言語モデルの言語的帰納的バイアスを特徴付ける
- Abstract要約: LLM(Large Language Model)ベースのナビゲーションシステムは、通常、明示的な空間表現(例えば、トポロジグラフ、セマンティックマップ)を入力として構成する。
本研究では,航法計画におけるLLMの言語的帰納バイアスを評価するために,異なる文脈からの言語構造をアンハングリングする2つのインターベンショナル・フレームワークを提案する。
本研究は,LLMに基づくナビゲーションにおける効果的なテキストベースの空間表現は,トポロジ的整合性を維持し,表現圧縮をモデルキャパシティに調整し,意味的正当性を確保するべきであることを示す。
- 参考スコア(独自算出の注目度): 23.983002175011205
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Model (LLM)-based navigation systems commonly construct explicit spatial representations (e.g., topological graphs, semantic raster maps) and translate them into textual descriptions as LLMs' inputs. However, the linguistic structures of such text-based spatial representations and the choices of contextual features (e.g., topology, geometry) they contain are often treated as neutral engineering decisions rather than key factors that shape LLMs' behavior. To fill the gap, we propose a dual-interventional framework that disentangles linguistic structures from different contextual cues to evaluate the linguistic inductive bias of LLMs for navigation planning. In the framework, representation intervention varies the linguistic format and the degree of linguistic compression, clarifying when linguistic representations support or inhibit navigation planning. Context intervention, combined with contextual feature combination and conflict probing, explicitly clarifies the preferences and weaknesses of LLMs when processing different contextual cues. Experiments across diverse spatial reasoning tasks and multiple model scales reveal a consistent pattern: topological information is a sturdy shield and the backbone of robust planning; linguistic format is a double-edged sword whose effect depends on model size, task demands, and the compression level; and semantic information is a fatal Achilles' heel -- incorrect semantic cues can systematically derail the planning process. Overall, our study shows that effective text-based spatial representations in LLM-based navigation should preserve topological integrity, calibrate representational compression to model capacity, and ensure semantic correctness, rather than simply adopting a single representation. Our code is publicly available at https://github.com/jonesdong150/LLM-Navigation-Inductive-Bias.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくナビゲーションシステムは、通常、明示的な空間表現(例えば、トポロジカルグラフ、セマンティックラスタマップ)を構築し、それらを LLM の入力としてテキスト記述に変換する。
しかし、そのようなテキストベースの空間表現の言語構造とそれらに含まれる文脈的特徴(例えば、トポロジー、幾何学)の選択は、LLMの振る舞いを形作る重要な要因ではなく、中立的なエンジニアリング決定として扱われることが多い。
このギャップを埋めるために,航法計画におけるLLMの言語的帰納バイアスを評価するために,異なる文脈からの言語構造をアンハングリングする二重干渉フレームワークを提案する。
この枠組みでは、表現の介入は言語形式や言語圧縮の程度に変化し、言語表現がナビゲーション計画をサポートするか、または阻害するかを明確にする。
コンテキスト介入とコンテキスト特徴の組み合わせとコンフリクト探索を組み合わせることで、異なるコンテキストキューを処理する際のLLMの好みと弱点を明確に明確化する。
様々な空間的推論タスクと複数のモデルスケールにわたる実験は、一貫したパターンを明らかにしている: トポロジカル情報とは、頑丈な計画の頑丈なシールドとバックボーン、言語形式は、モデルサイズ、タスク要求、圧縮レベルに依存する二重刃の剣であり、意味情報は致命的なアキレスのヒールであり、誤ったセマンティック・キューは、計画プロセスを体系的に破壊することができる。
全体として,LLMに基づくナビゲーションにおける効果的なテキストベースの空間表現は,トポロジ的整合性を維持し,モデルキャパシティの表現圧縮を校正し,単一の表現を採用するのではなく意味的正当性を確保するべきである。
私たちのコードはhttps://github.com/jonesdong150/LLM-Navigation-Inductive-Biasで公開されています。
関連論文リスト
- Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding [88.11781604392606]
本稿では,言語表現を実世界の地図化とモデル化に使用される言語的・象徴的構造として定義する。
我々は、高度な言語表現によるスキーマ形成が、大規模言語モデルの拡張の次のフロンティアであると主張している。
論文 参考訳(メタデータ) (2026-05-10T02:42:29Z) - State Space Models are Effective Sign Language Learners: Exploiting Phonological Compositionality for Vocabulary-Scale Recognition [0.0]
我々は、PHONSSMを導入し、解剖学的に座屈したグラフの注意による音韻的分解、部分空間への明示的な分解、少数ショット転送を可能にする分類を導入した。
PHONSSMは史上最大のASLデータセット(5,565の符号)の骨格データのみを使用して、WLASL2000(+18.4pp over skeleton SOTA)で72.1%を獲得し、ビデオ入力なしでほとんどのRGBメソッドを超える。
論文 参考訳(メタデータ) (2026-04-09T20:50:52Z) - The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices? [42.515122675241486]
現在のシステムは世界中の言語で不均一なパフォーマンスを提供する。
本研究は,これらのギャップが持続する理由と,それらが固有の言語的困難を反映しているか,あるいは人工物をモデル化するかを考察する。
論文 参考訳(メタデータ) (2026-01-12T05:25:39Z) - Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth [21.092167028989632]
ドライブロロジーは「深みのあるナンセンス」によって特徴づけられる言語現象である
我々は、英語、マンダリン、スペイン語、フランス語、日本語、韓国語で、1200以上の精巧にキュレートされ、多様なサンプルのベンチマークデータセットを構築した。
現在の大規模言語モデル (LLM) は,ドライブロジカルテキストの階層的意味論の理解に一貫して失敗している。
論文 参考訳(メタデータ) (2025-09-04T03:58:55Z) - Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition [50.86415025650168]
マスク付き画像モデリング(MIM)は、局所的な構造を利用して視覚パターンを再構築する傾向があり、言語知識は限られている。
本稿では,言語情報とMIMの復号過程を別ブランチで関連づける,言語学対応の仮面画像モデリング(LMIM)手法を提案する。
論文 参考訳(メタデータ) (2025-03-24T14:53:35Z) - High-Dimensional Interlingual Representations of Large Language Models [65.77317753001954]
大規模言語モデル(LLM)は、多言語データセットに基づいて訓練され、言語間構造の形成を示唆する。
資源レベル, 類型, 地理的地域によって異なる31の多様な言語を探索する。
多言語 LLM は非一貫性な言語間アライメントを示す。
論文 参考訳(メタデータ) (2025-03-14T10:39:27Z) - Large Language Models are Interpretable Learners [53.56735770834617]
本稿では,Large Language Models(LLM)とシンボルプログラムの組み合わせによって,表現性と解釈可能性のギャップを埋めることができることを示す。
自然言語プロンプトを持つ事前訓練されたLLMは、生の入力を自然言語の概念に変換することができる解釈可能な膨大なモジュールセットを提供する。
LSPが学んだ知識は自然言語の記述と記号規則の組み合わせであり、人間(解釈可能)や他のLLMに容易に転送できる。
論文 参考訳(メタデータ) (2024-06-25T02:18:15Z) - Interpretability of Language Models via Task Spaces [14.543168558734001]
本稿では,解釈言語モデル (LM) の代替手法を提案する。
我々は、LM処理の品質に焦点を合わせ、言語能力に焦点をあてる。
言語現象間の関係を照らす「言語的タスク空間」を構築した。
論文 参考訳(メタデータ) (2024-06-10T16:34:30Z) - Integrating Language Guidance into Vision-based Deep Metric Learning [78.18860829585182]
埋め込み空間として意味的類似性を符号化した距離空間を学習することを提案する。
これらの空間は、トレーニング中に見られるもの以外のクラスに転送可能であるべきである。
これにより、学習された埋め込み空間は不完全な意味的コンテキストを符号化し、クラス間の意味的関係を誤って表現する。
論文 参考訳(メタデータ) (2022-03-16T11:06:50Z) - Learning Universal Representations from Word to Sentence [89.82415322763475]
この研究は普遍的な表現学習、すなわち一様ベクトル空間における言語単位の異なるレベルへの埋め込みを導入し、探求する。
本稿では, 単語, 句, 文の観点から, 類似したデータセットを構築するためのアプローチを提案する。
適切なトレーニング設定を組み込んだよく訓練されたトランスフォーマーモデルが、効果的に普遍的な表現が得られることを実証的に検証する。
論文 参考訳(メタデータ) (2020-09-10T03:53:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。