論文の概要: Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.20237v1
- Date: Thu, 20 Aug 2026 16:28:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.635807
- Title: Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルのためのルール整合型空間計画法
- Abstract要約: RuleMazeは、MLLMが様々な複雑さの自然言語規則に従いながら迷路をナビゲートしなければならない制御可能なベンチマークである。
Disentangled Multimodal Planning (DMP)は、解釈可能な推論プリミティブを通じて認識、実行、ルール検証を分離する。
- 参考スコア(独自算出の注目度): 9.477726328920694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) combine linguistic reasoning with visual perception, yet their ability to perform visual spatial planning under explicit or previously unseen rule constraints remains underexplored. This setting requires models to jointly understand spatial layouts, interpret natural-language rules, and plan valid actions accordingly. To address this gap, we introduce RuleMaze, a controllable benchmark in which MLLMs must navigate mazes while obeying natural-language rules of varying complexity. RuleMaze isolates rule-compliant spatial planning by requiring accurate perception, rule interpretation, and constrained action planning. To enable scalable and systematic rule construction, we propose Language-Logic-Function Hybridization, which automatically generates natural-language rules and translates them into logical representations and executable validators, eliminating manual rule engineering. To improve rule following and generalization, we introduce Disentangled Multimodal Planning (DMP), which separates perception, execution, and rule verification through interpretable reasoning primitives. By disentangling these components, DMP facilitates systematic generalization to more complex and previously unseen rules, while providing transparent intermediate planning traces. Experiments demonstrate that DMP substantially improves rule compliance and planning success compared to end-to-end textual planning baselines. Overall, RuleMaze establishes a principled benchmark for studying grounded and interpretable rule-based spatial planning in MLLMs. Code is available at https://github.com/oceanflowlab/RuleMaze.
- Abstract(参考訳): MLLM(Multimodal large language model)は、言語推論と視覚的知覚を併用するが、明示的あるいは以前には見られなかった規則制約の下で視覚空間計画を行う能力は、未解明のままである。
この設定では、空間的レイアウトを共同で理解し、自然言語規則を解釈し、それに従って有効なアクションを計画する必要がある。
このギャップに対処するために、MLLMが迷路をナビゲートし、さまざまな複雑さの自然言語規則に従う、制御可能なベンチマークであるRe RuleMazeを紹介します。
RuleMazeは、正確な認識、ルール解釈、制約されたアクション計画を必要とすることによって、ルールに準拠した空間計画を分離する。
スケーラブルで体系的なルール構築を実現するために、自然言語ルールを自動的に生成し、それらを論理表現や実行可能なバリデータに変換するLanguage-Logic-Function Hybridizationを提案する。
ルール追従と一般化を改善するために,解釈可能な推論プリミティブを通じて認識,実行,ルール検証を分離するDMP(Disentangled Multimodal Planning)を導入する。
これらの成分を切り離すことで、DMPはより複雑で以前は見えなかった規則への体系的な一般化を促進し、透明な中間計画トレースを提供する。
実験により、DMPは、エンドツーエンドのテキストプランニングベースラインに比べて、規則の遵守と計画の成功を大幅に改善することが示された。
総合的に、ルールマゼはMLLMの基底と解釈可能な規則に基づく空間計画を研究するための原則化されたベンチマークを確立している。
コードはhttps://github.com/oceanflowlab/RuleMaze.comで入手できる。
関連論文リスト
- STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models [9.560201418658144]
視覚言語アクション(VLA)モデルは印象的な一般化を示すが、しばしば解釈可能性に欠ける。
本稿では,信号時間論理(STL)を高レベル言語理解と低レベルロボット実行を結合した共有表現として用いる階層型フレームワークを提案する。
実世界のテーブルトップドメインに対するアプローチを評価し,言語調和型ロボット計画の精度,信頼性,解釈性を改善するための正式な仕様について述べる。
論文 参考訳(メタデータ) (2026-07-20T23:26:32Z) - Abductive Logical Rule Induction by Bridging Inductive Logic Programming and Multimodal Large Language Models [22.49558896794021]
Inductive Logic Programming(ILP)とMultimodal Large Language Models(MLLM)をブリッジするILP-CoTを提案する。
このタスクには、論理的事実の発見と、少数の構造化されていないテキストや視覚的な入力から論理的ルールの誘導の両方が含まれる。
本手法は,MLLMのルール構造提案に基づいて,探索空間を切断したILPタスクを自動生成する。
論文 参考訳(メタデータ) (2025-09-26T04:56:19Z) - Large Language Models are Good Multi-lingual Learners : When LLMs Meet Cross-lingual Prompts [5.520335305387487]
本稿では,MLプロンプトという新しいプロンプト戦略を提案する。
MLPromptは、LLMが他の言語に追従するのに苦労するエラーを起こしやすいルールを翻訳する。
本稿では,MLPromptを構造化データ生成の自動チェック機構に統合するフレームワークと,テキストからMIPインスタンスへの特定のケーススタディを提案する。
論文 参考訳(メタデータ) (2024-09-17T10:33:27Z) - Rule Extrapolation in Language Models: A Study of Compositional Generalization on OOD Prompts [14.76420070558434]
ルール外挿は、プロンプトが少なくとも1つのルールに違反するOODシナリオを記述する。
規則の交わりによって定義される形式言語に焦点を当てる。
我々はアルゴリズム情報理論に先立ってソロモノフに触発された規則外挿の規範的理論の最初の石を配置した。
論文 参考訳(メタデータ) (2024-09-09T22:36:35Z) - Symbolic Working Memory Enhances Language Models for Complex Rule Application [87.34281749422756]
大規模言語モデル(LLM)は、顕著な推論性能を示しているが、多段階の推論に苦慮している。
本稿では,外部ワーキングメモリを用いたLLMの拡張と,ルール適用のためのニューロシンボリックフレームワークを提案する。
当社のフレームワークは,LLMベースのルール実装とシンボリックルールグラウンディングを反復的に実施する。
論文 参考訳(メタデータ) (2024-08-24T19:11:54Z) - DECIDER: A Dual-System Rule-Controllable Decoding Framework for Language Generation [57.07295906718989]
制約付き復号法は,事前訓練された大言語(Ms と PLMs)が生成するテキストの意味やスタイルを,推論時に様々なタスクに対して制御することを目的としている。
これらの方法は、しばしば、欲求的かつ明示的にターゲットを選択することによって、もっともらしい連続を導く。
認知二重プロセス理論に着想を得て,新しい復号化フレームワークDECDERを提案する。
論文 参考訳(メタデータ) (2024-03-04T11:49:08Z) - SoFA: Shielded On-the-fly Alignment via Priority Rule Following [90.32819418613407]
本稿では,各ダイアログにおけるルールを主制御機構として定義する,新たなアライメントパラダイムである優先ルールを提案する。
そこで本研究では,厳密な規則統合と固着性を確保するために,シミュレーションから優先信号に従う半自動蒸留手法であるプライオリティディスティルを提案する。
論文 参考訳(メタデータ) (2024-02-27T09:52:27Z) - Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs [87.34281749422756]
大規模言語モデル(LLM)は、様々な推論タスクにおいて、印象的な人間的なパフォーマンスを実現している。
しかし、その根底にある推論規則の熟達性は、人間の能力に欠ける。
本稿では,推論ルールベースであるULogicを構築するための,推論ルール生成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-18T03:38:51Z) - LLM-Assist: Enhancing Closed-Loop Planning with Language-Based Reasoning [65.86754998249224]
従来のルールベースプランナとLCMベースのプランナを併用した,新しいハイブリッドプランナを開発した。
当社のアプローチでは,既存のプランナが苦労する複雑なシナリオをナビゲートし,合理的なアウトプットを生成すると同時に,ルールベースのアプローチと連携して作業する。
論文 参考訳(メタデータ) (2023-12-30T02:53:45Z) - ChatRule: Mining Logical Rules with Large Language Models for Knowledge
Graph Reasoning [107.61997887260056]
そこで我々は,知識グラフ上の論理ルールをマイニングするための大規模言語モデルの力を解き放つ新しいフレームワークChatRuleを提案する。
具体的には、このフレームワークは、KGのセマンティック情報と構造情報の両方を活用するLLMベースのルールジェネレータで開始される。
生成されたルールを洗練させるために、ルールランキングモジュールは、既存のKGから事実を取り入れてルール品質を推定する。
論文 参考訳(メタデータ) (2023-09-04T11:38:02Z) - Building Rule Hierarchies for Efficient Logical Rule Learning from
Knowledge Graphs [20.251630903853016]
本稿では,ルール階層を用いて非プロミッシングルールを抽出する新しい手法を提案する。
HPMの応用は非プロムルールの除去に有効であることを示す。
論文 参考訳(メタデータ) (2020-06-29T16:33:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。