論文の概要: Seeing, Saying, but Not Using: From Reportable Spatial Facts to Usable States in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2610.02876v1
- Date: Fri, 02 Oct 2026 06:12:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.241905
- Title: Seeing, Saying, but Not Using: From Reportable Spatial Facts to Usable States in Multimodal Large Language Models
- Title(参考訳): 語・語・用法:マルチモーダル大言語モデルにおける記述可能な空間的特徴から使用可能な状態へ
- Abstract要約: 空間的事実を正しく報告する多モーダルな大言語モデルは、後続の推論において必ずしもその事実を使用するとは限らない。
タスク関連空間状態とその変換軌道を監督する操作状態スーパービジョン(OSS)を提案する。
OSSは、状態の整理と使用に依存するレベルであるL3とL4に基づいて、一致した判断のペア精度を改善する。
- 参考スコア(独自算出の注目度): 27.790263172718635
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A multimodal large language model that correctly reports a spatial fact does not necessarily use that fact in subsequent reasoning. To study this distinction, we introduce \textsc{SpaceConflict}, a benchmark of 23{,}196 inputs for the construction and use of spatial state. Under a unified Supported/Contradictory/Unknown judgment interface, it covers local fact binding (L1), relational composition (L2), cross-observation consistency (L3), and state judgment under transformation (L4). Posing a direct-state query, a full-transformation query, and an explicit-initial-state query on the same world reveals an availability--utilization gap: models recover the initial state from visual evidence yet fail when that state must drive a transformation. For Qwen3.5-9B, 50 of 100 sequences with a correctly recovered initial state fail the full transformation, and supplying the state explicitly repairs all 50; the gap narrows with scale but does not close. We therefore propose Operational State Supervision (OSS), which supervises task-relevant spatial states and their transformation trajectories and aligns shared facts across contexts. OSS improves paired accuracy on matched judgments most on L3 and L4, the levels that depend on organizing and using state. Evaluating multimodal spatial reasoning thus requires asking not only whether a model can see and state a spatial fact, but whether that fact becomes a usable state in subsequent computation.
- Abstract(参考訳): 空間的事実を正しく報告する多モーダルな大言語モデルは、後続の推論において必ずしもその事実を使用するとは限らない。
この区別を研究するために,空間状態の構成と利用のための23{,}196入力のベンチマークである \textsc{SpaceConflict} を導入する。
統一されたSupported/Contradictory/Unknownの判断インタフェースの下では、局所的な事実結合(L1)、関係性合成(L2)、相互観測一貫性(L3)、変換による状態判断(L4)をカバーする。
ダイレクトステートクエリ、フルトランスフォーメーションクエリ、および同一世界における明示的な初期状態クエリを示すと、アベイラビリティー利用ギャップが明らかになる: モデルは、その状態が変換を駆動しなければならないときに失敗する、視覚的エビデンスから初期状態を回復する。
Qwen3.5-9Bでは、正しく回復した初期状態を持つ100のシーケンスのうち50は完全な変換を失敗し、状態の供給は50の全てを明示的に修復する。
そこで我々は,タスク関連空間状態とその変換トラジェクトリを監督し,コンテキスト間の共有事実を整合させる操作状態スーパービジョン(OSS)を提案する。
OSSは、状態の整理と使用に依存するレベルであるL3とL4に基づいて、一致した判断のペア精度を改善する。
したがって、マルチモーダルな空間推論を評価するには、モデルが空間的事実を見ることができるかどうかだけでなく、その後の計算でその事実が有用な状態になるかどうかを問う必要がある。
関連論文リスト
- Lost with a Map: Conversational State and Behavioral Reliability in Language Models [5.8120627413404184]
タスク指向の対話はターン間で情報の維持と更新を必要とするが、言語モデルは明示的な信念状態のオブジェクトを公開しない。
我々は,MultiWOZとSGDの4つのファミリーから8つの命令調整言語モデルの中で,会話状態がどのように表現され,更新され,使用されるかを検討する。
論文 参考訳(メタデータ) (2026-09-27T19:57:52Z) - Resolving State-Representation Mismatch: State-Space Visual Reasoning for Open-Loop VLA Planning [15.141008188974432]
静的な視覚的コンテキスト、言語制約、反復的な潜時状態を分離するtextbfState-Space Visual Reasoning (SSVR)を提案する。
Qwen2.5-VLをバックボーンとし、SSVRは99.5/99.6、96.3/98.0、83.9/90.6 EM/PRをFrozenLake、Maze、MiniBehaviorで達成している。
論文 参考訳(メタデータ) (2026-09-27T09:47:27Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - EmbeddingRWKV: State-Centric Retrieval with Reusable States [12.535698360263988]
State-Centric Retrievalは、埋め込みモデルと再ランカを接続するブリッジとして"states"を利用する統一的な検索パラダイムである。
テストの結果,システム全体の効率を大幅に向上させながら,高品質な検索と再ランク付けを実現していることがわかった。
論文 参考訳(メタデータ) (2026-01-10T03:29:43Z) - Scaling Laws for State Dynamics in Large Language Models [0.0]
大規模言語モデル(LLM)は、内部状態追跡を必要とするタスクでますます使われるようになっている。
LLMが3つの領域(Box Tracking, Abstract DFA Sequences, Complex Text Games)にまたがる決定論的状態ダイナミクスをいかにうまく捉えているかを評価する。
タスク全体にわたって、次の状態予測精度は、状態空間のサイズとスパース遷移の増加とともに低下する。
論文 参考訳(メタデータ) (2025-05-20T20:38:21Z) - OpenPI-C: A Better Benchmark and Stronger Baseline for Open-Vocabulary
State Tracking [55.62705574507595]
OpenPIは、オープン語彙状態トラッキング用に注釈付けされた唯一のデータセットである。
手順レベル,ステップレベル,状態変化レベルの3つの問題を分類する。
評価指標として,クラスタベースの計量法を提案する。
論文 参考訳(メタデータ) (2023-06-01T16:48:20Z) - Language Modeling with Latent Situations [46.38670628102201]
状況スーパービジョンは、言語モデルにおけるコヒーレンスを改善するためのアプローチのファミリーである。
モデルの構築と、エンティティとその状態の明示的な表現の条件付けを訓練する。
4-11%のコヒーレンス向上を実現している。
論文 参考訳(メタデータ) (2022-12-20T05:59:42Z) - A New Bandit Setting Balancing Information from State Evolution and
Corrupted Context [52.67844649650687]
本稿では,2つの確立されたオンライン学習問題と包括的フィードバックを組み合わせた,逐次的意思決定方式を提案する。
任意の瞬間にプレーする最適なアクションは、エージェントによって直接観察できない基礎となる変化状態に付随する。
本稿では,レフェリーを用いて,コンテキストブレイジットとマルチアームブレイジットのポリシーを動的に組み合わせるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-11-16T14:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。