論文の概要: MentalThink: Shaping Thoughts in Mental SVG World
- arxiv url: http://arxiv.org/abs/2607.03530v1
- Date: Fri, 03 Jul 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.643695
- Title: MentalThink: Shaping Thoughts in Mental SVG World
- Title(参考訳): メンタルシンク:メンタルSVGの世界における思考の形成
- Abstract要約: MentalThink(メンタルシンク)は、マルチモーダル LLM に「メンタル」視覚化の実行可能なメカニズムを組み込んだ視覚的シンボリック推論パラダイムである。
我々はこのパラダイムを2段階のトレーニングフレームワークを通じてインスタンス化し、マルチターンSVG強化学習(RL)と構文アライメントのためのSupervised FineTuning(SFT)を組み合わせることで、中間視覚仮説の反復的検査、修正、改善を促進する。
- 参考スコア(独自算出の注目度): 65.29580685085101
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce MentalThink, a visual-symbolic reasoning paradigm that equips Multimodal LLMs (MLLMs) with an executable mechanism for "mental" visualization. The core of MentalThink is a think-with-SVG pipeline, where the model learns to generate, render, and interpret scalable vector graphics (SVG) code as an intermediate visual representation for multi-turn reasoning. By creating structured vector sketches, the model can externalize spatial hypotheses, inspect them through deterministic rendering, and reason within a constrained geometric space, effectively mimicking the human process of mental imagery. We instantiate this paradigm through a two-stage training framework, combining Supervised Fine-Tuning (SFT) for SVG syntactic alignment with multi-turn Reinforcement Learning (RL) to encourage iterative inspection, revision, and refinement of intermediate visual hypotheses. Extensive evaluations demonstrate that MentalThink achieves superior performance on spatial understanding and reasoning benchmarks (e.g., 55.1% on VSIBench, 76.0% on MindCube), showing that executable vector graphics provide a verifiable visual workspace for dynamic perspective taking, visual reflection, and compositional scene construction.
- Abstract(参考訳): 我々は,Multimodal LLM(MLLM)と「メンタル」視覚化のための実行可能なメカニズムを備えた視覚記号推論パラダイムであるMentalThinkを紹介する。
MentalThinkのコアはシンク・ウィズ・SVGパイプラインであり、モデルがマルチターン推論のための中間視覚表現としてスケーラブルベクトルグラフィックス(SVG)コードの生成、レンダリング、解釈を学ぶ。
構造化されたベクトルスケッチを作成することで、モデルは空間仮説を外部化し、決定論的レンダリングを通してそれらを検査し、制約された幾何学空間内で理性を調べ、精神画像の人間の過程を効果的に模倣することができる。
SVG構文アライメントにスーパーバイザードファインチューニング(SFT)とマルチターン強化学習(RL)を組み合わせた2段階のトレーニングフレームワークにより、このパラダイムをインスタンス化し、反復的な検査、修正、中間視覚仮説の洗練を促進する。
大規模な評価では、MentalThinkは空間的理解と推論のベンチマーク(例えばVSIBenchでは55.1%、MindCubeでは76.0%)において優れた性能を達成しており、実行可能ベクトルグラフィックスが動的視点撮影、視覚反射、合成シーン構築のための検証可能な視覚ワークスペースを提供することを示している。
関連論文リスト
- CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning [58.582602613053204]
チャート質問応答 (CQA) は、視覚的理解と論理的推論を統合するために、マルチモーダルな大言語モデル (MLLM) を必要とする。
現在のMLLMには固有の視覚的根拠に基づく推論能力がなく、不正確な認識と視覚的証拠から切り離された推論をもたらす。
CQAを多段階の視覚的基盤的推論として再構成することにより、固有の視覚的推論機能を開発するカリキュラム学習フレームワークCURVを提案する。
論文 参考訳(メタデータ) (2026-08-03T19:48:00Z) - LanteRn: Latent Visual Structured Reasoning [7.141402207573525]
本稿では,視覚的推論を潜在空間で直接実行可能にするフレームワークであるLanteRnを紹介する。
LanteRnは、推論中に連続的な視覚的思考の埋め込みを生成し、参加する能力を持つ視覚言語変換器を増強する。
我々はLanteRnを3つの知覚中心ベンチマーク(VisCoT, V*, Blink)で評価する。
論文 参考訳(メタデータ) (2026-03-26T16:41:59Z) - Visual-ERM: Reward Modeling for Visual Equivalence [59.317480168347664]
Visual Equivalence Reward Model (Visual-ERM)は、細粒度、解釈可能、タスクに依存しないフィードバックを提供するマルチモーダル生成報酬モデルである。
Visual-ERM は Qwen3-VL-8B-Instruct を 8.4 で改善し、テーブルとSVGのパースで一貫したゲインを得る。
VisualCritic-RewardBench(VC-RewardBench)は、構造化された視覚データに対して微細な画像と画像の相違を判定するためのベンチマークである。
論文 参考訳(メタデータ) (2026-03-13T17:58:14Z) - Thinking with Drafting: Optical Decompression via Logical Reconstruction [19.018138128118775]
本稿では、圧縮された視覚トークンから潜在論理構造を再構築するプロセスとしてThinking with Drafting(TwD)を提案する。
TwDはモデルにメンタルモデルを実行可能なコードにドラフトさせ、自己検証のための決定論的視覚的証明を描画させる。
我々の研究は、視覚生成が創造的な出力としてではなく論理的検証として機能するクローズドループシステムを確立する。
論文 参考訳(メタデータ) (2026-02-12T08:54:02Z) - Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling [68.14113731953971]
本稿では,人間のような想像力をシミュレートするインプリシット・スパットIaLwOrldモデリングパラダイムMILOを紹介する。
提案手法は,複数のベースラインとベンチマークにまたがる空間推論能力を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2025-12-01T16:01:41Z) - Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs [22.46006112029019]
メンタル・ヴィジュアライゼーションは人間にとって重要な認知能力であり、空間ナビゲーション、物理的な軌道予測、想像的シミュレーションによる複雑な視覚問題の解決などの能力をサポートする。
マルチモーダル大規模言語モデル (MLLM) の心的可視化能力を評価するために, 慎重に構築された4つのパズルを用いて, ハイパーファンタジア(Hyperphantasia)を提案する。
我々の最先端モデルに対する包括的評価は、人間とMLLMの性能の間に大きなギャップがあることを示唆している。
論文 参考訳(メタデータ) (2025-07-16T05:54:37Z) - Spatial Mental Modeling from Limited Views [71.57140964322559]
新しいMindCubeベンチマークでは、3,268枚の画像に21,154件の質問があった。
MindCubeを用いて、視覚言語モデル(VLM)がいかに堅牢な空間精神モデルを構築するかを評価する。
次に、VLMが空間的メンタルモデルに近似する3つのアプローチを探索する。
論文 参考訳(メタデータ) (2025-06-26T16:38:19Z) - Thinking with Generated Images [30.28526622443551]
我々は,大規模マルチモーダルモデル(LMM)が視覚的推論にどのように関与するかを変換する,新しいパラダイムであるThinking with Generated Imagesを紹介する。
我々のアプローチは、AIモデルが人間の創造的、分析的、戦略的思考を特徴づける視覚的想像力や反復的な洗練に関わり得ることを可能にする。
論文 参考訳(メタデータ) (2025-05-28T16:12:45Z) - Visually Descriptive Language Model for Vector Graphics Reasoning [76.42082386029206]
低レベル視覚知覚と高レベル言語推論のギャップを埋めるための視覚記述型言語モデル(VDLM)を提案する。
VDLMは,様々なマルチモーダル認識および推論タスクにおいて,GPT-4oのような最先端のLMMを大幅に改善することを示す。
論文 参考訳(メタデータ) (2024-04-09T17:30:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。