論文の概要: Reasoning with Image Generation
- arxiv url: http://arxiv.org/abs/2609.16409v1
- Date: Mon, 14 Sep 2026 22:29:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.256906
- Title: Reasoning with Image Generation
- Title(参考訳): 画像生成による推論
- Abstract要約: 思考の連鎖推論は、大きな言語モデルが答える前に問題を中間ステップに分解できるようにすることによって自然言語処理に革命をもたらした。
本稿では,マルチモーダルLLMのためのフレキシブルな視覚推論機構として,画像生成モデルを活用するReImaGinを提案する。
ReImaGinはテキストのみの推論とビジョンツールのベースラインの両方を一貫して上回り、最大25%のゲインを達成しています。
- 参考スコア(独自算出の注目度): 18.95650438552521
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought reasoning has revolutionized natural language processing by enabling large language models (LLMs) to decompose problems into intermediate steps before answering. Yet confining reasoning to the textual domain presents limitations for tasks requiring direct manipulation of visual representations. Recent efforts augment multimodal LLMs with external visual expert tools such as depth estimation or object detection modules, but these remain fundamentally limited by their reliance on narrow, rigid operations that cannot flexibly generate or transform visual content. We propose ReImaGin, which leverages image generation models as a flexible visual reasoning mechanism for multimodal LLMs: unlike fixed-function tools, they accept natural language commands and can perform open-ended visual operations, like removing an occlusion or generating a floorplan from multiple disjoint views of a room. Across six diverse visual reasoning tasks including multi-view spatial reasoning and collision prediction, ReImaGin consistently outperforms both text-only reasoning and specialist vision-tool baselines, with gains of up to 25\%, demonstrating the advantage of flexible, generative visual reasoning.
- Abstract(参考訳): 連鎖推論は、大きな言語モデル(LLM)が答える前の中間ステップに問題を分解できるようにすることによって、自然言語処理に革命をもたらした。
しかし、テキスト領域への推論の補足は、視覚表現を直接操作する必要のあるタスクに制限を与える。
近年の取り組みでは、深度推定やオブジェクト検出モジュールといった外部視覚専門家ツールによるマルチモーダル LLM の強化が試みられているが、これらは、柔軟に視覚コンテンツを生成または変換できない狭義の厳密な操作に依存しているため、基本的に制限されている。
本研究では,マルチモーダルLCMのフレキシブルな視覚的推論機構として画像生成モデルを活用するReImaGinを提案する。
多視点空間推論と衝突予測を含む6つの視覚的推論タスクの中で、ReImaGinはテキストのみの推論と専門的な視覚ツールベースラインの両方を一貫して上回り、最大25倍のゲインを獲得し、フレキシブルで生成的な視覚的推論の利点を示している。
関連論文リスト
- LanteRn: Latent Visual Structured Reasoning [7.141402207573525]
本稿では,視覚的推論を潜在空間で直接実行可能にするフレームワークであるLanteRnを紹介する。
LanteRnは、推論中に連続的な視覚的思考の埋め込みを生成し、参加する能力を持つ視覚言語変換器を増強する。
我々はLanteRnを3つの知覚中心ベンチマーク(VisCoT, V*, Blink)で評価する。
論文 参考訳(メタデータ) (2026-03-26T16:41:59Z) - MentisOculi: Revealing the Limits of Reasoning with Mental Imagery [63.285794947638614]
視覚的解決が可能な多段階推論問題の組である MentisOculi を開発した。
遅延トークンから明示的な生成画像まで,視覚的戦略を評価すると,一般的にはパフォーマンス向上に失敗する。
以上の結果から,視覚的思考がモデル推論の恩恵を受けていないことが示唆された。
論文 参考訳(メタデータ) (2026-02-02T18:49:06Z) - Latent Implicit Visual Reasoning [59.39913238320798]
本稿では,視覚的推論トークンの発見と使用をLMMに指示するタスク非依存機構を提案する。
提案手法は直接微調整より優れ,様々な視覚中心のタスクにおいて最先端の結果が得られる。
論文 参考訳(メタデータ) (2025-12-24T14:59:49Z) - Monet: Reasoning in Latent Visual Space Beyond Images and Language [55.424507246294326]
視覚的推論を推し進める上で有効なパラダイムとして「画像で考える」が登場している。
既存の方法は、人間のような抽象的な視覚的思考に欠ける。
Monetは、マルチモーダルな大規模言語モデルを潜在視覚空間内で直接推論できるトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-11-26T13:46:39Z) - DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning [16.880791276029964]
画像を用いたシンキング」とは、視覚言語モデルがテキスト中心のチェーンから画像対話的推論へシフトする現象である。
本稿では、画像テキストインターリーブ付きデータセットと自己完結型モデルの両方からなる包括的スイートであるDeepSketcherを紹介する。
我々は,視覚的な埋め込み空間で直接操作することで,インターリーブされた画像テキスト推論を実行し,視覚的思考を生成するモデルを設計する。
論文 参考訳(メタデータ) (2025-09-30T07:02:01Z) - Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing [62.447497430479174]
空間における推論への描画は、視覚空間における基本的な描画操作を通じてLVLMを推論できる新しいパラダイムである。
我々のモデルはVILASRと呼ばれ、様々な空間推論ベンチマークで既存の手法より一貫して優れています。
論文 参考訳(メタデータ) (2025-06-11T17:41:50Z) - Cantor: Inspiring Multimodal Chain-of-Thought of MLLM [83.6663322930814]
視覚的コンテキスト獲得と論理的推論の集約は、視覚的推論タスクに取り組む上で重要であると我々は主張する。
我々はCantorと呼ばれる革新的なマルチモーダルCoTフレームワークを提案し、その特徴は知覚決定アーキテクチャである。
提案手法の有効性を実証し,マルチモーダルCoT性能の大幅な向上を示した。
論文 参考訳(メタデータ) (2024-04-24T17:59:48Z) - Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception [63.03288425612792]
マルチモーダル参照から画素単位のオブジェクト認識と自然言語記述を生成できる汎用MLLMモデルであるbfAnyRefを提案する。
本モデルでは,領域レベルの参照表現生成とセグメンテーションの多様さを含む,複数のベンチマークにおける最先端結果を実現する。
論文 参考訳(メタデータ) (2024-03-05T13:45:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。