論文の概要: Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
- arxiv url: http://arxiv.org/abs/2605.16848v1
- Date: Sat, 16 May 2026 07:12:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.200849
- Title: Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
- Title(参考訳): パターンによる思考:パターン誘導による視覚計画における知覚的ボツネックの破滅
- Abstract要約: 生の視覚入力からのプランニングは、視覚言語モデル(VLM)にとって重要な課題である。
我々は、Thinking with Images(TWI)を、徐々に正確な内部世界モデルを構築し、反映するツールとして定式化する。
我々は,新しいタスクにおいて,VLMが既知の視覚的パターンを積極的に認識することを可能にする新しいTWI戦略であるPattern Inferenceを提案する。
- 参考スコア(独自算出の注目度): 5.489090549883847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Planning from raw visual input remains a significant challenge for current Vision-Language Models (VLMs), when the complexity of input is beyond their one-step perception capability. Motivated by recent advances in Thinking with Images (TWI), a reasonable solution is to decompose the perception process into simpler steps by iteratively acquiring and incorporating local visual evidence. However, even though current VLMs are well-trained in general TWI ability, their perceptual bottleneck in the planning domain remains. To tackle this challenge, we formulate TWI as a tool to gradually build and reflect an accurate internal world model. We find that the resulting training-free planning strategy enables VLMs to solve tasks that are far beyond their initial capabilities, at the cost that too many TWI operations would significantly increase the computational overhead. To further improve efficiency, we propose Pattern Inference, a novel TWI strategy enabling VLMs to actively recognize known visual patterns in the new tasks and directly infer local world model structures. To obtain these patterns, we propose Pattern Induction, an online inductive learning strategy treating visual patterns as composite and reusable experts, which are autonomously discovered and optimized from experience. Experimental evaluations in FrozenLake, Crafter and CubeBench domains show that our approaches achieve a desirable balance between accuracy and efficiency.
- Abstract(参考訳): 生の視覚入力からのプランニングは、現在の視覚言語モデル(VLM)にとって重要な課題であり、入力の複雑さは1段階の知覚能力を超えている。
近年のThinking with Images (TWI)の進歩に触発された合理的な解決策は、局所的な視覚的エビデンスを反復的に取得し、組み込むことにより、知覚プロセスをより単純なステップに分解することである。
しかしながら、現在のVLMは一般的なTWI能力で十分に訓練されているにもかかわらず、計画領域における知覚的ボトルネックは残っている。
この課題に対処するため、我々はTWIを、正確に内部世界モデルを構築し、反映するツールとして定式化する。
結果として、トレーニング不要な計画戦略により、多くのTWI操作が計算オーバーヘッドを大幅に増加させるため、VLMが初期能力を超えているタスクを解決できることが判明した。
本稿では,VLMが新しいタスクにおける既知の視覚的パターンを積極的に認識し,局所世界モデル構造を直接推論することを可能にする新しいTWI戦略であるPattern Inferenceを提案する。
これらのパターンを得るために、視覚パターンを総合的かつ再利用可能な専門家として扱うオンライン帰納学習戦略であるPattern Injectionを提案し、経験から自律的に発見し、最適化する。
FrozenLake, Crafter, CubeBench ドメインでの実験評価により, 提案手法は精度と効率のバランスが望ましいことを示した。
関連論文リスト
- Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design [15.20939188156227]
高解像度の視覚的推論は、意味的推論だけでなく、知覚帯域幅の制限下でのタスク関連エビデンス獲得でもある。
我々はこの過程を逐次ベイズ最適実験設計(S-BOED)として定式化する。
高解像度ベンチマークの実験では、直接およびReActスタイルのベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-05-02T09:39:42Z) - Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking [154.2388970262703]
Unified Vision-Language Models (UVLM) は、単一のフレームワーク内での理解と生成の両方をサポートすることで、マルチモーダル学習を促進することを目的としている。
本稿では,解析処理と起案処理を交互に行う新たな思考パラダイムである,インターリーブド・アナライジング・ドレイティング問題解決ループ(AD-Loop)を紹介する。
テキスト思考を視覚的思考とインターリーブすることで、AD-Loopはモデルが理解と出力の両方を反復的に洗練し、真のシナジーを育むことができる。
論文 参考訳(メタデータ) (2026-02-24T23:26:09Z) - Rethinking Visual Intelligence: Insights from Video Pretraining [75.32388528274224]
大規模言語モデル(LLM)は、大規模事前学習によってシステムが新しい問題に迅速に適応できることを実証している。
本稿では,映像拡散モデル(VDM)をギャップを埋めるための有望な方向として検討する。
論文 参考訳(メタデータ) (2025-10-28T14:12:11Z) - Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey [13.43815806675263]
VLA(Vision-Language-Action)モデルは、自然言語の指示と視覚的な観察をロボットの行動にマッピングすることで、視覚言語モデルを拡張し、制御を具体化する。
これらの能力にもかかわらず、VLAシステムは膨大な計算とメモリ要求のために重大な課題に直面している。
論文 参考訳(メタデータ) (2025-10-20T02:59:45Z) - Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models [63.69856480318313]
AGILEは、対話的なプロセスとしてジグソー解決を定式化し、モデルが環境に徐々に関与できるようにする。
我々は AGILE がジグソータスクの性能を大幅に向上させることを示す。
また、9つの一般的な視覚タスクに対して強力な一般化を示し、平均3.1%の改善を実現した。
論文 参考訳(メタデータ) (2025-10-01T17:58:05Z) - Learning to See and Act: Task-Aware View Planning for Robotic Manipulation [88.37482534484627]
Task-Aware View Planning (TAVP)は、アクティブなビュープランニングとタスク固有の表現学習を統合するために設計されたフレームワークである。
提案したTAVPモデルは、最先端の固定ビューアプローチよりも優れた性能を実現する。
論文 参考訳(メタデータ) (2025-08-07T09:21:20Z) - Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures [34.542592986038265]
本報告では,コンピュータビジョンにおけるキーデザインパターンの進化を,影響力のある6つの論文から分析する。
本稿では,残差接続を導入したResNetについて概説する。
画像パッチのシーケンスにトランスフォーマーアーキテクチャを適用し,新たなパラダイムを確立したビジョントランスフォーマー(ViT)について検討する。
論文 参考訳(メタデータ) (2025-07-31T09:08:11Z) - VLMPlanner: Integrating Visual Language Models with Motion Planning [18.633637485218802]
VLMPlannerは、学習ベースのリアルタイムプランナと生画像の推論が可能な視覚言語モデル(VLM)を組み合わせたハイブリッドフレームワークである。
我々は,VLMが人間の運転動作を模倣できるコンテキスト適応推論ゲート機構を開発した。
論文 参考訳(メタデータ) (2025-07-27T16:15:21Z) - Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning [70.57180215148125]
ビジュアルインストラクションチューニングは、大きな言語モデルで視覚世界を理解できるようにすることを目的としている。
既存の手法は、精度と効率の間の難解なトレードオフに悩まされることが多い。
LLaVA-Meteorは,コア情報を妥協することなく,視覚トークンを戦略的に圧縮する手法である。
論文 参考訳(メタデータ) (2025-05-17T10:22:29Z) - OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles [91.88062410741833]
我々はOpenVLThinkerを紹介した。OpenVLThinkerはオープンソースの大規模視覚言語モデル(LVLM)の1つである。
OpenVLThinker-7Bは、数学的および一般的な推論を必要とする6つのベンチマークで一貫して性能を向上することを示す。
論文 参考訳(メタデータ) (2025-03-21T17:52:43Z) - Can Graph Learning Improve Planning in LLM-based Agents? [61.47027387839096]
言語エージェントにおけるタスクプランニングは、大規模言語モデル(LLM)の開発とともに重要な研究トピックとして浮上している。
本稿では,課題計画のためのグラフ学習に基づく手法について検討する。
我々のグラフ学習への関心は、注意のバイアスと自己回帰的損失が、グラフ上の意思決定を効果的にナビゲートするLLMの能力を妨げているという理論的な発見に起因している。
論文 参考訳(メタデータ) (2024-05-29T14:26:24Z) - Artificial-Spiking Hierarchical Networks for Vision-Language
Representation Learning [16.902924543372713]
最先端の手法は、大規模データセットの事前トレーニングによって、素晴らしいパフォーマンスを達成する。
本稿では,新しい視覚的セマンティックモジュールを導入することで,マルチモーダルアライメントのための効率的なフレームワークを提案する。
実験の結果、提案されたASH-Netsは競合する結果が得られることが示された。
論文 参考訳(メタデータ) (2023-08-18T10:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。