論文の概要: Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
- arxiv url: http://arxiv.org/abs/2601.06803v1
- Date: Sun, 11 Jan 2026 08:30:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-13 19:08:01.003214
- Title: Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
- Title(参考訳): 木の前の森:効率的な視覚的推論のための潜在的重ね合わせ
- Abstract要約: レーザーは動的ウィンドウアライメント学習(DWAL)を通して視覚的推論を再構成する新しいパラダイムである
レーザーは遅延推論法で最先端のパフォーマンスを達成し、強いベースラインのモネを平均5.03%上回る。
- 参考スコア(独自算出の注目度): 61.29300723302152
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While Chain-of-Thought empowers Large Vision-Language Models with multi-step reasoning, explicit textual rationales suffer from an information bandwidth bottleneck, where continuous visual details are discarded during discrete tokenization. Recent latent reasoning methods attempt to address this challenge, but often fall prey to premature semantic collapse due to rigid autoregressive objectives. In this paper, we propose Laser, a novel paradigm that reformulates visual deduction via Dynamic Windowed Alignment Learning (DWAL). Instead of forcing a point-wise prediction, Laser aligns the latent state with a dynamic validity window of future semantics. This mechanism enforces a "Forest-before-Trees" cognitive hierarchy, enabling the model to maintain a probabilistic superposition of global features before narrowing down to local details. Crucially, Laser maintains interpretability via decodable trajectories while stabilizing unconstrained learning via Self-Refined Superposition. Extensive experiments on 6 benchmarks demonstrate that Laser achieves state-of-the-art performance among latent reasoning methods, surpassing the strong baseline Monet by 5.03% on average. Notably, it achieves these gains with extreme efficiency, reducing inference tokens by more than 97%, while demonstrating robust generalization to out-of-distribution domains.
- Abstract(参考訳): Chain-of-Thoughtは多段階推論による大規模視覚言語モデルに権限を与えるが、明示的なテキスト論理は情報帯域幅のボトルネックに悩まされ、離散的なトークン化の間に連続的な視覚的詳細が破棄される。
最近の潜伏推論手法はこの課題に対処しようとするが、しばしば堅固な自己回帰的目的のために早々に意味的崩壊に陥る。
本稿では,DWAL(Dynamic Windowed Alignment Learning)を用いて視覚的推論を再構成する新しいパラダイムであるLaserを提案する。
ポイントワイズ予測を強制するのではなく、レーザーは潜在状態を将来のセマンティクスの動的妥当性ウィンドウと整列する。
このメカニズムは"Forest-before-Trees"認知階層を強制し、局所的な詳細に絞り込む前に、モデルがグローバルな特徴の確率的重ね合わせを維持することを可能にする。
重要なことは、レーザーは、自己精製重ね合わせによる制約のない学習を安定化しながら、デオード可能な軌道による解釈性を維持している。
6つのベンチマークでの大規模な実験により、レーザーは遅延推論法で最先端のパフォーマンスを達成し、強いベースラインのMonetを平均5.03%上回った。
特に、これらのゲインを極端に効率よく達成し、推論トークンを97%以上削減し、非分配領域への堅牢な一般化を実証する。
関連論文リスト
- Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs [44.74237674161132]
MLLM(Multimodal Large Language Models)における推論は、きめ細かい視覚認識と厳密な論理推論の両方を必要とする。
明示的なテキストベースのChain-of-Thought (CoT) は計算に高価であり、視覚幻覚を起こしやすい。
既存の潜在的推論手法は、通常、コストのかかる訓練を必要とする。
論文 参考訳(メタデータ) (2026-08-04T10:46:10Z) - Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models [86.02826269126308]
本稿では,局所スナップショット決定から時間軌道モデリング問題へのプルーニングを高める新しいフレームワークであるTrend-Aware Pruningを提案する。
これにより、"ラトブルーミング"トークンを選択的に再活性化する動的修正機構が実現される。
論文 参考訳(メタデータ) (2026-07-30T15:07:00Z) - Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models [3.4519796338615225]
観測不能な潜伏変数の列として推論をモデル化する新しいVision-Language-Action(VLA)フレームワークを提案する。
本稿では,遅延状態生成を逐次決定プロセスとして扱う強化学習に基づくデノゲーション機構を提案する。
具体化決定ベンチマークの実験により、AVA-VLAは明示的なCoT法よりも6倍の速度アップを達成することが示された。
論文 参考訳(メタデータ) (2026-06-13T04:16:18Z) - Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model [56.21523258053447]
SCOLAR(Self-Consistent LAtent Reasoning)は、1枚のショットで補助的な視覚トークンを生成する軽量なデコンバータを導入している。
SCOLARは許容遅延CoT長を30ドル以上延長し、実世界の推論ベンチマークでオープンソースモデルの間で最先端を実現している。
論文 参考訳(メタデータ) (2026-05-12T14:13:08Z) - Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs [54.16324124242172]
連続潜在空間推論は、マルチモーダルモデルに対するテキストチェーンのコンパクトな代替を提供する。
既存の視覚的推論手法では,これまで見過ごされてきた最適化病理を同定する。
パラメータ更新を伴わない推論時間潜時最適化は、視覚潜時における抑止的推論能力を効果的に解き放つことを示す。
論文 参考訳(メタデータ) (2026-05-04T15:36:12Z) - A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning [49.61652671596548]
「多像幻覚推論」では、前頭と時頭クエリ間の大規模なパフォーマンス低下は、真に理解するのではなく、表面的なショートカットへの依存を示す。
これを軽減するために、我々は、チェーンステップへの詳細な推論と決定的な判断に基づく、時間的連鎖構築という新しいデータセットを開発する。
実験により,本手法は精度を向上するだけでなく,70%以上から6.53%まで,前向きのパフォーマンスギャップも改善することが示された。
論文 参考訳(メタデータ) (2026-04-12T07:48:44Z) - Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization [41.15414881730464]
VLM(Vision-Language Models)は、この目標に対して、一般的なパーセプティブ・レアソン・アクティベート・フレームワークを提供する。
従来のアプローチは、ノイズの多い予見予測から状態値の非効率で、しばしば不正確な暗黙の学習に依存していた。
動作生成から状態評価を分離する新しいテスト時間計算フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-22T22:53:16Z) - Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning [62.680551162054975]
我々はLLMが動的要約によって推論ステップの粒度を自己制御することを学ぶエンドツーエンドのフレームワークを紹介した。
高い効率のFoldモードと徹底的なUnfoldモードの精度ギャップを徐々に狭めていくという重要な知見を見出し,この能力をさらにインセンティブ化するために強化学習を適用した。
私たちのAccordion-Thinkerは、学習した自己圧縮により、LLMは依存性トークンのオーバーヘッドを最小限に抑えながら複雑な推論タスクに取り組むことができることを示した。
論文 参考訳(メタデータ) (2026-02-03T08:34:20Z) - Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization [56.59356959631999]
Gated Perception-Reasoning Optimization (GPRO) は3つの決定経路間で動的に計算をルーティングするメタ推論コントローラである。
GPROは精度と効率を大幅に改善し、最近のスロー思考法よりも優れている。
論文 参考訳(メタデータ) (2026-01-07T23:05:17Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - A Survey on Latent Reasoning [100.54120559169735]
大きな言語モデル(LLM)は印象的な推論機能を示している。
中間ステップを言語化するCoT推論は、モデルの表現帯域幅を制限する。
潜在的推論は、モデルの連続的な隠れ状態に完全にマルチステップの推論を実行することで、このボトルネックに対処する。
論文 参考訳(メタデータ) (2025-07-08T17:29:07Z) - Lost at the Beginning of Reasoning [85.17612793300238]
第1の推論ステップが最終予測に不当に大きな影響を与えることを示す。
本稿では、報酬モデルを利用して高品質な第1推論ステップを特定し、維持する効率的なサンプリング戦略を提案する。
論文 参考訳(メタデータ) (2025-06-27T09:53:57Z) - Efficient Post-Training Refinement of Latent Reasoning in Large Language Models [22.878147805601706]
Chain-of-Thoughtのプロンプトは十分なトークンオーバーヘッドと固定された推論軌道に悩まされ、ステップワイズの改良が妨げられる。
潜在推論の最近の進歩は、モデル潜在空間において内部推論プロセスを直接精製することによってこれらの制限に対処している。
本稿では,2つの新しい戦略を用いて遅延推論軌道を洗練する軽量なポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-10T08:17:16Z) - Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models [0.0]
エラーは均一に分散されていないが、重要な決定ジャンクションを表すスパースな"キートークン"に集中していることを示す。
本稿では,意味的に重要なトークンを選択的に保存することを目的とした次世代システムのためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-30T03:57:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。