論文の概要: Recursive Vision Language Models for General Symbolic Reasoning
- arxiv url: http://arxiv.org/abs/2608.01534v1
- Date: Sun, 02 Aug 2026 23:01:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.267706
- Title: Recursive Vision Language Models for General Symbolic Reasoning
- Title(参考訳): 一般記号推論のための帰納的視覚言語モデル
- Authors: Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz,
- Abstract要約: Sudoku、maze pathfinding、ARCといったシンボリック推論タスクは、LSMにとって依然として困難な課題である。
トレーニング済みのQwenバックボーン上に構築されたフレームワークであるR-Qwenを提案する。
R-Qwenはプログラムによる自己再帰と深い監督を通じて、候補解を何度も洗練する。
- 参考スコア(独自算出の注目度): 17.777375944237015
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Hard symbolic-reasoning tasks such as Sudoku, maze pathfinding, and ARC remain challenging for LLMs due to their fixed-depth autoregressive reasoning, which limits systematic search, refinement, and backtracking. While recursive models such as Hierarchical Reasoning Model (HRM) and Tiny Recursive Model (TRM) address this limitation through iterative latent-state refinement, they are typically task-specific and do not leverage pretrained language priors. We propose R-Qwen, a recursive reasoning framework built upon a pretrained Qwen backbone. R-Qwen repeatedly refines a candidate solution through programmatic self-recursion and deep supervision, combining the structured iterative computation of recursive models with the linguistic and reasoning priors of pretrained LLMs. We further adapt Hierarchical Supervision Weighting (HSW) to autoregressive models by exponentially weighting losses across recursive steps. HSW reduces gradient variance by at least 50\%, improves the signal-to-noise ratio of stochastic gradients, and accelerates convergence. Across eight challenging benchmarks, R-Qwen consistently outperforms prior recursive reasoning models and substantially larger LLMs while using a comparable number of trainable parameters. Notably, on ARC-AGI dataset, our model achieves a 27.6\% improvement over the baseline, highlighting the effectiveness of recursive refinement for general symbolic reasoning. These results suggest that recursive reasoning mechanisms and pretrained language model priors are complementary approaches for improving symbolic puzzle-solving. Code and models will be released after acceptance.
- Abstract(参考訳): Sudoku、maze pathfinding、ARCといった厳密なシンボリック推論タスクは、体系的な探索、洗練、バックトラックを制限する固定深度自己回帰推論のため、LSMにとって依然として困難である。
Hierarchical Reasoning Model (HRM) や Tiny Recursive Model (TRM) のような再帰的モデルは、反復的な潜在状態の洗練を通じてこの制限に対処するが、それらは通常タスク固有であり、事前訓練された言語を利用しない。
事前学習したQwenのバックボーン上に構築された再帰的推論フレームワークであるR-Qwenを提案する。
R-Qwenは、再帰的モデルの構造化された反復計算と事前訓練されたLLMの言語的および推論的事前計算を組み合わせることで、プログラム的自己再帰と深い監督を通じて、候補解を何度も洗練する。
さらに、再帰的なステップ間の損失を指数関数的に重み付けすることで、自己回帰モデルに階層的スーパービジョン重み付け(HSW)を適用する。
HSWは、勾配分散を少なくとも50\%減少させ、確率勾配の信号対雑音比を改善し、収束を加速する。
8つの挑戦的なベンチマークにおいて、R-Qwenはトレーニング可能なパラメータの数に匹敵する数を使いながら、再帰的推論モデルとかなり大きなLLMよりも一貫して優れていた。
特に、ARC-AGIデータセットでは、ベースラインよりも27.6%向上し、一般的な記号的推論に対する再帰的改善の有効性を強調した。
これらの結果は,再帰的推論機構と事前訓練された言語モデルが,記号的パズル解法を改善するための補完的アプローチであることを示唆している。
コードとモデルは受け入れられてからリリースされる。
関連論文リスト
- Recursive Scaling in Masked Diffusion Models [67.93066069475753]
マスク付き拡散モデル (MDMs) は近年, シーケンス生成において有望なパラダイムとして浮上している。
本稿では,R-MDM(Recursive Masked Diffusion Models)を導入し,パラメータ数を増やすことなくモデル深度を増加させる。
Sudoku や Countdown などの構造化された生成タスク全体で、R-MDM がパラメータ効率を大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-06-16T15:02:49Z) - Generative Recursive Reasoning [67.22973831501257]
Generative Recursive ReAsoning Models (GRAM) は、潜在的推論を確率論的多軌道に変換するフレームワークである。
GRAMは$p_(y mid x)$で条件推論をサポートし、固定または欠落した入力では$p_(x)$で条件生成を行う。
論文 参考訳(メタデータ) (2026-05-19T05:20:56Z) - Recursive Models for Long-Horizon Reasoning [28.82044197167549]
分離された文脈でサブタスクを解くためにモデルが自身を呼び出すことができることを示す。
フレームワークを任意のコンテキスト処理と制御フローを備えた現代的なエージェントシステムに一般化する。
論文 参考訳(メタデータ) (2026-03-02T17:37:10Z) - Looping Back to Move Forward: Recursive Transformers for Efficient and Flexible Large Multimodal Models [63.47909317137073]
大規模マルチモーダルモデル (LMM) は視覚言語計算タスクにおいて顕著な成功を収めた。
しかし、その膨大なパラメータ数は、トレーニングと推論の両方で利用されていないことが多い。
LMMに適した再帰トランスフォーマーアーキテクチャであるRecursiveVLMを提案する。
論文 参考訳(メタデータ) (2026-02-09T17:58:23Z) - Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective [85.06838178922791]
強化学習(RL)は自己回帰言語モデルに非常に効果的であることが証明されている。
しかし、これらの手法を拡散大言語モデル(dLLM)に適応させることは、根本的な課題を提起する。
本稿では,全シーケンス生成を単一アクションとして扱い,ELBOを抽出可能なシークエンスレベル確率プロキシとして利用する,原則的RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T13:05:32Z) - Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures [0.0]
本稿では,動的グラフベースの推論フレームワークであるAdaptive Graph of Thoughts (AGoT)を紹介する。
AGoTはテスト時間のみでのLarge Language Models (LLM)推論を強化する。
マルチホップ検索,科学的推論,数学的問題解決にまたがる多様なベンチマークに対するアプローチを検証する。
論文 参考訳(メタデータ) (2025-02-07T16:54:19Z) - Let's reward step by step: Step-Level reward model as the Navigators for
Reasoning [64.27898739929734]
Process-Supervised Reward Model (PRM)は、トレーニングフェーズ中にステップバイステップのフィードバックをLLMに提供する。
LLMの探索経路を最適化するために,PRMからのステップレベルのフィードバックを応用した欲求探索アルゴリズムを提案する。
提案手法の汎用性を探るため,コーディングタスクのステップレベル報酬データセットを自動生成する手法を開発し,コード生成タスクにおける同様の性能向上を観察する。
論文 参考訳(メタデータ) (2023-10-16T05:21:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。