論文の概要: Energy-guided Recursive Model
- arxiv url: http://arxiv.org/abs/2607.10128v2
- Date: Fri, 17 Jul 2026 09:09:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.017353
- Title: Energy-guided Recursive Model
- Title(参考訳): エネルギー誘導再帰モデル
- Authors: Yifei Zhao, Ying Tang,
- Abstract要約: エネルギー誘導再帰モデル(ERM)は、明示的なホップフィールドエネルギーに基づく本質的な選択原理を導入する。
ERMは、サンプリング効率とランキングを高めるために、並列テンパリングのようなエネルギーベースの技術とシームレスに統合される。
- 参考スコア(独自算出の注目度): 4.674535220224721
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive reasoning models address structured problems by repeatedly updating latent states of small neural networks. However, their test-time scaling lacks a principled inference mechanism: increasing depth or stochastic breadth generates more trajectories without a clear criterion for selection, and existing methods predominantly rely on additional q-heads or heuristic voting. Here, we develop the Energy-guided Recursive Model (ERM), which introduces an intrinsic selection principle based on explicit Hopfield energies. ERM leverages Hopfield-type memories of valid local or global structures to define the selector over candidate trajectories. The resulting energy seamlessly integrates with energy-based techniques such as parallel tempering to enhance sampling efficiency and ranking. With $D=64$ recurrent steps and $K=128$ candidates, ERM reaches optimal solutions on Sudoku ($98.97\%$), Pencil Puzzle Bench (PPBench, $88.04\%$) and Maze ($99.30\%$), improving upon recent Probabilistic Tiny Recursive Model and Equilibrium Reasoners. These results suggest that incorporating explicit energy functions into recursive reasoning offers a principled path toward more effective inference.
- Abstract(参考訳): 再帰的推論モデルは、小さなニューラルネットワークの潜伏状態を繰り返し更新することで、構造化された問題に対処する。
深度や確率的幅の増大は、選択の明確な基準なしにより多くの軌道を生成し、既存の手法は、主に追加のqヘッドやヒューリスティック投票に依存している。
本稿では,エネルギ誘導再帰モデル(ERM)を開発し,明示的なホップフィールドエネルギーに基づく本質的な選択原理を導入する。
ERMは、有効なローカルまたはグローバルな構造のホップフィールド型記憶を活用して、候補軌道上のセレクタを定義する。
結果として生じるエネルギーは、サンプリング効率とランキングを高めるために並列テンパリングのようなエネルギーベースの技術とシームレスに統合される。
D=64$リカレントステップと$K=128$の候補により、ERMはSudoku(98.97$%)、Pencil Puzzle Bench(PPBench、88.04$%$)、Maze(99.30$%$)の最適解に達し、最近の確率論的Tiny Recursive ModelとEquilibrium Reasonersが改善された。
これらの結果は、明示的なエネルギー関数を再帰的推論に組み込むことにより、より効果的な推論への原則的な道筋が得られることを示唆している。
関連論文リスト
- Reasoning as Attractor Dynamics: Latent Memory Retrieval via Gibbs-Weighted Energy Minimization [0.0]
大規模言語モデル(LLM)は伝統的に自己回帰型ジェネレータと見なされている。
本研究では,数学的推論のエネルギー景観について検討する。
軌道のスペクトルエントロピーのギブス測度に基づく検索機構を導入する。
論文 参考訳(メタデータ) (2026-06-23T13:07:39Z) - AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering [76.52199013231484]
マルチホップ質問回答(QA)における適応的インターリーブド思考のための強化学習(RL)に基づくフレームワークAdaptR1を紹介する。
Graph-R1設定では、AdaptR1は平均的なシンクトークンを69.71%削減し、HotpotQAは90.35%削減された。
分析の結果,マルチホップ推論における過度な思考は,一様分布ではなく,初期計画段階で主に発生することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-29T09:34:45Z) - Generative Recursive Reasoning [67.22973831501257]
Generative Recursive ReAsoning Models (GRAM) は、潜在的推論を確率論的多軌道に変換するフレームワークである。
GRAMは$p_(y mid x)$で条件推論をサポートし、固定または欠落した入力では$p_(x)$で条件生成を行う。
論文 参考訳(メタデータ) (2026-05-19T05:20:56Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Improving Sample Efficiency of Model-Free Algorithms for Zero-Sum Markov Games [66.2085181793014]
モデルフリーのステージベースQ-ラーニングアルゴリズムはモデルベースアルゴリズムと同じ$H$依存の最適性を享受できることを示す。
本アルゴリズムは,楽観的値関数と悲観的値関数のペアとして参照値関数を更新するキーとなる新しい設計を特徴とする。
論文 参考訳(メタデータ) (2023-08-17T08:34:58Z) - A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs
with Near-optimal Regret [44.374427255708135]
無限水平平均逆マルコフ決定過程(MDP)のモデルフリーアルゴリズムである探索強化Q-ラーニング(EE-QL)を提案する。
EE-QLは、最適平均報酬のオンライン集中近似が利用可能であると仮定する。
これは、エルゴード的な仮定なしに$O(sqrt T)$後悔を達成する最初のモデル自由学習アルゴリズムであり、対数的因子を除いて、下位境界の$T$と一致する。
論文 参考訳(メタデータ) (2020-06-08T05:09:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。