論文の概要: Steering Recurrent Reasoners at Inference Time with Readout Feedback
- arxiv url: http://arxiv.org/abs/2608.24136v1
- Date: Tue, 25 Aug 2026 07:00:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.85124
- Title: Steering Recurrent Reasoners at Inference Time with Readout Feedback
- Title(参考訳): リードアウトフィードバックを用いた推論時間におけるリカレント共振器のステアリング
- Abstract要約: そこで本研究では,リトレーニングを伴わずに遅延力学を操り,自己の読み出し確率を用いて再帰モデルを推論時に改善可能であることを示す。
SudokuとMazeの3つのリカレントモデル(AKOrN, ItrSA++, TRM)の中で、RoFBは6つのモデルタスクペアのうち4つで明確な利得を得る。
- 参考スコア(独自算出の注目度): 22.32377205563293
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recurrent models, which repeatedly update latent states with shared computation blocks, have emerged as powerful architectures for solving complex reasoning tasks. Existing inference-time methods scale computation by running more steps or sampling more trajectories, but ignore information revealed within each trajectory. Here we show that recurrent models can be improved at inference time by using their own readout probabilities to steer latent dynamics without retraining. We introduce Readout Feedback (RoFB), a test-time intervention that converts intermediate predictions into token-wise pairwise coupling forces injected into the latent dynamics. Across three recurrent models (AKOrN, ItrSA++, TRM) on Sudoku and Maze, RoFB yields clear gains in four of six model-task pairs, achieving performance unattainable by merely running more steps or selecting from multiple trajectories, at comparable or lower computational cost. These results suggest that closed-loop steering of latent dynamics can serve as a complementary inference-time control mechanism for recurrent reasoning models.
- Abstract(参考訳): リカレントモデルは、計算ブロックを共有した遅延状態を繰り返し更新するが、複雑な推論タスクを解決するための強力なアーキテクチャとして登場した。
既存の推論時間法は、より多くのステップを実行したり、より多くのトラジェクトリをサンプリングすることで計算をスケールするが、各トラジェクトリ内で明らかになった情報を無視する。
そこで本研究では,リトレーニングを伴わずに遅延力学を操り,自己の読み出し確率を用いて再帰モデルを推論時に改善可能であることを示す。
我々は、中間予測を潜在力学に注入されたトークンワイドなペアワイズ結合力に変換するテストタイム介入であるReadout Feedback (RoFB)を紹介する。
SudokuとMazeの3つのリカレントモデル(AKOrN, ItrSA++, TRM)の中で、RoFBは6つのモデルタスクペアのうち4つで明確なゲインを得る。
これらの結果から,潜在力学の閉ループステアリングは,逐次推論モデルに対する相補的推論時間制御機構として機能することが示唆された。
関連論文リスト
- Recursive Think-Answer Process for LLMs and VLMs [54.52289112197118]
R-TAP(Recursive Think-Answer Process)を提案する。
R-TAPにより、モデルは反復的推論サイクルに参加し、より正確な答えを生成することができる。
R-TAP強化モデルが従来のシングルパス法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-03-02T17:20:10Z) - Reactive Knowledge Representation and Asynchronous Reasoning [35.58961985804191]
複素確率モデルにおける厳密な推論は、しばしば禁止的な計算コストを引き起こす。
既存の手法は、どの変更でもモデル全体を再評価するため、継続する推論には非効率であることが多い。
まず、確率論的論理とリアクティブプログラミングを融合した確率論的プログラミング言語であるRetinを紹介します。
レジンの効率的かつ正確なセマンティクスを提供するために,反応回路(RC)を提案する。
高忠実度ドローン群シミュレーションにおいて,本手法は周波数非依存推論よりも数桁の高速化を実現する。
論文 参考訳(メタデータ) (2026-02-05T13:02:01Z) - NEAT: Neuron-Based Early Exit for Large Reasoning Models [37.88270573682948]
大規模な推論モデル(LRM)は、正しい解が到達した後に冗長な推論ステップが生成される現象であるエンフェーバー思考に悩まされることが多い。
既存の早期推論終了メソッドは、冗長な推論ステップをスキップするために出力レベルや訓練されたプローブモデルに依存している。
トレーニング不要早期退避を可能にするために,ニューロンレベルの活性化ダイナミクスを監視するフレームワークである textbfNEAT を提案する。
論文 参考訳(メタデータ) (2026-02-02T12:09:59Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Parallel Test-Time Scaling for Latent Reasoning Models [58.428340345068214]
並列テスト時間スケーリング(TTS)は、大規模言語モデル(LLM)の拡張のための重要なアプローチである。
連続ベクトル空間において中間的推論が展開する潜在的推論の最近の進歩は、明示的なチェーン・オブ・サート(Chain-of-Thought)に対するより効率的な代替手段を提供する。
この作業は、上記の問題に対処することで、潜在推論モデルに対する並列TSを可能にする。
論文 参考訳(メタデータ) (2025-10-09T03:33:00Z) - Inverse Scaling in Test-Time Compute [51.16323216811257]
LRM(Large Reasoning Models)の推論長の延長は性能を低下させる。
モデルが長い理由付けをする場合には、5つの異なる障害モードを特定します。
これらの結果は、テストタイムの計算スケーリングはモデル機能の改善に引き続き期待できるが、問題のある推論パターンを必然的に補強する可能性があることを示唆している。
論文 参考訳(メタデータ) (2025-07-19T00:06:13Z) - SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models [2.7645012830234]
大きな推論モデルは複雑な推論タスクでは優れているが、典型的には長いシーケンシャル連鎖を生成する。
SPRINTは、LRMが並列化の機会を動的に識別し活用できるようにするために設計された、新しいトレーニング後および推論時フレームワークである。
本研究では,SPRINTフレームワークで微調整されたモデルが,数学などの複雑な領域における推論モデルの性能と一致することを示す。
論文 参考訳(メタデータ) (2025-06-06T05:10:31Z) - Gated Recurrent Neural Networks with Weighted Time-Delay Feedback [55.596897987498174]
本稿では,重み付き時間遅延フィードバック機構を備えたゲートリカレントユニット(GRU)を導入し,時系列データの長期依存性をモデル化する手法を提案する。
提案したモデルである $tau$-GRU は、繰り返し単位の連続時間定式化の離散版であり、力学は遅延微分方程式(DDE)によって制御される。
論文 参考訳(メタデータ) (2022-12-01T02:26:34Z) - Deep Explicit Duration Switching Models for Time Series [84.33678003781908]
状態依存型と時間依存型の両方のスイッチングダイナミクスを識別できるフレキシブルモデルを提案する。
状態依存スイッチングは、リカレントな状態-スイッチ接続によって実現される。
時間依存スイッチング動作を改善するために、明示的な期間カウント変数が使用される。
論文 参考訳(メタデータ) (2021-10-26T17:35:21Z) - Causal Modeling with Stochastic Confounders [11.881081802491183]
この作業は、共同設立者との因果推論を拡張します。
本稿では,ランダムな入力空間を持つ表現子定理に基づく因果推論のための変分推定手法を提案する。
論文 参考訳(メタデータ) (2020-04-24T00:34:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。