論文の概要: What Makes Recurrence Effective in Looped Language Models?
- arxiv url: http://arxiv.org/abs/2609.36636v1
- Date: Tue, 29 Sep 2026 03:43:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.161126
- Title: What Makes Recurrence Effective in Looped Language Models?
- Title(参考訳): ループ言語モデルで再帰を効果的にする理由は何か?
- Abstract要約: 追加の再発がいつ有効か、アーキテクチャの選択がその効果にどのように影響するかについて検討する。
再発は、知識性能を低下させながら、トレーニングの地平を越えて推論を改善することができる。
本稿では, チャネルワイドなヒストリーステートインジェクションとタイムステップコンディショニングを組み合わせることで, 低コストで効率的な設計が可能であることを示す。
- 参考スコア(独自算出の注目度): 43.44794022344695
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Looped language models (LoopLMs) increase computational depth through parameter sharing, offering a path to scale inference computation without adding parameters. However, it remains unclear when additional recurrence is beneficial and how architectural choices affect its effectiveness. Through controlled experiments, we systematically examine (1) when recurrence helps, (2) where it should be applied, and (3) how its conditioning affects performance. Our evaluation covers inference budgets below, within, and beyond the training horizon under knowledge and reasoning tasks. (1) We find that recurrence can improve reasoning beyond the training horizon while degrading knowledge performance, but harder reasoning instances do not consistently benefit more. (2) Performance also depends on how distinct layers and recurrent iterations are allocated, showing that effective depth alone is insufficient to predict behavior. Non-recurrent output layers improve robustness to under-unrolling, while the preferred placement of input and output layers varies with inference budget. (3) Finally, we find that conventional initial-state injection offers limited robustness to varying recurrence depth. We therefore propose history-state injection as an alternative, and show that channel-wise history-state injection combined with timestep conditioning offers a low-cost and more effective design, better preserving knowledge under extended unrolling while improving robustness across inference budgets. Overall, our results clarify when recurrent computation helps, where it fails, and offer practical guidelines for designing LoopLMs across variable inference budgets.
- Abstract(参考訳): ループ言語モデル(LoopLM)はパラメータ共有によって計算深度を増大させ、パラメータを追加せずに推論計算をスケールする方法を提供する。
しかし、いつ追加の再発が有益か、アーキテクチャの選択がその効果にどのように影響するかは、まだ不明である。
制御された実験を通して,(1)再発の助けとなる時期,(2)適用すべき場所,(3)条件がパフォーマンスにどのように影響するかを系統的に検討した。
我々の評価では、知識と推論タスクの下でのトレーニングの地平線の下、内、及びそれ以上の推論予算をカバーしています。
1) 知識性能を低下させながら, トレーニング地平線を超える推論を改善することができるが, 難解な推論事例の方が, 常に有利であるとは限らない。
2) パフォーマンスは、レイヤーと繰り返しの繰り返しの割り当て方法にも依存し、効果的な深さだけで振舞いを予測するのに不十分であることを示す。
非リカレントな出力層はアンダー・アンダー・アンローリングの堅牢性を改善する一方、入力層とアウトプット層の配置は推論予算によって異なる。
(3) 従来の初期状態注入は, 再発深度の変化に対して, 頑健性に限界があることがわかった。
そこで我々は,チャネルワイドな履歴状態注入とタイムステップ条件付けを組み合わせることで,低コストで効率的な設計を実現し,拡張アンロール下での知識の保存と,推論予算間の堅牢性の向上を実現していることを示す。
全体として、再帰計算がいつ、どこで失敗したかを明らかにし、可変推論予算にまたがってLoopLMを設計するための実践的なガイドラインを提供する。
関連論文リスト
- CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs [50.189987475377656]
マルチモーダル推論における適応推論長最適化のための能力認識型報酬形成フレームワークであるCAREを提案する。
CAREは、パスレートの指数的な移動平均を通したスムーズなコンピテンス推定を維持し、それを訓練を進行段階にルートするために利用する。
複数のビデオ推論と一般的なビデオ理解ベンチマークの実験により、CAREは推論精度を一貫して改善し、強化学習を安定化し、トークン効率を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-06-18T08:28:26Z) - ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models [48.426487984321675]
大きな推論モデルは高い性能を達成するために長い連鎖に依存しているが、そのような推論を適用すると計算コストが一様になる。
既存の効率指向の手法は推論戦略を短縮または混合しようとするが、しばしば推論能力を低下させる。
本稿では,トークンレベルのデュアルプロセスフレームワークであるAdaptive Dual-Process Thinking (ADaPT)を提案する。
論文 参考訳(メタデータ) (2026-06-18T08:11:45Z) - Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search [62.1546099504045]
本稿では、推論を計画と実行に分離する二相テストタイムスケーリングフレームワークを提案する。
具体的には、推論軌跡を分解し、各フェーズの報酬モデルを構築し、探索者が個別に計画と実行を探索、実行できるようにする。
数学的推論とコード生成ベンチマークの両方の実験により、我々の手法は計算の冗長性を低減しつつ、常に精度を向上することを示した。
論文 参考訳(メタデータ) (2025-09-29T19:27:23Z) - SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning [43.91094438704087]
SelfBudgeterは、アダプティブな制御可能な推論フレームワークで、推論の前に予算推定メカニズムを組み込む。
本稿では,問題複雑度に応じて予算を動的に割り当てることにより,平均応答長61%の圧縮が得られることを示す。
論文 参考訳(メタデータ) (2025-05-16T14:08:04Z) - Normalization and effective learning rates in reinforcement learning [52.59508428613934]
正規化層は近年,深層強化学習と連続学習文学においてルネッサンスを経験している。
正規化は、ネットワークパラメータのノルムにおける成長と効果的な学習速度における崩壊の間の等価性という、微妙だが重要な副作用をもたらすことを示す。
そこで本研究では,正規化・プロジェクトと呼ぶ単純な再パラメータ化により,学習率を明示的にする手法を提案する。
論文 参考訳(メタデータ) (2024-07-01T20:58:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。