論文の概要: Random Recursive Models
- arxiv url: http://arxiv.org/abs/2610.00541v1
- Date: Wed, 30 Sep 2026 18:23:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.694284
- Title: Random Recursive Models
- Title(参考訳): ランダム再帰モデル
- Abstract要約: 再帰モデルはパラメータ再利用によって計算深度を生成する。
我々はRandom Recursive Model (RRM)を導入する。
RRMは、トレーニング中に見られるものを含め、推論時に深さを変えることができる。
- 参考スコア(独自算出の注目度): 15.755161495786503
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive models create computational depth through parameter reuse, offering a parameter-efficient alternative to increasing model size. However, most recursive models repeatedly apply one learned transformation or a prescribed sequence of transformations, restricting computation to a fixed layer order. We introduce the Random Recursive Model (RRM), which maintains a pool of $L$ learned layers and performs $T$ recursive steps by sampling one layer independently with replacement for each example and step. This enables flexible layer reuse while retaining the parameter efficiency of recurrence. We evaluate RRM on challenging reasoning tasks, where it matches or exceeds the baselines, often with 50-75 % fewer parameters. RRM can vary its depth at inference, including beyond that seen during training, without retraining or adding parameters, improving tasks that benefit from deeper iterative computation. RRM also supports Monte Carlo inference and probabilistic test-time scaling, both of which improve performance without retraining. These insights may open new directions in neural network architecture design.
- Abstract(参考訳): 再帰的モデルはパラメータ再利用を通じて計算深度を生成し、モデルのサイズを増やすためのパラメータ効率の代替手段を提供する。
しかし、ほとんどの再帰的モデルは、1つの学習された変換または所定の一連の変換を繰り返し適用し、計算を固定層オーダーに制限する。
我々は、Random Recursive Model (RRM)を導入し、このモデルでは、学習したレイヤのプールを保持し、各サンプルとステップの置き換えを独立して1つのレイヤをサンプリングすることで、$T$再帰的なステップを実行する。
これにより、繰り返しのパラメータ効率を維持しながらフレキシブルなレイヤ再利用が可能になる。
RRMは、基準値にマッチまたは超え、しばしばパラメータが50~75%減少する難解な推論タスクで評価する。
RRMは、トレーニング中に見られる範囲を超えて、パラメータをトレーニングしたり追加したりすることなく、推論時の深さを変えることができ、より深い反復計算の恩恵を受けるタスクを改善することができる。
RRMはモンテカルロ推論や確率的テストタイムスケーリングもサポートしている。
これらの洞察は、ニューラルネットワークアーキテクチャ設計における新たな方向性を開く可能性がある。
関連論文リスト
- Recursive Scaling in Masked Diffusion Models [67.93066069475753]
マスク付き拡散モデル (MDMs) は近年, シーケンス生成において有望なパラダイムとして浮上している。
本稿では,R-MDM(Recursive Masked Diffusion Models)を導入し,パラメータ数を増やすことなくモデル深度を増加させる。
Sudoku や Countdown などの構造化された生成タスク全体で、R-MDM がパラメータ効率を大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-06-16T15:02:49Z) - Generative Recursive Reasoning [67.22973831501257]
Generative Recursive ReAsoning Models (GRAM) は、潜在的推論を確率論的多軌道に変換するフレームワークである。
GRAMは$p_(y mid x)$で条件推論をサポートし、固定または欠落した入力では$p_(x)$で条件生成を行う。
論文 参考訳(メタデータ) (2026-05-19T05:20:56Z) - Looping Back to Move Forward: Recursive Transformers for Efficient and Flexible Large Multimodal Models [63.47909317137073]
大規模マルチモーダルモデル (LMM) は視覚言語計算タスクにおいて顕著な成功を収めた。
しかし、その膨大なパラメータ数は、トレーニングと推論の両方で利用されていないことが多い。
LMMに適した再帰トランスフォーマーアーキテクチャであるRecursiveVLMを提案する。
論文 参考訳(メタデータ) (2026-02-09T17:58:23Z) - MeSH: Memory-as-State-Highways for Recursive Transformers [23.995570647573484]
パラメータが少ない再帰モデルは、マッチした計算の下では非再帰的モデルよりも遅れることが多い。
隠れた状態を探索することで、このパフォーマンスギャップを2つの主要なボトルネックにトレースします。
メモリ管理を明示的なメモリバッファに外部化するメモリ・アズ・ステート・ハイウェイ方式を導入する。
論文 参考訳(メタデータ) (2025-10-09T03:23:38Z) - Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation [61.67090981767583]
本研究では,Mixture-of-Recursions (MoR)を導入した。
MoRはパラメータ効率を達成するために再帰ステップをまたいだ共有レイヤのスタックを再利用し、軽量ルータは適応トークンレベルの思考を可能にする。
また、メモリフットプリントをさらに削減するために、KVペアを最初の再帰から再利用するKV共有変種を提案する。
論文 参考訳(メタデータ) (2025-07-14T17:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。