論文の概要: Penelope: Localized Latent Recurrence for Efficient Structured Reasoning
- arxiv url: http://arxiv.org/abs/2607.25915v1
- Date: Tue, 28 Jul 2026 16:06:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.913571
- Title: Penelope: Localized Latent Recurrence for Efficient Structured Reasoning
- Title(参考訳): Penelope: 効率的な構造推論のための局所潜時再帰
- Authors: Yutong Chen, Shouqian Shi, Xinran Liu, Haochen Wang, Jiaying Wang, Tianxing Xu, Yuanxi Wang, Zirui Ding,
- Abstract要約: Penelopeは、事前訓練されたデコーダのみのトランスフォーマーのための効率的な潜時推論フレームワークである。
再帰計算を選択されたデコーダ間隔にローカライズする。
確立された潜在推論モデルと比較して、競争精度が向上する。
- 参考スコア(独自算出の注目度): 26.549641831847982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Complex structured reasoning tasks often require additional computation, yet current language models obtain it mainly by increasing parameter scale or by serializing intermediate steps as chain-of-thought (CoT) tokens. The former raises training and deployment costs, while the latter ties reasoning computation to autoregressive output length. We introduce Penelope, an efficient latent-reasoning framework for pretrained decoder-only Transformers that localizes recurrent computation to a selected decoder interval. The lower decoder prefix is evaluated once to construct a problem-conditioned boundary memory, which is then iteratively refined through time-modulated GRU dynamics and recurrent readout states before answer generation. A progressive CoT-to-latent curriculum transfers visible reasoning into this internal recurrent path, allowing additional computation to be allocated in latent space without repeatedly executing the complete decoder or generating a long intermediate trace. Experiments on open-source structured-reasoning benchmarks show that, at validation-selected latent budgets, Penelope attains competitive accuracy relative to established latent-reasoning models while reducing measured inference latency. These results show that latent refinement can be localized to a narrow decoder interval, reducing repeated full-decoder execution without generating a long visible reasoning trace and providing a practical accuracy-efficiency tradeoff for decoder-only Transformer models.
- Abstract(参考訳): 複雑な構造化推論タスクは、追加の計算を必要とすることが多いが、現在の言語モデルは、主にパラメータスケールの増大や、中間ステップをチェーン・オブ・シント(CoT)トークンとしてシリアライズすることによって得られる。
前者はトレーニングとデプロイメントのコストを上げ、後者は推論計算を自動回帰出力長に結び付けている。
我々は、再帰計算を選択されたデコーダ間隔にローカライズする、事前学習されたデコーダのみのトランスフォーマのための効率的な潜時推論フレームワークであるPenelopeを紹介する。
下位デコーダプレフィックスを一度評価して問題条件境界メモリを構築し、応答生成前の時間変調GRUダイナミックスと繰り返し読み出し状態を通じて反復的に洗練する。
プログレッシブなCoT-to-latentカリキュラムは、可視的推論をこの内部再帰経路に転送し、完全なデコーダを繰り返し実行したり、長い中間トレースを生成することなく、追加の計算を潜時空間に割り当てることを可能にする。
オープンソースの構造化推論ベンチマークの実験では、検証選択された潜在予算において、ペネロペは、測定された推論レイテンシを低減しつつ、確立された潜在推論モデルと比較して、競争精度を達成している。
これらの結果から,潜時精細化は狭い復号器間隔に局所化でき,長い可視的推論トレースを発生させることなく繰り返し全復号器の実行を低減し,復号器のみのトランスフォーマーモデルに対して実用的な精度・効率のトレードオフを提供することがわかった。
関連論文リスト
- Accelerating Hierarchical Sparse Predictive Coding with Hybrid Amortized Inference [0.0]
また,LISTA型イニシャライザーと短い修正再発は,長時間の反復推論よりもはるかに高速でありながら,純粋なアモート化よりも改善することを示した。
以上の結果より,LISTA型イニシャライザーと短い補正再発は,長期反復推論よりもはるかに高速でありながら,純粋な償却よりも改善することが示唆された。
論文 参考訳(メタデータ) (2026-06-26T07:38:55Z) - $R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction [28.068667649331246]
推論とトレーニングの両方の観点から,デコード冗長性を低減するための統一的なフレームワークを提案する。
R2$-dLLMは、既存のデコード戦略と比較して、デコードステップの数を最大75%削減する。
論文 参考訳(メタデータ) (2026-04-21T02:26:08Z) - TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs [8.818252253980985]
TempoNetは、置換不変トランスフォーマーと深いQ近似を組み合わせた強化学習スケジューラである。
ブロックワイズのトップk選択と局所性に敏感なチャンキングを備えた遅延対応スパースアテンションスタックは、順序のないタスクセットに対するグローバルな推論を可能にする。
論文 参考訳(メタデータ) (2026-02-20T09:56:23Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - READER: Retrieval-Assisted Drafter for Efficient LLM Inference [0.0386965802948046]
自己回帰言語モデルはトークンシーケンスよりも分解された確率をインスタンス化するが、その厳密なシーケンシャルなデコーディングプロセスは、遅延推論に固有の低いバウンドを課す。
このボトルネックは、大規模生成モデルのスケーラブルなデプロイにおける中心的な障害として現れています。
本稿では,補助的ドラフトモデルのトレーニングを回避した投機的復号化フレームワークREADERを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:47:48Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Short-Term Memory Optimization in Recurrent Neural Networks by
Autoencoder-based Initialization [79.42778415729475]
線形オートエンコーダを用いた列列の明示的暗記に基づく代替解を提案する。
このような事前学習が、長いシーケンスで難しい分類タスクを解くのにどのように役立つかを示す。
提案手法は, 長周期の復元誤差をはるかに小さくし, 微調整時の勾配伝播を良くすることを示す。
論文 参考訳(メタデータ) (2020-11-05T14:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。