論文の概要: Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models
- arxiv url: http://arxiv.org/abs/2609.19934v1
- Date: Thu, 17 Sep 2026 09:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.194034
- Title: Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models
- Title(参考訳): 深度トラニケーションを超えて:再帰的言語モデルにおける深度利用の制御された評価
- Abstract要約: Depth-recurrent言語モデルは小さなレイヤスタックを反復的に適用し、異なるパラメータ数からトークン単位の計算を分離する。
このようなモデルがその深さを真に活用するかどうかを判断するために、再帰性および層破り性のある文献は、共用評価に依存する。
本稿では,これら3つの量に絡み合う診断スイートであるDCPを提案する。
- 参考スコア(独自算出の注目度): 1.733255162390776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Depth-recurrent language models iteratively apply a small layer stack, decoupling per-token compute from distinct parameter count. To determine whether such a model genuinely utilizes its depth, both recurrence and layer-pruning literatures rely on a shared evaluation: truncating depth at inference time, plotting quality against retained depth fraction, and reading off the slope. While cheap and training-free, this metric suffers from an unexamined flaw: it extracts a single scalar from an intervention that alters multiple model properties simultaneously. Depth truncation concurrently reduces the number of block applications, decreases the volume of distinct computation performed, and pushes the readout head onto an out-of-distribution residual stream. The observed slope conflates all three factors, yet is conventionally interpreted as reflecting solely the second. We propose the Depth Control Protocol (DCP), a diagnostic suite that disentangles these three quantities. DCP comprises three positive controls that isolate each factor while varying the others, a negative control applying the identical interventions to dense transformers to ensure the effect is not an artifact of the measurement protocol, and a controlled training intervention to verify causality. The linchpin control, running the full budget of block applications while executing only a single distinct iteration, is strictly realizable only in depth-wise weight-sharing architectures, since in a dense network repeating a layer yields an entirely different model rather than the same model in an alternative configuration.
- Abstract(参考訳): Depth-recurrent言語モデルは小さなレイヤスタックを反復的に適用し、異なるパラメータ数からトークン単位の計算を分離する。
そのようなモデルがその深さを真に活用するか否かを判断するために、再帰性および層破り性のある文献は、共用評価、すなわち推論時に深さを減らし、保持された深さ分に対する品質をプロットし、斜面から読み取る。
安価でトレーニングが不要なこの測定基準は、複数のモデルプロパティを同時に変更する介入から単一のスカラーを抽出する、未検討の欠陥に悩まされる。
Depth truncationはブロックアプリケーションの数を同時に減らし、異なる計算のボリュームを減らし、リードアウトヘッドをアウト・オブ・ディストリビューション残ストリームにプッシュする。
観測された斜面は3つの要素全てを膨らませるが、従来は2番目の要因のみを反映していると解釈されている。
本稿では,これら3つの量に絡み合う診断スイートであるDCPを提案する。
DCPは、他の因子を変動させながら各因子を分離する3つの正の制御と、その効果が測定プロトコルの成果物でないことを保証するために同一の介入を高密度変圧器に適用する負の制御と、因果性を検証するための制御された訓練介入とからなる。
1つの異なるイテレーションだけを実行しながら、ブロックアプリケーションの完全な予算を実行するリンチピン制御は、ディープワイドな重み付けアーキテクチャにおいてのみ厳密に実現可能である。
関連論文リスト
- Forward-Free LLM Depth Pruning via Weight Redundancy [0.08594140167290099]
Depth pruningは、完全なTransformerブロックを削除することで、大きな言語モデル(LLM)推論コストを低減する。
Weight-Redundancy Pruning (WRP) は,チェックポイント重みから選択ブロックまでの層間冗長度を推定する,フォワードフリーなディープ・プルーニング手法である。
WRPは、既存のフォワードフリー・マグニチュード・プルーニングを一貫して上回り、アクティベーションベースの手法の性能にアプローチする。
論文 参考訳(メタデータ) (2026-09-09T08:38:23Z) - RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers [8.085475675888045]
リカレントGPT(RecurrentGPT)は、固定深度前処理とコダブロックが1つの共有コア繰り返しR回ブラケットする再カレント深さ変換器である。
ゲート型リカレントニューラルネットワークにインスパイアされた私たちは、ライトウェイトプロジェクションとエレメントワイズ更新ゲートを使用して、リカレント更新を変調する。
この結果から,適応的深度再利用は品質の取引パラメータの原則的戦略であることが示唆された。
論文 参考訳(メタデータ) (2026-08-15T06:22:00Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Flow Map Denoisers: Traversing the Distortion-Perception Plane for Inverse Problems [48.501415601682815]
画像復元は基本的なトレードオフに直面している: エラーを最小限に抑える手法はぼやけた再構成を生み出し、知覚的品質を最大化する手法はシャープだが忠実でない画像を生み出す。
フローマップモデルは、歪み知覚フロンティアを連続的に分散する1パラメータのデノイザ群を暗黙的に定義する。
Plug-and-Playソルバ内では、同じメカニズムが一般的な逆問題にまで拡張され、知覚的アライメントとデータの一貫性のトレードオフを制御する。
論文 参考訳(メタデータ) (2026-06-18T05:15:43Z) - WiNet: Wavelet-based Incremental Learning for Efficient Medical Image Registration [68.25711405944239]
深部画像登録は異常な精度と高速な推測を示した。
近年の進歩は、粗大から粗大の方法で密度変形場を推定するために、複数のカスケードまたはピラミッドアーキテクチャを採用している。
本稿では,様々なスケールにわたる変位/速度場に対して,スケールワイブレット係数を漸進的に推定するモデル駆動WiNetを提案する。
論文 参考訳(メタデータ) (2024-07-18T11:51:01Z) - Multi-threshold Deep Metric Learning for Facial Expression Recognition [60.26967776920412]
本稿では,難易度検証を回避する多閾値深度学習手法を提案する。
その結果,三重項損失のそれぞれの閾値は本質的にクラス間変動の特異な分布を決定することがわかった。
埋め込み層はスライスで構成されており、より情報的で差別的な特徴である。
論文 参考訳(メタデータ) (2024-06-24T08:27:31Z) - Scaling strategies for on-device low-complexity source separation with
Conv-Tasnet [8.40565031143262]
単一チャンネル音声分離のための非常に効果的なニューラルアプローチが文献で紹介されている。
これらのモデルのサイズと複雑さのため、補聴器やイヤホンなどの低リソースデバイスでの使用は依然として困難である。
モデル全体のサイズを直接制御する3つのパラメータ、すなわち、残余ブロックの数、分離ブロックの繰り返し数、深さワイド畳み込みにおけるチャネルの数を考える。
論文 参考訳(メタデータ) (2023-03-06T10:15:14Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z) - Manifold Regularized Dynamic Network Pruning [102.24146031250034]
本稿では,全インスタンスの多様体情報をプルーンドネットワークの空間に埋め込むことにより,冗長フィルタを動的に除去する新しいパラダイムを提案する。
提案手法の有効性をいくつかのベンチマークで検証し,精度と計算コストの両面で優れた性能を示す。
論文 参考訳(メタデータ) (2021-03-10T03:59:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。