論文の概要: Dynamic Parameterization Is Not Dynamic Inference
- arxiv url: http://arxiv.org/abs/2607.26192v1
- Date: Tue, 28 Jul 2026 18:51:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.453103
- Title: Dynamic Parameterization Is Not Dynamic Inference
- Title(参考訳): 動的パラメータ化は動的推論ではない
- Abstract要約: 非摂動軌道に沿って完全にテンソル係数をキャッシュするFrozen-Controller Auditing (FCA)を実装した。
FCAは、独立したキャリブレーションセットから推定されるクロスインプットの再割り当て、トークンシャッフル、および静的プロファイルで凍結モデルを再生する。
係数は介入前にキャッシュされるため、コントローラの再計算からのフィードバックを伴わずに、リプレイ時のアサイン依存によるパフォーマンス変化を計測する。
- 参考スコア(独自算出の注目度): 1.874915440086176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Input-dependent controller coefficients are often treated as evidence of dynamic inference or computational savings. This interpretation conflates three properties: coefficient variation, dependence of a frozen model on how coefficients are assigned to inputs, and conditional execution. We focus on the second property and formulate a general principle of frozen-controller auditing. We provide one concrete implementation, Frozen-Controller Auditing (FCA), which caches the complete coefficient tensor along an unperturbed trajectory, disables the controller, and replays the frozen model with cross-input reassignment, token shuffling, and static profiles estimated from an independent calibration set. Because the coefficients are cached before any intervention, performance changes under replay measure assignment dependence without feedback from recomputing the controller on perturbed hidden states. Across seven independently trained 76M FeatureGate Transformers and three 504M models, static layerwise profiles retain 98.70% and 99.43% of the Correct-to-GlobalMean performance gap, respectively. Layer identity explains 87% to 96% of the coefficient variance. FeatureGate nevertheless executes every Transformer block, and its measured inference is 30.8% slower than Dense. On the public MUDDPythia-1.4B checkpoint, cross-input reassignment and token shuffling increase NLL by 1.9067 and 2.9637, respectively. These penalties show that the model depends strongly on content-conditioned cross-layer assignment. MUDDPythia also executes every Transformer block. The results show that dynamic parameterization alone does not establish dynamic inference and that functional dynamics do not establish computational savings. Claims about dynamic models should separately report coefficient variation, functional dependence of the frozen model, and actual execution.
- Abstract(参考訳): 入力依存の制御係数は、しばしば動的推論や計算的貯蓄の証拠として扱われる。
この解釈は、係数の変動、係数の入力への割り当て方法への凍結モデルの依存、条件付き実行の3つの特性を混同している。
本稿では,第2の特性に着目し,凍結制御器監査の一般原理を定式化する。
本稿では,非摂動軌道に沿って全係数テンソルをキャッシュし,コントローラを無効にし,クロスインプットの再割り当て,トークンシャッフル,および独立キャリブレーションセットから推定される静的プロファイルを用いて凍結モデルを再生するFlezen-Controller Auditing(FCA)という具体的実装を提案する。
係数は介入前にキャッシュされるため、乱れ隠された状態のコントローラを再計算するフィードバックを伴わずに、リプレイ計測代入依存性による性能変化が生じる。
7つの独立に訓練された76M FeatureGate Transformerと3つの504Mモデルで、静的な層回りのプロファイルはそれぞれ98.70%と99.43%のCorrect-to-GlobalMeanパフォーマンスギャップを保持している。
層密度は係数分散の87%から96%である。
FeatureGateはすべてのTransformerブロックを実行し、測定された推論はDenseよりも30.8%遅い。
MUDDPythia-1.4Bチェックポイントでは、クロスインプットの再割り当てとトークンシャッフルがそれぞれ1.9067と2.9637に増加する。
これらの罰則は、モデルはコンテンツ条件の層間割り当てに強く依存していることを示している。
MUDDPythiaはすべてのTransformerブロックも実行する。
その結果、動的パラメータ化だけでは動的推論が確立せず、機能的ダイナミクスが計算的貯蓄を確立できないことがわかった。
動的モデルに関する主張は、係数の変動、凍結モデルの機能的依存、実際の実行を別々に報告する必要がある。
関連論文リスト
- Causal Unlearning in Collaborative Optimization: Exact and Approximate Influence Reversal under Adversarial Contributions [2.5565719921628443]
フェデレートされた学習システムは、プライバシー規則に従うためにデータ削除要求をサポートしなければならない。
本稿では,クライアントのコントリビューションをKrylov部分空間の共役反復によって近似することで,クライアントのコントリビューションを除去する手法であるHF-KCUを提案する。
我々は、k がヘッセン条件数である場合、クリロフ近似誤差が O((k 1/2-1)/(k1/2+1) として減少することを示す収束保証を提供する。
論文 参考訳(メタデータ) (2026-05-19T18:00:39Z) - The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference [2.954681536906518]
KVキャッシングは自己回帰変換器推論におけるユビキタス最適化である。
FP16 KVキャッシュ推論は基本的に再計算と等価ではないことを示す。
論文 参考訳(メタデータ) (2026-04-16T15:59:40Z) - Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation [51.48086451600577]
E3Flowは、同変拡散ポリシーの限界に対処する新しいフレームワークである。
安定な多モード同変学習による効率的な整流を初めて統一する。
E3Flowは、最先端の球拡散政策よりも平均的な成功率を3.12%向上させる。
論文 参考訳(メタデータ) (2026-03-24T14:00:36Z) - Engineering Verifiable Modularity in Transformers via Per-Layer Supervision [0.0]
分散冗長性は損傷を補うため、資本化にとって重要なものとして認識される注目ヘッドを非難することは、最小限の行動変化をもたらす。
アーキテクチャの介入が隠されたモジュール性を公開することを実証します。
このことは、受動的観察から能動的制御への解釈可能性変換の方法論を台無しにしている。
論文 参考訳(メタデータ) (2026-03-08T05:18:14Z) - Variational Inference for Bayesian MIDAS Regression [0.0]
線形重みパラメータージネーションを用いた回帰のための座標アセント変分推論 (CAVI) アルゴリズムを開発した。
CAVIは、107xから1,772xのスピードアップを達成しつつ、ブロックギブスサンプリングベンチマークとほぼ同一の後方手段を生成する。
重み関数パラメータは、すべてのcon gurationに対して優れたキャリブレーション(カバーは92%以上)を維持している。
論文 参考訳(メタデータ) (2026-02-23T08:51:26Z) - Function-Space Decoupled Diffusion for Forward and Inverse Modeling in Carbon Capture and Storage [65.51149575007149]
本稿では,Fun-DDPSについて述べる。Fun-DDPSは,関数空間拡散モデルと微分可能なニューラル演算子サロゲートを結合した生成フレームワークである。
Fun-DDPSは、ジョイントステートベースラインで観察される高周波アーティファクトから、物理的に一貫した実現をもたらす。
論文 参考訳(メタデータ) (2026-02-12T18:58:12Z) - Weak instrumental variables due to nonlinearities in panel data: A Super Learner Control Function estimator [0.0]
加法的に分離可能な個々の固定効果を持つパネルデータに対する三角同時方程式モデルを提案する。
推定手順は2つの主要なステップとサンプル分割から構成される。
2SLS推定器では,スーパーラーナー制御関数推定器が有意に優れていた。
論文 参考訳(メタデータ) (2025-04-04T07:22:18Z) - Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching [56.286064975443026]
拡散変圧器内の多数の層をキャッシュ機構で計算することで、モデルパラメータを更新しなくても容易に除去できる。
本稿では,拡散変圧器の動的手法でキャッシングを学習するL2C(Learningto-Cache)を提案する。
実験の結果,L2C は DDIM や DPM-r など,キャッシュベースの従来の手法と同等の推論速度で性能を向上することがわかった。
論文 参考訳(メタデータ) (2024-06-03T18:49:57Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Scaling & Shifting Your Features: A New Baseline for Efficient Model
Tuning [126.84770886628833]
既存の微調整法は、事前訓練されたモデルの全てのパラメータ(フル微調整)をチューニングするか、最後の線形層(線形プローブ)のみをチューニングする。
そこで本研究では,SSFと呼ばれるパラメータ効率の高いファインタニング手法を提案する。
論文 参考訳(メタデータ) (2022-10-17T08:14:49Z) - Adaptive LASSO estimation for functional hidden dynamic geostatistical
model [69.10717733870575]
関数型隠れ統計モデル(f-HD)のためのペナル化極大推定器(PMLE)に基づく新しいモデル選択アルゴリズムを提案する。
このアルゴリズムは反復最適化に基づいており、適応最小限の収縮・セレクタ演算子(GMSOLAS)ペナルティ関数を用いており、これは不給付のf-HD最大線量推定器によって得られる。
論文 参考訳(メタデータ) (2022-08-10T19:17:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。