論文の概要: An Exact Instrument for State Usage in Selective State-Space Models, and the Input-Driven Migration It Reveals
- arxiv url: http://arxiv.org/abs/2607.11796v1
- Date: Mon, 13 Jul 2026 16:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.560276
- Title: An Exact Instrument for State Usage in Selective State-Space Models, and the Input-Driven Migration It Reveals
- Title(参考訳): 選択的状態空間モデルにおける状態利用のための厳密な手段とその入力駆動マイグレーション
- Abstract要約: トレーニングされたモデルが1次モードをどのように使用するかを測定するための正確な手段を提供する。
トレーニングされたモデルは入力によって状態空間を再配置する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Selective state-space models such as Mamba route information through a bank of first-order modes whose input coupling is set by a learned selection mechanism. We give an exact instrument for measuring how a trained model uses these modes. Because the state matrix is diagonal, each channel's output decomposes exactly into per-mode contributions, and a per-(layer, channel, window) Gram tensor yields the exact output error of dropping any subset of modes, offline, at any budget. Validated against the reference implementation to a relative error of $2.3\times10^{-7}$ on the Mamba-1 family where it is exact, the instrument predicts a layer's deployed pruning error to a median relative deviation of $5\times10^{-7}$ over $4{,}464$ configurations, its floor set by the reconstruction. Applying the instrument across the Mamba-1 family (130M--2.8B), the deployed 7B Falcon-Mamba, and Mamba-2, we find that trained models re-allocate their state space with the input: which modes carry the signal migrates across contexts, and at the most affected layers a per-input oracle roughly halves the output error of a fixed mode set. Frozen-signal counterfactuals attribute the migration primarily to the input-dependent write map $B_t$; the timestep usually identified with selectivity carries almost none of it. Input-scheduled mode pruning on this measurement outperforms static, Hankel-based, and layer-adaptive rankings at every scale from 130M to the deployed 7B Falcon-Mamba, and at half the state budget it matches the unpruned model. Because the scheduler reads each window's mode usage from a first pass, this demonstrates realizable headroom; we claim no deployed compute or memory saving.
- Abstract(参考訳): マンバルート情報のような選択的な状態空間モデルでは、入力結合が学習された選択機構によって設定される1次モードのバンクを経由する。
トレーニングされたモデルがこれらのモードをどのように使用するかを測定するための、正確な手段を提供する。
状態行列は対角的であるため、各チャネルの出力はモード毎のコントリビューションに完全に分解され、各(レイヤ、チャンネル、ウィンドウ)グラムテンソルは任意の予算でモードのサブセットをオフラインにドロップする正確な出力エラーを発生させる。
正確には、Mamba-1ファミリーの相対誤差2.3\times10^{-7}$に対して検証され、配置されたプルーニングエラーを5\times10^{-7}$4{,}464$以上の相対偏差で予測する。
Mamba-1ファミリー(130M--2.8B)、デプロイされた7B Falcon-Mamba、Mamba-2に適用すると、トレーニングされたモデルでは、入力によって状態空間を再配置する。
Frozen-signal counterfactualsは、主に入力依存の書き込みマップ$B_t$である。
この測定による入力スケジューリングモードのプルーニングは、130Mからデプロイされた7B Falcon-Mambaまでのすべてのスケールで、静的、ハンケルベース、および層適応的なランキングよりも優れており、州予算の半分では未実行モデルと一致している。
スケジューラは、最初のパスから各ウィンドウのモード使用状況を読み取るので、これは実現可能なヘッドルームを示します。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Fixed-order postselected CHSH reference acquisition for parity-constrained spatial-mode qubits on a commercial cloud photonic processor [0.0]
我々は,Quandelaの商用クラウドアクセス可能なベレノスプロセッサ上で,2つの符号化されたフォトニックキュービットに対して,Clauser-Horne-Shimony-Holt (CHSH) の取得と報告を行う。
各論理キュービットは、8モードの単一光子レジスタの7次元ゼロサムセクターにおける2次元空間モード部分空間である。
論文 参考訳(メタデータ) (2026-08-13T01:08:02Z) - Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard [0.010742675209112621]
F-ICLは、正しい帰納的推論のためのテキスト内学習ベンチマークである。
長さ15億のプログラム全てをLle13$で包含し、ベイズ最適後部を閉形式で計算する。
モデルはクエリの最大92%を正しく答えるが、46モデルのうち45モデルはキーストローク参照よりも最適な位置から分布を得る。
論文 参考訳(メタデータ) (2026-08-03T01:21:44Z) - Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - Selective State-Space Adaptation and Retrieval for Language Model Reasoning [5.8120627413404184]
2つの相補的な粒度で選択的な状態空間再帰を導入するアダプタ群が提案されている。
textbfMaLoRA (Mamba-modulated Low-rank adaptation) は、アダプタのスケーリング係数をトークン間での繰り返し状態を持つ動的入力依存関数にする。
論文 参考訳(メタデータ) (2026-07-21T17:47:57Z) - Scaling Laws for Behavioral Foundation Models over User Event Sequences [2.924581427482972]
本稿では、共通の2部分の振る舞いモデルアーキテクチャ、特徴ベースのイベント埋め込み、デコーダのみの変換器について検討する。
約600回にわたって、実際のインタラクションデータで動作し、トレーニング用FLOPは1015ドルから1019ドルの範囲で、デプロイ関連軸が4つあります。
計算最適トレーニングは低計算時のテキストと比較してデータ量が多いが、計算量が増加するにつれて、そのD/N$比はチンチラに向かう。
論文 参考訳(メタデータ) (2026-06-03T15:59:25Z) - Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling [0.0]
16家系の63塩基モデルにおける推論と真理の結合度を測定した。
我々は、家族依存の臨界スケール(N_c$)以下の損失曲線を目に見えない体制変化を発見し、その上、彼らは協力する。
論文 参考訳(メタデータ) (2026-05-13T03:14:09Z) - Attractor-Keyed Memory [0.0]
物理セレクタは、決定の時点で高次元のシグネチャを生成する。
試行錯誤(ステレオタイプ化)および経路間で線形に独立なシグネチャを繰り返すと、単一の線形デコーダがそれらを任意のペイロードにマップする。
我々は,全誤差分解を導出し,Ising-machineセレクタの構成を与え,合成スペックル・シグナチャシミュレーションで予測されたスケーリングを検証する。
論文 参考訳(メタデータ) (2026-03-17T18:31:40Z) - Mamba-3: Improved Sequence Modeling using State Space Principles [74.41028882099846]
線形モデルの状態空間モデル(SSM)の視点に触発された3つの中核的方法論的改善を紹介する。
アーキテクチャの改良とともに、Mamba-3モデルは、検索、状態追跡、下流言語モデリングタスク間で大きな進歩を遂げます。
論文 参考訳(メタデータ) (2026-03-16T17:30:08Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - SAMITE: Position Prompted SAM2 with Calibrated Memory for Visual Object Tracking [58.35852822355312]
Visual Object Tracking (VOT)は、ビデオ内のターゲットを継続的に追跡する自律運転のようなアプリケーションで広く使われている。
これらの問題に対処するために、ビデオ基盤モデルSAM2をVOTに適用し、各フレームの追跡結果をメモリとして符号化し、残りのフレームを自己回帰的に条件付けする手法を提案する。
これらの課題に対処するために,SAM2 上にモジュールを追加して構築した SAMITE モデルを提案する。
論文 参考訳(メタデータ) (2025-07-29T12:11:56Z) - Multistep Inverse Is Not All You Need [87.62730694973696]
実世界の制御環境では、観測空間は不要に高次元であり、時間関連ノイズにさらされることが多い。
したがって、観測空間を制御関連変数のより単純な空間にマッピングするエンコーダを学ぶことが望ましい。
本稿では,多段階逆予測と遅延フォワードモデルを組み合わせた新しいアルゴリズムACDFを提案する。
論文 参考訳(メタデータ) (2024-03-18T16:36:01Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z) - Mid-circuit operations using the omg-architecture in neutral atom arrays [0.0]
我々は48個の中性原子配列に中間回路演算を実装した。
$171$Yb に存在する $textitomg$ アーキテクチャを制御する新しい方法が提示される。
論文 参考訳(メタデータ) (2023-05-30T17:56:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。