論文の概要: What Survives When You Compress a Recursive Reasoner for the Edge?
- arxiv url: http://arxiv.org/abs/2606.26488v1
- Date: Thu, 25 Jun 2026 00:47:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.122752
- Title: What Survives When You Compress a Recursive Reasoner for the Edge?
- Title(参考訳): エッジ用再帰型推論器を圧縮するとどうなるか?
- Abstract要約: 再帰的推論モデルは、潜伏状態を繰り返し更新することで、数百万のパラメータだけで複雑な構造化タスクを解くことができる。
攻撃的な圧縮は局所的な予測を保存するが、グローバルな推論を損なう。
我々は,この損傷とその回復を予測できるラベルのない信号として,フル精度推論経路に類似した搬送軌道の忠実さを導入する。
- 参考スコア(独自算出の注目度): 15.460381731793975
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive reasoning models can solve complex structured tasks with only a few million parameters by repeatedly updating a latent state. Deploying these models on edge hardware requires significant compression, but unlike conventional sequence models, quantization errors compound across recursive reasoning cycles rather than across output tokens. As a result, standard intuitions about compression fail to apply. In this work, we ask what survives when recursive reasoners are compressed. Across a full precision sweep, three tasks, and two recursive architectures, we find that aggressive compression preserves local prediction but destroys global reasoning: cell accuracy holds while puzzle-exact accuracy collapses to zero under naive INT4 pruning, distillation, and linear attention alike. Token-level objectives, including quantization-aware training, cannot repair it. The collapse is architectural -- it strikes MLP-mixing recursion but not attention on the same task -- and we reverse it with per-channel calibrated INT4 without retraining. We also introduce carry-trajectory fidelity, the cosine similarity to the full-precision reasoning path, as a label-free signal that predicts this damage and its recovery before a task evaluation. The combined result is a deployment recipe: flash-streamed embeddings remove a 99.4MB bottleneck, INT8 at one cycle matches full-depth accuracy at 6x fewer FLOPs (8MB SoC), and calibrated INT4 fits a 4MB microcontroller.
- Abstract(参考訳): 再帰的推論モデルは、潜伏状態を繰り返し更新することで、数百万のパラメータだけで複雑な構造化タスクを解くことができる。
エッジハードウェアにこれらのモデルをデプロイするにはかなりの圧縮が必要であるが、従来のシーケンスモデルとは異なり、量子化エラーは出力トークンではなく再帰的推論サイクルにまたがる。
その結果、圧縮に関する標準的な直観は適用されない。
本研究では,再帰的推論器を圧縮した場合の生存状況について尋ねる。
完全精度,3つのタスク,2つの再帰的アーキテクチャにおいて,アグレッシブ圧縮は局所的な予測を保ちながらグローバルな推論を損なうことが判明した。
量子化対応トレーニングを含むトークンレベルの目的は、それを修復することはできない。
崩壊はアーキテクチャであり、MLP混合再帰にぶつかるが、同じタスクに注意を払わない。
また,この損傷を予測し,その回復をタスク評価の前に予測するラベルフリー信号として,フル精度推論経路とコサインの類似性であるキャリー・トラジェクトリの忠実さも導入する。
フラッシュストリームの埋め込みは99.4MBのボトルネックを取り除き、1サイクルのINT8は6倍のFLOP(8MB SoC)で完全深度精度と一致し、4MBのマイクロコントローラに適合する。
関連論文リスト
- Steering Under Compression: Dose-Response, Capability Cost, and Failure Asymmetry in Quantized LLMs [0.0]
推論時ステアリングは、パラメータ修正なしで大きな言語モデルの振る舞い制御を可能にする。
トレーニング後の量子化により、デプロイメントのメモリと計算コストが削減される。
重量のみの量子化下での活性化ステアリングを系統的に研究する。
論文 参考訳(メタデータ) (2026-09-06T08:41:42Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs [0.23438564092609357]
プロアクティブ干渉(英: Proactive interference, PI)は、大規模言語モデルにおける文書化された障害モードであり、繰り返し上書きされた値の検索は、事前上書きが蓄積されるにつれて劣化する。
PTQは現在、オープンウェイトモデルのデフォルトのデプロイメントパスとなっているが、この障害モードへの影響はテストされていない。
アーキテクチャ的に異なる3つの命令調整モデルの3つの精度レベル(FP16, INT8, INT4/NF4, ビット/バイト)を評価する。
論文 参考訳(メタデータ) (2026-08-19T06:17:13Z) - KV Cache Compression Through the Lens of Transform Coding [9.884224071643606]
本稿では,アテンション・アウェア・トランスフォーメーション・コーディング(AATC)を紹介し,アテンション・アウェア・トランスフォーメーションの歪みを最小限に抑えるために,キャリブレーション・セット上のビットを割り当てる。
提案手法は, ほぼロスレスの精度を約5.8倍の圧縮で達成する一方, 各ベースラインは少なくともいくつかの設定で劣化する。
論文 参考訳(メタデータ) (2026-08-14T11:08:01Z) - Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery [40.94400211806987]
生成プロセスの不安定性はトークン数を膨らませるため、2ビットのアグレッシブ推論がエンドツーエンドのスピードアップを達成できないことを示す。
Qwen3推論モデルの完全な推論トレースを数学的および常識的なベンチマークで分析する。
以上の結果から, 異常を制御可能な世代病理として扱うと, 極端に低ビット推論が現実的になることがわかった。
論文 参考訳(メタデータ) (2026-06-01T10:04:09Z) - Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution [3.6704226968275253]
量子化を乗り越える手法はモデルにほとんど変化しないが, 圧縮条件下では, 有意義な忘れ方を実現するための勾配に基づく手法を示す。
因果回路の属性を組み合わせることで両モードを解消し,最小限の差分集合部分グラフを分離するMANSUを提案する。
さらに,構造的消去と行動抑制を区別する機構的検証尺度であるCircuit Attribution Divergence(CAD)を導入する。
論文 参考訳(メタデータ) (2026-05-14T17:44:10Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification [67.15451442018258]
拡散変換器は素晴らしいビデオ生成能力を示すが、その計算とメモリの禁止コストは実際の展開を妨げる。
モデル量子化とアテンションスパシフィケーションは圧縮に有望な2つの方向であるが、それぞれがアグレッシブ圧縮の下で深刻な性能劣化を被っている。
モデル量子化と注意散布を統合した統合フレームワークである textbfQuantSparse を提案する。
論文 参考訳(メタデータ) (2025-09-28T06:49:44Z) - COMQ: A Backpropagation-Free Algorithm for Post-Training Quantization [8.214857267270807]
ポストトレーニング量子化(PTQ)は、大規模なニューラルネットワークを圧縮するための実践的なアプローチとして登場した。
本稿では,階層的再構成誤りの座標最小化を逐次行う,COMQと呼ばれる革新的なPTQアルゴリズムを提案する。
COMQは、4ビットビジョン変換器を量子化し、Top-1の精度で1%未満の損失を負う。
論文 参考訳(メタデータ) (2024-03-11T20:04:03Z) - An Information Theory-inspired Strategy for Automatic Network Pruning [97.03772272417599]
深層畳み込みニューラルネットワークは、リソース制約のあるデバイスで圧縮されることがよく知られている。
既存のネットワークプルーニング手法の多くは、人的努力と禁忌な計算資源を必要とする。
本稿では,自動モデル圧縮のための情報理論に基づく戦略を提案する。
論文 参考訳(メタデータ) (2021-08-19T07:03:22Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z) - Efficient Integer-Arithmetic-Only Convolutional Neural Networks [87.01739569518513]
我々は従来のReLUを境界ReLUに置き換え、その減少は活性化量子化によるものであることを示す。
我々の整数ネットワークは、対応するFPNネットワークと同等の性能を発揮するが、メモリコストは1/4に過ぎず、最新のGPUでは2倍高速である。
論文 参考訳(メタデータ) (2020-06-21T08:23:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。