論文の概要: CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning
- arxiv url: http://arxiv.org/abs/2607.20129v1
- Date: Wed, 22 Jul 2026 13:34:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.092052
- Title: CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning
- Title(参考訳): 量子化小言語モデル推論のためのCUSUM型推論時間モニタリングとターゲット再符号化
- Authors: El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane,
- Abstract要約: MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
- 参考スコア(独自算出の注目度): 0.6999740786886536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quantized small autoregressive reasoning models can enter long, repetitive, or unproductive trajectories, yet inference-time compute is usually allocated without observing how a trajectory develops. Building on an earlier token-level e-CUSUM controller, we develop MGT-B (Monitoring-Guided Test-time Backtracking), a revised external controller that maps overlapping windows of pre-sampling uncertainty and degeneration features to position-conditional empirical tail probabilities, accumulates mixture betting factors with a CUSUM-shaped reset, and responds to an alarm by estimating a rollback point, restoring token and key-value-cache state, and performing constrained re-decoding. To audit whether the effect persists on problem identities first observed after the manual choice of log threshold h = 10, we retrospectively exclude 260 IDs present in pre-threshold artifacts and retain the chronologically first post-threshold pair for each remaining ID, yielding a 240-pair chronology-audit set. On this set, accuracy changes from 82/240 to 88/240 (+2.50 percentage points; 13 corrections, 7 regressions; exact McNemar p = 0.2632; paired bootstrap 95% interval [-1.25, +6.25]). A broader 467-pair historical-coverage set of seed-matched pairs changes accuracy from 146/467 to 167/467 (+4.50 points; McNemar p = 0.000753), but includes 200 seed-1 IDs available before or during threshold selection and is reported only as an exploratory estimate. All 316 no-alarm outputs in the 467-pair set are identical to vanilla, while the 151 alarmed trajectories contain 29 corrections and 8 regressions. Neither analysis is confirmatory, and the empirical factors are not established as a valid e-process or e-detector. The results support a selective monitoring-and-repair mechanism for the studied MATH-500 setting, rather than a general or theoretically certified reasoning improvement.
- Abstract(参考訳): 量子化された小さな自己回帰的推論モデルは、長い、反復的、または非生産的な軌跡に入ることができるが、推論時間計算は通常、軌跡がどのように発達するかを観察せずに割り当てられる。
従来のトークンレベルのe-CUSUMコントローラ上に構築したMGT-B(Monitoring-Guided Test-time Backtracking)は,事前サンプリングの不確かさと劣化特徴の重なり合うウィンドウを,CUSUM形状のリセットで混合ベッティング因子を蓄積し,ロールバックポイントを推定してアラームに応答し,トークンとキー-値-キャッシュ状態を復元し,制約付き再復号を行う。
ログしきい値h = 10のマニュアル選択後に最初に観測された問題アイデンティティに対する影響を検査するために,前閾値アーティファクトに存在する260のIDを遡及的に除外し,残余のIDごとに時系列的に第1の保持ペアを保持し,240ペアの時系列オーディットを出力する。
このセットでは、精度が82/240から88/240(+2.50ポイント、13の修正、7の回帰、正確なマクネマール p = 0.2632、ペアブートストラップ95%間隔 [-1.25, +6.25])に変化する。
146/467から167/467(+4.50ポイント、McNemar p = 0.000753)に変化しているが、しきい値選択の前後に200個のシード-1IDが含まれており、探索的な推定値としてのみ報告されている。
467対の316の非警報出力はすべてバニラと同一であり、151の警報軌道は29の補正と8の回帰を含む。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
その結果,MATH-500設定に対する選択的モニタリング・リペア機構が,汎用的あるいは理論的に証明された推論改善よりも支持された。
関連論文リスト
- Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection [0.12691047660244334]
DCASE Challenge Task 2における1発の異常音検出は、未確認の機械の異常を1つの閾値で警告しなければならない。
ソースドメインとターゲットドメインのAUCはシステム間で負の相関を持ち、開発セットの性能は評価セットのパフォーマンスを予測しない。
凍結したオーディオ埋め込みの上に、トレーニング不要のポストホック層で対処する。
論文 参考訳(メタデータ) (2026-07-05T22:22:31Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Variational Inference for Bayesian MIDAS Regression [0.0]
線形重みパラメータージネーションを用いた回帰のための座標アセント変分推論 (CAVI) アルゴリズムを開発した。
CAVIは、107xから1,772xのスピードアップを達成しつつ、ブロックギブスサンプリングベンチマークとほぼ同一の後方手段を生成する。
重み関数パラメータは、すべてのcon gurationに対して優れたキャリブレーション(カバーは92%以上)を維持している。
論文 参考訳(メタデータ) (2026-02-23T08:51:26Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Bootstrapped Control Limits for Score-Based Concept Drift Control Charts [0.5985204759362747]
適応型教師付き学習モデル(コンセプトドリフト検出)で表される予測関係の変化のモニタリングは広く行われている問題である。
汎用的で強力なフィッシャースコアに基づくコンセプトドリフト手法が最近提案されている。
我々は制御限界(CL)を計算するための新しいブートストラップ法を開発した。
これは、特にサンプルサイズと/または偽アラームレートが小さい場合に、より正確な偽アラームレートの制御を提供する。
論文 参考訳(メタデータ) (2025-07-22T16:36:51Z) - Graph Spatiotemporal Process for Multivariate Time Series Anomaly
Detection with Missing Values [67.76168547245237]
本稿では,グラフ時間過程と異常スコアラを用いて異常を検出するGST-Proという新しいフレームワークを提案する。
実験結果から,GST-Pro法は時系列データ中の異常を効果的に検出し,最先端の手法より優れていることがわかった。
論文 参考訳(メタデータ) (2024-01-11T10:10:16Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - Evaluating Prediction-Time Batch Normalization for Robustness under
Covariate Shift [81.74795324629712]
我々は予測時間バッチ正規化と呼び、共変量シフト時のモデル精度とキャリブレーションを大幅に改善する。
予測時間バッチ正規化は、既存の最先端アプローチに相補的な利点をもたらし、ロバスト性を向上させることを示します。
この手法は、事前トレーニングと併用して使用すると、さまざまな結果が得られるが、より自然なタイプのデータセットシフトでは、パフォーマンスが良くないようだ。
論文 参考訳(メタデータ) (2020-06-19T05:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。