論文の概要: The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces
- arxiv url: http://arxiv.org/abs/2605.27965v1
- Date: Wed, 27 May 2026 05:01:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.75653
- Title: The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces
- Title(参考訳): オーバーシンキングの形状:ロングリゾニングトレースにおけるバーストのバックトラック
- Authors: Navid Rezazadeh, Arash Gholami Davoodi,
- Abstract要約: 本研究では, 局所的再考, リトラクション, あるいは長期的推論トレース内での再導出について検討する。
6000 Qwen3-8B AIMEトレース上では, セグメントレベルのバックトラックの重大度をアノテートし, イベントタイミング, 正規化深度, 局所バースト構造を解析した。
早期の孤立した修復は正しい推論と互換性があることが多いのに対して、不正確なトレースはより多く、緩やかなバックトラックが持続し、クラスタ化が遅くなっています。
- 参考スコア(独自算出の注目度): 2.102532345063307
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning models often generate long traces in which useful self-correction and unproductive revision are hard to distinguish. We study this distinction through backtracking dynamics: local reconsideration, retraction, or re-derivation inside long-form reasoning traces. On 6{,}000 Qwen3-8B AIME traces, we annotate segment-level backtrack severity and analyze event timing, normalized depth, and local burst structure. We find that early isolated repair is often compatible with correct reasoning, whereas incorrect traces more often show moderate-to-severe backtracks that persist and cluster late. Cross-corpus checks show the same qualitative asymmetry across additional model/domain pairs. Filtering analyses instantiate the signal as a prefix-causal selective early-exit policy: at shallow and intermediate depths, burst-aware filtering outperforms fixed length-based filtering while using only prefix-available features. Moderate length cutoffs remain strong completed-trace baselines, but burst-aware control provides a deployable mechanism for separating recoverable repair from likely instability.
- Abstract(参考訳): 推論モデルは、有用な自己補正と非生産的修正が区別が難しい長いトレースを生成することが多い。
本研究では, この特徴を, 局所的再考, リトラクション, あるいは長期的推論トレース内での再導出という, バックトラックのダイナミクスを通して研究する。
6{,}000 Qwen3-8B AIMEトレースでは,セグメントレベルのバックトラックの重症度をアノテートし,イベントタイミング,正規化深度,局所バースト構造を分析した。
早期の孤立した修復は正しい推論と互換性があることが多いのに対して、不正確なトレースはより多く、緩やかなバックトラックが持続し、クラスタ化が遅くなる。
クロスコーパスチェックは、追加のモデル/ドメイン対で同じ定性的非対称性を示す。
フィルタ解析は、信号がプレフィックス-因果選択的早期終了ポリシーとしてインスタンス化される: 浅い深さと中間深さでは、バースト・アウェア・フィルタリングはプレフィックス可能な機能のみを使用しながら、固定長ベースのフィルタリングに優れる。
適度な長さのカットオフは強力な完備トラスベースラインにとどまるが、バーストアウェアコントロールは、回復可能な修復を不安定から分離するためのデプロイ可能なメカニズムを提供する。
関連論文リスト
- Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes [13.293115227628775]
ロングチェーン・オブ・シークレット (Long CoT) 推論は多段階問題のパフォーマンスを向上させるが、過度な考えも引き起こす。
長文推論トレースを解析・解析するオンラインアルゴリズムSTOP(Structured On-policy Pruning)を提案する。
論文 参考訳(メタデータ) (2026-05-13T08:28:05Z) - Surprised by Attention: Predictable Query Dynamics for Time Series Anomaly Detection [1.7751300245073598]
AxonADは、マルチヘッドアテンションクエリの進化を短い水平方向予測可能なプロセスとして扱う教師なし検出器である。
テール集約型クエリミスマッチスコアは、最近のタイムステップで予測されたクエリとターゲットクエリの相違を測定する。
インターバルアノテーションを用いた車内テレメトリでは、AxonADは強力なベースライン上でのランキング品質と時間的ローカライゼーションを改善している。
論文 参考訳(メタデータ) (2026-03-13T11:40:51Z) - Constraint-Rectified Training for Efficient Chain-of-Thought [60.52883907721588]
CoT (Chain-of-Thought) は,Large Language Models (LLMs) の推論能力を大幅に向上させた。
より長い推論トレースは、自己訂正のような回答の品質とアンロック能力を改善することができるが、高い推論コストを発生させ、過度に考えることとして知られる冗長なステップをしばしば導入する。
近年の研究は、推論の長さと精度のバランスをとる効率的な推論戦略の開発を目指している。
論文 参考訳(メタデータ) (2026-02-13T02:13:45Z) - LEFT: Learnable Fusion of Tri-view Tokens for Unsupervised Time Series Anomaly Detection [53.191369031661885]
教師なし時系列異常検出は、アノテーションの可用性を前提とせず、異常なタイムスタンプを識別するモデルを構築することを目的としている。
本稿では,非教師付きTSADフレームワークであるLearnable Fusion of Tri-view Tokens(LEFT)について述べる。
実世界のベンチマーク実験では、LEFTはSOTAベースラインに対して最高の検出精度を示し、FLOPの5倍、トレーニングの8倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-09T13:33:49Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart [27.904791075662896]
TAAR(Trap-Aware Adaptive Restart)は,部分軌道から2つの信号を予測するための診断ポリシーをトレーニングするテスト時間制御フレームワークである。
推測時、TAARは予測されたトラップセグメントの前に軌道を切断し、復号を適応的に再起動する。
実験の結果,TAARはモデルパラメータを微調整することなく推論性能を向上させることがわかった。
論文 参考訳(メタデータ) (2026-01-17T07:26:02Z) - Unstable Prompts, Unreliable Segmentations: A Challenge for Longitudinal Lesion Analysis [0.5537760992845262]
本稿では,ULS23セグメンテーションモデルの性能を経時的に検討する。
本報告では, スキャン間登録誤りによる経過観察におけるセグメンテーション品質の急激な低下と, その後の病変対応過程の崩壊の2つの重要な障害モードを同定した。
論文 参考訳(メタデータ) (2025-07-25T12:55:48Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。