論文の概要: It's the Problem, Not the Path: Budget and Difficulty Confounds in LLM Reasoning Trajectories
- arxiv url: http://arxiv.org/abs/2609.03436v1
- Date: Thu, 03 Sep 2026 06:47:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.949586
- Title: It's the Problem, Not the Path: Budget and Difficulty Confounds in LLM Reasoning Trajectories
- Title(参考訳): LLM推論軌道の予算と難易度
- Abstract要約: 再起動制御トランケーションプローブは、ソリューションが継続予算に適合するときに、プレフィックスが購入できない値を持てるときとを分離する。
事前登録された、難易度制御されたテストは、問題の難解なベースラインを超えた早期ウィンドウ内部信号における検出可能な結果情報を見つけない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning traces of large language models are widely read as containing "breakthrough" moments and early-legible fates. Both readings rest on measurements missing a counterfactual control at the level of the claim; we supply both controls. First, a restart-controlled truncation probe separates when a solution fits the continuation budget from when a prefix carries value that fresh computation cannot buy, comparing per-anchor continuation solve rates against from-scratch restart curves at matched total generated-token budget. Applied to 178 problem-model cells (89 MATH problems x two small open models, an outcome-blind but difficulty-targeted cohort), exactly 1 of 178 cells survives as prefix-limited; restart dose-response separates a compute-starved model from a capability-limited one; and wherever the matched budget lies inside the restart grid, continuing the model's own prefix beats restarting (9 of 9) -- predominantly compute compression rather than expanded reachability. Second, a pre-registered, difficulty-controlled test finds no detectable outcome information in early-window internal signals beyond a problem-difficulty baseline, and two generation-free analyses of public corpora show why this control is needed: a trace-blind difficulty proxy reaches AUROC 0.873 on 192K DeepSeek-R1 generations -- inside the published probe range -- and a closely matched reconstruction of the closest published early-window positive recovers a comparable pooled result (0.849) while within problem it is statistically indistinguishable from chance at all ten anchors (0.496 at t=4); a post-hoc within-targeted probe finds only a small average residual, concentrated in three low-failure problems. High pooled probe AUROCs cannot by themselves establish within-attempt information; a question-only baseline or within-problem evaluation is required.
- Abstract(参考訳): 大規模な言語モデルの推論トレースは、"ブレークスルー"モーメントとアーリー・レガシブルな運命を含むものとして広く読まれている。
どちらの読み取りも、クレームのレベルにおいて反実的なコントロールを欠いている測定に依存します。
第一に、再起動制御トランケーションプローブは、ソリューションが継続予算に適合する場合と、プレフィックスが新しい計算が購入できない値を持つ場合とを分離し、一致した総生成トーケン予算におけるアンカー毎継続解率と再起動曲線の比較を行う。
178個の問題モデル細胞(89 MATH 問題 x 2つの小さなオープンモデル、結果ブラインドだが難解なコホート)に適用すると、正確に178個の細胞のうち1個はプレフィックス限定として生き残る。
第2に、事前登録された難易度制御テストは、問題の難解なベースラインを超えた早期ウィンドウ内部信号において検出可能な結果情報を見つけず、また、この制御が必要な理由を2世代無用なパブリックコーパスの分析で示している: トレースブラインド困難プロキシが、公表された調査範囲内にある192K DeepSeek-R1世代でAUROC 0.873に到達し、最も頻繁に公開された早期ウィンドウの正の復元が、同等のプール結果(0.849)を再現するが、問題内では10個のアンカー(t=4で0.496)の確率から統計的に区別できない。
ハイプール型プローブAUROCは、それ自体で、質問のみのベースラインまたはイントラプロブレム評価を必要とする。
関連論文リスト
- Feature Priming in Online Linear Regression: Sparse-Regret Lower Bounds and a Tight Univariate Rate [47.36630149538994]
高次元のオンライン予測では、最良の予測子はいくつかの機能にのみ依存する可能性があるため、後悔は周囲の次元ではなく、疎らさでスケールすべきである。
WarmuthとAmidはCOLT 2023で、これらの3つのルールのいずれかが競合するオンライン後悔の保証を認めているかどうかを尋ねた。
安価なニュアンスは、リフィットが真の予測座標を過度に重くする原因となる。
論文 参考訳(メタデータ) (2026-08-18T09:32:03Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use [28.57781785937644]
PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションの間に障害特異的ニューロンベースを共有するクローズループフレームワークである。
6つのモデル全体で、PRISMSはプールされたオーバーコール率を80%削減し、ツール要求の精度を14.2%向上させた。
論文 参考訳(メタデータ) (2026-07-31T19:03:44Z) - Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior [0.0]
人間の認知の多様性が行動から回復し、LSMエージェントに移行できるかどうかを問う。
Nousは、実際のポリマーケット取引活動から構造化された8次元の行動プロファイルを抽出し、プロンプトを通じてエージェントに注入する。
我々は,Nousを認知的モノカルチャー問題と即時治療の限界を計測するものとして位置づける。
論文 参考訳(メタデータ) (2026-06-11T08:18:25Z) - Measuring the Symmetry--Data Exchange Rate [0.2538209532048867]
同一の軌道サイズと一致した計算値を持つ間違った群制御は制約を伴わないよりも悪いことを示す。
相対交換率beta_diff = 1.28は、理論ブートストラップ1.0と符号と桁違いに一致している。
手法的貢献 -- 共有拡散の欠点をキャンセルする相対レート推定器、間違ったグループ制御、および予め特定された失敗分類 - は、強度をパラメータ化できる帰納バイアスに転送される。
論文 参考訳(メタデータ) (2026-05-31T08:17:40Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Detecting Unobserved Confounders: A Kernelized Regression Approach [46.52607207396279]
Kernel Regression Confounder Detection (KRCD) は、単一環境下での非線形観測データにおける観測不能なコンバウンディングを検出する新しい方法である。
ゼロからの有意な偏差が観測不能な共起を示すテスト統計学。
合成ベンチマークとツインズデータセットの実験は、KRCDが既存のベースラインを上回るだけでなく、計算効率も優れていることを示した。
論文 参考訳(メタデータ) (2026-01-01T04:26:02Z) - Asymptotically Optimal Linear Best Feasible Arm Identification with Fixed Budget [55.938644481736446]
本稿では,誤差確率の指数的減衰を保証し,最適な腕識別のための新しいアルゴリズムを提案する。
我々は,複雑性のレベルが異なる様々な問題インスタンスに対する包括的経験的評価を通じて,アルゴリズムの有効性を検証する。
論文 参考訳(メタデータ) (2025-06-03T02:56:26Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Statistical and Computational Phase Transitions in Group Testing [73.55361918807883]
本研究の目的は、希少な疾患を患っているk人の集団を同定することである。
個々人のテストを割り当てるための2つの異なる単純なランダムな手順を考える。
論文 参考訳(メタデータ) (2022-06-15T16:38:50Z) - Optimal Clustering with Bandit Feedback [57.672609011609886]
本稿では,バンディットフィードバックを用いたオンラインクラスタリングの問題点について考察する。
これは、NPハード重み付きクラスタリング問題をサブルーチンとして解決する必要性を回避するための、シーケンシャルなテストのための新しい停止規則を含む。
合成および実世界のデータセットの広範なシミュレーションを通して、BOCの性能は下界と一致し、非適応的ベースラインアルゴリズムよりも大幅に優れることを示す。
論文 参考訳(メタデータ) (2022-02-09T06:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。