論文の概要: Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost
- arxiv url: http://arxiv.org/abs/2607.17240v1
- Date: Sun, 19 Jul 2026 13:11:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.409248
- Title: Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost
- Title(参考訳): 制約された経路推論: コストが増大する段階を計測する
- Authors: Honglin Li,
- Abstract要約: Constrained Path Reasoning (CPR)は、ソース認識パス仮説とステージレベルの会計とをペアリングする。
CPRは、タスク互換のコミットメントは、移行を分解し、候補の質量を集中し、正規性を誘導し、そのゲインが宣伝されたエラーや実行コストを超えたときにフィードバックを公開することができると予測している。
- 参考スコア(独自算出の注目度): 2.9867974725783113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When does a committed intermediate stage in an LLM reasoning pipeline earn its cost? Constrained Path Reasoning (CPR) pairs a source-aware path hypothesis with stage-level accounting. Search generates provisional states; trusted or validated invariants can constrain hard, while other proposals remain soft and revisable. CPR predicts that task-compatible commitments can factor transitions, concentrate candidate mass, induce regularity, and expose feedback when their gains exceed propagated error and execution cost. The formalism covers discrete commitments and continuous flows and measures effective branching, endpoint concentration, and cost per usable output. Across 1,180 generated QCQPs and 40 engineered degenerate polynomial instances (2,140 endpoints), residual triage recovers 63.0% of repair-all's additional feasible yield with 17.7% of its attempts. Fixed-LLM accounting (270 unique calls shared across nested arms) finds usable yield of 41.1% direct, 90.0% after formalization and deterministic execution, 20.0% after one-shot convexification, and 21.1% for the full path. In 120 paired-condition calls, a two-action rollback rule reaches 90% usable yield versus 36.7% for the feedback-conditioned selector. Two endpoint probes separate source from validation: a 72-output cross-trajectory transplant reduces entropy and acceptable mass; a 24-output same-call self-proposal pilot gives unchanged two-repeat collision entropy, 25.0% versus 8.3% usable yield, and 1/8 deterministically confirmed endpoint checks. Model-generated states supply hypotheses; trusted execution earns constraint strength.
- Abstract(参考訳): LLM推論パイプラインのコミット中間段階はいつコストを発生させるのか?
Constrained Path Reasoning (CPR)は、ソース認識パス仮説とステージレベルの会計とをペアリングする。
検索は一時的な状態を生成する。信頼あるいは検証された不変量は厳しい制約を受ける可能性があるが、他の提案はソフトで修正可能である。
CPRは、タスク互換のコミットメントは、移行を分解し、候補の質量を集中し、正規性を誘導し、そのゲインが宣伝されたエラーや実行コストを超えたときにフィードバックを公開することができると予測している。
形式主義は、離散的なコミットメントと継続的なフローをカバーし、有効分岐、終端集中、使用可能な出力当たりのコストを測定する。
1,180個のQCQPと40個のデジェネレーション多項式インスタンス(2,140のエンドポイント)が生成され、残余のトリアージは17.7%の試行で補修全体の追加可能な収率の63.0%を回復した。
固定LLM会計(ネストアーム間で共有される270のユニークな呼び出し)では、使用可能な収量は41.1%、形式化および決定的実行後の90.0%、一発の凸化後の20.0%、完全なパスに対する21.1%である。
120のペア条件呼び出しでは、2アクションのロールバックルールが90%の利得に達するが、フィードバック条件のセレクタは36.7%である。
72アウトプットのクロストラジェクトリ移植はエントロピーと許容質量を減少させるが、24アウトプットのセルフプロポッシルパイロットは、異なる2リピート衝突エントロピーを与え、25.0%対8.3%、決定的に確認された1/8のエンドポイントチェックを与える。
モデル生成状態は仮説を提供し、信頼できる実行は制約強度を得る。
関連論文リスト
- When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation [0.11280931253550518]
構造化世代 (NER, 抽出, QA, 分類) にデプロイされる大規模言語モデル (LLM) には、正式な信頼性保証がない。
我々は、共形リスク制御(CRC)が構造化LLM出力を証明でき、かつ、それが証明不可能な場合に特徴付ける。
論文 参考訳(メタデータ) (2026-06-27T19:25:07Z) - Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials [2.102846336724103]
Mat-Prefは、11の無機構造体ファミリーにわたる10,837のイオン置換質問のベンチマークである。
4つのゼロショットフロンティアモデルは、すべての分割において33-54%の範囲に留まっており、スケールだけでは、このタスク要求の合成化学的理由を解決していないことを確認している。
論文 参考訳(メタデータ) (2026-06-20T01:46:41Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers [0.0]
デプロイされた安全分類器における分散シフトのオンラインモニタリングシステムを提案する。
検出後、共形吸収層は、目標誤差を回復する決定に適応する。
このシステムは平均遅延39.5800ステップで86.6%の検知を実現している。
論文 参考訳(メタデータ) (2026-06-10T11:24:25Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。