論文の概要: The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals
- arxiv url: http://arxiv.org/abs/2608.04611v1
- Date: Wed, 05 Aug 2026 09:16:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.797195
- Title: The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals
- Title(参考訳): The Order is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals
- Authors: Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang,
- Abstract要約: 本稿では,Al系が実行検証能力が有限である場合,コードを削除する方法の逆問題について検討する。
提案スケジューリングとして冗長コード削減を定式化する。
スケジューリングが検索を司る一方で、テストスイートのみが"保存行動"の意味を司ることを示す。
- 参考スコア(独自算出の注目度): 12.095189927690988
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier coding models now match or exceed strong human reference points on programming benchmarks, yet benchmark success does not imply maintainable software. Prompt-driven "vibe coding" is additive: new branches, guards, and fallbacks accumulate faster than obsolete logic is removed. We study the inverse problem-how an Al system should remove code when execution-verification capacity is finite. We formulate redundant-code reduction as proposal scheduling: a ranker orders single-statement deletion candidates, an execution suite accepts the first candidate that passes, and a budget bounds how many candidates may be tested. Our central observation is that candidate order, not model confidence, is the control surface a deployment can reason about. DELSCOUT instantiates two schedules. Given representative target-domain validation, a five-slot budget spends three slots on deterministic shortest-first candidates and two on complementary learned candidates; across nine MBPP replications with 0.5B, 0.6B, and 8B rankers this raises verified-deletion coverage by 9.5% relative (+6.7 accepted tasks) while consuming slightly fewer verifier calls than the matched static baseline. Without such validation the same rankers can lose coverage under shift, so we instead evaluate the complete static prefix first and append learned candidates only afterwards; for a deterministic verifier this makes coverage and character reduction non-decreasing by construction, at a measured 4.8-62.5% increase in verifier calls. MBPP+ then erases the in-domain advantage, showing that scheduling governs search while the test suite alone governs what "preserving behavior" means. The result is an auditable division of labor: models widen the search for removable code, order bounds the damage a mis-ranked proposal can do, and execution retains authority over every committed deletion.
- Abstract(参考訳): 最前線のコーディングモデルは、プログラミングベンチマークにおいて強力な人間の参照ポイントと一致するか超えるが、ベンチマークの成功は保守性のあるソフトウェアを意味するものではない。
新しいブランチ、ガード、フォールバックは、古いロジックが削除されるよりも早く蓄積される。
本稿では,Al系が実行検証能力が有限である場合,コードを削除する方法の逆問題について検討する。
オーダがシングルステートメントの削除候補を注文し、実行スイートが通過する最初の候補を受け入れ、予算がテストされる候補数を制限します。
私たちの中心的な観察は、モデルの信頼性ではなく、候補の順序が、デプロイが引き起こすコントロールサーフェスである、ということです。
DELSCOUTは2つのスケジュールをインスタンス化する。
5スロットの予算は、決定論的最短優先候補に3つのスロット、補完的な学習候補に2つのスロットを割く: 0.5B、0.6B、および8BランクのMBPPレプリケーションにおいて、これは一致した静的ベースラインよりもわずかに小さな検証対象呼び出しを消費しながら、9.5%の相対的(+6.7タスク)で検証削除カバレッジを上昇させる。
このような検証がなければ、同じランク付け者が、シフト中のカバレッジを失う可能性があるので、代わりに、完全な静的接頭辞を最初に評価し、学習した候補をあとで追加する。
MBPP+はドメイン内のアドバンテージを消去し、スケジューリングが検索を制御し、テストスイートだけが"保存行動"の意味を制御していることを示す。
モデルは取り外し可能なコードの検索を広げ、命令はミスランクの提案ができる損害を制限し、実行はコミットされた削除の度に権限を保持する。
関連論文リスト
- Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control [50.46501177871741]
LNOQRD は小物候補を75.9% で削減し、90.8% でニアオラクルのカバレッジを維持している。
実験の結果、LNOQRDは実用性と意図の満足度が最も高く、かつ、法律違反が最低で、世代後レイテンシが低いことがわかった。
論文 参考訳(メタデータ) (2026-08-02T00:27:01Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control [0.0]
再帰的なシステムは、過度な失敗が見える前に、崩壊のような状態に入ることができる。
障害が指向性テレメトリパターンに従うかどうかをテストするためのクレームバウンド型ベンチマークフレームワークであるLoopzeroを紹介した。
凍結した2つの公開アーティファクトベンチマークのブリッジを評価する。
論文 参考訳(メタデータ) (2026-05-29T20:12:42Z) - Agentic Systems as Boosting Weak Reasoning Models [6.622844972691325]
検証者支援委員会探索を推論言語モデルの推論時間向上として検討する。
繰り返しサンプリングすることでカバレッジを増幅できるが、それ自体で有用な批評家やコンパレータを作ることはできない。
SWE-bench Verifiedでは、単一のテキストGPT-5.4ナノプロポーザルが67.0%のタスクを解決している。
論文 参考訳(メタデータ) (2026-05-13T22:32:31Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Efficient Ensemble Selection from Binary and Pairwise Feedback [32.05855919168298]
マルチウィンナー投票の分布変種として選択問題を考察する。
我々は、正しい/間違った結果のタスクに対する二項フィードバックと、候補出力を優先的に比較したタスクに対するペアフィードバックの両方を解析する。
本稿では,全情報最適化はPTASを許容するが,Gap-ETHの下ではEPPTASを含まないことを示し,目的はモノトーンだが部分モジュラーではないことを示す。
論文 参考訳(メタデータ) (2026-05-10T15:01:34Z) - Efficient Test-Time Inference via Deterministic Exploration of Truncated Decoding Trees [68.04613115686509]
自己整合性は、複数の推論トレースを並列にサンプリングし、投票することで、推論時間のパフォーマンスを向上させる。
そこで本研究では,切り落された標本を伐採木として扱う決定論的復号法であるDLE(Distinct Leafion)を提案する。
DLEは高品質な推論トレースを調査し、数学、コーディング、一般的な推論タスクのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-04-22T12:42:03Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。