論文の概要: When Policies Change Probabilities: Modular Decision-Making for LLM Code Review
- arxiv url: http://arxiv.org/abs/2608.02677v1
- Date: Sun, 02 Aug 2026 20:09:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.884483
- Title: When Policies Change Probabilities: Modular Decision-Making for LLM Code Review
- Title(参考訳): ポリシーが確率を変えるとき - LLMコードレビューのためのモジュール決定-
- Authors: Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi,
- Abstract要約: 720のパッチに対する15,792の応答を用いて,4つのデプロイされたレビュアインタフェースが分離を維持しているかどうかを検証した。
パッチと一致した呼び出しで、修正された証拠を監視し、同じコストの政策を10:1の偽受け入れポリシーに変更し、障害確率を13.6から16.9ポイントと報告した。
また、ポリシー情報なしでリスクを発生させるモジュールパイプラインを評価し、独立したモニタスコアを組み合わせて、コードにコストを適用します。
- 参考スコア(独自算出の注目度): 1.957901132578125
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM code reviewers often estimate patch risk and make approval decisions in one prompt. A probability should depend on evidence; costs should determine the action taken from it. We test whether four deployed reviewer interfaces preserve this separation using 15,792 responses on 720 candidate patches, with one that passed and one that failed an archived test harness for each of 360 repository issues. In matched calls with the patch and monitor evidence fixed, replacing an equal-cost policy with a 10:1 false-accept policy changes reported failure probabilities by 13.6 to 16.9 percentage points on average. For every reviewer, the actions returned under the high-cost prompt are worse than rejecting all patches. Applying the same high-cost rule to probabilities elicited under equal costs reduces loss for all four systems, showing that probability elicitation itself contributes to the excess loss. We also evaluate a modular pipeline that elicits risk without policy information, combines an independent monitor score, and applies costs in code. Relative to calibrated reviewer-only scores, the pipeline improves average probability accuracy and, at equal costs, reduces mean loss by .073 per issue while accepting 58 to 68% of patches. At 10:1, it accepts none and matches reject-all. Downstream policy can therefore change the probability it is meant to use, motivating separate evaluation of risk, outside evidence, and action.
- Abstract(参考訳): LLMコードレビュアーは、しばしばパッチのリスクを見積もり、承認決定を1つのプロンプトで行う。
確率は証拠に依存するべきであり、コストはそこから取られた行動を決定するべきである。
3つのデプロイされたレビュアインターフェースが720の候補パッチに対して15,792のレスポンスを使用してこの分離を維持しているかどうかをテストする。
パッチと一致した呼び出しと、修正された証拠を監視し、同じコストの政策を10:1の偽受け入れポリシーに変更し、故障確率を平均13.6から16.9ポイントと報告した。
すべてのレビュアーにとって、高コストのプロンプトで返されるアクションは、すべてのパッチを拒否するよりも悪い。
同じコストで同じ高コストな規則を適用すれば、4つのシステム全体の損失を減少させ、確率の誘発自体が過剰な損失に寄与することを示す。
また、ポリシー情報なしでリスクを発生させるモジュールパイプラインを評価し、独立したモニタスコアを組み合わせて、コードにコストを適用します。
校正されたレビュアーのみのスコアとは対照的に、パイプラインは平均確率の精度を改善し、同じコストで1イシューあたり平均損失を.073削減し、58から68%のパッチを受け付けている。
10:1で、何も受け入れず、すべてと一致します。
したがって、下流政策は、使用を意図した確率を変え、リスク、外部証拠、行動の別々な評価を動機付けることができる。
関連論文リスト
- Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification [1.547549252134621]
本稿では,クロスフィット型残効ユーティリティとプライマリ保存型認知決定ポリシーを用いて,推論後の問題について検討する。
構造化されたkan-Fourier分類器はデフォルトの確率を提供し、ニューラルおよび非ニューラル候補は観測可能な証拠を提供する。
RMLA、RMLB、HISARでは、完全なシステムは全体の精度を63.632%から66.332%、65.161%から66.168%、77.769%から79.867%に改善している。
論文 参考訳(メタデータ) (2026-08-03T11:07:37Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving [0.0]
言語モデルの安全性評価は、サービス構成を固定されたバックグラウンドインフラストラクチャとして扱うことが多い。
我々は4つのアーティファクト支援研究をペアテストプロトコルに合成する。
標準vLLMは、現在のスコアフリップ候補に対して22/55ラベルのフリップを再生し、VLLM_BATCH_INIANT=1を有効にすることで、同じテストを0/55フリップに削減する。
論文 参考訳(メタデータ) (2026-05-26T23:22:55Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Best-Effort Policies for Robust Markov Decision Processes [69.60742680559788]
我々は、ロバスト MDP (RMDPs) として知られる遷移確率の組によるマルコフ決定過程(MDPs)の共通一般化について研究する。
このような政策を最適な堅牢なベストプラクティス(ORBE)政策と呼ぶ。
我々はORBEポリシーが常に存在することを証明し、その構造を特徴付け、標準的なロバストな値反復よりも小さなオーバヘッドで計算するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-08-11T09:18:34Z) - Conformal Off-Policy Evaluation in Markov Decision Processes [53.786439742572995]
強化学習は、データから効率的な制御ポリシーを特定し評価することを目的としている。
この学習タスクのほとんどの方法は、Off-Policy Evaluation (OPE)と呼ばれ、正確さと確実性を保証するものではない。
本稿では,目標方針の真報を含む区間を所定の確信度で出力するコンフォーマル予測に基づく新しいOPE手法を提案する。
論文 参考訳(メタデータ) (2023-04-05T16:45:11Z) - Will My Robot Achieve My Goals? Predicting the Probability that an MDP Policy Reaches a User-Specified Behavior Target [56.99669411766284]
自律的なシステムがタスクを実行する場合、ユーザの目標を達成する確率のキャリブレーションされた見積もりを維持する必要がある。
本稿では,ユーザの目標が目標間隔として指定される設定について検討する。
我々は、共形予測を反転させて確率推定を計算する。
論文 参考訳(メタデータ) (2022-11-29T18:41:20Z) - Sayer: Using Implicit Feedback to Optimize System Policies [63.992191765269396]
我々は、暗黙のフィードバックを活用して、新しいシステムポリシーを評価し、訓練する方法論を開発する。
Sayerは、強化学習の2つのアイデアに基づいて、既存のポリシーで収集されたデータを活用する。
Sayer氏は任意のポリシーを正確に評価し、生産ポリシーを上回るような新しいポリシーをトレーニングできることを示します。
論文 参考訳(メタデータ) (2021-10-28T04:16:56Z) - Universal Off-Policy Evaluation [64.02853483874334]
ユニバーサルオフ政治推定器(UnO)への第一歩を踏み出す
我々は, 平均, 分散, 分位数/中間数, 分位数範囲, cvar, および累積分布全体の推定と同時結合に uno を用いる。
論文 参考訳(メタデータ) (2021-04-26T18:54:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。