論文の概要: Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.24473v1
- Date: Tue, 25 Aug 2026 12:20:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.965301
- Title: Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning
- Title(参考訳): Ockhamareto: 強化学習による簡潔なユニットテスト生成のためのパレットゲート付きセグメンテーションレベルクレジットアサインメント
- Authors: Dong Huang, Mark Harman, Jie M. Zhang, Zhijiang Guo, Mingzhe Du, See Kiong Ng,
- Abstract要約: 我々は単発のGRPOフレームワークであるtextbfOckhamaretoを紹介した。
Ockhamaretoには2つの主要なコンポーネントがある: (i)emphPareto-gated Bonusは、(mutation, $-$#tests)スペースで非支配的なロールアウトのみを報酬する。
- 参考スコア(独自算出の注目度): 64.49364696628294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce \textbf{Ockhamareto}, a single-shot GRPO framework for unit-test generation and selection, based on the principles of \emph{Ockham's Razor} and \emph{Pareto Optimality}. Ockhamareto has two principal components: (i)~a \emph{Pareto-gated Bonus} that rewards only rollouts non-dominated in~(mutation, $-$\#tests) space, and (ii)~\emph{Token-level Segment Credit}, which attributes each test's marginal mutation kills back to the tokens of its unit-test block. On the \emph{UnLeakedTestBench~(ULT)}, Ockhamareto \emph{strictly Pareto-dominates} the strongest RL baseline~(\emph{MIST-RL}). Furthermore, it dominates on {\em each and all} optimization objectives, catching more bugs ($49.9\%$ vs $31.3\%$ mutation score at $N{=}5$), using \emph{fewer} tests ($2.60$ vs $4.67$ on average), thereby achieving $3.4\times$ the per-test trade-off improvement. The advantage is found in all four benchmarks~(\emph{HumanEval+}, \emph{MBPP+}, \emph{CodeContests}, \emph{TestGenEval-Lite}): Ockhamareto leads both mutation and coverage metrics on every one, always with the smallest suite. Ockhamareto also outperforms the state-of-the-art at all model scales, adding $+30$--$35$~pp mutation at 4B, 9B, and 27B model sizes. We also show that the knee point of the optimal trade-off between efficiency and effectiveness on the Pareto front is not correlated with obvious more easily computed proxy metrics, such as function size. This finding motivates the Pareto front computation; it is needed to identify this crucial engineering trade-off for each function under test.
- Abstract(参考訳): 単発のGRPOフレームワークである「textbf{Ockhamareto}」を紹介し,「emph{Ockham's Razor}」と「emph{Pareto Optimality}」の原理に基づく。
オックハマレトには2つの主成分がある。
(i)~a \emph{Pareto-gated Bonus} は、~(mutation, $-$\#tests)空間における非支配的なロールアウトのみを報酬する。
(ii)~\emph{Token-level Segment Credit} – 各テストの限界突然変異を属性として、ユニットテストブロックのトークンに戻す。
Emph{UnLeakedTestBench~(ULT)} では、Ockhamareto \emph{strictly Pareto-dominates} が最強の RL ベースライン~(\emph{MIST-RL} である。
さらに、より多くのバグ(49.9\%対311.3\%=$N{=}5$)をキャッチし、emph{fewer}テスト(2.60$対平均4.67$)を使用し、テストごとのトレードオフ改善で3.4\times$を達成している。
利点は、すべての4つのベンチマーク~(\emph{HumanEval+}, \emph{MBPP+}, \emph{CodeContests}, \emph{TestGenEval-Lite}): Ockhamaretoは、常に最小のスイートで、すべてのベンチマークで、突然変異とカバレッジの両方をリードする。
Ockhamaretoはまた、あらゆるモデルスケールで最先端のパフォーマンスも向上し、4B、9B、27Bモデルサイズで$+30$--35$~pp変異を加えた。
また,Paretoフロントにおける効率性と有効性の間の最適トレードオフ点が,関数サイズなどのより容易に計算可能なプロキシ指標と相関しないことを示す。
この発見は、Paretoフロント計算を動機付け、テスト中の各関数に対して、この重要なエンジニアリングトレードオフを特定する必要がある。
関連論文リスト
- Online Shadow Tomography Matching the Classical Bounds [13.458467420475507]
本稿では、適応データ解析の古典的問題の直接量子一般化について研究する。
私たちの最初のアルゴリズムは、$mathrmpoly(log(d)/)$とともに$o(log2 m)$-dependenceを達成した最初のアルゴリズムです。
第2のアルゴリズムは$d$とは無関係なバウンダリ間で最適であることが知られており、$sqrtm log m$ factorによって最高の事前結果を改善する。
論文 参考訳(メタデータ) (2026-07-31T17:59:54Z) - Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization [0.21485350418225238]
不均一なNLPタスクに展開される微調整エンコーダは、3つの複合的な問題に直面している。
textbfsurgellmは、専用の軽量モジュールでそれぞれに対処する統合トランスフォーマーフレームワークである。
論文 参考訳(メタデータ) (2026-06-23T07:47:21Z) - Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling [71.62893745623526]
ビデオフレーム選択は準ガウスサンプリングの問題である。
我々はAdaQと呼ばれる適応的でトレーニングなしのアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-23T06:13:30Z) - Robust Learning of a Group DRO Neuron [21.632698901872843]
任意のラベルノイズと群レベルの分布シフトの存在下で,標準2乗損失下で原始ニューロンを学習する問題について検討した。
我々のフレームワークは、任意のラベルの破損やグループ固有の分布シフトに直面して、堅牢な学習保証を提供する。
論文 参考訳(メタデータ) (2026-01-26T04:00:53Z) - Scale-Invariant Regret Matching and Online Learning with Optimal Convergence: Bridging Theory and Practice in Zero-Sum Games [60.871651115241406]
ゼロサムゲームにおける理論と実践の間、何十年にもわたってかなりのシャズムが一階法によって浸食されてきた。
我々は、IREG-PRM$+$と呼ぶPRM$+$の新しいスケール不変かつパラメータフリーな変種を提案する。
ベンチマークゲームでは, PRM$+$と同等でありながら, 最適収束保証を$T-1/2$, $T-1$とする。
論文 参考訳(メタデータ) (2025-10-06T00:33:20Z) - Hyper-Heuristics Can Profit From Global Variation Operators [12.774575491521926]
モーブアクセプタンス・ハイパーヒューリスティック(MAHH)は,マルチモーダルCLIFFベンチマークの局所的最適化を極めて効率よく残していることを示す。
また、MAHHの局所的な1ビット突然変異演算子を、EAで一般的に使用されるグローバルビットワイズ演算子に置き換えると、JUMP関数上の$min1, O(fraceln(n)m)m, O(nm)$のランタイムが得られることを示す。
論文 参考訳(メタデータ) (2024-07-19T12:10:05Z) - Statistical Learning under Heterogeneous Distribution Shift [71.8393170225794]
ground-truth predictor is additive $mathbbE[mathbfz mid mathbfx,mathbfy] = f_star(mathbfx) +g_star(mathbfy)$.
論文 参考訳(メタデータ) (2023-02-27T16:34:21Z) - Fine-Grained Gap-Dependent Bounds for Tabular MDPs via Adaptive
Multi-Step Bootstrap [84.66885506098724]
本稿では,アダプティブ・マルチステップ・ブートストラップ (AMB) を用いた表層有限水平マルコフ決定過程 (MDP) のモデルフリーアルゴリズムを提案する。
AMBは,部分最適ギャップの逆の和でのみスケールする,ギャップ依存的後悔境界を達成できることを示す。
また、AMB は $frac|Z_mul|Delta_min$ regret という追加の $frac|Z_mul|Delta_min$ を被っていることも示しています。
論文 参考訳(メタデータ) (2021-02-09T07:46:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。