論文の概要: CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging
- arxiv url: http://arxiv.org/abs/2605.19665v1
- Date: Tue, 19 May 2026 10:59:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.288947
- Title: CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging
- Title(参考訳): CriterAlign: コード優先判断のための基準中心のRationaleアライメント
- Authors: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka,
- Abstract要約: 本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
- 参考スコア(独自算出の注目度): 95.02210956333374
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pairwise human preference prediction is central to evaluating code-generation systems, where quality often depends on task-specific trade-offs beyond functional correctness. While rubric-based LLM judges improve interpretability by decomposing evaluation into explicit criteria, most existing pipelines remain pointwise: they score each response independently and derive preferences by comparing aggregated scores. We show that this design is poorly matched to pairwise code preference prediction and can underperform a strong monolithic judge. We propose CriterAlign, a criterion-centric framework that adapts rubric-based judging to pairwise preference evaluation through direct criterion-level pairwise judgments, tie-driven criterion refinement, swap-consistency filtering, and final pairwise synthesis. We further introduce Human-Preference-Aligned Guidance (HPAG), synthesized offline from training examples by extracting recurring rationale gaps between human preferences and monolithic judge predictions, and injected into the criterion generator, criterion judge, and final judge. On BigCodeReward, CriterAlign improves a Qwen2.5-VL-32B monolithic judge from 60.4% to 66.3% accuracy, with ablations confirming the contributions of pairwise criterion design and HPAG.
- Abstract(参考訳): 人間の好みの予測は、品質が機能的正しさを超えたタスク固有のトレードオフに依存するコード生成システム評価の中心である。
ルーブリックに基づくLLMの判断は、評価を明示的な基準に分解することで解釈可能性を改善するが、既存のパイプラインのほとんどはポイントワイズのままであり、各応答を独立にスコアし、集計されたスコアを比較することで好みを導出する。
この設計はペアワイズコードの選好予測とあまり一致せず、強力なモノリシックな判断を過小評価できることを示す。
直接基準レベルのペアワイズ判定、タイ駆動のクレーターリファインメント改善、スワップ・一貫性のフィルタリング、最終的なペアワイズ合成により、ルブリックに基づく判断をペアワイズ評価に適応するクレーターアラインを提案する。
さらに、人間の嗜好とモノリシックな判断予測の合理性ギャップを抽出し、トレーニング例からオフラインで合成されたHuman-Preference-Aligned Guidance (HPAG)を導入し、クレータージェネレータ、クレータージャッジ、最終審査員に注入する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bのモノリシック・ジャッジを60.4%から66.3%の精度で改善した。
関連論文リスト
- ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks [11.138973570127206]
テキスト分類のための人間によるフィードバックに基づく強化学習フレームワークであるClaHFを提案する。
ClaHFは、追加の人間のアノテーションを必要とせずに、好みのモデリングとRL最適化を分類パイプラインに統合する。
ClaHFは多様な言語モデル間での分類性能と信頼性校正の両方を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-17T14:00:01Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Autorubric: A Unified Framework for Rubric-Based LLM Evaluation [34.429649156970015]
大規模言語モデル(LLM)を評価するための統一フレームワークを提案する。
この論文で提案されているオープンソースのPythonフレームワークであるAutorubricで、それぞれのテクニックが実現されている。
Autorubricは、重み付き二分、順序、および名目基準をサポートしており、多数派、重み付き、一対一、無投票のアグリゲーションによるシングルジャッジとマルチジャッジのアンサンブルの評価である。
論文 参考訳(メタデータ) (2026-02-13T02:26:30Z) - Distribution-Calibrated Inference time compute for Thinking LLM-as-a-Judge [5.855996386998925]
大きな言語モデル(LLM)をペアの選好の判断に使用すると、単一サンプルレベルではノイズが残る。
本研究では,各項目ごとにn個の独立した思考型サンプルを生成する評価器の推論時間計算(ITC)について検討する。
論文 参考訳(メタデータ) (2025-12-02T18:46:47Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - A Consequentialist Critique of Binary Classification Evaluation Practices [4.603739046972463]
ICML、FAccT、CHILといった主要なカンファレンスでは、トップKメトリクスや一定のしきい値が好まれています。
我々は、この決定論的フレームワークを使用して、評価指標を最適なユースケースにマッピングし、Pythonパッケージであるbriertoolsとともに、より広範なBrierスコアの採用を促進する。
論文 参考訳(メタデータ) (2025-04-06T15:58:01Z) - A Backdoor-based Explainable AI Benchmark for High Fidelity Evaluation of Attributions [60.06461883533697]
まず、属性手法の信頼性ベンチマークが満たすであろう信頼度基準のセットを同定する。
次に、望ましい忠実度基準に準拠したBackdoorベースのeXplainable AIベンチマーク(BackX)を紹介します。
我々の分析はまた、属性を利用して神経トロイの木馬を守るための洞察を提供する。
論文 参考訳(メタデータ) (2024-05-02T13:48:37Z) - HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical
Criteria Decomposition [92.17397504834825]
HD-Evalは、大規模な言語モデル評価ツールと人間の好みを反復的に調整するフレームワークである。
HD-Evalは、人間の専門家の評価思想から本質を継承し、LLMに基づく評価器のアライメントを強化する。
3つの評価領域に関する広範囲な実験は、HD-Evalのさらなる整合状態評価器の優位性を実証している。
論文 参考訳(メタデータ) (2024-02-24T08:01:32Z) - FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets [69.91340332545094]
FLASKは、人間に基づく評価とモデルに基づく評価の両方のためのきめ細かい評価プロトコルである。
モデル性能の全体像を得るためには,評価の微粒化が重要であることを実験的に観察する。
論文 参考訳(メタデータ) (2023-07-20T14:56:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。