論文の概要: ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation
- arxiv url: http://arxiv.org/abs/2608.22559v2
- Date: Thu, 27 Aug 2026 06:21:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.640559
- Title: ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation
- Title(参考訳): ExecRubrics: 有効かつ効率的な長期評価のための実行可能なツール強化ルーブ
- Abstract要約: 本稿では,ルーブリックをコンパクトな実行可能プログラムとして表現するフレームワークであるExecRubricsを提案する。
ExecRubricsは評価ロジックを検証可能なPythonスコアリング関数としてエンコードする。
ExecRubricsは、好ましくない応答よりも格付けが望ましい、高価なブラックボックスの審査員に取って代わることができることを示す。
- 参考スコア(独自算出の注目度): 11.624122488044542
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rubrics aim to make language-model evaluation transparent by decomposing response quality into interpretable criteria. However, natural-language rubrics are often ambiguous, require black-box LLM judges, and typically assume criteria aggregate independently through linear weighted sums, limiting their ability to capture dependencies, alternatives, penalties, and override conditions. We propose ExecRubrics, a framework for representing rubrics as compact executable programs. ExecRubrics encodes evaluation logic as verifiable Python scoring functions, giving natural-language rubric intent an operational semantics: a fixed decision procedure that can be inspected, executed, and edited. On three long-form response benchmarks-HealthBench, HelpSteer, and ArgQuality-we show that ExecRubrics can substitute for expensive black-box judges in ranking preferred over dispreferred responses, matching or improving NL rubric baselines with best preference accuracies of 52.9%, 75.3%, and 91.5%, respectively, while reducing evaluation latency by a large margin. We show that incorporating external logic and resources from text processing libraries such as NLTK and spaCy can further improve preference accuracy. Our results suggest a novel way of looking at evaluation, by offering a faster, more explainable and less ambiguous alternative to black-box rubric evaluation, particularly in high-stakes domains such as healthcare and banking where precision and auditability are critical.
- Abstract(参考訳): 論理学は,応答品質を解釈可能な基準に分解することで,言語モデルの評価を透過的にすることを目指している。
しかし、自然言語のルーブリックはしばしば曖昧であり、ブラックボックスのLCM審査員が必要であり、通常、基準は線形重み付けの和を通じて独立にまとめられ、依存関係、代替品、罰則、条件を捕捉する能力を制限する。
本稿では,ルーブリックをコンパクトな実行可能プログラムとして表現するフレームワークであるExecRubricsを提案する。
ExecRubricsは、評価ロジックを検証可能なPythonスコアリング関数としてエンコードし、自然言語のルーブリックインテントにオペレーションセマンティクスを与える。
HealthBench、HelpSteer、ArgQuality-weの3つのロングフォーム・レスポンス・ベンチマークでは、ExecRubricsは、好ましくない応答よりも高価なブラックボックス・ジャッジに代えて、52.9%、75.3%、91.5%の好ましくない精度でNLルーリック・ベースラインをマッチングまたは改善できる。
NLTK や SpaCy などのテキスト処理ライブラリから外部ロジックやリソースを組み込むことで、好みの精度をさらに向上できることを示す。
以上の結果から,ブラックボックスのルーブリック評価に代わる,より高速で説明しやすい,曖昧な代替手段を提供することによって,特に精度と監査性が重要となる医療や銀行などの高度な分野において,評価の新たな方法が示唆された。
関連論文リスト
- GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation [11.869490719319577]
CalibratedRubricは、タイプ固有のスコアリング、ベイジアンルーブリック可測性フィルタリング、およびアイテム応答理論(IRT)ベースの銀行アセンブリを組み合わせたタスク適応フレームワークである。
財務、医療、一般、法的なベンチマーク全体にわたって、測定可能性のフィルタリングは、人間と金の合意を改善する。
IRTベースのグリーディセレクションは、ランダムセレクションよりもクロスフィットなランクフィデリティを改善する。
論文 参考訳(メタデータ) (2026-07-31T10:21:56Z) - Is Code Better Than Language for Algorithmic Reasoning [58.86873062890482]
ツール拡張言語モデルでは、中間表現と実行機構の両方を変えるため、自然言語推論とコード実行パイプラインを比較することは困難である。
モデルは、その推論を実行可能なコードとして表現し、言語モデルは、そのコードを文脈でシミュレートして、回答を生成する。
中間介入は自然言語の推論と有意に異なるものではない(+0.15pp)。
論文 参考訳(メタデータ) (2026-06-14T04:17:21Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation [11.21565372620296]
大規模言語モデル(LLM)は、スカラースコアや選好を出力する自動グレーダを使用して、ますます評価され、時には訓練される。
この解釈可能性の欠如は、モデル開発、データセットキュレーション、高レベルのデプロイメントに対する有用性を制限している。
本稿では,関連するクエリから推論時にルーリックからドメイン知識を抽出するシンプルな戦略RAGを紹介する。
論文 参考訳(メタデータ) (2026-03-21T17:10:14Z) - One-Eval: An Agentic System for Automated and Traceable LLM Evaluation [10.701916838477187]
One-Evalは、自然言語要求を実行可能な評価に変換するエージェント評価システムである。
One-Evalは、産業環境でより効率的で再現可能な評価をサポートする。
論文 参考訳(メタデータ) (2026-03-10T15:45:51Z) - CLARC: C/C++ Benchmark for Robust Code Search [2.225731679677886]
現実のGitHubリポジトリから構築されたC/C++ベンチマークであるCLARCを紹介します。
Clarcには、評価用の1,245のクエリコードペアと、トレーニング用の5,472のペアが含まれている。
論文 参考訳(メタデータ) (2026-03-04T18:57:37Z) - Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges [39.6038287387348]
LLMに基づく審査員の行動は自然なルーリックによってガイドされ、ベンチマークで検証される。
我々は、このワークフローにおいて、事前に認識されていない脆弱性を識別し、このワークフローは、Preference Drift (RIPD) という用語で表現する。
我々は、この脆弱性を選好攻撃によって悪用できることを示し、そこでは、ベンチマーク準拠者が、固定された人間またはターゲットドメインの信頼された参照から、ステア判断を編集する。
論文 参考訳(メタデータ) (2026-02-14T03:19:14Z) - Autorubric: A Unified Framework for Rubric-Based LLM Evaluation [34.429649156970015]
大規模言語モデル(LLM)を評価するための統一フレームワークを提案する。
この論文で提案されているオープンソースのPythonフレームワークであるAutorubricで、それぞれのテクニックが実現されている。
Autorubricは、重み付き二分、順序、および名目基準をサポートしており、多数派、重み付き、一対一、無投票のアグリゲーションによるシングルジャッジとマルチジャッジのアンサンブルの評価である。
論文 参考訳(メタデータ) (2026-02-13T02:26:30Z) - SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization [64.95852289011385]
大規模言語モデル(LLM)は拡大を続けており、様々な下流タスクのパフォーマンスは大幅に改善されている。
多数のベンチマークサンプルで推論を行うと、高い計算コストが発生するため、それらの能力を評価するのがますます高価になっている。
SparseEvalは,アンカーウェイトを最適化する勾配降下法を初めて導入し,アンカーセレクションに反復的洗練戦略を採用する手法である。
論文 参考訳(メタデータ) (2026-02-08T11:12:45Z) - RULERS: Locked Rubrics and Evidence-Anchored Scoring for Robust LLM Evaluation [15.787947727055611]
本稿では,自然言語ルーブを実行可能な仕様に変換するコンパイラ・エグゼクタフレームワークであるRULERSを紹介する。
RULERSは、基準をバージョニングされた不変バンドルにコンパイルし、決定論的証拠検証による構造化復号を強制し、軽量なワッサーシュタインベースのポストホックキャリブレーションを適用する。
論文 参考訳(メタデータ) (2026-01-13T15:31:42Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries [85.81295563405433]
本稿では,不特定クエリを取り巻くコンテキストを合成的に構築し,評価中にそれを提供するプロトコルを提案する。
その結果,1) 評価から得られた結論の変更,2) モデルペア間のベンチマークランキングの反転,2) スタイルのような表面レベルの基準に基づいて判断を下すナッジ評価,3) 多様なコンテキスト間でのモデル行動に関する新たな洞察の提供,などが確認できた。
論文 参考訳(メタデータ) (2024-11-11T18:58:38Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models [94.31327813151208]
BiGGen Benchは、77のタスクにわたるLMの9つの異なる能力を徹底的に評価するために設計された、原則化された世代ベンチマークである。
BiGGen Benchの重要な特徴は、インスタンス固有の評価基準の使用であり、人間の評価のニュアンスな識別を忠実に反映している。
論文 参考訳(メタデータ) (2024-06-09T12:30:30Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。