論文の概要: Does task decomposition improve automatic NLG evaluation?
- arxiv url: http://arxiv.org/abs/2609.01139v1
- Date: Tue, 01 Sep 2026 12:15:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.619768
- Title: Does task decomposition improve automatic NLG evaluation?
- Title(参考訳): タスク分解はNLGの自動評価を改善するか?
- Authors: Sebastian Steindl, Nikos Voskarides, Alberto Gasparin, Diego Marcheggiani,
- Abstract要約: LLM-as-a-judge(LLMaJ)フレームワークは、安価で再現可能な、参照不要な自然言語生成(NLG)評価のための有望なソリューションとして登場した。
LLMaJ法と複数のNLGデータセットの分解の有無を系統的に比較した。
タスク分解を伴うLLMaJが、分解を使用しない公平なベースラインよりもパフォーマンスの向上につながるという証拠は見つからない。
- 参考スコア(独自算出の注目度): 3.0607199893136006
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The LLM-as-a-judge (LLMaJ) framework has emerged as a promising solution for cheap, reproducible, reference-free Natural Language Generation (NLG) evaluation. Prior work seeks to improve LLMaJ by decomposing evaluation tasks into simpler sub-tasks. In this work, we systematically compare LLMaJ methods with and without decomposition on multiple NLG datasets. We find no evidence that LLMaJ with task decomposition leads to performance gains over a fair baseline that does not use decomposition. Instead, we find that previously reported performance gains in decomposition-based LLMaJ stem from using human labels as training data, and not task decomposition itself. Also, we find that, when human labels are available, LLMaJ without using task decomposition can perform comparably to human annotators.
- Abstract(参考訳): LLM-as-a-judge(LLMaJ)フレームワークは、安価で再現可能な、参照不要な自然言語生成(NLG)評価のための有望なソリューションとして登場した。
以前の作業では,評価タスクをシンプルなサブタスクに分解することで,LLMaJの改善を目指している。
本研究では,LLMaJ法と複数のNLGデータセットの分解の有無を系統的に比較する。
タスク分解を伴うLLMaJが、分解を使用しない公平なベースラインよりもパフォーマンスの向上につながるという証拠は見つからない。
その代わりに、以前に報告された分解に基づくLLMaJのパフォーマンス向上は、人間のラベルをトレーニングデータとして使用することによるものであり、タスクの分解そのものではない。
また、人間のラベルが利用可能であれば、タスク分解を使わずにLLMaJが人間のアノテータと互換性を持って動作できることが判明した。
関連論文リスト
- Improving Automatic Evaluation of Large Language Models (LLMs) in Biomedical Relation Extraction via LLMs-as-the-Judge [7.064104563689608]
大規模言語モデル (LLM) は, 生物医学的関係抽出において顕著な性能を示した。
本稿では, LLMs-as-the-Judgeをバイオメディカルな関係抽出のための代替評価法として利用することを検討した。
論文 参考訳(メタデータ) (2025-06-01T02:01:52Z) - Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering [18.766132076075365]
大規模言語モデル(LLM)は、コード生成のような様々なソフトウェアエンジニアリング(SE)タスクに取り組むためにデプロイされている。
Pass@kメトリックは、広範囲なユニットテストと設定された環境を必要とし、LLM生成したテキストの評価には適していない。
BLEUのような従来のメトリクスは、意味的類似性ではなく語彙のみを測定するが、精査されている。
論文 参考訳(メタデータ) (2025-02-10T06:49:29Z) - Addressing Data Leakage in HumanEval Using Combinatorial Test Design [1.9336815376402723]
HumanEvalベンチマークは164の手作りタスクで構成されている。
HumanEvalのようなベンチマークを用いたLCMの公正な評価に対する大きな障壁は、データ汚染である。
本稿では,新しい具体的なタスクにインスタンス化可能なテンプレートタスクからなるベンチマーク構築手法を提案する。
論文 参考訳(メタデータ) (2024-12-02T14:18:32Z) - LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints [86.59857711385833]
実世界のマルチ制約命令に従うLLMの能力を評価するために設計された最初のベンチマークであるRealInstructを紹介する。
オープンソースモデルとプロプライエタリモデルのパフォーマンスギャップを解決するため,Decompose, Critique and Refine(DeCRIM)自己補正パイプラインを提案する。
この結果から,DeCRIMはフィードバックが弱い場合でも,RealInstructでは7.3%,IFEvalでは8.0%,Mistralでは7.3%向上した。
論文 参考訳(メタデータ) (2024-10-09T01:25:10Z) - AIME: AI System Optimization via Multiple LLM Evaluators [79.03422337674664]
AIME は複数の LLM を利用した評価プロトコルであり、それぞれが独立した基準で評価を生成し、結合を通してそれらを結合する。
コード生成タスクにおける AIME のベースラインメソッドのパフォーマンスは,LeetCodeHard と HumanEval データセットの単一 LLM 評価プロトコルよりも最大 62% 高いエラー検出率,最大 16% 高い成功率で向上している。
論文 参考訳(メタデータ) (2024-10-04T04:03:24Z) - See, Say, and Segment: Teaching LMMs to Overcome False Premises [67.36381001664635]
この課題を解決するために,LMMのカスケードと共同学習手法を提案する。
得られたモデルでは、画像中に物体が存在するかどうかを検知し、その物体が存在しないかをユーザに「例」し、最終的に、対象物のマスクを出力することで「分類」を行う。
論文 参考訳(メタデータ) (2023-12-13T18:58:04Z) - G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment [64.01972723692587]
本稿では,大規模言語モデルにチェーン・オブ・シント(CoT)を組み込んだフレームワークであるG-Evalと,NLG出力の品質評価のためのフォームフィリングパラダイムを提案する。
GPT-4 をバックボーンモデルとした G-Eval は,要約タスクにおいて,0.514 と人間とのスピアマン相関を達成し,従来手法の差を大きく上回ることを示す。
論文 参考訳(メタデータ) (2023-03-29T12:46:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。