論文の概要: Towards a Reliable and Practical Eval Pipeline
- arxiv url: http://arxiv.org/abs/2609.00805v1
- Date: Tue, 01 Sep 2026 07:02:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.425117
- Title: Towards a Reliable and Practical Eval Pipeline
- Title(参考訳): 信頼性と実用的なEvalパイプラインを目指して
- Authors: Emma Thuong Nguyen, Abhishek Ghose,
- Abstract要約: 本稿では,evalチェックリスト生成と,チェックリスト応答の学習集約を組み合わせたエンドツーエンドのevalパイプラインを提案する。
さらに, 自己整合性, 説明, 予測の不確実性も促進し, その効果を実証的に実証する。
- 参考スコア(独自算出の注目度): 0.21485350418225244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based software systems increasingly require effective "evals" as quality gates in the development lifecycle. However, existing work typically addresses individual aspects of eval reliability rather than the full set of practical requirements. We present an end-to-end eval pipeline that combines eval checklist creation, with learned aggregation for checklist responses, to improve agreement across LLM judges and accuracy against human judgments. The framework additionally pro- vides self-consistency, explanations, and prediction uncertainty, and we empirically demonstrate its effectiveness.
- Abstract(参考訳): LLMベースのソフトウェアシステムは、開発ライフサイクルにおける品質ゲートとして、より効果的な"価値"を必要としている。
しかしながら、既存の作業は通常、実践的な要求の完全なセットではなく、evalの信頼性の個々の側面に対処する。
本稿では,evalチェックリスト生成とチェックリスト応答の学習集約を組み合わせたエンドツーエンドのevalパイプラインを提案する。
さらに, 自己整合性, 説明, 予測の不確実性も促進し, その効果を実証的に実証する。
関連論文リスト
- Position: It's Time to Optimize LLMs for Self-Consistency [50.68587056599734]
多くの重要な障害は、事前および後トレーニングパイプラインの言語モデルに持続する。
これらの失敗は、パイプラインのすべての側面に浸透するモデリングの前提から生じます。
これらの失敗を理解するためのフレームワークとして,自己整合性を提案する。
論文 参考訳(メタデータ) (2026-07-31T19:16:53Z) - Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions [1.9774267722954466]
大規模言語モデル(LLM)は、ソフトウェア工学(SE)ツールにますます組み込まれています。
信頼性評価がLCMツールの信頼性,採用,有意義な評価に欠かせない理由を論じる。
論文 参考訳(メタデータ) (2026-04-27T15:51:22Z) - Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems [94.9141394384021]
マルチエージェントシステムの個々のエージェントは、しばしば堅牢性を欠き、誤解を招く仲間に盲目的に適合する傾向にある。
この弱点は, 相互信頼度を評価する能力の欠如に起因していると考えられる。
まず,歴史認識参照の学習問題を定式化し,ピア間の歴史的相互作用を付加的な入力として導入する。
次に,歴史的に構築されたピアプロファイルの予測を行うための推論フレームワークであるEcestemic Context Learning (ECL) を開発した。
論文 参考訳(メタデータ) (2026-01-29T13:59:32Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution [20.607071807794195]
大規模言語モデル(LLM)は自動化された判断として広く使われており、実際的な価値は正確さと信頼性の高いリスク認識の判断の両方に依存する。
既存のアプローチは主に正確さに焦点を合わせ、よく校正された信頼の必要性を見越す。
我々は、精度中心の評価から信頼性駆動型、リスク対応型LCM-as-a-Judgeシステムへの移行を提唱する。
論文 参考訳(メタデータ) (2025-08-08T11:11:22Z) - Integrating Expert Knowledge into Logical Programs via LLMs [3.637365301757111]
ExKLoPは、大規模言語モデルが専門家の知識を論理的推論システムに統合する方法を評価するために設計されたフレームワークである。
この能力は特にエンジニアリングにおいて有用であり、製造業者が推奨する運用範囲などの専門家の知識を、自動化された監視システムに直接組み込むことができる。
論文 参考訳(メタデータ) (2025-02-17T19:18:23Z) - How Reliable are LLMs as Knowledge Bases? Re-thinking Facutality and Consistency [60.25969380388974]
大規模言語モデル (LLM) は知識ベース (KB) として研究されている。
現在の評価手法は、信頼性の高い性能の他の決定的な基準を見越して、知識の保持に過度に焦点を絞っている。
我々は,事実と一貫性を定量化するための新しい基準と指標を提案し,最終的な信頼性スコアを導いた。
論文 参考訳(メタデータ) (2024-07-18T15:20:18Z) - TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness [58.721012475577716]
大規模言語モデル(LLM)は、様々な領域にまたがる印象的な能力を示しており、その実践的応用が急増している。
本稿では,行動整合性の概念に基づくフレームワークであるTrustScoreを紹介する。
論文 参考訳(メタデータ) (2024-02-19T21:12:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。