論文の概要: CAFE: A Compound-AI Factorial Evaluation Framework
- arxiv url: http://arxiv.org/abs/2607.10380v1
- Date: Sat, 11 Jul 2026 16:17:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.407317
- Title: CAFE: A Compound-AI Factorial Evaluation Framework
- Title(参考訳): CAFE: 複合AI因子評価フレームワーク
- Authors: Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff,
- Abstract要約: 我々は、複合AIシステム(CAIS)の評価に実験の設計をもたらすオープンソースのプラットフォームであるCompound-AI Factorial Evaluation(CEFA)を紹介する。
CEFAはパイプラインの各スワップ可能なコンポーネントを要因として登録し、選択した要因に対する要因設計を構築する。
これは、コンポーネントと混合効果モデルとの相互作用に応答品質のばらつきがあり、効果のサイズ、重要度、最高の構成、コストとレイテンシのトレードオフ、判断と人間の信頼性を報告します。
- 参考スコア(独自算出の注目度): 40.35767028179069
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce CAFE (Compound-AI Factorial Evaluation), an open-source platform that brings design of experiments to the evaluation of compound AI systems (CAIS). Such systems expose many interchangeable choices - e.g. which retriever, model, or prompt - and practitioners rarely know which of them most affects answer quality. With CAFE, a practitioner registers each swappable component of a pipeline as a factor to build a factorial design over the chosen factors, run the resulting configurations, and score the answers on a shared rubric using a configurable LLM judge together with human raters. From these ratings it attributes answer-quality variance to the components and their interactions with mixed-effects models and reports effect sizes, significance, the best configuration, cost and latency trade-offs, and judge-human reliability. Whereas existing tools mostly either search for a good configuration or score outputs in isolation, CAFE also explains which component drives quality and whether an observed difference is significant. We validate CAFE on a retrieval-augmented question-answering (QA) pipeline over the HotpotQA benchmark dataset, where it recovers planted factor effects and stays calibrated under a permutation null. CAFE is released as a Python package and as a Web application.
- Abstract(参考訳): 我々は、複合AIシステム(CAIS)の評価に実験の設計をもたらすオープンソースプラットフォームであるCAFE(Compound-AI Factorial Evaluation)を紹介する。
このようなシステムは、レトリバー、モデル、プロンプトなど、多くの交換可能な選択肢を公開しています。
CAFEでは、実践者がパイプラインの各スワップ可能なコンポーネントを、選択された要因に対する因子的設計を構築する要因として登録し、その結果のコンフィギュレーションを実行し、設定可能なLCM判断と人間のレーダを使用して、共有ルーリック上で回答をスコアする。
これらの評価から、コンポーネントに対する応答品質のばらつきと、混合効果モデルとの相互作用、効果のサイズ、重要度、最高の構成、コストとレイテンシのトレードオフ、判断と人間の信頼性を特徴付ける。
既存のツールは、よい設定を検索するか、独立したアウトプットをスコアすることが多いが、CAFEはまた、どのコンポーネントが品質を駆動し、観察された違いが重要であるかを説明している。
我々は、HotpotQAベンチマークデータセット上での検索拡張質問応答(QA)パイプライン上でCAFEを検証する。
CAFEはPythonパッケージとして、またWebアプリケーションとしてリリースされている。
関連論文リスト
- PCoKG: Personality-aware Commonsense Reasoning with Debate [32.49722822521962]
Personality-Aware Commonsense Knowledge Graph (PCoKG)は、521,316個の4倍数からなる構造化データセットである。
知識グラフ構築には,大規模言語モデルのロールプレイング機能を活用する。
我々はPCoKGをペルソナに基づく対話生成に適用し、生成した応答と参照出力との整合性の改善を示す。
論文 参考訳(メタデータ) (2026-01-09T15:05:01Z) - Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation [57.380464382910375]
評価のためのフィードバックプロトコルの選択は,評価信頼性に大きく影響し,系統的なバイアスを生じさせることを示す。
ジェネレータモデルは、気を散らす機能を埋め込むことで好みをひっくり返すことができる。
我々は,データセットの特徴と評価目標に基づくフィードバックプロトコルの選択を推奨する。
論文 参考訳(メタデータ) (2025-04-20T19:05:59Z) - Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning [88.55095746156428]
Retrieval-augmented Generation (RAG) は、外部知識を大規模言語モデルに組み込むために広く利用されている。
標準的なRAGパイプラインは、クエリ書き換え、文書検索、文書フィルタリング、回答生成など、いくつかのコンポーネントで構成されている。
本稿では,複数コンポーネントからなる複雑なRAGパイプラインを多エージェント協調作業として扱うことを提案する。
論文 参考訳(メタデータ) (2025-01-25T14:24:50Z) - Compositional Models for Estimating Causal Effects [0.9208007322096533]
構造系における個人レベルのポテンシャルと因果効果を推定するための構成的アプローチについて検討する。
構成的アプローチは、単位レベルの因果クエリをよりきめ細かいクエリに分解する。
観測データから因果効果を推定することの利点が示された。
論文 参考訳(メタデータ) (2024-06-25T16:56:17Z) - Improving Text Matching in E-Commerce Search with A Rationalizable,
Intervenable and Fast Entity-Based Relevance Model [78.80174696043021]
エンティティベース関連モデル(EBRM)と呼ばれる新しいモデルを提案する。
この分解により、高精度にクロスエンコーダQE関連モジュールを使用できる。
また、ユーザログから自動生成されたQEデータによるQEモジュールの事前トレーニングにより、全体的なパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-07-01T15:44:53Z) - Fairness and underspecification in acoustic scene classification: The
case for disaggregated evaluations [6.186191586944725]
機械学習(ML)アプリケーションにおける不明瞭さと公平さは、最近、MLコミュニティで2つの顕著な問題となっている。
本研究では,アコースティックシーン分類(ASC)モデルに対して,非凝集評価によるより包括的な評価プロセスの必要性を論じる。
本研究では,2つの広く使用されているASCデータセットを用いたトレーニングにおいて,不特定性や公平性の問題を明らかにする上で,提案手法の有効性を実証する。
論文 参考訳(メタデータ) (2021-10-04T15:23:01Z) - Contextualized Embeddings based Convolutional Neural Networks for
Duplicate Question Identification [0.25782420501870296]
質問パラフレーズ識別(QPI)は,大規模質問回答フォーラムにとって重要な課題である。
本稿では,QPIタスクのための双方向変換器と畳み込みニューラルネットワークを組み合わせた新しいアーキテクチャを提案する。
実験結果から,Quora Question Pairsデータセットの最先端性能が得られた。
論文 参考訳(メタデータ) (2021-09-03T14:30:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。