論文の概要: Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications
- arxiv url: http://arxiv.org/abs/2607.14673v1
- Date: Thu, 16 Jul 2026 07:38:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.02905
- Title: Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications
- Title(参考訳): Project Kaleidoscope: 実世界のAIアプリケーションのためのコンテキスト対応評価
- Abstract要約: 文脈関数評価のための統合ワークフローであるKaleidoscopeを提案する。
これは、ペルソナベースのテスト生成、コンテキスト化されたルーリック、信頼性の高い自動スコアリングのためのヒューマンレビューをリンクする。
組織的ユースケース4件の3週間のパイロットによる早期証拠と,カスタム・ルーブリック・ジャッジ実験について報告する。
- 参考スコア(独自算出の注目度): 9.941992941056993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluations (Evals) are a deployment bottleneck for real-world AI applications: public benchmarks rarely match a team's users, context, or policies, and human review is often tedious to scale. Motivated by our work with AI applications in the public sector, this project addresses recurring evaluation challenges encountered when applications must satisfy local policy and governance requirements. We present Kaleidoscope, an integrated workflow for contextual functional evaluation that links persona-based test generation, contextualized rubrics, and human review for reliability-gated automated scoring. Generated test cases are scored against application-specific rubrics; human annotations provide reviewable labels; and LLM judges automate scoring only when their agreement with those labels meets a configured threshold. Kaleidoscope is therefore a practical, inspectable, iterative workflow for product teams. We report early evidence from a three-week pilot across four organizational use cases and custom-rubric judge experiments on 108 annotated Q\&A pairs spanning four domains and 14 evaluation dimensions. The results highlight useful features for end-to-end reliable, automated scoring.
- Abstract(参考訳): 評価(Evals)は、実世界のAIアプリケーションのデプロイメントボトルネックである。 公開ベンチマークは、チームのユーザやコンテキスト、ポリシとほとんど一致せず、ヒューマンレビューはスケールが難しいことが多い。
パブリックセクターにおけるAIアプリケーションの開発によって動機づけられたこのプロジェクトは、アプリケーションがローカルポリシーとガバナンス要件を満たす必要がある場合に直面する、繰り返し発生する評価課題に対処します。
カレイドスコープ(Kaleidoscope)は、ペルソナベースのテスト生成、コンテキスト化されたルーリック、信頼性の高い自動スコアリングのためのヒューマンレビューをリンクするコンテキスト機能評価のための統合ワークフローである。
生成されたテストケースは、アプリケーション固有のルーリックに対してスコアされ、ヒューマンアノテーションはレビュー可能なラベルを提供する。
したがって、Kaleidoscopeはプロダクトチームにとって実用的で、検査可能な反復的なワークフローです。
4つの組織的ユースケースにまたがる3週間のパイロットと,4つのドメインと14の評価次元にまたがる108の注釈付きQ\&Aペアに関するカスタムルーブリックな審査実験の早期証拠を報告する。
結果は、エンドツーエンドの信頼性と自動スコアリングに有用な機能を強調している。
関連論文リスト
- DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - Interactive Evaluation Requires a Design Science [90.62695599188204]
大規模言語モデル(LLM)は、ツールや環境、ユーザ、その他のエージェントを通じて、時間とともに機能するシステムとして、ますます多くデプロイされている。
フィールドはインタラクティブなベンチマークを構築し始めたが、その結果のランドスケープは断片化されている。
本論では,対話的評価は原則的評価パラダイムとして扱うべきであると論じる。
論文 参考訳(メタデータ) (2026-05-18T04:03:18Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs [48.36707944399574]
バイブテストが実際にどのように機能するかを研究し、その後、体系的な分析を支援するために形式化する。
コーディングベンチマークの実験では、パーソナライズされたプロンプトとユーザ認識評価を組み合わせることで、どのモデルが好まれるかを変更できることがわかった。
論文 参考訳(メタデータ) (2026-04-15T17:57:08Z) - One-Eval: An Agentic System for Automated and Traceable LLM Evaluation [10.701916838477187]
One-Evalは、自然言語要求を実行可能な評価に変換するエージェント評価システムである。
One-Evalは、産業環境でより効率的で再現可能な評価をサポートする。
論文 参考訳(メタデータ) (2026-03-10T15:45:51Z) - Evaluating AI Grading on Real-World Handwritten College Mathematics: A Large-Scale Study Toward a Benchmark [9.922581736690159]
カリフォルニア大学アーバイン校(UC Irvine)の実際の手書き電卓におけるAIのグルーピングに関する大規模な実証的研究について述べる。
OCR条件付き大規模言語モデルを用いて, 何千もの応答型クイズ入力に対して, スコアと形式的フィードバックを生成する。
本研究は,1つの基礎的ラベルを持たない環境下で,公的な指導助成学級,学生調査,独立人レビューに対する評価を行った。
論文 参考訳(メタデータ) (2026-03-01T03:32:51Z) - Principled Design of Interpretable Automated Scoring for Large-Scale Educational Assessments [2.2219355720968967]
AnalyticScoreは、応答の明確な識別可能な要素を抽出し、各応答を人間の解釈可能な値に分解する。
AnalyticScoreは、ASAP-SASデータセットから平均10項目にわたって、解釈不能なSOTAの0.06 QWK以内である。
論文 参考訳(メタデータ) (2025-11-21T09:19:05Z) - What Users Value and Critique: Large-Scale Analysis of User Feedback on AI-Powered Mobile Apps [2.352412885878654]
本稿では,AIを活用したモバイルアプリにおけるユーザフィードバックに関する総合的かつ大規模な研究について紹介する。
私たちは、14カテゴリにわたる292のAI駆動アプリのキュレートされたデータセットを活用し、Google Playから894KのAI固有のレビューを取得しています。
私たちのパイプラインは、ひとつの機能による満足度と、同じレビュー内で別の機能に対するフラストレーションの両方を表面化しています。
論文 参考訳(メタデータ) (2025-06-12T14:56:52Z) - OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain [62.89809156574998]
金融分野において全方向自動RAGベンチマークであるOmniEvalを導入する。
我々のベンチマークは多次元評価フレームワークによって特徴づけられる。
実験では、広範囲なテストデータセットを含むOmniEvalの包括性を実証した。
論文 参考訳(メタデータ) (2024-12-17T15:38:42Z) - Keeping Humans in the Loop: Human-Centered Automated Annotation with Generative AI [0.0]
我々は、GPT-4を使用して、パスワードで保護された11のデータセットに27のアノテーションタスクを複製する。
各タスクについて,人間の注釈付き接地木ラベルに対するGPT-4アノテーションと,人為的ラベルに微調整された教師付き分類モデルからのアノテーションを比較した。
本研究は,人間中心のワークフローと注意深い評価基準の重要性を裏付けるものである。
論文 参考訳(メタデータ) (2024-09-14T15:27:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。