論文の概要: Skill-based Agentic Evaluation for Real-time Data Science Tasks
- arxiv url: http://arxiv.org/abs/2609.16487v1
- Date: Tue, 15 Sep 2026 01:20:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.289474
- Title: Skill-based Agentic Evaluation for Real-time Data Science Tasks
- Title(参考訳): リアルタイムデータサイエンスタスクのためのスキルベースエージェント評価
- Abstract要約: 本研究では,実地真実とフォーマットに依存しないファクトイドスコアリングを用いて,データサイエンスエージェントを継続的に更新した実地データ上で評価するためのフレームワークを提案する。
我々の中心的なコントリビューションであるground-truth-as-codeは、期待される各回答を実行可能な参照関数としてエンコードし、評価時にライブデータから直接回答を計算します。
我々はこれを、エージェントの応答と計算された基底の真理の両方を原子的クレームに分解し、それらの上で精度、リコール、精度をスコアするファクトイドレベルの形式に依存しない判断と組み合わせる。
- 参考スコア(独自算出の注目度): 5.185375990538448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a framework for evaluating data-science agents on live, continuously updated data using executable ground truth and format-agnostic factoid scoring. Consider this example query: "what were last week's audience sizes"---the reference answer changes as the underlying data changes, so static references become outdated and standard LLM-as-a-judge pipelines cannot verify responses against a fixed ground truth. Our central contribution, ground-truth-as-code, encodes each expected answer as an executable reference function that recomputes the answer directly from live data at evaluation time, ensuring the reference remains consistent with the system it describes. We combine this with a factoid-level, format-agnostic judge that decomposes both the agent's response and the computed ground truth into atomic claims and scores precision, recall, and accuracy over them, irrespective of the response format (prose, list, table, HTML, etc.). The approach is applicable to agents whose expected outputs can be expressed as executable data computations. We validate the framework through a human--LLM agreement study on an internally developed machine learning skill deployed in production, using a synthetic database constructed to reproduce production schemas and entity relationships. Relative to a natural-language ground-truth baseline, our method achieves a 29% improvement in the Matthews Correlation Coefficient (MCC)---a class-balanced measure of agreement between expert annotators and LLM-as-a-judge predictions---and a 16% reduction in token consumption per test case, while a self-directed baseline lacking explicit ground truth is anti-correlated with human judgment. Agents that perform multi-source data integration and computation over non-stationary data are routinely deployed in industry; we propose ground-truth-as-code as a practical methodology for their evaluation.
- Abstract(参考訳): 本研究では,実地真実とフォーマットに依存しないファクトイドスコアリングを用いて,データサイエンスエージェントを継続的に更新した実地データ上で評価するためのフレームワークを提案する。
この例を考えてみましょう – "先週のオーディエンスのサイズは何か" – 基本データの変更に伴って参照回答が変更されるため、静的参照は時代遅れになり、標準のLCM-as-a-judgeパイプラインは、固定された基底真理に対する応答を検証できません。
我々の中心的なコントリビューションであるground-truth-as-codeは、期待される各回答を実行可能な参照関数としてエンコードし、評価時にライブデータから直接回答を計算し、参照が記述したシステムと一致し続けることを保証します。
エージェントの応答と計算された基底の真理の両方をアトミックなクレームに分解し、応答フォーマット(プロス、リスト、テーブル、HTMLなど)に関係なく、それらに対して精度、リコール、精度をスコアするファクトイドレベルの形式に依存しない判断と組み合わせる。
このアプローチは、期待される出力を実行可能なデータ計算として表現できるエージェントに適用できる。
本研究では,生産スキーマとエンティティ関係を再現するために構築された合成データベースを用いて,本番環境に展開する内部開発機械学習スキルに関する人間-LLM合意研究を通じて,本フレームワークの有効性を検証する。
提案手法は,提案手法を用いて,専門家アノテータとLLM-as-a-judge予測との一致のクラスバランス尺度であるマシューズ相関係数(MCC)の29%の改善を実現し,テストケースあたりのトークン消費量を16%削減した。
非定常データ上でのマルチソースデータ統合と計算を行うエージェントは,産業において日常的にデプロイされる。
関連論文リスト
- Can Generalist Agents Automate Data Curation? [58.652262227632406]
トレーニングデータのキュレーションは、現代のAI開発において、もっとも重要だが労働集約的な部分のひとつだ。
一般のコーディングエージェントがこのデータキュレーションループを自動化できるかどうかを問う。
モデル、トレーニングレシピ、評価スイートを修正するエージェント中心のベンチマークである*Curation-Bench*を紹介します。
論文 参考訳(メタデータ) (2026-06-02T22:26:53Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Runtime Execution Traces Guided Automated Program Repair with Multi-Agent Debate [8.424102114588559]
自動プログラム修復(APR)は複雑なロジックエラーとサイレント障害に悩まされる。
現在のLLMベースのAPRメソッドは主に静的であり、ソースコードと基本的なテスト出力に依存している。
我々は、パッチ検証のための共有制約としてランタイム事実を活用するマルチエージェントフレームワークであるTraceRepairを提案する。
論文 参考訳(メタデータ) (2026-04-03T02:23:25Z) - From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants [0.0]
顧客向け産業向けの信頼できる会話AIアシスタントの構築は、ノイズの多い会話データ、断片化された知識、正確なヒューマンハンドオフの必要性により、依然として困難である。
本稿では,履歴書から直接対話型AIアシスタントを構築し,評価するためのエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-26T07:44:47Z) - Long-Form Information Alignment Evaluation Beyond Atomic Facts [60.25969380388974]
明示的な幻覚を導入することなく、真理のステートメントを"モンテージ"することで、偽りの物語を構築するベンチマークであるMontageLieを紹介します。
本稿では,事実の正確性とイベント順序の整合性を共同で検証する新しいフレームワークであるDoveScoreを提案する。
論文 参考訳(メタデータ) (2025-05-21T17:46:38Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - Posthoc Verification and the Fallibility of the Ground Truth [10.427125361534966]
我々は,エンティティリンク(EL)タスクにおいて,系統的なポストホック検証実験を行う。
プレアノテーション評価と比較して,最先端ELモデルはポストホック評価法により極めて良好に動作した。
驚くべきことに、ELモデルからの予測は、基礎的な真実よりも類似または高い検証率を持っていた。
論文 参考訳(メタデータ) (2021-06-02T17:57:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。