論文の概要: CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes
- arxiv url: http://arxiv.org/abs/2606.31435v1
- Date: Tue, 30 Jun 2026 10:08:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.172053
- Title: CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes
- Title(参考訳): CDR-Bench: 組成・順序感応性データリファインメントの忠実な実行の評価
- Abstract要約: CDR-Benchは、4つの現実世界のデータリファインメントドメインにまたがる3,462の高品質なタスクを特徴とする包括的なベンチマークである。
我々のベンチマークでは、原子性、秩序に依存しない、秩序に敏感な設定でモデルを評価する。
10以上の最先端のLLMの実験では、一貫した障害パターンが明らかになっている。
- 参考スコア(独自算出の注目度): 52.734097662607375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data refinement involves executing multi-step recipes over evolving text states, where both composition and execution order of processing operators determine the outcome. While existing benchmarks either isolate text editing or entangle it with code and tool execution, it remains unclear whether LLMs can directly and faithfully execute these compositional, order-sensitive data refinement recipes. To fill this gap, we introduce CDR-Bench, a comprehensive benchmark featuring 3,462 high-quality tasks spanning four real-world data refinement domains and 29 distinct operators. Our benchmark evaluates models across atomic, order-agnostic, and order-sensitive settings, leveraging deterministic reference outputs to enable exact evaluation. Experiments on 10+ state-of-the-art LLMs reveal consistent failure patterns: performance degrades sharply in compositional settings, and order-sensitive recipe success collapses. These findings underline that current LLMs lack the procedural faithfulness required for reliable compositional data refinement.
- Abstract(参考訳): データリファインメントは、処理オペレータの合成順序と実行順序の両方が結果を決定する、進化するテキスト状態上で多段階のレシピを実行することを含む。
既存のベンチマークでは、テキスト編集を分離するか、コードとツールの実行を混同しているが、LLMが直接的かつ忠実にこれらの構成的、順序に敏感なデータリファインメントのレシピを実行できるかどうかは不明だ。
CDR-Benchは4つの実世界のデータリファインメントドメインと29の異なる演算子にまたがる3,462の高品質なタスクを特徴とする包括的なベンチマークである。
本ベンチマークでは, 原子, 秩序に依存しない, 秩序に敏感な設定のモデルを評価し, 決定論的基準出力を活用し, 正確な評価を可能にする。
10以上の最先端のLCMの実験では、一貫した障害パターンが明らかにされている。
これらの結果から,現在のLCMは,信頼性の高い合成データ精錬に必要な手続き的忠実さを欠いていることが示唆された。
関連論文リスト
- Task-Adaptive Embedding Refinement via Test-time LLM Guidance [3.6468227618496627]
組込みモデルのユーザビリティをゼロショット検索と分類タスクに拡張するためのLLM誘導クエリ改善パラダイムの有効性について検討する。
提案手法では, ユーザクエリの埋め込み表現を, 少数の文書に対して生成LLMからのフィードバックを用いて洗練する。
我々は,最先端のテキスト埋め込みモデルを用いて,多様な検索と分類のベンチマークを行う。
論文 参考訳(メタデータ) (2026-05-12T17:58:27Z) - ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows [17.525508735432147]
ProfiliTableは動的プロファイリングを中心とした自律型マルチエージェントフレームワークである。
インタラクティブな探索、知識強化された合成、フィードバック駆動の洗練を通じて、統合された実行コンテキストを構築し、反復的に洗練する。
論文 参考訳(メタデータ) (2026-05-12T16:42:38Z) - POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference [10.01438318022033]
実世界のソフトウェアからメソッドレベルの後条件生成を評価するベンチマークであるPOSTCONDBENCHを紹介する。
自動評価を可能にするため、POSTCONDBENCHは実行可能な実行環境を提供し、欠陥識別を通じて完全性を運用する。
以上の結果から,リポジトリレベルの依存関係とメソッドの複雑性が,このギャップを悪化させることを示す。
論文 参考訳(メタデータ) (2026-05-05T04:29:38Z) - RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis [78.32151470154422]
テスト担当者が自律的に設計し、典型的な合成操作を実行できるようにするためのエージェントフレームワークであるRAVELを紹介する。
C3EBenchは、プロの人間の文章から1,258個のサンプルを抽出したベンチマークである。
SOTA LLMを演算子としてRAVELを増強することにより、そのようなエージェントテキスト合成はLLMの推論能力に支配されていることがわかった。
論文 参考訳(メタデータ) (2026-02-28T14:47:34Z) - Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review [37.98161722413899]
プルリクエスト(PR)レビューは、ソフトウェア品質を保証する上で不可欠だが、ノイズの多い監視、限られたコンテキスト理解、不適切な評価指標のため、依然として難しい。
提案するPRレビュー用統合フレームワークであるSphinxは,(1)擬似修飾コードとマージコードを比較することによって,文脈に富んだ,意味論的根拠のあるレビューコメントを生成する構造化データ生成パイプライン,(2)実行可能な検証ポイントの構造化カバレッジに基づいてレビュー品質を評価するチェックリストに基づく評価ベンチマーク,(3)ルールベースで解釈可能な報酬を用いて,モデル動作を現実と整合させる新しいトレーニングパラダイムであるCRPOである。
論文 参考訳(メタデータ) (2026-01-06T18:49:56Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing [10.712756715779822]
大規模言語モデル(LLM)は、データ処理において有望であることを示している。
これらのフレームワークは、ユーザが指定した操作を実行する際のコスト削減に重点を置いている。
これは複雑なタスクやデータに問題があります。
本稿では,複雑な文書処理パイプラインを最適化するDocETLを提案する。
論文 参考訳(メタデータ) (2024-10-16T03:22:35Z) - Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization [132.25202059478065]
命令制御可能なテキスト要約の大規模言語モデル(LLM)をベンチマークする。
本研究は,LLMにおいて,命令制御可能なテキスト要約が依然として困難な課題であることを示す。
論文 参考訳(メタデータ) (2023-11-15T18:25:26Z) - Reflection-Tuning: Data Recycling Improves LLM Instruction-Tuning [79.32236399694077]
トレーニングセットの低品質データは、通常、チューニングのチューニングに有害である。
我々は「反射チューニング」と呼ばれる新しい手法を提案する。
このアプローチでは、オラクルLSMを使用して、データ内の命令や応答の質を検査し、向上することで、元のトレーニングデータをリサイクルする。
論文 参考訳(メタデータ) (2023-10-18T05:13:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。