論文の概要: Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations
- arxiv url: http://arxiv.org/abs/2605.29786v1
- Date: Thu, 28 May 2026 11:34:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 05:02:24.579755
- Title: Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations
- Title(参考訳): Croissant Tasks: 再現可能な機械学習評価のためのメタデータフォーマット
- Authors: Omar Benjelloun, Leonardo Martins Bianco, Isabelle Guyon, Thanh Gia Hieu Khuong, Jonathan Lebensold, Sebastian Lobentanzer, Luis Oala, Benedictus Kent Rachmat, Ihsan Ullah, Peyman Vahidi, Joaquin Vanschoren,
- Abstract要約: 再現性は科学的手法の基本であるが、マシンラーニングでは依然として重要な課題である。
チェックリストや手動検証のような人間中心の治療法は、集中的な努力を必要とし、スケールに失敗するのに役立つ。
Croissant Tasks: 低レベルの実装の詳細を高レベルの仕様に抽象化する、機械操作可能なメタデータフォーマットを紹介します。
- 参考スコア(独自算出の注目度): 11.805680495035567
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reproducibility is fundamental to the scientific method, yet remains a critical challenge in machine learning. Contributing factors include underspecified execution details and brittle software environments. Human-centric remedies, such as checklists and manual verification, help but require intensive effort and fail to scale. To address this, we introduce Croissant Tasks: a declarative, machine-actionable metadata format that abstracts low-level implementation details into high-level specifications. This format enables conceptual reproducibility: verifying claims via independent, agent-generated implementations rather than brittle source code replication. We contribute: (1) the Croissant Tasks specification, formally decoupling task problem from solution; (2) an automated LLM pipeline that retrofits existing benchmarks into this format; and (3) empirical validation showing autonomous agents can ingest these specifications to generate functional, accurate reproduction pipelines from scratch. We envision this format as a new foundation for automated and conceptual reproducibility in machine learning.
- Abstract(参考訳): 再現性は科学的手法の基本であるが、マシンラーニングでは依然として重要な課題である。
コントリビュートする要因には、不特定な実行の詳細と脆いソフトウェア環境が含まれる。
チェックリストや手動検証のような人間中心の治療法は、集中的な努力を必要とし、スケールに失敗するのに役立つ。
この問題を解決するために、低レベルの実装の詳細を高レベルな仕様に抽象化する宣言的で機械操作可能なメタデータフォーマットであるCroissant Tasksを紹介します。
このフォーマットは概念的再現性を可能にし、ソースコードの複製を不安定にするのではなく、独立したエージェント生成実装によるクレームの検証を可能にする。
1)Croissant Tasks仕様、(2)既存のベンチマークをこのフォーマットに適合させる自動LLMパイプライン、(3)自律エージェントがこれらの仕様を取り込み、機能的で正確な再現パイプラインをスクラッチから生成できることを示す実証検証を行う。
我々は、このフォーマットを機械学習における自動化および概念再現性のための新しい基盤として想定する。
関連論文リスト
- A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences [19.81372090301296]
ReplicatorBenchは、3段階にわたる研究レプリケーションにおけるAIエージェントの評価のためのエンドツーエンドのベンチマークである。
ReplicatorAgentは,Web検索やサンドボックス環境との反復的なインタラクションなど,必要なツールを備えたエージェントフレームワークである。
ReplicatorAgentは、4つの基礎となる大規模言語モデル(LLM)にまたがって評価する。
論文 参考訳(メタデータ) (2026-02-11T20:42:10Z) - Self-Steering Language Models [113.96916935955842]
DisCIPL は "self-steering" 言語モデル (LM) の手法である。
DisCIPLは、Followerモデルの集団によって実行されるタスク固有の推論プログラムを生成する。
我々の研究は、高度に並列化されたモンテカルロ推論戦略の設計空間を開く。
論文 参考訳(メタデータ) (2025-04-09T17:54:22Z) - Learning Task Representations from In-Context Learning [67.66042137487287]
大規模言語モデル(LLM)は、文脈内学習(ICL)において顕著な習熟性を示した。
ICLプロンプトにおけるタスク情報をアテンションヘッドの関数として符号化するための自動定式化を導入する。
提案手法は,テキスト中の実演からタスク固有の情報を抽出し,テキストと回帰タスクの両方で優れる。
論文 参考訳(メタデータ) (2025-02-08T00:16:44Z) - A Scalable and Efficient Iterative Method for Copying Machine Learning
Classifiers [0.802904964931021]
本稿では,機械学習モデルのコピーのトレーニングや維持に必要な計算資源を大幅に削減する,新しいシーケンシャルなアプローチを提案する。
シーケンシャルアプローチの有効性は、合成データセットと実世界のデータセットによる実験を通じて実証され、正確性を維持したり改善したりしながら、時間とリソースの大幅な削減を示す。
論文 参考訳(メタデータ) (2023-02-06T10:07:41Z) - Scanflow: A multi-graph framework for Machine Learning workflow
management, supervision, and debugging [0.0]
本稿では,エンドツーエンドの機械学習ワークフロー管理を支援するコンテナ化指向グラフフレームワークを提案する。
このフレームワークは、コンテナ内でMLを定義してデプロイし、メタデータを追跡し、本番環境での振る舞いを確認し、学習された知識と人為的な知識を使用してモデルを改善する。
論文 参考訳(メタデータ) (2021-11-04T17:01:12Z) - Generating Fact Checking Explanations [52.879658637466605]
まだ欠けているパズルの重要なピースは、プロセスの最も精巧な部分を自動化する方法を理解することです。
本稿では、これらの説明を利用可能なクレームコンテキストに基づいて自動生成する方法について、最初の研究を行う。
この結果から,個別に学習するのではなく,両目標を同時に最適化することで,事実確認システムの性能が向上することが示唆された。
論文 参考訳(メタデータ) (2020-04-13T05:23:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。