論文の概要: MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses
- arxiv url: http://arxiv.org/abs/2609.33411v1
- Date: Sun, 27 Sep 2026 09:45:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 17:09:56.525921
- Title: MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses
- Title(参考訳): MetaBench-Harness: ベンチマークハーネスのエンドツーエンド最適化のアンロック
- Abstract要約: ベンチマーク生成ワークフロー自体をMetaBench-Harnessでエンドツーエンドに最適化することを提案する。
具体的には、内部ループはベンチマークハーネスを使用して各ラウンドで新しいベンチマークを生成し、外側のメタハーネスオーケストレーション層は、ハーネスの実装を反復的に洗練し、検索する。
メタベンチ・ハーネスを競合プログラミングのCodeContestsとOlympiad数学のAIME-2024データセットに適用することにより、進化したベンチマークがフロンティアモデルに対して挑戦的で差別的であることを示す。
- 参考スコア(独自算出の注目度): 46.883509917111724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rapid progress in Large Language Models (LLMs) is saturating static benchmarks faster than they can be designed. While existing automated evolution frameworks attempt to generate harder questions by perturbing individual tasks, they remain constrained by rigid, hard-coded generation rules. Moving beyond the evolution of isolated tasks, we propose to optimize the benchmark generation workflow itself end to end with MetaBench-Harness, a dual-loop search framework. Specifically, the inner loop utilizes a benchmark harness to generate a new benchmark in each round, while the outer meta-harness orchestration layer iteratively refines and searches over harness implementations based on historical evolution trajectories. By applying MetaBench-Harness to the competitive programming CodeContests and Olympiad mathematics AIME-2024 datasets, we demonstrate that the evolved benchmarks are challenging and discriminative for frontier models. Trajectory and quality analyses verify that MetaBench-Harness enables multi-dimensional evolution, steadily improving evolution reasonableness, benchmark competency, and evaluator robustness across successive rounds. Furthermore, case studies reveal its effective utilization of diverse difficulty levers to reframe problems and elevate required capabilities. Ultimately, this work provides a solution to the pressing challenge of benchmark saturation.
- Abstract(参考訳): LLM(Large Language Models)の急速な進歩は、静的ベンチマークを設計よりも早く飽和させている。
既存の自動進化フレームワークは、個々のタスクを摂動することで難しい質問を発生させようとするが、厳格でハードコードされた生成ルールによって制約される。
孤立したタスクの進化を超えて、デュアルループ検索フレームワークであるMetaBench-Harnessでベンチマーク生成ワークフロー自体をエンドツーエンドに最適化することを提案する。
具体的には、内部ループはベンチマークハーネスを使用して各ラウンドで新しいベンチマークを生成し、外側のメタハーネスオーケストレーション層は歴史的進化軌道に基づく実装を反復的に洗練し、検索する。
メタベンチ・ハーネスを競合プログラミングのCodeContestsとOlympiad数学のAIME-2024データセットに適用することにより、進化したベンチマークがフロンティアモデルに対して挑戦的で差別的であることを示す。
軌道と品質分析により,MetaBench-Harnessは多次元的進化を可能にし,進化の合理性,ベンチマーク能力,連続ラウンド間のロバスト性の向上を実現している。
さらに、ケーススタディでは、様々な難易度レバーを効果的に活用し、問題を再構築し、必要な能力を高めることを明らかにする。
最終的に、この研究は、ベンチマーク飽和の急激な挑戦に対する解決策を提供する。
関連論文リスト
- Evo-Bench: Can Language Models Improve Agent Harness? [44.72089415085898]
Evo-Benchは、検索、オフィス、ジェネラルエージェントドメインにまたがるモデル固有のハーネス進化能力を評価するために設計された最初のベンチマークである。
トップモデルは16.6ポイントに達し、最先端の人間工学ベースラインに近づいた。
論文 参考訳(メタデータ) (2026-08-10T03:49:28Z) - SDDMO-Bench: A Benchmark Suite for Streaming Data-Driven Dynamic Multi-Objective Optimization [10.627368862090728]
本稿では,動的多目的テスト問題をストリーミング環境に変換するベンチマークスイートであるSDDMO-Benchを提案する。
5つの時間依存基底関数と6つの分布ドリフトパターンを組み合わせることで、SDDMO-Benchは30のシナリオを構成する。
代表的な進化的アルゴリズムを用いた実験は、SDDMO-Benchが挑戦的で差別的なテストシナリオを提供することを示した。
論文 参考訳(メタデータ) (2026-08-01T06:56:01Z) - BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution [59.619780973577434]
BenchEvolverはソリューション中心の進化的フレームワークで、既存のコーディング問題をより難しい変種に変換する。
BenchEvolverは、飽和ベンチマークをフロンティアレベルの評価スイートと再利用可能なトレーニング信号に変換することができることを示す。
論文 参考訳(メタデータ) (2026-05-31T15:12:16Z) - K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model [57.440609834690385]
既存のアプローチでは、進化ループ内の高速コードジェネレータとして、LLM(Large Language Models)を扱います。
我々は,共進化的世界モデルによる検索を提案し,この手法に基づいてK-Searchを構築する。
GQA, MLA, MoE カーネルを含む多種多様な複雑なカーネル上で K-Search を評価する。
論文 参考訳(メタデータ) (2026-02-22T11:06:22Z) - InfoSynth: Information-Guided Benchmark Synthesis for LLMs [69.80981631587501]
大規模言語モデル (LLM) は推論やコード生成において大きな進歩を見せている。
従来のベンチマーク作成は人手による作業に依存しています。
この作業では、推論ベンチマークの自動生成と評価のための新しいフレームワークであるInfo Synthを紹介した。
論文 参考訳(メタデータ) (2026-01-02T05:26:27Z) - AI Benchmark Democratization and Carpentry [12.180796797521062]
大規模な言語モデルはしばしば静的なベンチマークを行い、ベンチマーク結果と実世界のパフォーマンスのギャップを生じさせる。
現在のベンチマークでは、上位層のハードウェア上でのピークパフォーマンスを強調し、多様な実世界のシナリオに対する限られたガイダンスを提供することが多い。
民主化は、技術革新とレベルを越えた体系的な教育の両方を必要とし、ベンチマーク設計と使用において持続的な専門知識を構築する。
論文 参考訳(メタデータ) (2025-12-12T14:20:05Z) - Benchmarking that Matters: Rethinking Benchmarking for Practical Impact [2.952553461344481]
本稿では,実世界のベンチマーク,実践者が利用できる機能空間,コミュニティが維持するパフォーマンスデータベースを中心にしたビジョンを提案する。
現実の洞察とともに進化し、科学的理解と産業的利用の両方をサポートする生きたベンチマークエコシステム。
論文 参考訳(メタデータ) (2025-11-15T15:42:15Z) - TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models [5.6525926183880255]
本論文では,対話型コードブレークタスクによるマルチターン・マルチステップ推論を評価する新しいベンチマークであるTurnBenchを紹介する。
各エピソードにおいて、モデルはシーケンシャルな推測を行い、構造化されたフィードバックを受け取り、複数のラウンドで手がかりを統合することによって、隠れた論理的または算術的なルールを明らかにする必要がある。
TurnBenchには、標準推論をテストするClassicと、複雑さを増し堅牢な推論チェーンを必要とするNightmareの2つのモードがある。
論文 参考訳(メタデータ) (2025-06-02T05:47:50Z) - Design-Bench: Benchmarks for Data-Driven Offline Model-Based
Optimization [82.02008764719896]
ブラックボックスモデルに基づく最適化問題は、タンパク質、DNA配列、航空機、ロボットの設計など、幅広い領域で広く使われている。
本稿では,統合評価プロトコルと最近の手法の参照実装を備えたオフラインMBOのためのベンチマークであるDesign-Benchを提案する。
私たちのベンチマークには、生物学、材料科学、ロボット工学における現実世界の最適化問題から派生した、多種多様な現実的なタスクが含まれています。
論文 参考訳(メタデータ) (2022-02-17T05:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。