論文の概要: A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- arxiv url: http://arxiv.org/abs/2607.02141v1
- Date: Thu, 02 Jul 2026 13:18:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.840787
- Title: A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- Title(参考訳): A$^{2}$utoLPBench: Inverse-KKT構築による自動生成エージェントフレンドリーLPベンチマーク
- Authors: Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho,
- Abstract要約: textbfA$2$utoLPBenchは、平文で書かれた線形プログラミング問題に対してLLM駆動エージェントをテストするためのベンチマークである。
この答えは、解決者からの電話も人間の注釈もなしに、建設によって知られている。
ベンチマークは固定データセットではなくジェネレータであるため、固定データセットにマッチするプロパティがない。
- 参考スコア(独自算出の注目度): 29.66946400529514
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most LP-from-text benchmarks are static datasets of word problems written and labeled by hand. Once such a dataset is released, its size is fixed, its difficulty is fixed, and every problem can leak into the training data of future LLMs. We present \textbf{A$^{2}$utoLPBench}, a benchmark for testing LLM-driven agents on linear programming problems written in plain text. We first pick a feasible point and dual, then write down a problem for which that point is optimal and the objective value is known. The answer is known by construction, with no solver call and no human annotator. The evaluation environment bundles a reference solver-critic baseline and a Docker image whose usage instructions are written for an LLM-driven agent to read. With these in place, any agent can run the benchmark and get a calibrated score with one command. Because the benchmark is a generator rather than a fixed dataset, it has properties no fixed dataset can match: an unlimited supply of fresh problems, a difficulty knob set by $(n,m)$, ground-truth answers correct by construction, low LLM-side cost per problem relative to human authoring, repeatable scores across independent batches, and resistance to training-data leakage when fresh post-cutoff seed ranges are used.
- Abstract(参考訳): ほとんどのLP-from-textベンチマークは、手書きで書かれた単語問題の静的データセットである。
このようなデータセットがリリースされると、そのサイズが固定され、その困難が修正され、すべての問題が将来のLCMのトレーニングデータにリークされる。
我々は、平文で書かれた線形プログラミング問題に対して LLM 駆動エージェントをテストするベンチマークである \textbf{A$^{2}$utoLPBench} を提示する。
まず、実現可能な点と双対を選び、それからその点が最適で客観的な値が知られている問題を書き留める。
この答えは、解決者からの電話も人間の注釈もなしに、建設によって知られている。
評価環境は、基準ソルバクリティカルベースラインと、LCM駆動エージェントが読み込むための使用指示が書かれたDockerイメージとをバンドルする。
これを設定すれば、任意のエージェントがベンチマークを実行し、1つのコマンドでキャリブレーションスコアを取得できる。
ベンチマークは固定データセットではなくジェネレータであるため、固定データセットが一致しない性質がある: 新鮮な問題の無制限供給、$(n,m)$で設定された難解なノブ、建設による正解、人間のオーサリングに対する問題ごとのLLM側のコストの低減、独立したバッチ間の繰り返しスコア、新鮮なポストカットオフシードレンジを使用する場合のトレーニングデータリークに対する抵抗。
関連論文リスト
- Estimating problem difficulty without ground truth using Large Language Model comparisons [4.599673637363014]
そこで本研究では,LLMとLLMを比較し,問題の難易度を推定する手法を提案する。
LLMはペアの難易度比較を行い、Bradley-Terryスコアは結果に基づいて計算される。
我々の研究は、時間を要する人間のアノテーションと合成データ生成を置き換えるための重要なステップである。
論文 参考訳(メタデータ) (2025-12-16T09:13:56Z) - Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation [55.21013307734612]
AoPS-Instructは60,000以上の高品質QAペアのデータセットである。
LiveAoPSBenchは、最新のフォーラムデータから派生したタイムスタンプによる進化的評価セットである。
我々の研究は、高度な数学推論のための大規模で高品質なデータセットの作成と維持にスケーラブルなアプローチを提示している。
論文 参考訳(メタデータ) (2025-01-24T06:39:38Z) - Training on the Benchmark Is Not All You Need [52.01920740114261]
本稿では,複数選択肢の内容に基づいた簡易かつ効果的なデータ漏洩検出手法を提案する。
本手法は,モデルトレーニングデータや重みを使用せずに,グレーボックス条件下で動作可能である。
4つのベンチマークデータセットから35個の主要なオープンソースLCMのデータ漏洩度を評価する。
論文 参考訳(メタデータ) (2024-09-03T11:09:44Z) - Generating Unseen Code Tests In Infinitum [1.0674604700001968]
本稿では,プログラミングタスクやプログラミング言語にまたがって一般化するベンチマークのバリエーションを作成する手法を提案する。
我々は、Pythonでテキストからコードを生成するタスクに対して、textitauto-regressionと呼ばれる1つのベンチマークを実装した。
論文 参考訳(メタデータ) (2024-07-29T08:11:20Z) - LiveBench: A Challenging, Contamination-Limited LLM Benchmark [93.57775429120488]
最近の情報ソースから頻繁に更新された質問を含む最初のベンチマークであるLiveBenchをリリースする。
我々は、多くの著名なクローズドソースモデルと、0.5Bから405Bまでの数十のオープンソースモデルを評価した。
質問は毎月追加され、更新され、時間とともに新しいタスクとより難しいタスクをリリースします。
論文 参考訳(メタデータ) (2024-06-27T16:47:42Z) - DCA-Bench: A Benchmark for Dataset Curation Agents [9.60250892491588]
不完全なドキュメンテーション、不正確なラベル、倫理的懸念、時代遅れの情報といったデータ品質問題は、広く使われているデータセットで共通している。
大きな言語モデル(LLM)の急増する能力により、LLMエージェントによる隠れデータセット問題の発見の合理化が約束されている。
本研究では,この課題に対処するLLMエージェントの能力を評価するためのベンチマークを確立する。
論文 参考訳(メタデータ) (2024-06-11T14:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。