論文の概要: AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds
- arxiv url: http://arxiv.org/abs/2608.29397v1
- Date: Sat, 29 Aug 2026 18:37:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.950917
- Title: AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds
- Title(参考訳): AlgoWorlds: アルゴリズムの世界におけるグローバル最適化のためのベンチマークツール
- Authors: Zixiang Xu, Jiaan Wang, Fandong Meng,
- Abstract要約: ツール使用ベンチマークは一般的に、適切なツールと有効な引数を使用して、エージェントがワークフローを完了するかどうかを評価する。
アルゴワールドス(AlgoWorlds)は、公式に指定された最適化問題を部分的に観察された決定環境に変換するベンチマークである。
AlgoWorldsには、10の最適化ファミリーと4つのワークロードレベルをカバーする240の環境が含まれている。
- 参考スコア(独自算出の注目度): 58.529749203758634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-use benchmarks generally evaluate whether an agent completes a workflow using appropriate tools and valid arguments. However, feasibility alone is insufficient in real-world decision settings such as route planning and fleet dispatch. Individual choices interact through shared constraints and costs, so a feasible solution may still be substantially suboptimal. This raises a harder question: can an agent turn information gathered through tools into a globally optimal decision? We introduce AlgoWorlds, a benchmark that transforms formally specified combinatorial optimization problems into partially observed decision environments with verifiable global optima. Each environment contains a hidden instance observed only through task-specific information tools, after which the agent commits to one structured decision evaluated for feasibility and optimality. AlgoWorlds contains 240 environments covering ten combinatorial optimization families and four workload levels. Family-specific deterministic programs generate the instances, exact algorithms certify their optima and determine workload levels, and two structurally different tool interfaces present each underlying instance. We evaluate seven leading LLMs, including Claude Opus 4.8 and GPT-5.6 Sol. Achieving global optimality remains highly challenging: although leading models produce feasible decisions in most cases, the best-performing model reaches exact optimality in only 38.61% of cases. Even when agents collect sufficient information to reconstruct the hidden instance, most failures end in feasible but suboptimal decisions. The challenge therefore extends beyond information acquisition to information integration, global constraint reasoning, and decision verification. The project homepage is available at https://xzx34.github.io/AlgoWorlds/, and the code is available at https://github.com/xzx34/AlgoWorlds.
- Abstract(参考訳): ツール使用ベンチマークは一般的に、適切なツールと有効な引数を使用して、エージェントがワークフローを完了するかどうかを評価する。
しかし、ルート計画や艦隊派遣といった現実的な意思決定設定では、実現可能性だけでは不十分である。
個々の選択は共有された制約とコストを通して相互作用するので、実現可能な解決策は依然としてかなり最適である。
エージェントはツールを通じて収集された情報を、グローバルに最適な決定へと変えられるだろうか?
本稿では,公式に指定された組合せ最適化問題を,検証可能な大域的最適性を持つ部分的な決定環境に変換するベンチマークAlgoWorldsを紹介する。
各環境はタスク固有の情報ツールを通してのみ観察される隠されたインスタンスを含み、その後エージェントは実行可能性と最適性について評価された1つの構造化された決定にコミットする。
AlgoWorldsには、10の組合せ最適化ファミリーと4つのワークロードレベルをカバーする240の環境が含まれている。
家族固有の決定論的プログラムはインスタンスを生成し、正確なアルゴリズムがその最適性を証明し、ワークロードレベルを決定する。
我々はClaude Opus 4.8, GPT-5.6 Solを含む7つのLLMの評価を行った。
先導的なモデルがほとんどのケースで実現可能な決定を下すが、最高の性能のモデルは38.61%のケースで正確な最適性に達する。
エージェントが隠されたインスタンスを再構築するのに十分な情報を収集しても、ほとんどの障害は実行可能であるが、最適ではない決定で終わる。
この課題は情報取得を超えて、情報統合、グローバル制約推論、意思決定の検証にまで及んでいる。
プロジェクトのホームページはhttps://xzx34.github.io/AlgoWorlds/で、コードはhttps://github.com/xzx34/AlgoWorldsで入手できる。
関連論文リスト
- Algorithmic Feature Highlighting for Human-AI Decision-Making [2.7830690575074435]
我々は,人的配慮のためのケース特化機能の小さなサブセットを強調するアルゴリズムについて検討する。
中心的な問題は、人間がアルゴリズムのフィーチャの選択をどう解釈するかである。
洗練されたエージェントのハイライトを最適化することは、計算的に難解であることを示す。
論文 参考訳(メタデータ) (2026-04-24T05:23:06Z) - ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization [0.0]
ConstraintBenchは、直接制約付き最適化において、大きな言語モデルを評価するためのベンチマークである。
200のタスクで6つのフロンティアモデルを評価し、最適性ではなく実現可能性が主要なボトルネックであることを確認した。
解法基準の0.1%の範囲内で、結合実現可能性と最適性について30.5%を超えるモデルはない。
論文 参考訳(メタデータ) (2026-02-25T22:54:26Z) - Non-Convex Bilevel Optimization with Time-Varying Objective Functions [57.299128109226025]
本稿では,時間変化の可能なオンライン二段階最適化を提案し,エージェントがオンラインデータを用いて決定を継続的に更新する。
既存のアルゴリズムと比較して、SOBOWは計算効率が良く、以前の関数を知る必要がない。
軽度条件下では,SOBOWはサブリニアな局所的後悔を達成できることを示す。
論文 参考訳(メタデータ) (2023-08-07T06:27:57Z) - A Bayesian Optimization Framework for Finding Local Optima in Expensive
Multi-Modal Functions [18.570591025615453]
本稿では,高コストで評価可能なマルチモーダル目的関数に対する局所的・言語的ソリューションの集合を見つけるためのマルチモーダルBOフレームワークを開発する。
目的関数とその一階微分の結合分布を解析的に導出する。
本稿では、マルチモーダル設定によく知られたBO取得関数の変種を導入し、提案フレームワークの性能を実証する。
論文 参考訳(メタデータ) (2022-10-13T00:10:13Z) - Learning Proximal Operators to Discover Multiple Optima [66.98045013486794]
非家族問題における近位演算子を学習するためのエンドツーエンド手法を提案する。
本手法は,弱い目的と穏やかな条件下では,世界規模で収束することを示す。
論文 参考訳(メタデータ) (2022-01-28T05:53:28Z) - Bayesian Algorithm Execution: Estimating Computable Properties of
Black-box Functions Using Mutual Information [78.78486761923855]
多くの現実世界では、T関数の評価の予算を考えると、高価なブラックボックス関数 f の性質を推測したい。
本稿では,アルゴリズムの出力に対して相互情報を最大化するクエリを逐次選択する手法InfoBAXを提案する。
これらの問題に対してInfoBAXは、元のアルゴリズムで要求されるより500倍少ないクエリをfに使用する。
論文 参考訳(メタデータ) (2021-04-19T17:22:11Z) - Generalized and Scalable Optimal Sparse Decision Trees [56.35541305670828]
様々な目的に対して最適な決定木を生成する手法を提案する。
また,連続変数が存在する場合に最適な結果が得られるスケーラブルなアルゴリズムも導入する。
論文 参考訳(メタデータ) (2020-06-15T19:00:11Z) - Optimizing Wireless Systems Using Unsupervised and
Reinforced-Unsupervised Deep Learning [96.01176486957226]
無線ネットワークにおけるリソース割り当てとトランシーバーは、通常最適化問題の解決によって設計される。
本稿では,変数最適化と関数最適化の両問題を解くための教師なし・教師なし学習フレームワークを紹介する。
論文 参考訳(メタデータ) (2020-01-03T11:01:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。