論文の概要: MarketBench: Evaluating AI Agents as Market Participants
- arxiv url: http://arxiv.org/abs/2604.23897v1
- Date: Sun, 26 Apr 2026 21:48:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.666688
- Title: MarketBench: Evaluating AI Agents as Market Participants
- Title(参考訳): MarketBench: AIエージェントを市場参加者として評価する
- Authors: Andrey Fradkin, Rohit Krishnan,
- Abstract要約: MarketBenchは、AIエージェントにAI機能があるかどうかを評価するためのベンチマークである。
我々は、ソフトウェアエンジニアリングベンチマークであるSWE-bench Liteの93タスクサブセットを使用し、最近リリースされた6つのLLMをデモとして使用しています。
我々の結果は、AIエージェントの市場スタイルの調整において、自己評価が重要なボトルネックであることを示している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Markets are a promising way to coordinate AI agent activity for similar reasons to those used to justify markets more broadly. In order to effectively participate in markets, agents need to have informative signals of their own ability to successfully complete a task and the cost of doing so. We propose MarketBench, a benchmark for assessing whether AI agents have these capabilities. We use a 93-task subset of SWE-bench Lite, a software engineering benchmark, with six recently released LLMs as a demonstration. These LLMs are miscalibrated on both success probability and token usage, and auctions built from these self-reports diverge from a full-information allocation. A follow-up intervention where we add information about capabilities from prior experiments to the context improves calibration, but only modestly narrows the gap to a full-information benchmark. We also document the performance of a market-based scaffolding with these LLMs. Our results point to self-assessment as a key bottleneck for market-style coordination of AI agents.
- Abstract(参考訳): 市場は、市場をより広く正当化するために使用されるものと同様の理由で、AIエージェントの活動を調整するための有望な方法だ。
市場を効果的に利用するためには、エージェントは、タスクを成功させる独自の能力とそれを行うコストの情報を伝達する必要がある。
我々は、AIエージェントにこれらの能力があるかどうかを評価するベンチマークであるMarketBenchを提案する。
我々は、ソフトウェアエンジニアリングベンチマークであるSWE-bench Liteの93タスクサブセットを使用し、最近リリースされた6つのLLMをデモとして使用しています。
これらのLCMは、成功確率とトークン使用率の両方で誤解され、これらの自己レポートから作られたオークションは、完全な情報アロケーションから分岐する。
事前の実験からコンテキストに機能に関する情報を追加するというフォローアップの介入はキャリブレーションを改善するが、完全な情報ベンチマークのギャップをわずかに狭めるだけである。
また、これらのLCMを用いた市場ベース足場の性能を文書化する。
我々の結果は、AIエージェントの市場スタイルの調整において、自己評価が重要なボトルネックであることを示している。
関連論文リスト
- Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition [102.73682784993169]
本稿では,経済関連タスクにおける大規模言語モデル(LLM)の能力を評価するベンチマークであるtextbfMarket-Benchを紹介する。
我々は、LLMが商品の調達・販売を担当する小売業者として機能するマルチエージェントサプライチェーン経済モデルを構築した。
Market-Benchは入札、価格、スローガン、販売、バランスシートの完全な軌跡を記録し、経済、運用、セマンティックメトリクスによる自動評価を可能にしている。
論文 参考訳(メタデータ) (2026-04-07T07:23:51Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes [5.848712585343904]
本稿では,大規模言語モデル(LLM)が仕事需要の変化をどの程度予測できるかを評価するためのベンチマークを紹介する。
当社のベンチマークでは、米国におけるセクターレベルの求職率の高頻度指標と、AIの採用による職業変化のグローバルデータセットの2つのデータセットを組み合わせています。
その結果、構造化タスクは予測安定性を継続的に改善し、ペルソナプロンプトは短期的な傾向に有利であることがわかった。
論文 参考訳(メタデータ) (2025-10-27T14:08:27Z) - MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges? [66.87201770167012]
MLRC-Benchは、機械学習(ML)リサーチコンペティションの挑戦において、言語エージェントがいかに効果的に対処できるかを定量化するために設計されたベンチマークである。
MLRC-Benchは以前の研究とは異なり、新しい研究手法を提案し、実装する上で重要なステップを計測する。
最も優れた試験薬でさえ、ベースラインとトップヒューマンのスコアの差の9.3%しか閉じていない。
論文 参考訳(メタデータ) (2025-04-13T19:35:43Z) - HERA: Hybrid Edge-cloud Resource Allocation for Cost-Efficient AI Agents [9.064429605488026]
AIの領域では、GPT-4のような大規模言語モデル(LLM)がAIエージェントの運用の中心であり、主にクラウドで運用されている。
ローカルベースの小型言語モデル(SLM)がより正確になるにつれて、クラウド排他的処理の必要性が再検討されている。
本稿では,AIエージェントのサブタスクを局所的なSLMとクラウドベースのLLMに自動的に分割する適応反復レベルモデルセレクタ(AIMS)を提案する。
論文 参考訳(メタデータ) (2025-04-01T05:36:13Z) - Assessing the Performance of Human-Capable LLMs -- Are LLMs Coming for Your Job? [0.0]
SelfScoreは、ヘルプデスクとプロのコンサルティングタスクにおけるLLM(Large Language Model)の自動エージェントのパフォーマンスを評価するために設計されたベンチマークである。
このベンチマークは、問題の複雑さと応答の助け、スコアリングシステムにおける透明性と単純さの確保に関するエージェントを評価する。
この研究は、特にAI技術が優れている地域では、労働者の移動の可能性への懸念を提起している。
論文 参考訳(メタデータ) (2024-10-05T14:37:35Z) - DCA-Bench: A Benchmark for Dataset Curation Agents [9.60250892491588]
不完全なドキュメンテーション、不正確なラベル、倫理的懸念、時代遅れの情報といったデータ品質問題は、広く使われているデータセットで共通している。
大きな言語モデル(LLM)の急増する能力により、LLMエージェントによる隠れデータセット問題の発見の合理化が約束されている。
本研究では,この課題に対処するLLMエージェントの能力を評価するためのベンチマークを確立する。
論文 参考訳(メタデータ) (2024-06-11T14:02:23Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z) - AgentBench: Evaluating LLMs as Agents [99.12825098528212]
エージェントとしてのLarge Language Model (LLM)は近年広く認知されている。
我々は,LLM-as-Agentの推論と意思決定能力を評価するために,8つの異なる環境からなるベンチマークであるAgentBenchを提案する。
論文 参考訳(メタデータ) (2023-08-07T16:08:11Z) - What do LLMs Know about Financial Markets? A Case Study on Reddit Market
Sentiment Analysis [15.195505464654493]
ソーシャルメディアコンテンツに対する市場の感情分析には、金融市場とソーシャルメディアのジャーゴンの両方の知識が必要である。
我々のパイプラインは、大きな言語モデル(LLM)を用いたReddit投稿の弱い財務感情ラベルを生成する。
少数のプロンプトだけで、最終モデルは既存の教師付きモデルと同等に実行される。
論文 参考訳(メタデータ) (2022-12-21T19:11:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。