論文の概要: Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
- arxiv url: http://arxiv.org/abs/2604.05523v1
- Date: Tue, 07 Apr 2026 07:23:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.683355
- Title: Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
- Title(参考訳): Market-Bench:経済・貿易競争における大規模言語モデルのベンチマーク
- Authors: Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai,
- Abstract要約: 本稿では,経済関連タスクにおける大規模言語モデル(LLM)の能力を評価するベンチマークであるtextbfMarket-Benchを紹介する。
我々は、LLMが商品の調達・販売を担当する小売業者として機能するマルチエージェントサプライチェーン経済モデルを構築した。
Market-Benchは入札、価格、スローガン、販売、バランスシートの完全な軌跡を記録し、経済、運用、セマンティックメトリクスによる自動評価を可能にしている。
- 参考スコア(独自算出の注目度): 102.73682784993169
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The ability of large language models (LLMs) to manage and acquire economic resources remains unclear. In this paper, we introduce \textbf{Market-Bench}, a comprehensive benchmark that evaluates the capabilities of LLMs in economically-relevant tasks through economic and trade competition. Specifically, we construct a configurable multi-agent supply chain economic model where LLMs act as retailer agents responsible for procuring and retailing merchandise. In the \textbf{procurement} stage, LLMs bid for limited inventory in budget-constrained auctions. In the \textbf{retail} stage, LLMs set retail prices, generate marketing slogans, and provide them to buyers through a role-based attention mechanism for purchase. Market-Bench logs complete trajectories of bids, prices, slogans, sales, and balance-sheet states, enabling automatic evaluation with economic, operational, and semantic metrics. Benchmarking on 20 open- and closed-source LLM agents reveals significant performance disparities and winner-take-most phenomenon, \textit{i.e.}, only a small subset of LLM retailers can consistently achieve capital appreciation, while many hover around the break-even point despite similar semantic matching scores. Market-Bench provides a reproducible testbed for studying how LLMs interact in competitive markets.
- Abstract(参考訳): 大規模言語モデル(LLM)の経済資源の管理・取得能力は未だ不明である。
本稿では、経済・貿易競争による経済関連課題におけるLCMの能力を評価する総合的なベンチマークである「textbf{Market-Bench}」を紹介する。
具体的には,LLMが商品の調達・販売を行う小売業者として機能する,構成可能なマルチエージェント・サプライチェーン経済モデルを構築した。
textbf{procurement} の段階では、LLM は予算制約のオークションにおける限られた在庫の入札を行う。
textbf{retail}の段階では、LLMは小売価格を設定し、マーケティングスローガンを生成し、ロールベースのアテンションメカニズムを通じて購入者に提供します。
Market-Benchは入札、価格、スローガン、販売、バランスシートの完全な軌跡を記録し、経済、運用、セマンティックメトリクスによる自動評価を可能にしている。
オープンおよびクローズド・ソースのLLMエージェント20件のベンチマークでは,類似のセマンティックマッチングスコアに関わらず,ブレークフェアポイント周辺に留まりながら,LLM小売業者のわずかなサブセットで継続的に資本評価を達成できるという,大きなパフォーマンス格差と勝者獲得現象が明らかにされている。
Market-Benchは、LLMが競争市場においてどのように相互作用するかを研究する再現可能なテストベッドを提供する。
関連論文リスト
- StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets? [44.10622904101254]
大規模言語モデル(LLM)は、最近、自律エージェントとして強力な能力を示した。
実時間複数ヶ月の株式トレーディング環境でLLMエージェントを評価するためのベンチマークであるStockBenchを紹介する。
我々の評価では、ほとんどのLLMエージェントは、単純な買い買い得ベースラインよりも優れているが、いくつかのモデルでは、より高いリターンをもたらし、より効果的にリスクを管理する可能性を実証している。
論文 参考訳(メタデータ) (2025-10-02T16:54:57Z) - AI Playing Business Games: Benchmarking Large Language Models on Managerial Decision-Making in Dynamic Simulations [0.0]
本研究は,ビジネスにおける意思決定にビジネスゲームを用いた新しいベンチマークを解析する。
この研究は、再現可能なオープンアクセス管理シミュレータを提案することで、AIに関する最近の文献に貢献する。
論文 参考訳(メタデータ) (2025-09-30T14:43:05Z) - On the Performance of LLMs for Real Estate Appraisal [5.812129569528997]
本研究では,Large Language Models (LLMs) が,競争力と解釈可能な住宅価格推定を生成することによって,不動産情報へのアクセスを民主化する方法について検討する。
我々は,多種多様な国際住宅データを用いて,ゼロショット,少数ショット,市場レポート強化,ハイブリッドプロンプト技術の比較を行った。
この結果から, LLMは, 特性サイズやアメニティなどのヘドニック変数を有効利用し, 有意義な推定値が得られることがわかった。
論文 参考訳(メタデータ) (2025-06-13T14:14:40Z) - A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs [74.35290684163718]
大規模言語モデル(LLM)開発における最大の課題は、その面倒な事前トレーニングコストである。
本稿では,小言語モデル(SLM)を活用して,LLMの事前学習効率と品質を改善するための有望なパラダイムについて検討する。
論文 参考訳(メタデータ) (2024-10-24T14:31:52Z) - Strategic Collusion of LLM Agents: Market Division in Multi-Commodity Competitions [0.0]
機械学習技術は、現実世界の市場シナリオへの展開が増えている。
マルチコモディティ市場において,大規模言語モデル(LLM)が自律エージェントとして展開する際の戦略行動について検討する。
論文 参考訳(メタデータ) (2024-09-19T20:10:40Z) - Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing [56.75702900542643]
大規模言語モデルの自己改善のためのAlphaLLMを紹介する。
モンテカルロ木探索(MCTS)とLLMを統合し、自己改善ループを確立する。
実験の結果,AlphaLLM は付加アノテーションを使わずに LLM の性能を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2024-04-18T15:21:34Z) - AgentBench: Evaluating LLMs as Agents [99.12825098528212]
エージェントとしてのLarge Language Model (LLM)は近年広く認知されている。
我々は,LLM-as-Agentの推論と意思決定能力を評価するために,8つの異なる環境からなるベンチマークであるAgentBenchを提案する。
論文 参考訳(メタデータ) (2023-08-07T16:08:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。