論文の概要: MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
- arxiv url: http://arxiv.org/abs/2607.28956v2
- Date: Tue, 04 Aug 2026 11:17:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.406531
- Title: MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
- Title(参考訳): MerchantBench:Eコマース運用における長期コヒーレンスのためのLLMエージェントのベンチマーク
- Abstract要約: 長期コヒーレンス(英: Long-Term Coherence)とは、累積的な証拠に決定を適応させながら、地平線を越えて目的的行動を維持する能力である。
売り手側のeコマースは、再帰的かつ相互依存的な決定を通じて、この評価に適切な設定を提供する。
MerchantBenchは、98,843件のeコマース製品記録に基づいた365日間の注文レベルのシミュレーションで、エージェントインタラクションのための26のツールを備えている。
- 参考スコア(独自算出の注目度): 18.706607921548326
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents are increasingly evaluated as autonomous tool users, yet most benchmarks focus on bounded tasks with immediate success criteria. Real-world deployments often require Long-Term Coherence, the capacity to preserve purposeful behavior across extended horizons while adapting decisions to accumulated evidence. Evaluating this capacity requires a persistent environment in which actions constrain future choices, feedback arrives at heterogeneous delays, and incoherent behavior produces measurable cumulative effects. Seller-side e-commerce provides a suitable setting for this evaluation through recurrent and interdependent decisions over Product Sourcing, Listing and Pricing Control, Cash-Flow Management, and Mixed-Latency Feedback Adaptation. We introduce MerchantBench, a 365-day order-level simulation grounded in 98,843 real e-commerce product records and equipped with 26 tools for agent interaction. MerchantBench couples promptly observable Upstream Supplier Events with delayed Downstream Order Outcomes, requiring agents to follow individual order lifecycles and revisit earlier decisions. We evaluate eight LLMs under two agent frameworks in 48 runs, each spanning 365 simulated days. Our results reveal a substantial gap between even the latest LLMs and human participants, with the best LLM configuration attaining only 27.3\% of the mean final net assets achieved by human participants.
- Abstract(参考訳): 大規模言語モデルエージェントは、自律的なツールユーザとしてますます評価されている。
実世界の展開には、しばしば長期コヒーレンス(Long-Term Coherence)を必要とする。
このキャパシティを評価するには、アクションが将来の選択を制限し、フィードバックが不均一な遅延に到達し、一貫性のない振る舞いが測定可能な累積効果を生み出す、永続的な環境が必要である。
売り手側のeコマースは、製品ソーシング、リスティングと価格管理、キャッシュフロー管理、混合レイテンシフィードバック適応に対する反復的および相互依存的な決定を通じて、この評価に適切な設定を提供する。
我々はMerchantBenchを紹介した。MerchantBenchは、98,843のリアルeコマース製品記録をベースとした365日間のオーダーレベルのシミュレーションであり、エージェントインタラクションのための26のツールを備えている。
MerchantBenchは、すぐに監視可能なアップストリームサプライヤイベントと遅延ダウンストリームオーダーアウトカムを結合する。
2つのエージェントフレームワークによる8つのLSMを48ランで評価し,それぞれ365日をシミュレーションした。
以上の結果から,LLMの最適構成は,ヒトが達成した平均純資産の27.3倍に過ぎなかった。
関連論文リスト
- E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation [54.50499240166176]
E-Commerce Benchは、マルチラウンドのネゴシエーションと動的イベントを1年間のビジネス運用に統合する、最初のオープンソースベンチマークです。
年末の資産を含む7次元にわたる18のフロンティアモデルを評価し,1つのモデルが支配的でないことを発見した。
論文 参考訳(メタデータ) (2026-08-31T13:03:57Z) - DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies [2.545704705278791]
異種企業からなる長期マルチエージェント経済におけるLCMエージェント評価のためのベンチマークであるCoffeeBenchを紹介する。
農家2人、ロースター2人、小売店2人が90日間のシミュレーションで事業を自律的に運営している。
すべてのモデルがパッシブベースラインを上回り、アクションを取らず、ほとんどのモデルが肯定的な純利益を達成する。
論文 参考訳(メタデータ) (2026-06-15T12:04:44Z) - RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments [8.751899157366005]
大規模言語モデル (LLM) エージェントは、短時間水平、よく観察されたタスクにおいて急速に進歩してきたが、動的な長距離環境におけるコヒーレントな決定を持続する能力は、いまだに不確実である。
RetailBenchは、単一店舗のスーパーマーケットオペレーションにおいて、ツールを使用するLLMエージェントを評価するためのデータグラウンドシミュレーションベンチマークである。
論文 参考訳(メタデータ) (2026-06-14T15:30:30Z) - ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants [30.950450014358722]
大規模かつ挑戦的な中国のショッピング環境であるShopSimulatorを紹介した。
様々なシナリオにまたがってLCMを評価し、最高の性能のモデルでさえ40%未満の完全成功率を達成することを発見した。
さらなる訓練は、これらの弱点を克服するための実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-01-26T07:24:28Z) - EComStage: Stage-wise and Orientation-specific Benchmarking for Large Language Models in E-commerce [26.028479108472265]
大規模言語モデル(LLM)ベースのエージェントは、ますますeコマースアプリケーションにデプロイされている。
EComStageは、総合的な段階的推論プロセスにおけるエージェント対応LCMを評価するための統一ベンチマークである。
私たちは、オープンソースモデルやクローズドソースAPIを含む、1Bから200Bのパラメータにまたがる30以上のLLMを評価しました。
論文 参考訳(メタデータ) (2026-01-06T06:39:16Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - AgentBench: Evaluating LLMs as Agents [99.12825098528212]
エージェントとしてのLarge Language Model (LLM)は近年広く認知されている。
我々は,LLM-as-Agentの推論と意思決定能力を評価するために,8つの異なる環境からなるベンチマークであるAgentBenchを提案する。
論文 参考訳(メタデータ) (2023-08-07T16:08:11Z) - Learning Multi-Agent Intention-Aware Communication for Optimal
Multi-Order Execution in Finance [96.73189436721465]
まず,現実的な制約を考慮したマルチオーダー実行のためのマルチエージェントRL(MARL)手法を提案する。
本稿では,学習可能なマルチラウンド通信プロトコルを提案する。
2つの実世界の市場のデータに関する実験では、優れたパフォーマンスを示し、コラボレーションの有効性が著しく向上した。
論文 参考訳(メタデータ) (2023-07-06T16:45:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。