論文の概要: ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons
- arxiv url: http://arxiv.org/abs/2608.09282v1
- Date: Mon, 10 Aug 2026 08:37:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.162952
- Title: ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons
- Title(参考訳): Combo ShoppingBench: クーポンによる予算制約型バスケットショッピングのためのLCMエージェントの評価
- Authors: Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu,
- Abstract要約: 現実世界のショッピングでは、1つの商品を回収するのではなく、補完的なアイテムのバスケットを構築する必要があることが多い。
複数のバスケットが同じ要求を満たす可能性があるため、正確なマッチメトリクスが適さないため、評価は難しい。
オープンエンドかつ検証可能なバスケット構築のためのエージェントショッピングベンチマークであるComboShoppingBenchを紹介する。
- 参考スコア(独自算出の注目度): 19.548878416586586
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world shopping often requires constructing a basket of complementary items rather than retrieving a single product. Such combo-shopping tasks arise in device setup, meal preparation, event planning, and group takeout ordering, requiring joint reasoning about item compatibility, availability, store-level requirements, delivery fees, coupons, and budgets. Evaluation is challenging because multiple baskets may satisfy the same request, making exact-match metrics unsuitable, whereas semantic evaluation alone cannot detect infeasible orders, invalid coupon combinations, or incorrect payments. We introduce ComboShoppingBench, an agentic shopping benchmark for open-ended yet verifiable basket construction in a simulated commerce and takeout environment. During task synthesis, an exploration agent constructs a feasible and semantically coherent basket of purchasable products; this witness guides the generation of coupons, budget constraints, user queries, and aligned evaluation rubrics. During evaluation, LLM judges assess semantic satisfaction, response quality, and claim faithfulness, while deterministic validation checks product-ID validity, budget compliance, and coupon optimality. Experiments with diverse LLM agents demonstrate that even strong agents struggle on ComboShoppingBench, highlighting substantial room for improvement in reliable, constraint-aware combo shopping.
- Abstract(参考訳): 現実世界のショッピングでは、1つの商品を回収するのではなく、補完的なアイテムのバスケットを構築する必要があることが多い。
このような複合ショッピングタスクは、機器のセットアップ、食事の準備、イベントプランニング、グループテイクアウトの順序付け、アイテムの互換性、可用性、店舗レベルの要求、配送手数料、クーポン、予算に関する共同推論を必要とする。
複数のバスケットが同じ要求を満たす可能性があるため、セマンティック評価だけでは不可能な注文、無効なクーポンの組み合わせ、不正な支払いを検出できない。
模擬商業・テイクアウト環境におけるオープンエンドかつ検証可能なバスケット構築のためのエージェントショッピングベンチマークであるComboShoppingBenchを紹介する。
タスク合成の間、探索エージェントは、購入可能な製品の実用的で意味的に一貫性のあるバスケットを構築し、この証人はクーポンの生成、予算制約、ユーザクエリ、および整列された評価ルーブリックをガイドする。
評価中、LCMはセマンティック満足度、応答品質、クレーム忠実度を評価し、決定論的検証は製品IDの妥当性、予算順守、クーポン最適性をチェックする。
多様なLLMエージェントによる実験は、強力なエージェントでさえCombo ShoppingBenchで苦労していることを示している。
関連論文リスト
- Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning [72.49938949082117]
MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MARメソッドは通常、クエリレベルのラベルやトラジェクトリレベルのリターンからルーティング決定を学習する。
効率的な適応MARのための共有操作型クレジット割り当てフレームワークであるTreeCreditを提案する。
論文 参考訳(メタデータ) (2026-08-03T14:22:23Z) - Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents [14.209118550299165]
本稿では,Alipay-PIBenchについて紹介する。
プロダクト固有の9つのプロジェクトと18のタスクインスタンスが含まれており、それぞれが基本機能補完と高度なリスク対応のハードニングシナリオで構成されている。
我々は6つの符号化エージェントモデルと報告ルーリックパス率(RPR)を評価する。
スキルの低い条件下では、RPRの平均は68.58%から91.37%である。
Alipay-payment-integration スキルへのアクセスにより、平均 RPR は非熟練条件に対する平均 10.31 ポイント向上する。
論文 参考訳(メタデータ) (2026-07-16T05:08:20Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition [102.73682784993169]
本稿では,経済関連タスクにおける大規模言語モデル(LLM)の能力を評価するベンチマークであるtextbfMarket-Benchを紹介する。
我々は、LLMが商品の調達・販売を担当する小売業者として機能するマルチエージェントサプライチェーン経済モデルを構築した。
Market-Benchは入札、価格、スローガン、販売、バランスシートの完全な軌跡を記録し、経済、運用、セマンティックメトリクスによる自動評価を可能にしている。
論文 参考訳(メタデータ) (2026-04-07T07:23:51Z) - A Modular LLM Framework for Explainable Price Outlier Detection [18.835973360203784]
本稿では,外付け価格のフラグ付けを関連製品の検出と比較に基づく推論タスクとして扱うエージェント型大規模言語モデル(LLM)フレームワークを提案する。
本システムは、商品の価格を3段階に分けて処理する。 (i)関連分類は、製品説明及び属性を用いて価格関連類似製品を選択し、 (ii)相対効用評価は、価格影響次元に沿って、各類似製品に対して目標製品を評価する。 (iii)推論に基づく決定は、これらの正当性を説明可能な価格外れ判定に集約する。
論文 参考訳(メタデータ) (2026-03-21T04:11:22Z) - Shopping Companion: A Memory-Augmented LLM Agent for Real-World E-Commerce Tasks [6.67534912037121]
LLMエージェントは、レコメンデーション、予算設定、バンドル取引などのショッピングタスクの約束を示す。
本稿では,2つのショッピングタスクにまたがる,長期記憶機能を備えた新しいベンチマークを提案する。
本稿では,ユーザの介入を支援するとともに,メモリ検索とショッピング支援を共同で行う統合フレームワークであるショッピング・コンパニオンを提案する。
論文 参考訳(メタデータ) (2026-03-16T06:07:52Z) - SolBench: A Dataset and Benchmark for Evaluating Functional Correctness in Solidity Code Completion and Repair [51.0686873716938]
コード補完モデルによって生成されたSolidityスマートコントラクトの機能的正しさを評価するベンチマークであるSolBenchを紹介する。
本稿では,スマートコントラクトの機能的正当性を検証するための検索拡張コード修復フレームワークを提案する。
その結果、コード修復と検索技術は、計算コストを削減しつつ、スマートコントラクト完了の正しさを効果的に向上することを示した。
論文 参考訳(メタデータ) (2025-03-03T01:55:20Z) - A Primal-Dual Online Learning Approach for Dynamic Pricing of Sequentially Displayed Complementary Items under Sale Constraints [54.46126953873298]
顧客に対して順次表示される補完アイテムの動的価格設定の問題に対処する。
各項目の価格を個別に最適化するのは効果がないため、補完項目のコヒーレントな価格ポリシーが不可欠である。
実世界のデータからランダムに生成した合成設定を用いて,我々のアプローチを実証的に評価し,制約違反や後悔の観点からその性能を比較した。
論文 参考訳(メタデータ) (2024-07-08T09:55:31Z) - IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce [71.37481473399559]
本稿では,eコマースにおけるLMの購入意図の理解を評価するためのベンチマークであるIntentionQAを提案する。
インテンションQAは、自動化パイプラインを使用して構築された3つの困難レベルにわたる4,360の慎重に計算された問題で構成されている。
人間の評価は、我々のベンチマークの高品質で低い偽陰性率を示す。
論文 参考訳(メタデータ) (2024-06-14T16:51:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。