論文の概要: Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce
- arxiv url: http://arxiv.org/abs/2608.02441v1
- Date: Mon, 03 Aug 2026 16:20:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.702993
- Title: Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce
- Title(参考訳): エージェント商取引の世界:バイブ商取引の可聴かつ検証可能な環境
- Authors: Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu,
- Abstract要約: Vibeコマースは、自然言語で購入や販売の目標を表現し、AIエージェントにタスクを委譲することを可能にする。
本稿では,現在進行中の取引にまたがるエージェント評価環境であるAgenic Commerce World(ACWorld)を紹介する。
ACWorldは、共有トランザクション状態を更新する前にエージェントアクションを検証し、結果のインタラクションを記録し、エージェントの振る舞いを監査可能とし、再現性を評価する。
- 参考スコア(独自算出の注目度): 83.90449137361595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In vibe coding, people describe software in natural language and delegate implementation to AI agents. By analogy, vibe commerce allows people to express buying or selling goals in natural language and delegate the corresponding tasks to agents. Commerce, however, requires independently controlled Buyer and Merchant agents to interact in a shared market while preserving their private objectives and distinct authority. We introduce Agentic Commerce World (ACWorld), an environment for evaluating such agents across ongoing transactions. Through its Vibe Commerce Protocol (VCP), ACWorld validates agent actions before updating shared transaction state and records the resulting interactions, making agent behavior auditable and evaluation reproducible. The ACWorld Benchmark contains a 200-task capability-coverage track and a 60-task large-catalog track that searches 785,022 transactable listings. Across ten models, mean scores range from 65.9% to 85.6% and from 56.1% to 91.4%, respectively. Our analysis shows that process-level evidence is necessary: final state alone can miss evaluated errors, incomplete trajectories still retain useful process signals, and large-catalog tasks expose bottlenecks across stages.
- Abstract(参考訳): ビブコーディングでは、自然言語でソフトウェアを記述し、AIエージェントに実装を委譲する。
類似によって、Vibeコマースは、自然言語で購入や販売の目標を表現し、対応するタスクをエージェントに委譲することを可能にする。
しかし、商業は独立してコントロールされたバイヤーとマーチャント・エージェントに、彼らの個人的目的と異なる権威を保ちながら、共有市場で対話することを要求する。
本稿では,現在進行中の取引にまたがるエージェント評価環境であるAgenic Commerce World(ACWorld)を紹介する。
ACWorld は Vibe Commerce Protocol (VCP) を通じて、共有トランザクション状態を更新する前にエージェントアクションを検証し、結果のインタラクションを記録する。
ACWorld Benchmarkには200タスクの能力カバートラックと785,022のトランザクタブルリストを検索する60タスクの大型カタログトラックが含まれている。
10モデルの平均スコアは65.9%から85.6%、56.1%から91.4%である。
最終状態だけで評価されたエラーを見逃すことができ、不完全な軌道は有用なプロセス信号を保持し、大規模な触媒タスクはステージ全体のボトルネックを露呈する。
関連論文リスト
- Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation [37.16322609017877]
Messierは、30のベンチマーク、714のエージェント、11,891のタスク、74,205の検証を含む957,253レコードの統一コーパスである。
M Messierは公開ベンチマークのスコアを集約し、6つの未表現の専門分野と科学分野にわたる5エージェントの実行を補完する。
論文 参考訳(メタデータ) (2026-07-28T15:50:19Z) - EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent [8.1223119066448]
EComAgentBenchは、実際のAmazon製品とレビューに根ざした62のタスクのベンチマークである。
各タスクは、要求を可視クエリ、ツールゲートプロファイル、スクリプトによる明確化に分散する。
typed, source-tagged rubricsは、各タスクをグレードし、各障害を要件とそのソースに原因付ける。
論文 参考訳(メタデータ) (2026-06-16T09:10:48Z) - CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? [150.84850629123287]
現実的な医療業務のエンドツーエンドの自動化は、現在のベンチマークで不足している3つの機能を強調します。
$-Benchは3つのドメインにわたる長期医療のベンチマークである。
30以上のエージェントハーネス/モデル構成で、最高のエージェントはタスクの28.0%しか解決せず、厳格なパス3では20%をクリアし、単一のセッションですべてのタスクを実行するとパフォーマンスは3.8%に低下する。
論文 参考訳(メタデータ) (2026-05-15T22:34:31Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - ManiAgent: An Agentic Framework for General Robotic Manipulation [30.154478145473792]
汎用操作のためのエージェントアーキテクチャであるManiAgentを紹介する。
複数のエージェントは、環境認識、サブタスク分解、アクション生成を行うためのエージェント間通信を含む。
ManiAgentはSimplerEnvベンチマークで86.8%、現実世界のピック・アンド・プレイスタスクで95.8%の成功率を達成した。
論文 参考訳(メタデータ) (2025-10-13T17:34:48Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。