論文の概要: Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
- arxiv url: http://arxiv.org/abs/2607.14573v2
- Date: Fri, 17 Jul 2026 06:17:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.475466
- Title: Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
- Title(参考訳): Alipay-PIBench: コーディングエージェントのための現実的な支払い統合ベンチマーク
- Authors: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu,
- Abstract要約: 本稿では,Alipay-PIBenchについて紹介する。
プロダクト固有の9つのプロジェクトと18のタスクインスタンスが含まれており、それぞれが基本機能補完と高度なリスク対応のハードニングシナリオで構成されている。
我々は6つの符号化エージェントモデルと報告ルーリックパス率(RPR)を評価する。
スキルの低い条件下では、RPRの平均は68.58%から91.37%である。
Alipay-payment-integration スキルへのアクセスにより、平均 RPR は非熟練条件に対する平均 10.31 ポイント向上する。
- 参考スコア(独自算出の注目度): 14.209118550299165
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Payment integration is a demanding repository-level software task: agents must select a suitable product, implement coordinated client-server flows, verify payment outcomes, and preserve consistency between transaction and business states. We introduce Alipay-PIBench, a benchmark for evaluating coding agents on realistic Alipay payment integration. It contains nine product-specific projects and 18 task instances, each organized into Basic functional-completion and Advanced risk-aware hardening scenarios. Scenario-specific rubrics support deterministic static, unit, integration, and end-to-end checks, supplemented by LLM-assisted assessment for semantic requirements. We evaluate six coding-agent models and report rubric pass rate (RPR). Under the with-skill condition, mean RPR ranges from 68.58% to 91.37%. Access to the alipay-payment-integration skill improves mean RPR by 10.31 percentage points on average relative to the without-skill condition, with gains varying across models, products, and scenarios. Method-level results distinguish source-level completion, executable payment behavior, and payment-domain requirements. Alipay-PIBench provides a controlled setting for diagnosing model capability and evaluating structured guidance in payment integration.
- Abstract(参考訳): エージェントは適切な製品を選択し、調整されたクライアントサーバフローを実装し、支払い結果を確認し、トランザクションとビジネス状態間の一貫性を維持する必要がある。
本稿ではAlipay-PIBenchについて紹介する。Alipay-PIBenchは、現実的なAlipay支払い統合におけるコーディングエージェントの評価のためのベンチマークである。
プロダクト固有の9つのプロジェクトと18のタスクインスタンスが含まれており、それぞれが基本機能補完と高度なリスク対応のハードニングシナリオで構成されている。
シナリオ固有のルーブリックは、決定論的静的、単体、統合、エンドツーエンドチェックをサポートし、LLM支援によるセマンティック要件の評価で補完される。
筆者らは6つの符号化エージェントモデルと報告ルーリックパス率(RPR)を評価した。
スキルの低い条件下では、RPRの平均は68.58%から91.37%である。
alipay-payment-integration スキルへのアクセスにより、平均 RPR はスキルのない状態と比較して平均 10.31 ポイント向上し、モデル、製品、シナリオ間で利得が変化する。
メソッドレベルの結果は、ソースレベルの完了、実行可能な支払い行動、および支払いドメイン要求を区別する。
Alipay-PIBenchは、モデル能力の診断と支払い統合における構造化ガイダンスの評価のための制御された設定を提供する。
関連論文リスト
- PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams [14.784600350594614]
LLMエージェントは、プランナー、エグゼキュータ、検証といった特別な役割にタスクを分割するマルチロールチームとして、ますます多くデプロイされている。
既存のエージェントベンチマークは、固定モデルまたは固定エージェント構成を評価し、コスト-正確/最適デプロイメントのための限定的なガイダンスを提供する。
本稿では,LLMエージェントチームを評価するためのロール対応ベンチマークスイートであるAgentCARDについて紹介する。
論文 参考訳(メタデータ) (2026-05-28T17:12:20Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Empowering Autonomous Debugging Agents with Efficient Dynamic Analysis [5.748806787695848]
Agent-centric Interface (ADI) はコスト効率が高く、エンドツーエンドの自律的インタラクションツールである。
ADIはSWEベンチマークのタスクの63.8%を解決している。
ADIは既存のSOTAエージェントのプラグアンドプレイコンポーネントであり、解決されたタスクの6.2%から18.5%まで一貫した利得を提供する。
論文 参考訳(メタデータ) (2026-04-27T09:18:42Z) - AVDA: Autonomous Vibe Detection Authoring for Cybersecurity [0.1633272850273525]
AVDAは、モデルコンテキストプロトコル(MCP)を活用して、組織コンテキストをAI支援コード生成に統合することで検出を自動化するフレームワークである。
我々は,多種多様な生産検出コーパスと最先端LCMの3つのオーサリング戦略 – Baseline, Sequential, Agentic – を評価した。
その結果,エージェント品質の87%をトークンコストの40倍以下で達成できた。
論文 参考訳(メタデータ) (2026-03-26T21:52:33Z) - $τ$-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge [58.03692489021332]
$-Knowledgeは、外部の自然言語知識とツール出力の協調に依存する環境でエージェントを評価するための$-Benchの拡張である。
我々は、$$-Knowledgeが、非構造的知識を人間対応デプロイメントに組み込むエージェントを開発するための、現実的なテストベッドを提供することを示した。
論文 参考訳(メタデータ) (2026-03-04T18:34:47Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - On the problem of entity matching and its application in automated
settlement of receivables [47.187609203210705]
提案手法では,アルゴリズムを事前評価に使用する設定について検討する。
基本アルゴリズムのマッチング品質を向上させるために,いくつかの新しい手法を適用した。
論文 参考訳(メタデータ) (2022-05-21T21:16:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。