論文の概要: 402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments
- arxiv url: http://arxiv.org/abs/2608.01341v1
- Date: Sun, 02 Aug 2026 16:04:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.169106
- Title: 402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments
- Title(参考訳): 402Pilot: 自律エージェントマイクロペイメントのためのx402決定層
- Abstract要約: 本稿では,自律エージェントと支払い実行の間のプロトコルに依存しない買い手側決定層である402Pilotを提案する。
我々は、PPA-DCTという、支払いを意識した文脈型Thompson-Samplingポリシーでインスタンス化する。
Pa-DCTは、非オラクル政策の中で最強の固定壁適応トレードオフを達成する。
- 参考スコア(独自算出の注目度): 21.628918058328793
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Programmable-payment protocols such as x402 enable per-request micropayments, but they do not determine which payable service an autonomous agent should buy under a finite wallet. We formulate this buyer-side problem as agent-native payment decision-making: contextual provider selection under wallet pressure, chosen-only paid feedback, and changing market conditions. We propose 402Pilot, a protocol-agnostic buyer-side decision layer between autonomous agents and payment execution that implements purchasing policies for selecting among payable providers. We instantiate it with PA-DCT, a payment-aware discounted contextual Thompson-sampling policy that adapts purchasing decisions under wallet pressure while learning from post-payment feedback. To evaluate buyer-side payment policies, we introduce 402Pilot-Bench, a frozen-replay benchmark spanning 823 tasks, five heterogeneous provider pipelines, and three market regimes, each evaluated over 30 paired seeds. PA-DCT achieves the strongest fixed-wallet adaptive trade-off among non-oracle policies: it maintains competitive service quality while spending only 39 to 43 percent of the wallet and reallocates spending as market conditions change. It attains the best non-oracle PA-gap/T under the price shock and the best mean and worst-case ranks across the nine scenario-metric combinations of quality, ROI, and PA-gap/T. Comparisons with learning baselines and component ablations further support the effectiveness and design of the proposed decision policy. These results suggest that programmable payment must be complemented by buyer-side decision-making capable of learning service value and adapting purchasing decisions accordingly.
- Abstract(参考訳): x402のようなプログラマブルペイメントプロトコルは、リクエスト毎のマイクロペイメントを可能にするが、自律エージェントが有限のウォレットの下で購入すべき有償サービスを決定するものではない。
我々は、この買い手側の問題をエージェントネイティブな支払い決定として定式化し、ウォレットプレッシャーによるコンテキストプロバイダの選択、選択のみの有償フィードバック、市場条件の変更などを行う。
本稿では,402Pilotを提案する。402Pilotは,自律エージェントと支払い実行の間のプロトコルに依存しない買い手側決定層であり,支払い可能なプロバイダを選択するための購入ポリシーを実装している。
我々は、支払い後のフィードバックから学びながら、財布圧力下での購入決定に適応する、支払い対応のコンテキストサンプリングポリシーであるPA-DCTをインスタンス化する。
402Pilot-Benchは823のタスクにまたがる凍結再生ベンチマークであり、5つのヘテロジニアス・プロバイダ・パイプラインと3つのマーケット・レジームを持ち、それぞれが30組以上のシードを評価している。
PA-DCTは、競争力のあるサービス品質を維持しつつ、ウォレットの39~43パーセントだけを消費し、市場の状況が変わるにつれて支出を再配分するという、非オーラル政策の中で、最も強力な固定壁適応トレードオフを達成している。
価格ショック下では最高の非オーラルなPA-gap/Tを達成し、品質、ROI、PA-gap/Tの9つのシナリオメトリックの組み合わせの中で、最高の平均と最悪の格付けを達成している。
学習ベースラインとコンポーネントの短縮との比較は、提案した意思決定方針の有効性と設計をさらに支援する。
これらの結果は、プログラム可能な支払いは、サービス価値を学習し、それに応じて購入決定を適応できる買い手側の意思決定によって補完されなければならないことを示唆している。
関連論文リスト
- CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach [0.0509780930114934]
本稿では,ニュースおよび歴史的市場データを用いて,Bitcoin(BTC)とTesla(TSLA)の1日あたりの長期・フラット・短距離取引決定を必要とするCLEF 2026 FinMMEval Labのタスク3について述べる。
離散的なマルコフ決定過程として問題を定式化し、政策グラディエント(PG)、近似政策最適化(PPO)、深部Qラーニング(DQL)、深部決定主義政策グラディエント(PGPG)の4つの深部強化学習アルゴリズムを比較した。
BTCの場合、DDPGは1.58%のプラスリターンを達成し、買いと持ち株は-34.27%減少する
論文 参考訳(メタデータ) (2026-07-17T15:01:35Z) - Strategic Buying Agents [5.678371127103685]
Agentic AIは、オンラインショッピングを検索からデリゲートされた購入へとシフトしている。
本研究では,有限のショッピングウィンドウ内でいつ購入するかを判断しなければならない戦略的購入エージェントの設計について検討する。
我々はこの問題を定常、ベイジアン、ロバストという3つの情報体制で定式化する。
論文 参考訳(メタデータ) (2026-07-06T06:24:17Z) - Semantic State Abstraction Interfaces for LLM-Augmented Portfolio Decisions: Multi-Axis News Decomposition and RL Diagnostics [0.0]
本稿では,スパースな非構造化テキストを監査可能な$K$にマッピングするための方法論テンプレートであるSemantic State Abstraction Interfaces (SSAI)を紹介する。
我々の貢献はフレームワークとその評価プロトコルであり、SSAIがより高密度な代替品よりも優れているという主張ではない。
我々は,SSAIをスパーステキスト決定システムのための解釈可能性・性能診断・再利用可能なプロトコルとして位置づける。
論文 参考訳(メタデータ) (2026-05-07T11:37:40Z) - Best-Effort Policies for Robust Markov Decision Processes [69.60742680559788]
我々は、ロバスト MDP (RMDPs) として知られる遷移確率の組によるマルコフ決定過程(MDPs)の共通一般化について研究する。
このような政策を最適な堅牢なベストプラクティス(ORBE)政策と呼ぶ。
我々はORBEポリシーが常に存在することを証明し、その構造を特徴付け、標準的なロバストな値反復よりも小さなオーバヘッドで計算するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-08-11T09:18:34Z) - No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need! [56.80767500991973]
アクション選択の前に報酬とコストが観測される$(i)$オンラインリソース割当と、アクション選択後、完全なフィードバックや盗賊フィードバックの下で、リソース制限付きオンライン学習である$(ii)$オンラインリソース割当に焦点を当てた。
報酬とコスト分布が時間とともに任意に変化する場合、これらの設定でサブ線形後悔を達成することは不可能であることが知られている。
我々は、支出計画に従う基準線に対する半線形後悔を実現する一般的な(基本的)二重的手法を設計し、また、支出計画が予算のバランスの取れた配分を保証すると、アルゴリズムの性能が向上する。
論文 参考訳(メタデータ) (2025-06-16T08:42:31Z) - Simulation-Based Optimistic Policy Iteration For Multi-Agent MDPs with Kullback-Leibler Control Cost [3.9052860539161918]
本稿では,マルコフ決定過程(MDP)における定常最適ポリシー学習のためのエージェントベース楽観的ポリシー(OPI)手法を提案する。
提案手法は, 強欲政策改善段階とm段階時間差(TD)政策評価段階から構成される。
我々は,OPIスキームの同期(入出力状態空間の評価)と非同期(一様にサンプリングされたサブステートの集合)の両バージョンが,最適値関数と最適共同ポリシーのロールアウトに収束することを示した。
論文 参考訳(メタデータ) (2024-10-19T17:00:23Z) - Contextual Dynamic Pricing with Strategic Buyers [93.97401997137564]
戦略的買い手によるコンテキスト動的価格問題について検討する。
売り手は買い手の真の特徴を観察せず、買い手の戦略行動に応じて操作された特徴を観察する。
本稿では,販売者の累積収益を最大化するために,購入者の戦略的行動をオンライン学習に取り入れた戦略的動的価格政策を提案する。
論文 参考訳(メタデータ) (2023-07-08T23:06:42Z) - Probably Anytime-Safe Stochastic Combinatorial Semi-Bandits [81.60136088841948]
本稿では,時間軸における後悔を最小限に抑えるアルゴリズムを提案する。
提案アルゴリズムは,レコメンデーションシステムや交通機関などの分野に適用可能である。
論文 参考訳(メタデータ) (2023-01-31T03:49:00Z) - Fairer LP-based Online Allocation [13.478067250930101]
本稿では,リニアプログラム(LP)に基づくオンラインリソース割り当て問題について考察する。
内部点LPソルバを用いて不公平な資源支出を動的に検出するフェアアルゴリズムを提案する。
提案手法は最適化インスタンスの制約としてフェアネス要件を定式化せず,アルゴリズム設計の観点からこの問題に対処する。
論文 参考訳(メタデータ) (2021-10-27T17:45:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。