論文の概要: When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation
- arxiv url: http://arxiv.org/abs/2609.01519v1
- Date: Tue, 01 Sep 2026 16:48:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.85631
- Title: When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation
- Title(参考訳): ガードレールが有効に見えた場合: LLMエージェント商業評価における妥当性障害の構築
- Authors: Peiying Zhu, Sidi Chang,
- Abstract要約: ホテル取引のマルチターン購入者のテストベッドで、このリスクを監査します。
最初の実施では、2つの市場ガードレールからの福祉給付が報告された。
売り手インセンティブチェックは非単調であり、利益圧力の増加はデフォルトの売り手プロンプトよりも利益を減少させる。
- 参考スコア(独自算出の注目度): 0.39287497907611874
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive simulations increasingly evaluate policies in markets populated by language-model agents. Their outputs can look economic---prices, profits, consumer surplus, and welfare---without instantiating the behavior named in the claim. We audit this risk in a multi-turn buyer--seller testbed for configurable hotel transactions. An initial implementation reported welfare gains from two marketplace guardrails of +87.4, +35.0, and +28.8 across a Qwen2.5 1.5B--14B ladder. It also gave guarded and unguarded agents different offer schemas and choice procedures. Holding the schema and buyer chooser fixed changes the paired contrasts to +7.2, -13.9, and +23.8. The four largest 14B single-generation effects averaged +229; after three generations per profile-condition, they averaged +37.6 (95% bootstrap interval [-34.2, 109.3]), while generation residuals account for 49.9% of variation in this post-hoc probe. A seller-incentive check is non-monotone: increasing profit pressure produces less profit than the default seller prompt. Scripted positive controls show why this matters. A profit-maximizing seller already attains first-best welfare, so guardrails mostly redistribute and reduce welfare; they create welfare only when the seller is explicitly programmed to force inefficient bundles. We contribute a construct-validity contract separating incentive validity, protocol isolation, stochastic stability, and welfare accounting, and returning INVALID or INCONCLUSIVE before substantive policy claims. In our case, the original estimate is INVALID under protocol isolation, while the controlled study remains INCONCLUSIVE under incentive validity and stochastic stability. The case does not show that guardrails are ineffective; it shows their apparent value is unidentified until the simulated agents and protocol pass these checks.
- Abstract(参考訳): 対話型シミュレーションは、言語モデルエージェントが居住する市場における政策をますます評価している。
彼らの生産物は、価格、利益、消費黒字、福祉のように見えるが、請求書に記載された行動のインスタンス化は行わない。
我々は、このリスクを、設定可能なホテル取引のためのマルチターンバイヤーテストベッドで監査する。最初の実施では、Qwen2.51.5B-14Bのはしごを横切る2つの市場ガードレール+87.4、+35.0、+28.8の福祉効果を報告した。
また、保護されたエージェントと保護されていないエージェントに異なるスキーマと選択手順を提供した。
スキーマとバイヤーセレクタを固定すると、対のコントラストは +7.2, -13.9, +23.8 となる。
4つの最大の14B単世代効果は+229であり、プロファイル条件当たりの3世代後、平均は+37.6(95%ブートストラップ間隔 [-34.2, 109.3])であり、生成残差はこのポストホックプローブの49.9%である。
売り手インセンティブチェックは非単調であり、利益圧力の増加はデフォルトの売り手プロンプトよりも利益を減少させる。
スクリプトによる肯定的なコントロールは、これがなぜ重要なのかを示している。
利益を最大化する販売者は、既に最優先の福祉を達成しており、ガードレールは、主に再分配し、福祉を減らす。
我々は,インセンティブ妥当性,プロトコル分離,確率安定,福祉会計を分離し,実質的な政策主張の前にINVALIDあるいはINCONCLUSIVEを返却する構成正当性契約を提出する。
本例では,プロトコル分離下でのINVALIDが推定され,制御された研究はインセンティブ妥当性と確率安定性の下でINCONCLUSIVEのままである。
このケースはガードレールが有効でないことを示すものではなく、シミュレートされたエージェントとプロトコルがチェックをパスするまで、その明らかな値が不明であることを示している。
関連論文リスト
- Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence [0.0]
1つのモデルの2つの例は、2つのエージェントのハンドオフにおいて、ミッションの90.0%で共失敗する。
異なるモデルの置換は、6つのコントラストのうち6つのコントラストの関連を減少させる。
論文 参考訳(メタデータ) (2026-08-13T07:25:05Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games [50.880420636090896]
9-player Werewolf環境において,隠れた役割に対する外部信頼状態を維持するための監査可能なフレームワークを構築した。
我々は,その効果を関連づけとして報告し,そのメカニズムを未解決として扱う。
論文 参考訳(メタデータ) (2026-07-12T16:03:30Z) - Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis [2.7092559671391]
OpenScholarやPaperQA2のようなエージェントLLMシステムは科学論文を読み、引用された回答を返す。
どちらもそのチェックの信頼性を監査しません。
私たちはそれが信頼できないこと、そしてこれが重要であることを示します。
本報告では,ゴールドアンコール評価プロトコルとデプロイ可能なガードについて述べる。
論文 参考訳(メタデータ) (2026-07-10T02:05:17Z) - PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations [0.18275108630751835]
PrefBenchは、暗黙の推論パーソナライズされた価格交渉のためのシミュレータベースのベンチマークである。
提案するPrefBenchは,隠れた買い手選好下での価格-エージェント行動を評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-19T04:10:05Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Neither Consent nor Property: A Policy Lab for Data Law [4.588656982178105]
この論文は、AI経済における不透明なデータ市場を初めて実証的に正当化するものである。
パイプラインは、市場の隠れたロジックを抽出するために、数年のフィールドワークから始まります。
現実に反し、観察された貿易パターンを再現する。
論文 参考訳(メタデータ) (2025-10-30T17:27:03Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。