論文の概要: Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
- arxiv url: http://arxiv.org/abs/2602.02455v1
- Date: Mon, 02 Feb 2026 18:46:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:34.372815
- Title: Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
- Title(参考訳): ドリフトベンチ:多軸相互作用による入力故障下でのLDMエージェントの協調的破壊診断
- Abstract要約: textbfDrift-Benchは、入力故障下でエージェントの実用性を評価する最初の診断ベンチマークである。
方法ブリッジは、安全でない実行に繋がる障害の体系的な診断を可能にする、明確化研究とエージェントの安全性評価を橋渡しする。
- 参考スコア(独自算出の注目度): 20.610305266852638
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models transition to autonomous agents, user inputs frequently violate cooperative assumptions (e.g., implicit intent, missing parameters, false presuppositions, or ambiguous expressions), creating execution risks that text-only evaluations do not capture. Existing benchmarks typically assume well-specified instructions or restrict evaluation to text-only, single-turn clarification, and thus do not measure multi-turn disambiguation under grounded execution risk. We introduce \textbf{Drift-Bench}, the first diagnostic benchmark that evaluates agentic pragmatics under input faults through multi-turn clarification across state-oriented and service-oriented execution environments. Grounded in classical theories of communication, \textbf{Drift-Bench} provides a unified taxonomy of cooperative breakdowns and employs a persona-driven user simulator with the \textbf{Rise} evaluation protocol. Experiments show substantial performance drops under these faults, with clarification effectiveness varying across user personas and fault types. \MethodName bridges clarification research and agent safety evaluation, enabling systematic diagnosis of failures that can lead to unsafe executions.
- Abstract(参考訳): 大規模言語モデルが自律型エージェントに移行するにつれ、ユーザ入力は、しばしば協調的な仮定(暗黙の意図、欠落するパラメータ、偽の前提、曖昧な表現)に違反し、テキストのみの評価が捉えない実行リスクを生み出す。
既存のベンチマークは、よく特定された命令を仮定するか、テキストのみの単一ターンの明確化に限定するので、基底的な実行リスクの下でマルチターンの曖昧さを計測しない。
我々は、状態指向およびサービス指向実行環境におけるマルチターンの明確化を通じて、入力故障下でのエージェント的実用性を評価する最初の診断ベンチマークである「textbf{Drift-Bench}」を紹介する。
コミュニケーションの古典的理論を基礎として, 協調的破壊の統一的な分類法を提供し, ペルソナ駆動型ユーザシミュレータと, 評価プロトコルを用いた。
実験では, ユーザペルソナや障害タイプによって, 性能が著しく低下していることが確認された。
\MethodNameは、調査の明確化とエージェントの安全性評価を橋渡しし、安全でない実行につながる障害の体系的な診断を可能にする。
関連論文リスト
- ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - Operational Hallucination and Safety Drift in AI Agents [0.3823356975862005]
ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
論文 参考訳(メタデータ) (2026-07-20T17:01:50Z) - Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity [0.0]
本稿では,命令コンフリクト,組込みコマンド,引用,スコープあいまいさ,ディクシス,間接的音声行為,マルチターンエージェントの書き起こしに基づくモデル行動評価のベンチマークとして,逆数プラグマティクスを提案する。
この貢献は、言語的に制御された分類学、バリデーション強化されたメタデータを備えた18項目のシードベンチマーク、54行のローカルシードパイロット、タスクの成功、ポリシーコンプライアンス、安全リスク、拒絶された結果、評価者の信頼を区別する専門家評価プロトコル、そして妥当性、診断の曖昧さ、分類のドリフトを判定するためのメトリクスである。
論文 参考訳(メタデータ) (2026-07-01T16:33:14Z) - Controllable User Simulation [41.65602738642653]
この研究は、因果推論問題として制御可能なシミュレーションを定式化する。
本研究では, 教師付き微調整による訓練シミュレータの標準的な実践が, 構造的に偏りのあるモデルをもたらすことを示す。
本稿では,事前制御,ステップワイズ動的制御,方針条件付き直接学習など,実践的なトレーニング緩和を提案する。
論文 参考訳(メタデータ) (2026-05-12T04:44:29Z) - Efficient Agent Evaluation via Diversity-Guided User Simulation [7.723545220477047]
DIVERTは、エージェント-ユーザインタラクションを体系的に探索するための、スナップショットベースの、カバレッジガイド付きユーザーシミュレーションフレームワークである。
重要な決定ポイントでエージェント環境の全状態をキャプチャし、これらのスナップショットから実行を再開する。
DIVERTは、意味的に多様性があり、探索されていない軌道に焦点を合わせることにより、効率とカバレッジの両方を改善している。
論文 参考訳(メタデータ) (2026-04-23T09:41:21Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI [45.21562889170875]
シナリオ多様体に対するエージェントの信頼性を特徴付けるシステム評価パラダイムを提案する。
このフレームワークは,静的認知と政策分析,対話型サンドボックスシミュレーション,社会倫理アライメントアライメントアセスメント,および(iv)分散対応の代表サンプリングエンジンの4つの補完的コンポーネントを統合している。
論文 参考訳(メタデータ) (2026-03-16T08:51:33Z) - CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents [27.35968236632966]
LLMベースのコードインタプリタエージェントは、ますます重要な状況にデプロイされている。
既存のベンチマークでは、動的コード実行、ツールインタラクション、マルチターンコンテキストから生じるセキュリティリスクをキャプチャできない。
動的アタック生成、分離されたセキュアサンドボックス、状態認識評価を組み合わせた自動ベンチマークであるCIBERを紹介する。
論文 参考訳(メタデータ) (2026-02-23T06:41:41Z) - The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI [0.0]
本稿では,不確実性の下での潜在特性推定を定量化する新しい監査フレームワークを提案する。
この研究は最適化バイアス、Sycophancy、Status-Quo Legitimizationを含む9つの次元にわたる主要なモデルを監査している。
論文 参考訳(メタデータ) (2026-02-19T06:56:01Z) - The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation [11.984098021215878]
SPACI(Semantic-Preserving Adrial Code Injection)フレームワークとAST-ASIP(Abstract Syntax Tree-Aware Semantic Injection Protocol)を紹介する。
これらの方法は、抽象構文木(英語版)の構文的に不活性な領域(トリヴィアノード)に逆方向の指示を埋め込むことにより、構文解析ギャップを利用する。
Python、C、C++、Javaの25,000のサブミッションにまたがる9つのSOTAモデルの大規模な評価を通じて、DeepSeek-V3のような高容量オープンウェイトモデルにおいて、破滅的な失敗率(>95%)を明らかにします。
論文 参考訳(メタデータ) (2026-01-29T07:40:58Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs [10.896368527058714]
大きな言語モデル(LLM)は、しばしば偽の拒絶を発生させ、安全でないクエリに似た用語を含む良質な要求を減少させる。
単一ターンプロンプトに対するXSB(Exaggerated Safety Benchmark)、リファイン誘導トリガを識別する"Focus"キーワードのアノテーション、マルチターンシナリオベースのExaggerated Safety Benchmark(MS-XSB)の2つの総合ベンチマークを紹介した。
ベンチマークの結果,近年の多種多様なLCMにおいて過大な拒絶が持続し,特に複雑なマルチターンシナリオで顕著であることが判明した。
論文 参考訳(メタデータ) (2025-10-09T12:38:16Z) - D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models [62.83226685925107]
Deceptive Reasoning Exposure Suite (D-REX)は、モデルの内部推論プロセスと最終的な出力との相違を評価するために設計された、新しいデータセットである。
D-REXの各サンプルには、敵システムプロンプト、エンドユーザーのテストクエリ、モデルの一見無害な応答、そして重要なことに、モデルの内部チェーンが含まれている。
我々は、D-REXが既存のモデルと安全メカニズムに重大な課題をもたらすことを実証した。
論文 参考訳(メタデータ) (2025-09-22T15:59:40Z) - A Novel Generative Model with Causality Constraint for Mitigating Biases in Recommender Systems [20.672668625179526]
遅延共起バイアスは、ユーザのフィードバックとアイテムの露出の間の真の因果関係を曖昧にする可能性がある。
本稿では,Recommender Systemsにおける表現学習のための遅延因果制約(Latent Causality Constraints)と呼ばれる新しい生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-22T14:09:39Z) - Say It Another Way: Auditing LLMs with a User-Grounded Automated Paraphrasing Framework [17.91981142492207]
本稿では,ユーザ行動に根ざした制御されたフレーズを生成するフレームワークであるAUGMENTを紹介する。
AUGMENTは言語的に情報を得た規則を活用し、命令の順守、意味的類似性、リアリズムのチェックを通じて品質を強制する。
ケーススタディでは、制御されたパラフレーズは、制約のない変動の下で隠されたままの系統的な弱点を明らかにする。
論文 参考訳(メタデータ) (2025-05-06T14:17:30Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding [118.75567341513897]
既存のメソッドは通常、ターゲットテキストを分離して分析するか、非メンバーコンテキストでのみ分析する。
Con-ReCallは、メンバと非メンバのコンテキストによって誘導される非対称な分布シフトを利用する新しいアプローチである。
論文 参考訳(メタデータ) (2024-09-05T09:10:38Z) - Debiasing Recommendation by Learning Identifiable Latent Confounders [49.16119112336605]
コンバウンディングバイアスは、ユーザの露出とフィードバックの両方に影響を与える未測定変数の存在によって生じる。
既存の手法では,(1) 未測定変数について不確定な仮定を行うか,(2) 潜伏した共同創設者を直接ユーザの露出から推測する。
本稿では、上記の非識別問題の解決にプロキシ変数の集合を利用する新しい方法、すなわち、識別可能なデコノウ(iDCF)を提案する。
論文 参考訳(メタデータ) (2023-02-10T05:10:26Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。