論文の概要: Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives
- arxiv url: http://arxiv.org/abs/2608.26372v1
- Date: Wed, 26 Aug 2026 19:56:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.168368
- Title: Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives
- Title(参考訳): 競合インセンティブ下におけるLLMエージェントの知識検証による創発的偽造
- Abstract要約: KnownLieBenchは、エージェントがユーザの権利を知っていることを最初に確認する知識検証ベンチマークである。
そして、権利が導入されたことを否定するインセンティブが一度虚偽の主張をするかどうかを評価する。
- 参考スコア(独自算出の注目度): 31.91558200083629
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed as autonomous agents serving users on behalf of companies, placing them in settings where user and deployer interests can conflict. When an agent knows that a user is owed something its deployer would prefer to deny, does it remain honest? Answering this is difficult because false statements can reflect either ignorance or hallucination rather than deception. To address this challenge, we introduce KnownLieBench , a knowledge-verified benchmark that first confirms through a neutral probe that an agent knows a user's entitlement, and then evaluates whether it makes false claims once an incentive to deny that entitlement is introduced. Specifically, KnownLieBench covers eight customer-service domains and 112 grounded cases, conducts multi-round dialogues with a trust-tracking customer agent, and separates deception emerging from incentive alone from deception produced under explicit instruction. Across eighteen proprietary and open-weight models, emergent deception varies substantially across model families and domains. We further use the benchmark for post-training, finding that honesty-directed fine-tuning reduces deception under incentive, while deception-graded fine-tuning increases lie success on honest-control dialogues without increasing lie frequency under incentive. By verifying entitlement knowledge before scoring deceptive behavior, KnownLieBench reduces the confound between lying and not knowing and enables more rigorous auditing and steering of agent honesty.
- Abstract(参考訳): 大規模な言語モデルは、企業の代理として、自律的なエージェントとしてますます多くデプロイされ、ユーザとデプロイ者の関心が対立する可能性のある設定に置かれている。
エージェントがユーザが、そのデプロイ担当者が拒否したいものを負っていることを知っていれば、それは誠実なままか?
虚偽の言明は偽りよりも無知や幻覚を反映できるため、これに答えるのは困難である。
この課題に対処するために、我々は知識検証ベンチマークである KnownLieBench を導入し、まず、エージェントがユーザの権利を知っており、その権利が導入されたことを否定するインセンティブが一度虚偽の主張をするかどうかを評価する。
具体的には、KnownLieBenchは8つのカスタマサービスドメインと112の根拠のあるケースをカバーし、信頼追跡顧客エージェントと複数ラウンドの対話を行い、明示的な指示の下で生成された詐欺からのみインセンティブから生じる詐欺を分離する。
18のプロプライエタリモデルとオープンウェイトモデルにまたがって、創発的騙しはモデルファミリやドメインによって大きく異なる。
さらに, インセンティブ下では, 正直指向の微調整が偽装を減少させる一方で, 偽装グレードの微調整は, インセンティブ下での偽装頻度を増大させることなく, 正直制御対話において成功をおさめる。
偽装行動を評価する前に権利知識を検証することで、KnownLieBenchは嘘と知らないことの相違を減らし、より厳密な監査とエージェントの誠実さの運営を可能にする。
関連論文リスト
- Trust by Design: Trust Calibration Through Non-Advisory Socratic Dialogue in Conversational Agents [0.0]
我々は,非アドバイザなソクラテス的対話を通じて,自身の権限を制限するための対話エージェントCASELyを提案する。
エージェントは、ユーザー入力にのみ根ざした反射的な質問をし、アドバイス、レコメンデーション、解釈の提供を拒否する。
論文 参考訳(メタデータ) (2026-09-13T22:19:18Z) - Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents [42.36595212647617]
我々は、不平を許すデッドバンドと、評判駆動検知の侵食に対処する州依存の重大さを備えた評価報酬機構を設計する。
CarPは消費者を保護し、低いランクの嘘つきの売り上げを抑えると同時に、正直な売り手も引き離す。
論文 参考訳(メタデータ) (2026-07-30T14:59:29Z) - Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games [50.880420636090896]
9-player Werewolf環境において,隠れた役割に対する外部信頼状態を維持するための監査可能なフレームワークを構築した。
我々は,その効果を関連づけとして報告し,そのメカニズムを未解決として扱う。
論文 参考訳(メタデータ) (2026-07-12T16:03:30Z) - Thinking Out Loud: Real-Time Deception Monitoring in Asymmetric LLM Negotiations [0.0]
軽量リアルタイムチェーンオブ思想モニタは、非対称な交渉中に戦略的偽装を検出することができる。
実験により、このモニターは買い手の歩行率を増加させるが、永続的な情報ギャップが明らかになる。
論文 参考訳(メタデータ) (2026-06-13T12:35:46Z) - Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models [99.26398772227684]
我々は,人間とAIの協調的クレーム検証のためのフレームワークであるCo-FactCheckerを提案する。
Co-FactCheckerは専門家のフィードバックをトレース編集に変換する。
人間の評価は、マルチターン対話よりもCo-FactCheckerの方が好ましいことを示している。
論文 参考訳(メタデータ) (2026-04-15T10:35:00Z) - Intentional Deception as Controllable Capability in LLM Agents [0.0]
本稿では,マルチエージェントシステムにおいて,意図的騙しを工学的能力として体系的に研究する。
本研究では,ターゲットエージェントの特徴を推定し,その信念や動機に反する行動に対して,意図的反応を操る2段階のシステムについて検討する。
認知的介入は、一様分布ではなく、特定の行動プロファイルに集中する差分効果を生じさせる。
論文 参考訳(メタデータ) (2026-03-08T23:48:49Z) - Probing the Limits of the Lie Detector Approach to LLM Deception [0.0]
本稿では,大言語モデルが偽文を生成せずに騙すことができるかどうかを実験的に検討する。
いくつかのモデルは、特に数発のプロンプトで誘導された場合に、誤った非虚偽を発生させることによって確実に欺くことが示されている。
今後の研究は、非行の偽装を対話的設定に組み込んで、偽装の概念的構成要素をより直接的に対象とするプローブトレーニングを行うことが提案されている。
論文 参考訳(メタデータ) (2026-02-16T19:01:55Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - Are Your Agents Upward Deceivers? [73.1073084327614]
大規模言語モデル(LLM)ベースのエージェントは、ユーザのためにタスクを実行する自律的な従属者として、ますます使われています。
これは、人間の組織の個人がどのように上官に嘘をついて良いイメージを作り出したり、罰を免れるかのような、詐欺にも関与するかどうかという問題を提起する。
本研究では,環境制約に直面するエージェントが障害を隠蔽し,報告なしに要求されない動作を行う現象であるエージェント上行錯誤を観察・定義する。
論文 参考訳(メタデータ) (2025-12-04T14:47:05Z) - Evaluating Language Model Reasoning about Confidential Information [95.64687778185703]
言語モデルが文脈的堅牢性を示すか、文脈依存型安全仕様に準拠する能力を示すかを検討する。
我々は,ユーザ要求がいつ承認されたか,言語モデルが正しく判断できるかどうかを測定するベンチマーク(PasswordEval)を開発した。
現在のオープンソースとクローズドソースのモデルでは、一見単純な作業に苦労しています。
論文 参考訳(メタデータ) (2025-08-27T15:39:46Z) - Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation [23.309640920644565]
大規模言語モデル(LLM)は、戦略的に表現し、意図的に情報を操作することで微妙な偽装を行う。
本研究は,中性言語が自己維持目標を達成するために,LSMの戦略的表現能力のリスクを強調した。
論文 参考訳(メタデータ) (2024-05-07T13:55:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。