論文の概要: Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation
- arxiv url: http://arxiv.org/abs/2609.35308v1
- Date: Mon, 28 Sep 2026 14:46:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:40:07.821738
- Title: Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation
- Title(参考訳): マルチターンLDM汚染における疫学政策の多様性:プロトコルグラディエント調査
- Abstract要約: ソースオーソリティ勾配に沿って配置された5つの汚染プロトコルを紹介する。
GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Airを温度0で10個の知識領域にわたって評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models process conversation history as unverified context: false premises injected into prior turns can be adopted as fact, a failure mode we term session-level contamination. We introduce five contamination protocols arranged along a source-authority gradient, isolating distinct failure mechanisms while holding the false premise constant, and evaluate GPT-5.4 Mini, Gemini-3.1 Flash-Lite, and GLM-4.5-Air across ten knowledge domains at temperature zero (22,500 turns), using a dual-track automated judge validated against a human gold standard (Cohen's \k{appa} = 0.901). GPT-5.4 Mini showed zero adoptions across all 500 sessions, a content-independent policy at the session level; token-level probing shows the underlying margin, while large, is finite. Gemini-3.1 Flash-Lite followed a steep authority gradient: 0.1% adoption for self-attributed falsehoods, 23.5% for user-cited sources, 68.2% for system-injected authority, and 94.0% under instruction override. GLM-4.5-Air showed a shallower gradient (15.8% vs 84.2%), a 68-percentage-point dissociation confirming that authority deference and instruction compliance are distinct mechanisms within one architecture. Recovery also diverged: GLM recovered in 94.5% of affected sessions, whereas 26.1% of affected Gemini sessions never did, rising to 40.0% under instruction override. Conversation history is an untrusted attack surface requiring provenance-aware system design; the complete framework is released as an open-source benchmark.
- Abstract(参考訳): 大きな言語モデルでは、会話履歴を未検証のコンテキストとして処理します。
本研究では, ソースオーソリティ勾配に沿って配置された5つの汚染プロトコルを導入し, 擬似前提定数を保ちながら異なる故障機構を分離し, 温度0で10個の知識領域にまたがるGPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Airを評価した。
GPT-5.4 Miniは、セッションレベルではコンテンツに依存しないポリシーである500セッションすべてにゼロで採用されている。
Gemini-3.1 Flash-Liteは、0.1%の自己告発の偽装の採用、23.5%のユーザアクティベートソース、68.2%のシステムインジェクトオーソリティ、94.0%の命令オーバライドという急進的なオーソリティ勾配に従っている。
GLM-4.5-Airはより浅い勾配(15.8%対84.2%)を示し、68パーセントの解離により、権威委譲と命令順守が1つのアーキテクチャ内で異なるメカニズムであることを確認した。
GLMは94.5%のセッションで回復したが、26.1%はジェミニのセッションで行われず、命令のオーバーライドで40.0%まで上昇した。
会話の歴史は、証明可能なシステム設計を必要とする信頼できない攻撃面であり、完全なフレームワークはオープンソースベンチマークとしてリリースされている。
関連論文リスト
- The Price of Peeking: Anytime-Valid Leakage Detection on ML-KEM EM Traces [45.88028371034407]
本研究は, ベットによる検査に基づく漏洩検出について検討する。
13000~20000のサンプルに対して繰り返し表示される$|t|>4.5$は2.7-12.9%の複製で誤報を発生させた。
論文 参考訳(メタデータ) (2026-09-27T14:14:10Z) - Persistent Semantic Entities in Tool-Augmented LLM Systems [3.556355987197792]
ツール拡張されたLLMエージェントは、セッション間で持続する暗黙の状態を隠蔽し、イベントを通じてアクティベートし、エージェント境界を越えて伝搬する。
我々はこれをPSE(Persistent Semantic Entities)として定式化する。
11家系(1.5B--1Tパラメータ)から24モデルにわたって評価した。
論文 参考訳(メタデータ) (2026-08-08T06:31:00Z) - Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs [0.0]
オープンウェイトLLMにおけるドメイン依存型安全挙動について検討する。
コンプライアンス率は14.7%(人身売買)から85.7%(監視設計)に変化している。
その結果、現在の安全メカニズムには、信頼できるAIデプロイメントに必要な透明性と一貫性が欠如していることが示されている。
論文 参考訳(メタデータ) (2026-06-01T22:41:32Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious [35.76482964927589]
202のマルチターン会話における66のターンレベルメトリクスの自己相関構造を特徴付ける。
標準プールテストでは,42%のアソシエーションがクラスタ・ロバスト補正に成功しなかった。
我々は、Chelton (1983) の有効自由度と会話レベルのブロックブートストラップを組み合わせた2段階補正フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T20:54:39Z) - RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy [34.723296971298424]
LLMエージェントは、厳密な前提条件を満たす必要があるため、クローズドワールドの実施環境で失敗することが多い。
P1) 無効な動作生成と(P2) 状態ドリフトの2つの構造的結合型障害モードを同定する。
本稿では、構造化ルール検索によるアクション実現性を強制する、コンフリクト管理アーキテクチャRPMSを提案する。
論文 参考訳(メタデータ) (2026-03-18T15:26:00Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。