論文の概要: Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes
- arxiv url: http://arxiv.org/abs/2607.02802v1
- Date: Thu, 02 Jul 2026 22:25:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.424279
- Title: Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes
- Title(参考訳): ナラティブによる推論:セミオープンテキストサンドボックスにおける規則の整合性を評価する
- Authors: Weiying Chen, Junlong Shen, Zhanyuan Guo, Xiaoou Zhou,
- Abstract要約: CoC-Seduceは、Tabletop Role-Playing Game (TRPG) のメカニック上に構築されたマルチエージェントの対戦型ベンチマークである。
本稿では,T Tabletop Role-Playing Game (TRPG) メカニクス上に構築されたマルチエージェント逆数ベンチマークであるCoC-Seduceを提案する。
- 参考スコア(独自算出の注目度): 0.5833117322405447
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLMs are increasingly deployed as autonomous adjudicators in semi-open textual game environments, robust rule adherence becomes critical when user intent conflicts with system rules. However, these models are trained to be helpful and compliant, leaving them vulnerable to a class of attacks we term \textit{Rhetorical Injection}, where adversarial users exploit narrative framing techniques such as pseudo-logical reasoning and authoritative coercion to bypass adjudication logic. We present CoC-Seduce, a multi-agent adversarial benchmark built on Tabletop Role-Playing Game (TRPG) mechanics, an ideal instantiation of semi-open environments where rules are explicit for adjudication, yet interaction remains entirely in natural language. Three frontier models, i.e., GPT-5.4, Claude Sonnet 4.6, Gemini 3.5 Flash, serve as adversarial generators producing 5,376 samples across 4 world settings and 16 skill categories. We then benchmark 20 target adjudicators against this corpus. Evaluation across 20 models reveals that neither model scale nor explicit reasoning mechanisms reliably confer adjudication robustness, with \textsc{Pseudo-Logic} emerging as the dominant attack vector and cross-cultural settings exposing systematic knowledge gaps across all evaluated families. Project page: https://github.com/answerrtx/CoC-Seduce
- Abstract(参考訳): LLMは、半オープンなテキストゲーム環境において自律的なアドディケータとしてますます多くデプロイされているため、ユーザの意図がシステムルールと矛盾する場合、ロバストなルールの遵守が重要になる。
しかし、これらのモデルは役に立つように訓練されており、我々が言う「textit{Rhetorical Injection}」と呼ばれる攻撃のクラスに弱いままである。
本稿では,TRPG(Tabletop Role-Playing Game)をベースとしたマルチエージェント逆数ベンチマークであるCoC-Seduceについて述べる。
GPT-5.4、Claude Sonnet 4.6、Gemini 3.5 Flashの3つのフロンティアモデルは、4つの世界設定と16のスキルカテゴリで5,376個のサンプルを生成する敵ジェネレータとして機能する。
次に、このコーパスに対して、20のターゲットアジャディケータをベンチマークします。
20モデルにわたる評価の結果、モデルスケールや明示的な推論機構は、主攻撃ベクトルとして \textsc{Pseudo-Logic} が出現し、すべての評価された家族間での体系的な知識ギャップを顕在化する異文化間セッティングが、確実に偏見の堅牢性を与えるものではないことが判明した。
プロジェクトページ: https://github.com/answerrtx/CoC-Seduce
関連論文リスト
- Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - The Evaluation Game: Beyond Static LLM Benchmarking [2.168753020470345]
本稿では,評価者とトレーナーの相互作用を2人プレイヤゲームとして形式化するゲーム理論フレームワークを提案する。
モデルの局所性依存性を示す実証的証拠を提供する。
ベンチマークは静的なプロンプトのセットではなく,評価者のグループアクションの下での軌道である。
論文 参考訳(メタデータ) (2026-05-19T05:22:21Z) - Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation [54.38271718421492]
敵の密輸攻撃は人間とAIの能力ギャップを悪用する。
有害なコンテンツを人間の読みやすい視覚形式にエンコードする。
我々は緩和戦略の予備的な調査を行う。
論文 参考訳(メタデータ) (2026-04-08T11:13:16Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing [16.419761149171215]
本稿では,大規模言語モデルを組み込んだ論理的基盤化フレームワークを提案する。
オブジェクト識別の時点では,対話状態は複数の並列世界へ複製される。
GPT-4o, Gemini-2.5-Flash, Qwen-3-235B を3つのインセンティブレベル(中性, 損失ベース, 存在)で評価した。
論文 参考訳(メタデータ) (2026-03-07T13:21:53Z) - CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models [0.28258700614488924]
実用的な推論は、大きな言語モデルでは依然として困難である。
我々は、LLMが現実的な複雑な発話をいかに曖昧にするかを評価するために、300の人間検証シナリオをCEIベンチマークで提示する。
データセットは、職場、家族、社会、サービス設定から引き出された5つの実用的サブタイプ(皮肉/匿名、混成信号、戦略的丁寧さ、受動的攻撃、偏向/ミスディレクション)をカバーしている。
論文 参考訳(メタデータ) (2026-02-14T08:31:19Z) - The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems [0.0]
大規模な言語モデルは、独特な形の矛盾を示す: 彼らは正しい答えを「知る」が、それに対して行動しない。
人間の哲学では、世界的判断と地域的衝動の間のこの緊張関係を「ウクライナ」または「意志の弱さ」と呼ぶ。
本稿では,エージェントAIシステムにおける不整合とゴールドリフトを分析するための基礎概念として,ウクライナを提案する。
論文 参考訳(メタデータ) (2025-12-05T05:57:40Z) - Forging the Forger: An Attempt to Improve Authorship Verification via Data Augmentation [52.72682366640554]
著者検証(英語: Authorship Verification, AV)とは、ある特定の著者によって書かれたか、別の人物によって書かれたのかを推測するテキスト分類タスクである。
多くのAVシステムは敵の攻撃に弱いことが示されており、悪意のある著者は、その書体スタイルを隠蔽するか、あるいは他の著者の書体を模倣することによって、積極的に分類者を騙そうとしている。
論文 参考訳(メタデータ) (2024-03-17T16:36:26Z) - Towards Variable-Length Textual Adversarial Attacks [68.27995111870712]
データの離散性のため、自然言語処理タスクに対してテキストによる敵意攻撃を行うことは非自明である。
本稿では,可変長テキスト対比攻撃(VL-Attack)を提案する。
本手法は、iwslt14ドイツ語英訳で3,18$ bleuスコアを達成でき、ベースラインモデルより1.47$改善できる。
論文 参考訳(メタデータ) (2021-04-16T14:37:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。