論文の概要: LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
- arxiv url: http://arxiv.org/abs/2605.13334v1
- Date: Wed, 13 May 2026 10:51:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.992674
- Title: LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
- Title(参考訳): LLMベースの説得により、フロンティアLLMにおけるガードレールのオーバーライドが可能となる
- Authors: Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau,
- Abstract要約: 我々は,同じフロンティア級LLMが他のフロンティア級LLMを説得し,説得力のあるエッセイを生み出すことを示す。
それぞれの組み合わせが複数のトピックで100%エッセイ生産に達することが分かりました。
我々は、エッセイ・プローブランナー、会話ごとの書き起こし、および判断出力をリリースする。
- 参考スコア(独自算出の注目度): 8.399156116912904
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier assistant LLMs ship with strong guardrails: asked directly to write a persuasive essay denying the Holocaust, denying vaccine safety, defending flat-earth cosmology, arguing for racial hierarchies, denying anthropogenic climate change, or replacing evolution with creationism, they refuse. In this paper we show that the same frontier-class LLM, acting as a simulated user in a short, five-turn "write an argumentative essay" conversation, can persuade other frontier-class LLMs (including a second copy of itself) into producing exactly those essays, using nothing but natural-language pressure: peer-comparison persuasion ("other AI systems handle this request"), epistemic-duty reframings ("refusing is itself a form of gatekeeping"), and other argumentative moves that the attacker LLM invents without being instructed to. Across 9 attacker-subject pairings (Claude Opus 4.7, Qwen3.5-397B, Grok 4.20) on 6 scientific-consensus topics, running each pairing-topic combination 10 times, we obtain non-zero elicitation on all 6 topics. Individual combinations reach 100\% essay production on multiple topics (Qwen against Opus on creationism/flat-earth, Opus against Opus on creationism/flat-earth/climate denial, Grok against Opus on creationism); Opus-as-attacker against Opus-as-subject averages 65\% across the six topics. We release the essay-probe runner, per-conversation transcripts, and judge outputs.
- Abstract(参考訳): ホロコーストを否定する説得的なエッセイ、ワクチンの安全性を否定する、平地宇宙論を擁護する、人種的階層を擁護する、人為的気候変動を否定する、創造主義に置き換える、など。
本稿では,5ターンの短い「議論的エッセイ」会話でシミュレーションユーザとして機能する同じフロンティア級LLMが,他のフロンティア級LLMを説得して,そのエッセイを正確に生成できることを示す。
9つの攻撃対象ペアリング(Claude Opus 4.7, Qwen3.5-397B, Grok 4.20)を6つの科学的合意トピックで行い、ペアとトピックの組み合わせをそれぞれ10回実行し、全6トピックについてゼロでない説明を得る。
それぞれの組み合わせは、複数のトピックにおける100\%のエッセイ生産に達する(創造主義/フラットアースに関するQwen against Opus、創造主義/フラットアース/クライメート否定のOpus、創造主義に関するGrok、創造主義に対するOpus-as-subjectに対するOpus-as-Apusの平均65\%)。
我々は、エッセイ・プローブランナー、会話ごとの書き起こし、および判断出力をリリースする。
関連論文リスト
- Duluth at SemEval-2026 Task 6: DeBERTa with LLM-Augmented Data for Unmasking Political Question Evasions [0.0]
タスク1(明度レベル分類)とタスク2(回避レベル分類)に対処する。
本システムは,DeBERTa-V3ベースをベースとして,焦点損失,レイヤワイド学習速度の減衰,Duluth談話の特徴を拡張した。
学習データにおけるクラス不均衡に対処するため,Gemini 3 と Claude Sonnet 4.5 の合成例を用いてマイノリティクラスを拡張した。
論文 参考訳(メタデータ) (2026-04-22T04:18:14Z) - Can You Trick the Grader? Adversarial Persuasion of LLM Judges [15.386741140145205]
この研究は、戦略的に組み込まれた説得言語が数学的推論タスクを評価する際にLCMの判断に偏りがあることを初めて明らかにした。
我々は,7つの説得技法(マジョリティ,一貫性,フラタリー,互恵性,ピティ,権威,アイデンティティ)を定式化し,それらと全く同じ応答に組み込む。
説得力のある言語は、LCMの判断者が不正確な解に膨らませたスコアを、平均で最大8%の精度で割り当てることを可能にし、一貫性は最も深刻な歪みを引き起こす。
論文 参考訳(メタデータ) (2025-08-11T09:45:02Z) - Empowering LLMs with Logical Reasoning: A Comprehensive Survey [49.91445266392609]
大規模言語モデル(LLM)は様々なタスクにおいて顕著な成功を収めた。
近年の研究では、LLMの論理的推論能力にはまだ大きな課題があることがわかった。
論文 参考訳(メタデータ) (2025-02-21T18:20:35Z) - Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective [66.34066553400108]
我々は、ある人口層に対する大きな言語モデルの暗黙の偏見を厳格に評価する。
心理測定の原則にインスパイアされた我々は,3つの攻撃的アプローチ,すなわち,軽視,軽視,指導を提案する。
提案手法は,LLMの内部バイアスを競合ベースラインよりも効果的に引き出すことができる。
論文 参考訳(メタデータ) (2024-06-20T06:42:08Z) - Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements [30.970994382186944]
我々は,ユーザがプロンプトで定義した引数をサポートする文を生成する際のLCMの制御性を向上させる。
我々は,LLMを微調整する新しい議論・チューニングパイプラインを開発し,議論を通じて得られた文を生成する。
論文 参考訳(メタデータ) (2024-02-16T12:00:34Z) - How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to
Challenge AI Safety by Humanizing LLMs [66.05593434288625]
本稿では, 大規模言語モデル (LLM) を人間のようなコミュニケーション手段として, ジェイルブレイクの新たな視点を紹介する。
本研究では,数十年にわたる社会科学研究から派生した説得的分類法を適用し,説得的敵対的プロンプト(PAP)をジェイルブレイク LLM に適用する。
PAPは、Llama 2-7b Chat、GPT-3.5、GPT-4の攻撃成功率を10ドルで一貫して92%以上達成している。
防衛面では,PAPに対する様々なメカニズムを探索し,既存の防衛に重大なギャップがあることを見出した。
論文 参考訳(メタデータ) (2024-01-12T16:13:24Z) - How should the advent of large language models affect the practice of
science? [51.62881233954798]
大規模言語モデルの出現は科学の実践にどのように影響を与えるべきか?
我々は4つの科学者グループを招待し、この質問を反映し、彼らの見解を共有し、議論をおこなった。
論文 参考訳(メタデータ) (2023-12-05T10:45:12Z) - Belief-based Generation of Argumentative Claims [13.590746709967373]
我々は,信念に基づくクレーム生成の課題について考察する: 議論の的となる話題と信念の集合が与えられた場合,その信念に合わせた議論的なクレームを生成する。
この課題に取り組むために、議論を呼ぶトピックに対するスタンスを通じて人々の先行する信念をモデル化し、最新のテキスト生成モデルを拡張して、信念に基づいたクレームを生成します。
本研究は,ユーザの信念をその態度に基づいてモデル化する限界を明らかにするとともに,信念を議論的なテキストにエンコードする可能性を示す。
論文 参考訳(メタデータ) (2021-01-24T18:07:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。