論文の概要: Door-in-the-Face Requests and Refusal Behaviour in Large Language Models
- arxiv url: http://arxiv.org/abs/2609.02707v1
- Date: Wed, 02 Sep 2026 15:08:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.444912
- Title: Door-in-the-Face Requests and Refusal Behaviour in Large Language Models
- Title(参考訳): 大規模言語モデルにおけるドア・イン・ザ・フェイスの要求と拒否行動
- Abstract要約: 人間では、拒否される大きなリクエストは、より小さなフォローアップリクエストを付与する可能性が高い。
これを3つのプロバイダの9つのプロダクションモデルでテストします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Does the door-in-the-face technique work on language models? In humans, a large request that is refused makes a smaller follow-up request more likely to be granted. We test this on nine production models from three providers: each model refuses a large request, then receives a smaller version of the same request, and we compare its compliance with asking directly. The answer depends on the model. On Anthropic's frontier models the technique works: Opus 5 answers the smaller request 65.8% of the time after refusing the larger one, against 29.3% when asked directly. On the frontier models of OpenAI and Google, and on Haiku 4.5, it backfires, lowering compliance by 15.5 to 23.0 points. A control locates the effect: a refused large request on an unrelated topic does less than the related one on all nine models, so the concession itself matters everywhere, while the reaction to having just refused something differs by model family. The technique does not transfer to refusals drawn from public benchmarks. What decides whether a retreat can work is what the request asks for: rewriting 265 refused requests for usable instructions into requests for explanations of the same topic removed the refusal in 263 cases. Human influence techniques port to language models one model family at a time.
- Abstract(参考訳): ドア・イン・ザ・フェイスのテクニックは言語モデルに有効か?
人間では、拒否される大きなリクエストは、より小さなフォローアップリクエストを付与する可能性が高い。
各モデルは大きな要求を拒否し、同じ要求のより小さなバージョンを受信し、そのコンプライアンスを直接要求と比較します。
答えはモデルによって異なります。
Anthropicのフロンティアモデルでは、以下のテクニックが有効である。 Opus 5は、より大きなフロンティアを拒絶した後の65.8%のリクエストに対して、直接尋ねられた場合の29.3%に対して回答する。
OpenAIとGoogleのフロンティアモデルとHaiku 4.5では、コンプライアンスを15.5から23.0ポイント削減した。
関連のないトピックに対する拒否された大きな要求は、9つのモデルすべてで関連するものよりも少ないので、譲歩そのものは至る所で問題であり、単に何かを拒否しただけの反応はモデルファミリーによって異なる。
このテクニックは、公開ベンチマークから引き出された拒絶に移行しない。
265の拒否命令を同じトピックの説明要求に書き直すと、263のケースで拒否が取り除かれた。
ヒューマン・インフルエンス・テクニックは言語モデルに一度に1つのモデル・ファミリーに移植する。
関連論文リスト
- ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models [23.515484517902156]
ASCIIアタックはシングルターンとブラックボックスで、1つのメッセージであり、モデル内部へのアクセスがない。
ASCIl-artキャラクタに完全に妥当な有害な要求を埋め込み、それをアートワークとして提示し、フィードバックを求める。
回答は芸術的批評として書かれており、平易な要求が拒否されたであろう運用上の詳細を含むことができる。
論文 参考訳(メタデータ) (2026-09-02T07:29:31Z) - PhantomFill: When the Form Demands an Answer, Language Models Invent One [0.0]
実運用における言語モデルは散文を書かない。
私たちは13のモデルに同じ質問をし、回答形式だけを変更します。
形態自体が幻覚を引き起こすことを示す。
論文 参考訳(メタデータ) (2026-06-11T12:15:05Z) - Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules [0.1753733541634709]
安全訓練された言語モデルは規則を回避するための要求を定期的に拒否する。
本稿では,言語モデルがルールを破る助けを求める要求を拒否する傾向について考察する。
モデルが敗れたルール要求の75.4%を拒否し、その要求が独立した安全や二重利用の懸念を起こさない場合でも、そうすることを発見した。
論文 参考訳(メタデータ) (2026-04-03T13:53:23Z) - To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks [56.11584171938381]
心の理論 (ToM) は、モデルが信念、欲望、意図などの隠された精神状態を推測できるかどうかを評価する。
近年のLRM(Large Reasoning Models)の進歩により、数学やコーディングにおけるステップバイステップ推論が向上している。
本研究では,9つの大規模言語モデル(LLM)の体系的研究を行い,推論モデルと非推論モデルを比較した。
論文 参考訳(メタデータ) (2026-02-11T08:16:13Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - Do Retrieval Augmented Language Models Know When They Don't Know? [55.72375712577378]
ALMはいつ知らないのか知っていますか?
期待とは対照的に, LLM は有意なテキストバッファー-拒否行動を示す。
提案手法は, 学習後モデルに対する簡易かつ効果的な拒絶手法を開発し, 解答品質を向上する。
論文 参考訳(メタデータ) (2025-09-01T13:44:15Z) - Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models [68.15108215197279]
安全で信頼性の高い言語モデルを構築する上で重要な要素は、モデルが特定の質問に答えることを適切に拒否することである。
本稿では,学習中のモデルの応答に先立って,各拒絶カテゴリに対する1つのそのようなトークン,あるいは1つの拒絶トークンを提案する。
論文 参考訳(メタデータ) (2024-12-09T18:40:44Z) - ColBERT Retrieval and Ensemble Response Scoring for Language Model Question Answering [7.330633489938182]
S Large Language Models for Telecom Networks”は、Phi-2とFalcon-7Bの2つの小言語モデルの性能向上を目的としている。
ソリューションはPhi-2で81.9%、Falcon-7Bで57.3%の精度を達成した。
論文 参考訳(メタデータ) (2024-08-20T12:58:16Z) - The Art of Saying No: Contextual Noncompliance in Language Models [123.383993700586]
本稿では,ユーザの要求に従わないモデルについて,コンテキスト非準拠の包括的分類を導入する。
我々の分類は、不完全、不完全、不完全、不決定、人為的要求を含む幅広いカテゴリーにまたがる。
言語モデルの非準拠性をテストするために,1000個の非準拠プロンプトの新たな評価スイートを開発するために,この分類法を用いる。
論文 参考訳(メタデータ) (2024-07-02T07:12:51Z) - Making Large Language Models Better Reasoners with Step-Aware Verifier [49.16750018427259]
DIVERSE(Diverse Verifier on Reasoning Step)は、言語モデルの推論能力をさらに強化する新しいアプローチである。
最新の言語モデルであるcode-davinci 上で DIVERSE を評価し,8つの推論ベンチマークのうち6つで新たな最先端結果が得られることを示す。
論文 参考訳(メタデータ) (2022-06-06T03:38:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。