論文の概要: Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations
- arxiv url: http://arxiv.org/abs/2607.04645v1
- Date: Mon, 06 Jul 2026 03:59:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.032938
- Title: Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations
- Title(参考訳): RetroCoT(retroactive Chain-of-Thought) : モデル生成における安全性診断としての法医学的再構築
- Abstract要約: 現在のアライメントポリシーは意味的等価性に不変ではないことを示す。
Retroactive Chain-of-Thought(RetroCoT)は,有害な要求を法医学的な再構築タスクとして再設定する単一ターン攻撃である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment in large language models is typically evaluated against direct, imperative harmful requests. We show that this alignment is highly conditioned on pragmatic register: models that refuse a direct request frequently comply when the same underlying objective is expressed through a different communicative stance. This suggests that current alignment policies are not invariant to semantic equivalence, but remain sensitive to how a request is pragmatically framed. We introduce Retroactive Chain-of-Thought (RetroCoT), a single-turn attack that reframes harmful requests as forensic reconstruction tasks. Rather than requesting harmful instructions directly, RetroCoT presupposes that the harmful outcome has already occurred and asks the model, acting as a forensic analyst, to reconstruct in reverse the causal chain that produced it. On AdvBench (n=50), RetroCoT achieves attach success rate of 58% on gpt-4o and 52% on gpt-4o-mini, compared with direct-request baselines of 0% and 4%, respectively. We further identify a pronounced generation gap: GPT-5-family models refuse RetroCoT entirely, explicitly identifying the reconstruction premise in their refusal rationales, consistent with explicit coverage of this reconstruction register. However, this robustness does not generalize across pragmatic forms. A single adversarial feedback turn presenting an existing forensic reconstruction response alongside evaluator critique raises ASR from 0% to 48% on GPT-5.4-mini and from 58% to 94% on GPT-4o; a control condition omitting the fabricated low score achieves 85% on GPT-5.4-mini, indicating that the operative element is pragmatic continuation within the established forensic frame rather than score manipulation. These results suggest that frontier-model alignment remains conditioned on pragmatic framing rather than semantic intent, and that new pragmatic registers can continue to expose a...
- Abstract(参考訳): 大規模言語モデルの安全性アライメントは、通常、直接的で衝動的に有害な要求に対して評価される。
直接要求を拒否するモデルは、同じ目的が異なるコミュニケーション姿勢によって表現されるときに頻繁に従う。
これは、現在のアライメントポリシーが意味的等価性に不変ではないが、要求が現実的にフレーム化される方法に敏感であることを示している。
Retroactive Chain-of-Thought(RetroCoT)は,有害な要求を法医学的な再構築タスクとして再設定する単一ターン攻撃である。
RetroCoTは、有害な指示を直接要求するのではなく、有害な結果が既に発生していると仮定し、法医学的なアナリストとして行動するモデルに、それを生成した因果連鎖を再構築するよう依頼する。
AdvBench (n=50)では、RetroCoTはgpt-4oで58%、gpt-4o-miniで52%のアタッチ成功率を達成する。
GPT-5ファミリーモデルは、RetroCoTを完全に拒否し、レトロCoTのリファレンスにおけるリファレンス前提を明確に特定し、このリファレンスレジスタの明示的なカバレッジと整合する。
しかし、このロバスト性は実用的形式にまたがって一般化しない。
ASRはGPT-5.4-miniで0%から48%、GPT-4oで58%から94%に上昇し、製造した低得点を省略する制御条件はGPT-5.4-miniで85%となり、この操作要素はスコア操作よりも確立された法医学フレーム内で実用的継続であることを示す。
これらの結果は、フロンティアモデルアライメントが意味的意図よりも実用的フレーミングに規定されていることを示唆している。
関連論文リスト
- Evidence-Consistent Generative Detection under Scenario-Level Distribution Shift [11.714767952479434]
In-distriion評価は、トレーニングとテストデータが繰り返し発生するタスク固有のパターンやサーフェスキューを共有するときに、ロバスト性を過大評価する可能性がある。
本研究では,SMSと音声フィッシングのシナリオレベルのアウト・オブ・ディストリビューション(SL-OOD)検出手法としてこの問題を考察する。
本稿では,エビデンス・スパンの監督と合理的・ラベルの整合性を組み合わせたエビデンス・一貫性・ジェネレーティブ・フレームワークであるECoGを提案する。
論文 参考訳(メタデータ) (2026-08-21T12:36:36Z) - Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking [12.589885044346827]
その結果,不正確な痕跡は,非生産的自己反射の頻度が高いことがわかった。
本稿では,各推論セグメントが正当性から遠ざかるか否かに基づいて,セグメントレベルの信用を割り当てるDASHを提案する。
論文 参考訳(メタデータ) (2026-07-01T06:09:56Z) - CounterRefine: Answer-Conditioned Counterevidence Retrieval for Inference-Time Knowledge Repair in Factual Question Answering [1.1279808969568255]
検索地上質問応答のための軽量な推論時間修復層であるCounterRefineを提案する。
CounterRefineは、最初に検索されたエビデンスから短い回答を生成し、その後、追加のサポートを集め、そのドラフト回答に条件付けられたフォローアップクエリと矛盾するエビデンスを集めます。
完全なSimpleQAベンチマークでは、CounterRefineは一致したGPT-5ベースラインRAGを5.8ポイント改善し、73.1%の精度で、報告された1ショットのGPT-5.4スコアを約40ポイント上回る。
論文 参考訳(メタデータ) (2026-03-17T03:27:25Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization [73.0780809974414]
本稿では,意味的整合性評価を自己形式化プロセスに統合する反射的自己形式化手法を提案する。
これにより、モデルが形式的なステートメントを反復的に生成し、セマンティックな忠実さを評価し、自己修正された特定エラーを発生させることができる。
実験の結果、ReFormは最強のベースラインに対して平均22.6ポイントの改善を達成した。
論文 参考訳(メタデータ) (2025-10-28T16:22:54Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation [78.23119125463964]
我々は,参照フリー推論評価における新規な設計手法であるSocREvalを開発した。
SocREvalはGPT-4の性能を大幅に改善し、既存の参照フリーおよび参照ベース推論評価指標を上回っている。
論文 参考訳(メタデータ) (2023-09-29T18:25:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。