論文の概要: Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
- arxiv url: http://arxiv.org/abs/2605.08936v1
- Date: Sat, 09 May 2026 13:14:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.979344
- Title: Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
- Title(参考訳): Self-ReSET: 安全でない推論軌道から自己修復を学ぶ
- Abstract要約: 大型共振モデルには一般領域における自己補正の優れた能力がある。
既存のアライメント手法は、エキスパートデータにモデルを微調整することで、この脆弱性を軽減しようとする。
本稿では,自己回帰学習フレームワークであるSelf-ReSETを提案する。
- 参考スコア(独自算出の注目度): 32.21829460720908
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Reasoning Models possess remarkable capabilities for self-correction in general domain; however, they frequently struggle to recover from unsafe reasoning trajectories under adversarial attacks. Existing alignment methods attempt to mitigate this vulnerability by fine-tuning the model on expert data including reflection traces or adversarial prefixes. Crucially, these approaches are often hindered by static training data which inevitably deviate from model's dynamic, on-policy reasoning traces, resulting in model hardly covering its vast generation space and learning to recover from its own failures. To bridge this gap, we propose Self-ReSET, a pure reinforcement learning framework designed to equip LRMs with the intrinsic capacity to recover from their own safety error trajectories, which are subsequently reused as an initial state for reinforcement learning. Extensive experiments across various LRMs and benchmarks demonstrate that Self-ReSET significantly enhances robustness against adversarial attacks especially out-of-distribution (OOD) jailbreak prompts while maintaining general utility, along with efficient data utilization. Further analysis reveals that our method effectively fosters self-recovery patterns, enabling models to better identify and recover from unsafe intermediate error states back to benign paths. Our codes and data are available at https://github.com/Ing1024/Self-ReSET.
- Abstract(参考訳): 大きな推論モデルは、一般領域における自己補正の優れた能力を持っているが、敵の攻撃下では、安全でない推論軌道から回復するのにしばしば苦労する。
既存のアライメント手法は、リフレクショントレースや敵のプレフィックスを含む専門家データに基づいてモデルを微調整することで、この脆弱性を緩和しようとする。
これらのアプローチは、しばしば静的なトレーニングデータによって妨げられ、それは必然的にモデルのダイナミックなオン・ポリシーの推論トレースから逸脱し、結果としてモデルがその膨大な世代空間をほとんどカバーせず、自身の失敗から回復することを学ぶことになる。
このギャップを埋めるために、自己回帰学習フレームワーク(Self-ReSET)を提案する。これは、LEMに固有の能力を持たせることで、自己の安全エラー軌道から回復し、その後、強化学習の初期状態として再利用される。
様々な LRM およびベンチマークの広範囲にわたる実験により、Self-ReSET は、汎用性を維持しつつも、特にOOD(Out-of-distriion) ジェイルブレイクプロンプトに対する堅牢性を大幅に向上し、データ利用の効率化を図っている。
さらに分析した結果,本手法は自己回復パターンを効果的に育成し,安全でない中間エラー状態から良性経路への回帰をよりよく同定し,復元することができることがわかった。
私たちのコードとデータはhttps://github.com/Ing1024/Self-ReSETで公開されています。
関連論文リスト
- Native Reasoning Models: Training Language Models to Reason on Unverifiable Data [16.065264121785294]
NRT(Native Reasoning Training)は、複雑な推論を育む新しいフレームワークである。
NRTは、推論プロセスを潜在変数として扱うことで、トレーニング問題を再構築する。
NRTは検証不要な手法の最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-12T04:15:46Z) - Reinforcement Learning with Backtracking Feedback [12.680874918250069]
フィードバックフィードバックを用いた強化学習(RLBF)を紹介する。
このフレームワークは、BSAFEのような事前の手法に進化する。
RLBFは様々なベンチマークやモデルスケールでの攻撃成功率を大幅に低下させることを示す。
論文 参考訳(メタデータ) (2026-02-09T08:23:19Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling [27.11560841914813]
本稿では,自己改善型報酬モデルであるREFORMを紹介する。
我々は、広く使われている2つの嗜好データセットであるArthhropic Helpful Harmless (HH)とPKU Beavertailsについて、REFORMを評価した。
論文 参考訳(メタデータ) (2025-07-08T21:56:33Z) - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards [67.86091419220816]
大規模言語モデル(LLM)は複雑な推論において非常に有望である。
一般的な問題は表面的な自己回帰であり、モデルが自身の出力をしっかりと検証できない。
本稿では、RISE(Reinforce Reasoning with Self-Verification)という新しいオンラインRLフレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-05-19T17:59:31Z) - Transferable Adversarial Attacks on SAM and Its Downstream Models [87.23908485521439]
本稿では,セグメント・アプライス・モデル(SAM)から微調整した様々な下流モデルに対する敵攻撃の可能性について検討する。
未知のデータセットを微調整したモデルに対する敵攻撃の有効性を高めるために,ユニバーサルメタ初期化(UMI)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-26T15:04:04Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z) - RelaxLoss: Defending Membership Inference Attacks without Losing Utility [68.48117818874155]
より達成可能な学習目標を持つ緩和された損失に基づく新しい学習フレームワークを提案する。
RelaxLossは、簡単な実装と無視可能なオーバーヘッドのメリットを加えた任意の分類モデルに適用できる。
当社のアプローチはMIAに対するレジリエンスの観点から,常に最先端の防御機構より優れています。
論文 参考訳(メタデータ) (2022-07-12T19:34:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。