論文の概要: SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\circ}$ Law
- arxiv url: http://arxiv.org/abs/2507.18576v2
- Date: Mon, 28 Jul 2025 05:33:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-29 14:15:47.070387
- Title: SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\circ}$ Law
- Title(参考訳): SafeWork-R1: AI-45$^{\circ}$ Lawの下での安全性とインテリジェンスの発展
- Abstract要約: 我々は,機能と安全性の共進化を示す最先端のマルチモーダル推論モデルであるSafeWork-R1を紹介する。
大規模でプログレッシブで安全指向の強化学習をポストトレーニングに取り入れたSafeLadderフレームワークを開発した。
さらに,SafeWork-R1-InternVL3-78B,SafeWork-R1-DeepSeek-70B,SafeWork-R1-Qwen2.5VL-7Bを開発した。
- 参考スコア(独自算出の注目度): 91.33824439029533
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce SafeWork-R1, a cutting-edge multimodal reasoning model that demonstrates the coevolution of capabilities and safety. It is developed by our proposed SafeLadder framework, which incorporates large-scale, progressive, safety-oriented reinforcement learning post-training, supported by a suite of multi-principled verifiers. Unlike previous alignment methods such as RLHF that simply learn human preferences, SafeLadder enables SafeWork-R1 to develop intrinsic safety reasoning and self-reflection abilities, giving rise to safety `aha' moments. Notably, SafeWork-R1 achieves an average improvement of $46.54\%$ over its base model Qwen2.5-VL-72B on safety-related benchmarks without compromising general capabilities, and delivers state-of-the-art safety performance compared to leading proprietary models such as GPT-4.1 and Claude Opus 4. To further bolster its reliability, we implement two distinct inference-time intervention methods and a deliberative search mechanism, enforcing step-level verification. Finally, we further develop SafeWork-R1-InternVL3-78B, SafeWork-R1-DeepSeek-70B, and SafeWork-R1-Qwen2.5VL-7B. All resulting models demonstrate that safety and capability can co-evolve synergistically, highlighting the generalizability of our framework in building robust, reliable, and trustworthy general-purpose AI.
- Abstract(参考訳): 我々は,機能と安全性の共進化を示す最先端のマルチモーダル推論モデルであるSafeWork-R1を紹介する。
大規模でプログレッシブで安全指向の強化学習をポストトレーニングに組み込んだSafeLadderフレームワークを開発した。
単に人間の好みを学習するRLHFのような従来のアライメント手法とは異なり、SafeLadderはSafeWork-R1が本質的な安全推論と自己回帰能力を開発することを可能にする。
特にSafeWork-R1は、基本モデルであるQwen2.5-VL-72Bよりも平均4,6.54$%向上し、GPT-4.1やClaude Opus 4のような主要なプロプライエタリモデルと比較して、最先端の安全性能を提供する。
さらに信頼性を高めるために、ステップレベルの検証を強制する2つの異なる推論時間介入法と熟考探索機構を実装した。
最後に,SafeWork-R1-InternVL3-78B,SafeWork-R1-DeepSeek-70B,SafeWork-R1-Qwen2.5VL-7Bを開発した。
すべてのモデルが、安全と能力が相乗的に共存できることを示し、堅牢で信頼性があり、信頼できる汎用AIを構築する上での私たちのフレームワークの一般化性を強調します。
関連論文リスト
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety [67.86055044301408]
我々は、敵対的に堅牢なコンテンツ安全性とより広範なAI安全性のために構築された、大きな言語モデルであるYuvion LLMを紹介する。
そのパイプラインは、逆向きに認識されたデータ構築、知識の強化された継続事前訓練、およびポリシーに基づくマルチタスクのトレーニング後安全性を組み合わせたものだ。
Yuvion LLMは、安全に焦点を当てたベンチマークにおいて明らかな利点を示し、特に敵対的な条件下では強い堅牢性を示す。
論文 参考訳(メタデータ) (2026-06-26T01:12:02Z) - SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model [45.895712358791705]
我々は、視覚言語アクションポリシーのためのモデルベースの安全な強化学習フレームワークであるSafeDojoを提案する。
インタラクティブなビデオワールドモデル上でオンライン強化学習を行う。
SafeLIBEROでは、SafeDojoが最高の集計タスク成功、安全な成功、実行効率を達成する。
論文 参考訳(メタデータ) (2026-06-15T08:58:37Z) - SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models [66.71948519280669]
MLRM(Multimodal Large Reasoning Models)は、クロスモーダルな推論を示すが、しばしば敵のプロンプトによる安全性のリスクを増幅する。
既存の防御は主に出力レベルで動作し、推論プロセスを制約せず、モデルは暗黙のリスクに置かれる。
4つのコンポーネントを統合し,表面レベルのフィルタリングを超える動的かつ解釈可能な安全性決定をサポートするSaFeR-VLMを提案する。
論文 参考訳(メタデータ) (2025-10-08T10:39:12Z) - SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning [76.56522719330911]
大規模推論モデル(LRM)は、応答する前に明示的に推論する新しい世代パラダイムを導入する。
LRMは有害なクエリや敵の攻撃に対して大きな安全リスクをもたらす。
キー文中の安全アハモーメントをより活性化するSafeKeyを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:46:03Z) - A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents [13.225168384790257]
大規模言語モデル(LLM)は、エンボディエージェント内のタスク計画能力を向上する上で大きな可能性を秘めている。
我々は, LLMをベースとしたエンボディエージェントの挙動を, セーフプランベンチとアライメントのための統合フレームワークであるSafe-BeAlを提案する。
我々の経験的分析によると、敵対的な入力や悪意がなくても、LSMベースのエージェントは安全でない行動を示すことができる。
論文 参考訳(メタデータ) (2025-04-20T15:12:14Z) - Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback [34.01716144973483]
汎用AIアシスタント構築にはMLLM(Multimodal large language model)が不可欠である。
MLLMの安全アライメントをどうやって確保すれば、望ましくない行動を防ぐことができるのか?
本研究では,安全なRLHF-Vを初めて探求する。
論文 参考訳(メタデータ) (2025-03-22T07:40:20Z) - The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1 [70.94607997570729]
本稿では,OpenAI-o3およびDeepSeek-R1推論モデルの総合的安全性評価を行う。
本研究では, 現実の応用における強靭性を評価するために, ジェイルブレイクやインジェクションなどの敵攻撃に対する感受性について検討する。
論文 参考訳(メタデータ) (2025-02-18T09:06:07Z) - Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing [12.986006070964772]
安全性アライメントは、現実世界のAIアプリケーションにとって重要な研究トピックである。
本研究はまず,モデルの有用性を犠牲にすることなく,このような脆弱性を除去することの難しさを明らかにした。
本手法は,安全性を維持しつつモデルの有用性を高め,トレードオフを改善できる。
論文 参考訳(メタデータ) (2025-02-04T09:31:54Z) - OpenAI o1 System Card [274.83891368890977]
o1モデルシリーズは、思考の連鎖を用いて推論するために大規模な強化学習で訓練されている。
本報告では,OpenAI o1およびOpenAI o1-miniモデルに対して実施される安全作業の概要について述べる。
論文 参考訳(メタデータ) (2024-12-21T18:04:31Z) - Towards Safer Generative Language Models: A Survey on Safety Risks,
Evaluations, and Improvements [76.80453043969209]
本調査では,大規模モデルに関する安全研究の枠組みについて述べる。
まず、広範囲にわたる安全問題を導入し、その後、大型モデルの安全性評価手法を掘り下げる。
トレーニングからデプロイメントまで,大規模なモデルの安全性を高めるための戦略について検討する。
論文 参考訳(メタデータ) (2023-02-18T09:32:55Z) - Evaluating Model-free Reinforcement Learning toward Safety-critical
Tasks [70.76757529955577]
本稿では、国家安全RLの観点から、この領域における先行研究を再考する。
安全最適化と安全予測を組み合わせた共同手法であるUnrolling Safety Layer (USL)を提案する。
この領域のさらなる研究を容易にするため、我々は関連するアルゴリズムを統一パイプラインで再現し、SafeRL-Kitに組み込む。
論文 参考訳(メタデータ) (2022-12-12T06:30:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。