論文の概要: OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets
- arxiv url: http://arxiv.org/abs/2607.02047v1
- Date: Thu, 02 Jul 2026 11:14:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.811815
- Title: OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets
- Title(参考訳): OpenSafe Intent: デュアルユースプロンプトセット間のインテントキャリブレーションによるセーフコンプリートの評価
- Authors: Rheeya Uppaal, Seungwoo Lyu, Selina Sung, Junjie Hu,
- Abstract要約: OpenSafeIntentは、制御されたプロンプトセットのベンチマークで、基本的なタスクを固定しながら意図を変える。
この設計により、モデルが平均的に安全なように見えるのではなく、意図的なシフトでアシストを校正するかどうかを評価することができる。
幅広いモデルスイート全体で、プロンプトレベルの安全性が重要な障害を隠蔽していることが分かりました。
- 参考スコア(独自算出の注目度): 6.985945816612278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe completion requires models to provide useful assistance without enabling harm, but this behavior is difficult to evaluate with isolated prompts. We introduce OpenSafeIntent, a benchmark of controlled prompt-sets that vary intent while holding the underlying task fixed. Each datapoint contains benign, dual-use, and malicious variants of the same task. This design lets us evaluate whether models calibrate assistance across intent shifts, rather than merely appearing safe on average. Across a broad model suite, we find that prompt-level safety hides important failures: models often fail to remain safe across matched intent variants, dual-use behavior is brittle under paraphrase, high-level answers on risky topics are not reliably safe, and responses that reframe ambiguous requests into safer tasks are substantially less likely to cross the safety boundary. Our results suggest that safe completion should be evaluated as intent-calibrated behavior over controlled task variants, not as a single safety-helpfulness tradeoff over independent prompts.
- Abstract(参考訳): セーフコンプリートには、害を発生させることなく有用なアシストを提供するモデルが必要であるが、この動作は独立したプロンプトで評価することは困難である。
OpenSafeIntentは、制御されたプロンプトセットのベンチマークで、基本的なタスクを固定しながら意図を変える。
各データポイントには、同じタスクの良性、デュアルユース、悪意のある変種が含まれている。
この設計により、モデルが平均的に安全なように見えるのではなく、意図的なシフトでアシストを校正するかどうかを評価することができる。
モデルが一致した意図の変種にまたがって安全を保つことができず、二重使用の振る舞いはパラフレーズの下で不安定であり、リスクのあるトピックに対する高レベルな回答は確実に安全ではない。
本研究の結果から, 安全度は, 独立したプロンプトに対する単一安全度トレードオフとしてではなく, 制御されたタスクバリアントに対する意図校正行動として評価されるべきであることが示唆された。
関連論文リスト
- OSGuard: A Benchmark for Safety in Computer-Use Agents [12.395093977641581]
OSGuard(OSGuard)は、コンピュータ使用エージェントの安全性を評価するベンチマークスイートである。
OSGuardには、ローカルガードレール決定のためのアクションレベルベンチマークと、エンドツーエンド評価のためのリスク強化実行スイートが含まれている。
論文 参考訳(メタデータ) (2026-06-13T00:32:24Z) - Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents [73.69976712292681]
電話使用エージェントが危害を免れた場合、安全を示すか、単に行動できないか?
有害な結果は、エージェントがリスクを認識して安全なアクションを選択したり、スクリーンを理解したり、関連するアクションを全く実行できなかったりすることで回避される。
私たちはPhoneSafetyでこの問題に対処しています。これは130以上のアプリにわたる実際の電話インタラクションから引き出された700の安全クリティカルな瞬間のベンチマークです。
論文 参考訳(メタデータ) (2026-05-08T11:58:57Z) - From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training [14.489448208361175]
本稿では,ユーザ意図のバイナリ分類ではなく,アシスタントのアウトプットの安全性を重視した安全訓練アプローチを提案する。
セーフコンプリートトレーニングは安全性を向上し(特にデュアルユースプロンプト)、残留する安全障害の重症度を低減し、モデルの有用性を大幅に向上させる。
論文 参考訳(メタデータ) (2025-08-12T00:18:23Z) - UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases [57.69882799751655]
さまざまなソースを持つハードプロンプトから構築された安全アライメントデータセットであるUnsafeChainをリリースする。
我々は3つの大きな推論モデル(LRM)を微調整し、それらを最近のSafeChainとSTAR-1と比較する。
UnsafeChainは、1Kサブセットのマッチングやベースラインのパフォーマンスを越えながら、従来よりも一貫してパフォーマンスが向上している。
論文 参考訳(メタデータ) (2025-07-29T10:08:52Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning [76.56522719330911]
大規模推論モデル(LRM)は、応答する前に明示的に推論する新しい世代パラダイムを導入する。
LRMは有害なクエリや敵の攻撃に対して大きな安全リスクをもたらす。
キー文中の安全アハモーメントをより活性化するSafeKeyを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:46:03Z) - TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback [15.904640266226023]
安全強化学習(RL)では、エージェントを安全な意思決定に合わせるために補助的な安全コストが使用される。
実際には、コスト関数や予算を含む安全性の制約は、不明または特定が難しい。
我々は、真の安全定義が不明な一般的な設定に対処し、少ないラベル付きデータから学ぶ必要がある。
論文 参考訳(メタデータ) (2025-04-17T01:11:08Z) - Safe Vision-Language Models via Unsafe Weights Manipulation [75.04426753720551]
我々は、異なるレベルの粒度で安全性を評価する新しい指標セットであるSafe-Groundを導入し、安全性の評価を見直した。
我々は異なる方向を採り、トレーニングなしでモデルをより安全にできるかどうかを探り、Unsafe Weights Manipulation (UWM)を導入します。
UWMは、セーフとアンセーフのインスタンスのキャリブレーションセットを使用して、セーフとアンセーフのコンテンツのアクティベーションを比較し、後者を処理する上で最も重要なパラメータを特定する。
論文 参考訳(メタデータ) (2025-03-14T17:00:22Z) - Certifying LLM Safety against Adversarial Prompting [70.96868018621167]
大規模言語モデル(LLM)は、入力プロンプトに悪意のあるトークンを追加する敵攻撃に対して脆弱である。
我々は,認証された安全保証とともに,敵のプロンプトを防御する最初の枠組みである消去・チェックを導入する。
論文 参考訳(メタデータ) (2023-09-06T04:37:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。