論文の概要: When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
- arxiv url: http://arxiv.org/abs/2607.15218v1
- Date: Thu, 16 Jul 2026 17:20:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.184288
- Title: When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
- Title(参考訳): テキストの安全性を超えた物理的危険を、隠れた状態のリスク空間で探す
- Abstract要約: コンテンツ危険 (CD) と物理的危険 (PD) が大きな言語モデルにおいて分離可能な信号を形成することを示す。
CD/PD分離性に基づいて,完全隠蔽状態上の単一層L2正規化ロジスティックプローブであるPRISMを提案する。
- 参考スコア(独自算出の注目度): 17.131581985583598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) increasingly serve as high-level planners for embodied agents, where linguistically benign instructions can become unsafe once grounded in the physical world. We study whether this physically grounded danger is the same safety problem as ordinary text-level content danger. Through hidden-state direction analysis and random-split null tests, we show that content danger (CD) and physical danger (PD) form separable signals in LLM representations across Qwen2.5-3B/7B/14B/32B, Phi-3.5 and SmolLM2. Building on the CD/PD separability, we propose PRISM, a single-layer L2-regularized logistic probe over full hidden states. PRISM achieves 86.2--87.7\% accuracy on SafeAgentBench with 11.7--13.7\% FPR, while same-scale LLM judges over-block safe tasks at 24.7--39.0\% FPR. We further introduce PhysicalSafetyBench-1K (PSB-1K), a contrastive benchmark of 1{,}000 physical-risk pairs without direct harm keywords, to test whether methods detect physically grounded danger rather than explicit unsafe wording. On PSB-1K, PRISM reaches 99.6\% accuracy and 0.7\% FPR, whereas a Qwen2.5-3B judge rejects 67.8\% of safe tasks. PRISM also replicates on SafeText and EARBench, supporting hidden-state probing as a representation-level method for physical safety beyond text moderation.
- Abstract(参考訳): 大型言語モデル (LLM) は、言語的に良識のある指示が物理的世界に根ざすと、安全でないものになりうる、エンボディエージェントの高レベルプランナーとしての役割を担っている。
我々は、この物理的に根拠付けられた危険が、通常のテキストレベルのコンテンツ危険と同じ安全性の問題であるかどうかを調査する。
隠れ状態方向解析とランダムスプリット・ヌルテストにより,Qwen2.5-3B/7B/14B/32B,Phi-3.5,SmolLM2のLCM表現において,コンテンツ危険(CD)と物理的危険(PD)が分離可能な信号を形成することを示す。
CD/PD分離性に基づいて,完全隠蔽状態上の単一層L2正規化ロジスティックプローブであるPRISMを提案する。
PRISM は SafeAgentBench で 86.2--87.7\% の精度を 11.7--13.7\% FPR で達成し、同じスケールの LLM では 24.7--39.0\% FPR でオーバーブロックセーフタスクを判断する。
さらに、1{,}000の物理リスク対を直接害キーワードなしで比較するベンチマークであるPhysicalSafetyBench-1K(PSB-1K)を導入し、明示的な安全でない単語ではなく、物理的に座屈した危険を検出する方法を検証する。
PSB-1Kでは、PRISMは精度99.6\%、FPR0.7\%に達するが、Qwen2.5-3B判事は67.8\%の安全タスクを拒絶する。
PRISMはSafeTextとEARBenchの複製も行い、テキストモデレーションを超えた物理的安全性の表現レベルメソッドとして隠れ状態のプローブをサポートする。
関連論文リスト
- From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs [11.582231928519754]
SPRINT (Sports Proactive Risk Inference Testbed) は、14のスポーツと3つの環境設定にまたがる2,888の現実世界のスポーツビデオ(2,440の事故、448の安全制御)のベンチマークである。
事故ビデオには、早期の危険状況、事故のタイミング、階層的な原因の微妙なアノテーションがあり、安全なビデオは事故のないものとして手動で検証され、即発の誤報を診断するのに役立つ。
論文 参考訳(メタデータ) (2026-08-06T03:25:39Z) - EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards [4.6400797556929545]
視覚言語モデル (VLM) は、住宅や工場で実施するエージェントの安全ガードとして提案されている。
我々はEgoSafetyBenchを紹介した。EgoSafetyBenchは、1200のロボットビューシナリオを半秒の粒度でアノテートしたエゴセントリックなビデオベンチマークである。
警備員は、危険を含むビデオを確実に認識する一方で、特定の危険瞬間を見逃すことがよくあります。
論文 参考訳(メタデータ) (2026-06-30T21:50:49Z) - Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering [18.59581013500335]
大きな推論モデルは、透明性、検証、意図的な問題解決のためのチェーンオブ思考のような推論を公開する。
有害またはポリシー違反のコンテンツは、最終回答が安全に見える場合でも、トレースを推論して現れる可能性がある。
両段階を統一された20基の安全ルーリックの下で評価することにより, 最終回答の安全性が完全な推論・回答軌道の十分なプロキシであるかどうかを検証した。
論文 参考訳(メタデータ) (2026-05-07T05:12:56Z) - Discovering Agentic Safety Specifications from 1-Bit Danger Signals [6.599344783327054]
EPO-Safeは、エージェントが反復的にアクションプランを生成し、スパースバイナリ警告を受け取り、リフレクションを通じて自然言語の振る舞い仕様を進化させるフレームワークである。
EPO-Safeは、構造化された低次元環境において、厳格に貧弱な信号から安全推論を行うことができることを示す。
標準的な報酬駆動リフレクションは安全性を積極的に低下させ、リフレクションを専用の安全チャンネルと組み合わせなければならないことを示す。
論文 参考訳(メタデータ) (2026-04-25T08:35:36Z) - SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond [134.43113804188195]
安全評価と科学的文脈の強化のための包括的枠組みであるSafeSciを紹介する。
SafeSciには、0.25Mサンプルを持つマルチディシプリナのベンチマークであるSafeSciBenchと、安全性向上のための1.5Mサンプルを含む大規模データセットであるSafeSciTrainが含まれている。
論文 参考訳(メタデータ) (2026-03-02T08:16:04Z) - Trust The Typical [8.32740388004069]
本稿では,安全をアウト・オブ・ディストリビューション(OOD)検出問題として扱うことにより,この原則を運用するフレームワークであるTrust The typical(T3)を紹介する。
T3は意味空間における許容可能なプロンプトの分布を学習し、潜在的な脅威として有意な偏差を宣言する。
安全な英語のテキスト転送のみを訓練した単一のモデルは、訓練をすることなく、多様なドメインと14以上の言語に効果的に移行した。
論文 参考訳(メタデータ) (2026-02-04T14:06:46Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space [91.99501941169831]
GuardSpaceは、微調整全体を通して安全アライメントを維持するためのガードレールフレームワークである。
GSM8Kで微調整されたLlama-2-7B-Chatでは、ガードスペースは最先端のAsFTよりも優れている。
論文 参考訳(メタデータ) (2025-10-16T04:57:53Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z) - SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior [56.10557932893919]
我々は、新しいAI安全モデレーションフレームワークであるSafetyAnalystを紹介する。
AIの振る舞いを考えると、SafetyAnalystはチェーン・オブ・シークレット・推論を使用してその潜在的な結果を分析する。
効果を28個の完全に解釈可能な重みパラメータを使って有害度スコアに集約する。
論文 参考訳(メタデータ) (2024-10-22T03:38:37Z) - Certifying LLM Safety against Adversarial Prompting [70.96868018621167]
大規模言語モデル(LLM)は、入力プロンプトに悪意のあるトークンを追加する敵攻撃に対して脆弱である。
我々は,認証された安全保証とともに,敵のプロンプトを防御する最初の枠組みである消去・チェックを導入する。
論文 参考訳(メタデータ) (2023-09-06T04:37:20Z) - SafeText: A Benchmark for Exploring Physical Safety in Language Models [62.810902375154136]
テキスト生成およびコモンセンス推論タスク用に設計された各種モデルのコモンセンス物理安全性について検討する。
最先端の大規模言語モデルは、安全でないテキストの生成に影響を受けやすく、安全でないアドバイスを拒否するのが困難であることがわかった。
論文 参考訳(メタデータ) (2022-10-18T17:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。