論文の概要: The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report
- arxiv url: http://arxiv.org/abs/2606.26529v1
- Date: Thu, 25 Jun 2026 02:09:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.144034
- Title: The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report
- Title(参考訳): 不注意なギャップ:タスク定義言語と視覚モデル
- Abstract要約: 狭義のタスクで言語や視覚モデルを条件付けると、それ以外は報告できる共表現、安全クリティカルな信号の報告が抑制されることを示す。
我々はこの解離を意図的ギャップ(Inattentional Gap)と呼び、ベンチマークの安全性を現実世界の安全性から切り離すと主張している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI safety is evaluated by how reliably a model detects the hazards it is told to find, yet accidents often arise from the hazard no one specified. We show that conditioning a language or vision model on a narrow task suppresses its reporting of co-present, safety-critical signals it can otherwise report, a machine analogue of human inattentional blindness arising from a different mechanism. Across radiology and driving text scenarios and chest-radiograph vision tasks, suppression appeared in every model tested, did not diminish with scale, persisted in a reasoning model, and varied more by model family than by size, while the same models reported these signals at substantially higher rates when unconstrained. We name this dissociation the Inattentional Gap and argue that it decouples measured benchmark safety from real-world safety: a system can score near-perfectly on the hazards an evaluation specifies while remaining blind to those that cause harm.
- Abstract(参考訳): AIの安全性は、モデルが発見するように指示されたハザードをいかに確実に検出するかによって評価されるが、事故は特定されていないハザードから生じることが多い。
狭義のタスクで言語や視覚モデルを条件付けすることは、異なるメカニズムから生じる人間の意図的盲点の機械的類似体である、それ以外は報告できない、表現可能な安全クリティカルな信号の報告を抑えることを示す。
放射線学やドライビングテキストのシナリオ、胸部X線撮影の視覚タスクなど、テスト対象のすべてのモデルに抑制が出現し、スケールとともに低下せず、推論モデルに留まり、サイズよりもモデルファミリーによって変化し、同じモデルでは、制約のない場合には、これらの信号をかなり高い速度で報告した。
我々はこの解離を意図的ギャップ(Inattentional Gap)と名付け、実際の安全性からベンチマークの安全性を分離する、と主張している。
関連論文リスト
- Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models [46.968844120076916]
実装エージェントベンチマークALFRED上に構築されたSafetyALFREDを紹介し,実際のキッチンハザードの6つのカテゴリを拡張した。
我々は,リスク認識だけでなく,具体的計画によるアクティブなリスク軽減についても,11種類の最先端モデルを評価した。
論文 参考訳(メタデータ) (2026-04-21T16:27:20Z) - Read the Scene, Not the Script: Outcome-Aware Safety for LLMs [22.814397376238755]
現在のモデルでは、アクションと結果の結びつきが弱いのです。
この障害モードをコンシークエンス・ブラインドネス(Consequence-blindness)と定義する。
CS-Chain-4kで微調整されたモデルでは、セマンティックカモフラージュジェイルブレイクに対する明らかな利得を示す。
論文 参考訳(メタデータ) (2025-10-05T18:46:49Z) - Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition [12.054081112688074]
VLM(Vision-Language Models)は、視覚的コンテンツを解釈する能力を示しているが、安全クリティカルなシナリオにおける信頼性はまだ十分に調査されていない。
本稿では,200枚の合成画像(100対)と50枚の実世界の画像(25対)からなる診断ベンチマークVERIを紹介する。
各緊急シーンは、人間の検証によって視覚的に似ているが安全なものとペアリングされる。
論文 参考訳(メタデータ) (2025-05-21T10:57:40Z) - SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors [2.07180164747172]
原子力や航空などのリスクの高い産業は、危険なシステム状態を検出するためにリアルタイムモニタリングを使用している。
教師なしアプローチを用いることで、有害なAI出力が発生する前に予測するリアルタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-20T12:49:58Z) - Epistemic Uncertainty for Generated Image Detection [107.62647907393377]
本稿では,創成モデルの時代において重要なセキュリティ問題に対処することを目的とした,てんかん不確実性によるAI生成画像検出のための新しいフレームワークを提案する。
我々の重要な洞察は、トレーニングとテストデータの分布の相違が、機械学習モデルのエピステマティック不確実性空間に顕著に現れていることに起因している。
論文 参考訳(メタデータ) (2024-12-08T11:32:25Z) - Unsupervised Model Diagnosis [49.36194740479798]
本稿では,ユーザガイドを使わずに,意味論的対実的説明を生成するために,Unsupervised Model Diagnosis (UMO)を提案する。
提案手法は意味論における変化を特定し可視化し,その変化を広範囲なテキストソースの属性と照合する。
論文 参考訳(メタデータ) (2024-10-08T17:59:03Z) - Extreme Miscalibration and the Illusion of Adversarial Robustness [66.29268991629085]
敵の訓練は、しばしばモデルの堅牢性を高めるために使用される。
我々は、この観測されたロバストネスの利得はロバストネスの錯覚(IOR)であることを示した。
我々は,NLPコミュニティに対して,試験時間温度のスケーリングを堅牢性評価に組み込むよう促す。
論文 参考訳(メタデータ) (2024-02-27T13:49:12Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z) - USC: Uncompromising Spatial Constraints for Safety-Oriented 3D Object Detectors in Autonomous Driving [7.355977594790584]
自律運転における3次元物体検出器の安全性指向性能について考察する。
本稿では,単純だが重要な局所化要件を特徴付ける空間的制約 (USC) について述べる。
既存のモデルに対する安全性指向の微調整を可能にするために,定量的な測定値を共通損失関数に組み込む。
論文 参考訳(メタデータ) (2022-09-21T14:03:08Z) - Sample-Efficient Safety Assurances using Conformal Prediction [57.92013073974406]
早期警戒システムは、安全でない状況が差し迫ったときに警告を提供することができる。
安全性を確実に向上させるためには、これらの警告システムは証明可能な偽陰性率を持つべきである。
本稿では,共形予測と呼ばれる統計的推論手法とロボット・環境力学シミュレータを組み合わせたフレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-28T23:00:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。