論文の概要: Shieldstral
- arxiv url: http://arxiv.org/abs/2607.25857v1
- Date: Tue, 28 Jul 2026 15:27:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.899032
- Title: Shieldstral
- Title(参考訳): シールドストラール
- Authors: Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan,
- Abstract要約: Shieldstralはポリシー適応型マルチモーダル安全分類器で、テキスト安全性ベンチマークで約7$timesのモデルに適合または性能を向上する。
本稿では、約54.1Mサンプルのキュレーションと生成をカバーしたデータ構築レシピと、政策適応性を評価するためのきめ細かい評価セットを提案する。
- 参考スコア(独自算出の注目度): 21.671866168898827
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Shieldstral, a 3B-parameter policy-adaptive multimodal safety classifier that matches or outperforms models nearly 7$\times$ its size on text safety benchmarks and sets a new state of the art on multimodal safety classification. Shieldstral formulates content moderation as a binary question-answering task. This simple formulation unifies diverse moderation tasks into a single yes/no problem, enabling heterogeneous safety datasets with divergent taxonomies to be consolidated under one training framework. We present the data construction recipe, covering curation and generation of approximately 54.1M samples and a fine-grained evaluation set to evaluate policy adaptability. Together, these enable a small adaptive model to match or outperform much larger models.
- Abstract(参考訳): Shieldstralは、3Bパラメータのポリシー適応型マルチモーダル安全性分類器で、テキスト安全性ベンチマークでモデルのサイズを7$\times$で一致させたり、性能を上回り、マルチモーダル安全性分類に新たな最先端を設定できる。
Shieldstralは、バイナリな質問応答タスクとしてコンテンツモデレーションを定式化する。
この単純な定式化は、多様なモデレーションタスクを1つのye/no問題に統一し、異種分類を含む異種安全データセットを1つのトレーニングフレームワークで統合することを可能にする。
本稿では、約54.1Mサンプルのキュレーションと生成をカバーしたデータ構築レシピと、政策適応性を評価するためのきめ細かい評価セットについて述べる。
これらを組み合わせることで、小さな適応モデルが非常に大きなモデルにマッチしたり、性能を向上することが可能になる。
関連論文リスト
- Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models [23.11474404054016]
多くの機械学習モデルは、コード生成、バイオメディカル分析、数学的問題解決といった特殊な領域で高いパフォーマンスを達成するために、大きな言語モデル(LLM)から微調整されている。
EnchTableは、大規模な再訓練を必要とせず、下流のLLMにおける安全アライメントを転送し、維持するように設計された新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-13T02:26:59Z) - Reimagining Safety Alignment with An Image [49.33281424100804]
大きな言語モデル(LLM)は多様なアプリケーションで優れていますが、Jailbreak攻撃下で有害なコンテンツを生成し、良質なクエリを過剰に拒否する、という2つの課題に直面しています。
我々は,過度な拒絶を低減しつつ,セキュリティを向上させる最適化駆動型ビジュアルプロンプトフレームワークであるMagic Imageを提案する。
論文 参考訳(メタデータ) (2025-11-01T11:27:07Z) - Benchmarking Unified Face Attack Detection via Hierarchical Prompt Tuning [58.16354555208417]
PADとFFDはそれぞれ物理メディアベースのプレゼンテーションアタックとデジタル編集ベースのDeepFakeから顔データを保護するために提案されている。
これら2つのカテゴリの攻撃を同時に処理する統一顔攻撃検出モデルがないことは、主に2つの要因に起因する。
本稿では,異なる意味空間から複数の分類基準を適応的に探索する,視覚言語モデルに基づく階層型プロンプトチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:35:45Z) - Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails [4.697160328460634]
大規模言語モデル(LLM)と生成AIが普及している。
LLM関連の安全リスクの完全なスペクトルに対処する、高品質で人間による注釈付きデータセットの欠如は明らかです。
安全リスクを分類するための包括的かつ適応可能な分類法を提案する。
論文 参考訳(メタデータ) (2025-01-15T18:37:08Z) - Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements [46.79887158348167]
大規模言語モデル(LLM)の安全性アライメントに関する現在のパラダイムは、一大のアプローチに従っている。
我々は,モデルの再トレーニングを伴わず,多様な安全要件に適応するフレームワークとして,制御可能な安全アライメント(CoSA)を提案する。
論文 参考訳(メタデータ) (2024-10-11T16:38:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。