論文の概要: RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation
- arxiv url: http://arxiv.org/abs/2605.07760v1
- Date: Fri, 08 May 2026 14:05:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.093897
- Title: RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation
- Title(参考訳): ルールセーフVL:視覚言語コンテンツモデレーションにおけるルール定義決定推論の評価
- Authors: Zhifeng Lu, Dianyuan Wang, Yuhu Shang, Zhenbo Xu,
- Abstract要約: RuleSafe-VLは、コンテンツモデレーションにおけるルール条件決定推論のベンチマークである。
93の原子規則と92の型付き規則関係を定式化し、2,166の文脈依存の画像テキストケースを生成する。
アクティベートされたルールを特定し、ルールのインタラクションを回復し、意思決定の十分性を判断し、不足したコンテキストが供給されると結果を解決する。
- 参考スコア(独自算出の注目度): 4.531887731522564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Platform content moderation applies explicit policy rules and context-dependent conditions to decide whether user content is allowed, restricted, or removed. A correct moderation outcome must therefore depend on which rules a case activates, how those rules interact, and whether the available evidence is sufficient. Current multimodal safety benchmarks largely reduce moderation to matching predefined final labels, leaving this underlying rule structure untested. As a result, a high benchmark score reveals little about whether a model applies the policy correctly or arrives at the correct label through superficial cues. To evaluate this rule-governed process, we introduce RuleSafe-VL, a benchmark for rule-conditioned decision reasoning in vision-language content moderation. Derived from publicly available platform moderation policies, RuleSafe-VL formalizes 93 atomic rules and 92 typed rule relations, yielding 2,166 context-sensitive image-text cases across three high-risk policy families. Its four diagnostic tasks decompose moderation into a rule-conditioned decision chain. They identify activated rules, recover rule interactions, judge decision sufficiency, and resolve outcomes once missing context is supplied. Experiments on 10 frontier, open-source, and safety-oriented VLMs reveal rule-relation recovery as the dominant bottleneck, where the best model reaches only 64.8 Macro-F1 and some safety-oriented models fall below 7 Macro-F1. Decision-state prediction also remains unreliable, peaking at 64.5 Macro-F1. RuleSafe-VL shifts moderation evaluation from final-label scoring toward diagnostic assessment of rule-conditioned decision reasoning.
- Abstract(参考訳): プラットフォームコンテンツモデレーションは、明示的なポリシールールとコンテキストに依存した条件を適用して、ユーザコンテンツが許可されたり、制限されたり、削除されたりするかどうかを決定する。
したがって、正しいモデレーションの結果は、ケースがどのルールをアクティベートするか、それらのルールがどのように相互作用するか、利用可能な証拠が十分かどうかに依存する必要がある。
現在のマルチモーダル安全ベンチマークは、予め定義された最終ラベルに対するモデレーションを大幅に減らし、基礎となるルール構造は未検証のままである。
その結果、高いベンチマークスコアは、モデルがそのポリシーを正しく適用するか、表面的な手がかりによって正しいラベルに到達するかをほとんど明らかにしない。
本稿では,ルール条件付き決定推論のベンチマークであるルールセーフVLを導入する。
RuleSafe-VLは、公開プラットフォームモデレーションポリシーから派生したもので、93のアトミックルールと92の型付きルール関係を定式化し、3つのハイリスクポリシーファミリで2,166のコンテキスト依存の画像テキストケースを生成する。
その4つの診断タスクは、モデレーションをルール条件決定チェーンに分解する。
彼らは、アクティベートされたルールを特定し、ルールの相互作用を回復し、決定の十分性を判断し、不足したコンテキストが供給されると結果を解決する。
10のフロンティア、オープンソース、安全指向のVLMの実験では、最高のモデルが64.8 Macro-F1にしか達せず、いくつかの安全指向モデルが7 Macro-F1を下回る主要なボトルネックとして、ルールリレーションリカバリが示されている。
決定状態の予測も信頼性が低く、64.5 Macro-F1 である。
RuleSafe-VLは、最終ラベルスコアからルール条件決定推論の診断評価へのモデレーション評価をシフトする。
関連論文リスト
- Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI [0.6138671548064355]
我々は、政策的正当性として評価を定式化し、Defensibility Index(DI)とAmbiguity Index(AI)を導入する。
フレームワークを複数のコミュニティで193,000以上のRedditモデレーション決定と評価コホートで検証する。
論文 参考訳(メタデータ) (2026-04-22T18:05:29Z) - Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies [0.0]
LLMは、RLHFを通じて安全ポリシーを内部化するが、これらのポリシーは公式には指定されず、検査も困難である。
既存のベンチマークは、モデルを外部標準に対して評価するが、モデルが自身のバウンダリを理解し、強制するかどうかを測定することはない。
本稿では,構造化されたプロンプトを介して,モデルが自己決定する安全ルールを抽出するフレームワークであるSNCAを紹介する。
論文 参考訳(メタデータ) (2026-04-10T10:18:45Z) - GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules [10.423914922203265]
大規模言語モデル(LLM)は、以下のガイドラインに適合するが、その判断能力は、ポリシーが不安定であるか、文脈に依存している場合に低下する。
既存の静的ベンチマークのパフォーマンスは、共起違反や動的に変化するルールを含む現実のシナリオに対して、AI判断の堅牢な一般化を真に保証していますか?
論文 参考訳(メタデータ) (2026-03-02T10:50:11Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Policy-Aware Generative AI for Safe, Auditable Data Access Governance [0.0]
本稿では,大規模言語モデル(LLM)を用いて,原データではなく,記述されたポリシーやメタデータに対して自然言語要求を解釈するポリシー対応コントローラを提案する。
Google Gemini2.0 Flashで実装されたこのシステムは、6段階の推論フレームワークを実行する。
論文 参考訳(メタデータ) (2025-10-27T16:10:55Z) - Asking For It: Question-Answering for Predicting Rule Infractions in Online Content Moderation [1.803599876087764]
ModQはルールに敏感なコンテンツモデレーションのための新しい問合せフレームワークである。
モデル変種を2つ実装し、RedditとLemmyの大規模データセットでそれらをトレーニングする。
どちらのモデルも、モデレーション関連ルール違反を特定する上で、最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-07T18:11:27Z) - SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization [57.69385990442078]
大規模言語モデル(LLM)は、入力プロンプト(クエスト)にまたがる様々なレベルの信頼を示す。
セマンティックエントロピー(Semantic entropy)は、プロンプトが与えられた複数の生成された回答における意味の多様性を測定し、ポリシー更新の規模を変調するためにこれを使用する。
論文 参考訳(メタデータ) (2025-05-18T10:20:59Z) - Conformal Off-Policy Evaluation in Markov Decision Processes [53.786439742572995]
強化学習は、データから効率的な制御ポリシーを特定し評価することを目的としている。
この学習タスクのほとんどの方法は、Off-Policy Evaluation (OPE)と呼ばれ、正確さと確実性を保証するものではない。
本稿では,目標方針の真報を含む区間を所定の確信度で出力するコンフォーマル予測に基づく新しいOPE手法を提案する。
論文 参考訳(メタデータ) (2023-04-05T16:45:11Z) - Offline Policy Selection under Uncertainty [113.57441913299868]
我々は、オフラインポリシーの選択を、一定の経験データセットを与えられた政策予測のセットよりも学習の選好とみなす。
政策価値に対する信念に対する完全な分布へのアクセスは、より幅広い下流評価指標の下でより柔軟な選択アルゴリズムを可能にする。
BayesDICEが任意の下流ポリシー選択メトリックに関してポリシーのランク付けにどのように使用されるかを示します。
論文 参考訳(メタデータ) (2020-12-12T23:09:21Z) - Doubly Robust Off-Policy Value and Gradient Estimation for Deterministic
Policies [80.42316902296832]
本研究では,行動継続時の非政治データから決定論的政策の政策値と勾配を推定する。
この設定では、密度比が存在しないため、標準重要度サンプリングとポリシー値と勾配の2倍の頑健な推定が失敗する。
異なるカーネル化アプローチに基づく2つの新しい頑健な推定器を提案する。
論文 参考訳(メタデータ) (2020-06-06T15:52:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。