論文の概要: Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
- arxiv url: http://arxiv.org/abs/2609.10410v2
- Date: Fri, 11 Sep 2026 07:34:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.463229
- Title: Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
- Title(参考訳): ファウンデーションモデルはオンラインコンテンツをモデレートできるか? : インストラクションと事例駆動型政策運用の評価
- Abstract要約: 本稿では,VLM(Vision-Language Model)ガイダンスの競合する2つのパラダイムを体系的に比較する。
この調査は、Blueskyプラットフォームから4000件の注釈付きインザミルポストの新たなベンチマークであるModerrationBenchに基礎を置いている。
実験の結果,基礎モデルはブルースキーの展開モデレーションシステムを大幅に上回っていることがわかった。
- 参考スコア(独自算出の注目度): 4.7513465823459695
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The growing complexity of content moderation policies presents a critical challenge for their consistent operationalization. While foundation models possess the basic capabilities needed to confront this challenge, whether they can reliably moderate online content remains an unanswered question. In this paper, we systematically compare two competing paradigms for Vision-Language Model (VLM) guidance: an instruction-driven approach where models reason from policy precepts, and an example-driven approach where they generalize from prior precedents. We ground this investigation in ModerationBench, a new benchmark of 4,000 manually annotated, in-the-wild posts from the Bluesky platform. Our experiments reveal that foundation models can substantially outperform Bluesky's deployed moderation system, nearly tripling its $F_1$ score (0.60 vs. 0.22) on Random Posts in the benchmark, with both instruction- and example-driven paradigms achieving comparable peak effectiveness. Our findings thus chart a path toward reliable and adaptable policy operationalization at scale.
- Abstract(参考訳): コンテンツモデレーションポリシーの複雑さの増大は、一貫した運用化において重要な課題となる。
ファンデーションモデルは、この課題に直面するために必要な基本的な能力を持っているが、オンラインコンテンツを確実に適度に調整できるかどうかは、未解決の問題のままである。
本稿では,VLM(Vision-Language Model)指導の競合する2つのパラダイムを,モデルが政策規範から推論する命令駆動アプローチと,前例から一般化する例駆動アプローチとを体系的に比較する。
この調査は、Blueskyプラットフォームから4000件の注釈付きインザミルポストの新たなベンチマークであるModerrationBenchに基礎を置いている。
我々の実験によると、基礎モデルはBlueskyのデプロイモデレーションシステムを大幅に上回り、ベンチマークでRandom PostsでF_1$スコア(0.60対0.22)を3倍にし、インストラクションとサンプル駆動のパラダイムの両方が同等のピーク効率を達成する。
以上の結果から,大規模かつ信頼性の高い政策運用に向けての道筋をたどることができた。
関連論文リスト
- Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning [76.93011742289768]
強い言語モデルから弱い言語モデルへの推論能力の蒸留は、典型的には特定の解軌跡を模倣する。
この軌道レベルの模倣は、伝達可能な問題解決スキルの獲得よりも、インスタンス固有のステップの記憶を促進する。
再利用可能な戦略蒸留にインスタンスレベルの軌道模倣を置き換えた戦略誘導型政策最適化を提案する。
論文 参考訳(メタデータ) (2026-06-23T02:14:12Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs [49.66344956133349]
推論能力は、大規模な(ビジョン)言語モデルのための推論時間性能と強化学習(RL)トレーニングの両方を形作る。
本稿では,戦略的文脈化のための潜在変数をモデルに付与する新しい潜在変調フレームワークであるReasoning Paletteを提案する。
論文 参考訳(メタデータ) (2025-12-19T03:32:53Z) - Offline Reinforcement Learning with Generative Trajectory Policies [6.501269050121785]
生成モデルは、オフラインの強化学習のための強力なポリシーのクラスとして登場した。
遅くて反復的なモデルは計算コストが高く、一貫性ポリシのような高速で単一ステップのモデルは、しばしば性能の低下に悩まされる。
提案するジェネレーティブ・トラジェクトリ・ポリティクス(GTP)は,基礎となるODEのソリューションマップ全体を学ぶための,より汎用的な政策パラダイムである。
論文 参考訳(メタデータ) (2025-10-13T15:06:28Z) - Merge and Guide: Unifying Model Merging and Guided Decoding for Controllable Multi-Objective Generation [49.98025799046136]
Merge-And-GuidEは、ガイド付きデコーディングにモデルマージを利用する2段階のフレームワークである。
ステージ1では、MAGEはガイダンスとベースモデルの互換性の問題を解決する。
ステージ2では、明示的で暗黙的な値モデルを統一的なガイダンスプロキシにマージします。
論文 参考訳(メタデータ) (2025-10-04T11:10:07Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Goal-Conditioned Imitation Learning using Score-based Diffusion Policies [3.49482137286472]
スコアベース拡散モデル(SDM)に基づく新しいポリシー表現を提案する。
我々はゴール・コンディションド・イミテーション・ラーニング(GCIL)の領域に新しい政策表現を適用した。
直感的なガイダンスを用いて,遊びデータから目標に依存しないポリシーを学習するためにBESOをどのように利用できるかを示す。
論文 参考訳(メタデータ) (2023-04-05T15:52:34Z) - Random Actions vs Random Policies: Bootstrapping Model-Based Direct
Policy Search [0.0]
本稿では,初期データ収集手法がその後の力学モデルの学習に与える影響について検討する。
ダイナミクスモデルは、モデル上で直接ポリシー探索を行うために、与えられたタスクの真の遷移関数を近似する。
論文 参考訳(メタデータ) (2022-10-21T08:26:10Z) - Contextual Policy Transfer in Reinforcement Learning Domains via Deep
Mixtures-of-Experts [24.489002406693128]
そこで本稿では,タスクのダイナミクスに関する状態依存的信念を学習するための,新しいミックス・オブ・エキスパートの定式化について紹介する。
我々は、このモデルを標準ポリシー再利用フレームワークに組み込む方法を示す。
論文 参考訳(メタデータ) (2020-02-29T07:58:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。