論文の概要: Benchmarking System One Models in Online Moderation
- arxiv url: http://arxiv.org/abs/2610.07953v1
- Date: Tue, 06 Oct 2026 08:25:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.896605
- Title: Benchmarking System One Models in Online Moderation
- Title(参考訳): オンラインモデレーションにおけるベンチマークシステム1モデル
- Abstract要約: システム1モデルは自然言語コンテキストを受け入れるが、型付き選択、確率、スコアを返す。
制御された情報条件を用いて、記述されたルールを分離し、前例を検索し、候補回答空間を制限します。
Jevは、特定の参照システムと競合し、いくつかのポリシーと有害なコンテンツの設定でそれらをマッチングまたは超える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online moderation systems must apply changing platform policies, community rules, and prior decisions while producing decisions that can be audited and routed to human review. We evaluate whether System One Models, which accept natural-language context but return typed choices, probabilities, or scores, can support this setting. Across five moderation benchmarks, Jev is competitive with specialized reference systems, matching or exceeding them in several policy-grounded and harmful-content settings. We then use controlled information conditions to separate written rules, retrieved precedents, and restrictions on the candidate answer space. Jev generally benefits from retrieved precedents, improving exact policy selection and harmful-content discrimination when the answer space is held fixed. Laya is less consistent: retrieval often shifts its positive prediction rate or no-violation rate without improving discrimination. Jev confidence can support selective review in several settings, although it is not consistently calibrated; Laya confidence is less useful for ranking errors. These results show a promising future for SOM-powered content moderation.
- Abstract(参考訳): オンラインのモデレーションシステムでは、プラットフォームポリシーやコミュニティルール、事前決定を適用しながら、監査や人的レビューにルーティング可能な意思決定を行なわなければならない。
自然言語コンテキストを受け入れるが、型付き選択や確率、スコアを返すSystem One Modelsが、この設定をサポートできるかどうかを評価する。
5つのモデレーションベンチマークで、Jevは特定の参照システムと競合し、いくつかのポリシーと有害なコンテンツの設定でそれらをマッチングまたは超える。
次に、制御された情報条件を使用して、記述されたルールを分離し、前例を検索し、候補の回答空間を制限します。
Jevは一般的に、検索された前例の恩恵を受け、回答空間が固定されたときに、正確なポリシー選択と有害なコンテンツ識別を改善します。
ラヤは一貫性が低い: 検索はしばしば、差別を改善することなく、肯定的な予測率または非暴力率をシフトする。
Jevの信頼性はいくつかの設定で選択的なレビューをサポートするが、常に校正されていない。
これらの結果は、SOMによるコンテンツモデレーションの将来性を示す。
関連論文リスト
- VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning [80.69185348729495]
我々は,政策の共進化,訓練カリキュラム,審査を通じて検証をスケールする枠組みを導入する。
ポリシー改善ループは、繰り返し発生する障害を診断し、適応的なカリキュラムを構築し、ポリシーを最適化するためにルーリックな判断を使用する。
運転およびロボットナビゲーションタスクの実験は、ポリシーと判断能力の両方において継続的な自己改善を示す。
論文 参考訳(メタデータ) (2026-10-06T17:50:29Z) - Overwhelmed by Choice: Studying LLM Decision Making at Scale [70.45144023754595]
候補数の増加に伴い,複数選択および候補選択の評価を体系的に評価した。
タスク間での相当な精度劣化、戦略の推進、モデルスケールが見られます。
階層分割と置換に基づく推論は、HotpotQAとMIMICで約20パーセントの精度をN=160$で向上する。
論文 参考訳(メタデータ) (2026-09-26T17:33:04Z) - Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - Actionable Recourse in Competitive Environments: A Dynamic Game of Endogenous Selection [22.661656301757663]
アクションブル・リコースは、AI支援意思決定支援システムが生み出す好ましくない結果を覆すために、個人が実現可能な特徴を修正できるかどうかを研究する。
本研究では,リスクベース選択規則の下での候補間の戦略的相互作用をモデルとした枠組みを提案する。
先に選択した候補が成功のベンチマークと改善の方向性の両方を決定することを示す。
論文 参考訳(メタデータ) (2026-03-18T16:45:11Z) - Optimized Distortion in Linear Social Choice [28.227695590829086]
決定的およびランダムな投票規則に対する線形社会的選択の歪みについて検討する。
候補と票の集合による歪みを最小化する多時間インスタンス最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-10-22T20:42:49Z) - Online Conformal Selection with Accept-to-Reject Changes [14.619101485265322]
アクセプション・トゥ・リジェクト・チェンジ(OCS-ARC)を用いたオンラインコンフォーマル・セレクションを提案する。
オンラインのBenjamini-Hochberg手順を候補選択プロセスに組み込む。
我々は,OCS-ARCが任意の段階において,名目レベル以下で偽発見率(FDR)を制御できることを理論的に保証する。
論文 参考訳(メタデータ) (2025-08-19T13:58:38Z) - LLM-based Rewriting of Inappropriate Argumentation using Reinforcement Learning from Machine Feedback [16.57980268646285]
本稿では,議論における不適切な言語を計算的に緩和する方法について検討する。
コンテンツ保存と適切性のバランスをとるための強化学習に基づく書き直し手法を提案する。
絶対的および相対的評価研究において,報酬関数の重み付け方式について検討した。
論文 参考訳(メタデータ) (2024-06-05T15:18:08Z) - Improving Recommendation System Serendipity Through Lexicase Selection [53.57498970940369]
本稿では,レコメンデーションシステムにおけるエコーチャンバーとホモフィリーの存在を測定するための新しいセレンディピティー指標を提案する。
そこで我々は,レキシケース選択と呼ばれる親選択アルゴリズムを採用することにより,よく知られたレコメンデーション手法の多様性保存性の向上を試みる。
以上の結果から,レキシケースの選択とランキングの混合は,パーソナライゼーション,カバレッジ,セレンディピティー・ベンチマークにおいて,純粋にランク付けされている。
論文 参考訳(メタデータ) (2023-05-18T15:37:38Z) - Recommendation Systems with Distribution-Free Reliability Guarantees [83.80644194980042]
我々は、主に良いアイテムを含むことを厳格に保証されたアイテムのセットを返す方法を示す。
本手法は, 擬似発見率の厳密な有限サンプル制御によるランキングモデルを提供する。
我々はYahoo!のランキングとMSMarcoデータセットの学習方法を評価する。
論文 参考訳(メタデータ) (2022-07-04T17:49:25Z) - Fair Sequential Selection Using Supervised Learning Models [11.577534539649374]
我々は、連続して到着した応募者が限られた数の位置/ジョブを申請する選択問題を考える。
一般の公正概念を満足する事前学習モデルであっても、選択の結果は特定の人口集団に偏っている可能性があることを示す。
本稿では、連続選択問題に適した「平等選択(ES)」という新たなフェアネス概念を導入し、ESフェアネス概念を満たすための後処理アプローチを提案する。
論文 参考訳(メタデータ) (2021-10-26T19:45:26Z) - Confidence-Budget Matching for Sequential Budgeted Learning [69.77435313099366]
問合せ予算で意思決定問題を定式化する。
我々は,多腕バンディット,線形バンディット,強化学習問題を考察する。
我々は,CBMに基づくアルゴリズムが逆性の存在下で良好に動作することを示す。
論文 参考訳(メタデータ) (2021-02-05T19:56:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。