論文の概要: Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting
- arxiv url: http://arxiv.org/abs/2607.26200v1
- Date: Tue, 28 Jul 2026 19:05:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.454151
- Title: Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting
- Title(参考訳): フィルタ配置と応答書き換えにおけるエンドツーエンドのトレードオフ
- Abstract要約: コンテント・モデレーションの選択は,コンポーネントの精度ではなく,顧客アウトカムの指標を用いて評価する。
入力のみ、レスポンスのみ、および入力 + 応答ハードブロッキングを、ヒューマンラベル付き製品ベンチマークと公開ToxicChat評価で比較する。
レスポンスのみのブロックをResponse+リライトで置き換えると、ブロックされたトラフィックが回復し、選択した設定に対してのみブロックされるResponseと同じHarmful Exposureカウントが返される。
- 参考スコア(独自算出の注目度): 1.7030364987743507
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Content-moderation classifiers are usually evaluated in isolation, but deployment requires choosing where to intervene and what follows a flag. We evaluate these choices using two end-to-end customer-outcome metrics rather than component accuracy: Usefulness, the fraction of turns with a shown, non-harmful, relevant response, and Harmful Exposure, the fraction with a shown harmful response. Latency and error rates are diagnostics. We compare Input only, Response only, and Input + response hard blocking on a human-labelled product benchmark and public ToxicChat evaluation. At the evaluated operating points, Response only achieves the highest filter-only Usefulness in both settings, while Input + response achieves lower Harmful Exposure. Replacing Response only blocking with Response + rewrite recovers most blocked traffic and yields the same observed Harmful Exposure count as Response only blocking for the selected configuration; this equality is not an equivalence result. Probe routing substantially reduces conditional route-and-generation time relative to LLM routing at comparable measured outcomes. A focused output review shows how rewrites balance filter passage with usefulness by generalizing triggering language while retaining benign intent and safe redirection; some sensitive-domain outputs nevertheless omit potentially safety-relevant support information. These results support comparing moderation configurations under deployment-specific safety and latency constraints rather than applying a universal placement rule. Code and public artifacts are available at https://github.com/microsoft/mod-frontier
- Abstract(参考訳): コンテンツモデレーション分類器は通常、独立して評価されるが、デプロイには、どこに介入するか、フラグに従うかを選択する必要がある。
これらの選択は、コンポーネントの精度よりも、エンド・ツー・エンドの顧客・アウトカムの指標を用いて評価する。
レイテンシとエラー率は診断である。
入力のみ、レスポンスのみ、および入力 + 応答ハードブロッキングを、ヒューマンラベル付き製品ベンチマークと公開ToxicChat評価で比較する。
評価された操作ポイントでは、Responseは両方の設定でフィルタオンリーのUsefulnessしか達成せず、Input + ResponseはHarmful Exposureが低い。
Replacing Response only block with Response +writeは、ほとんどのブロックされたトラフィックを回復し、選択された構成に対してのみブロックされるResponseと同じHarmful Exposureカウントを得る。
プローブルーティングは、LLMルーティングと同等の測定結果に対する条件付きルート・アンド・ジェネレーション時間を大幅に短縮する。
集中したアウトプットレビューでは、適切な意図と安全なリダイレクトを維持しながら、トリガー言語を一般化することで、フィルタパスの書き直しが有用であることを示し、機密領域のアウトプットによっては、潜在的に安全に関連するサポート情報を省略している。
これらの結果は、普遍的な配置ルールを適用するのではなく、デプロイメント固有の安全性とレイテンシ制約の下でのモデレーション構成の比較をサポートする。
コードと公開アーティファクトはhttps://github.com/microsoft/mod-frontierで入手できる。
関連論文リスト
- Scoring Without the Engine: Validating a Deterministic, Manipulation-Resistant Content Score for Generative Engines, End to End [0.0]
本稿では,プロキシの定義と選択を行うために,逆ファルシフィケーションゲート上に構築されたプロトコルを提案する。
我々は、プロキシが決定論的コンテンツスコアであるジェネレーティブエンジン最適化について、エンドツーエンドで示す。
論文 参考訳(メタデータ) (2026-09-07T14:40:28Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison [0.0]
span-guided rewritingは、注釈付き有害なスパンに編集をローカライズすることで意味を保つことを目的としているが、同じ制約は有害な意図を十分に緩和することができない。
我々は、固定された単世代環境下で、密集した盲目評価を行う。
人間の好みは、一様に優れた書き直し戦略というよりも、トレードオフを明らかにする。
論文 参考訳(メタデータ) (2026-07-29T11:37:12Z) - RSRank: Learning Relevance from Representational Shifts [2.996596877662786]
関連度スコアの校正を行うため,予測RSを学習する軽量なトレーニングフレームワークを導入する。
トレーニングの目的は、無関係なコンテンツをゼロしきい値で自然にフィルタリングし、依存調整を減らすことである。
論文 参考訳(メタデータ) (2026-06-16T03:29:23Z) - A Sentence Relation-Based Approach to Sanitizing Malicious Instructions [15.879266080043076]
現在の防衛措置は、しばしばLLMベースの検出器を使用して、そのようなコンテンツをフィルタリングする。
SONARは,自然言語推論のメトリクスを用いて注入されたコンテンツを識別・除去する,迅速な衛生化フレームワークである。
SONARは攻撃成功率をほぼゼロに減らし、確立された9つのベースライン防御を著しく上回った。
論文 参考訳(メタデータ) (2026-05-01T20:22:40Z) - ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval [12.84859278829763]
我々は,答え中心の関連信号を用いて強陰性サンプルを精査するためのARHN(Answer-centric Relabeling of Hard Negatives)を提案する。
BEIRベンチマークのARHNを3つの構成で評価した。
論文 参考訳(メタデータ) (2026-04-13T07:11:30Z) - Principled Context Engineering for RAG: Statistical Guarantees via Conformal Prediction [40.28465841863481]
Retrieval-Augmented Generation (RAG)は、大規模言語モデルにおける現実的な基盤を強化する。
既存の前世代のフィルターは信頼性のスコアに依存しており、保持された証拠に対する統計的制御を提供していない。
本研究では,コンフォメーション予測によるコンテキスト工学の実証を行う。
論文 参考訳(メタデータ) (2025-11-22T04:17:06Z) - MARS-Sep: Multimodal-Aligned Reinforced Sound Separation [72.85468563236005]
MARS-Sepは音分離のための強化学習フレームワークである。
クリッピングされた信頼領域サロゲートによって最適化された、ファクタライズされたベータマスクポリシを学ぶ。
複数のベンチマークの実験は、テキスト、オーディオ、イメージ-キュード分離において一貫した利得を示している。
論文 参考訳(メタデータ) (2025-10-12T09:05:28Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - AMRFact: Enhancing Summarization Factuality Evaluation with AMR-Driven Negative Samples Generation [57.8363998797433]
抽象的意味表現(AMR)を用いた摂動要約を生成するフレームワークであるAMRFactを提案する。
提案手法は,AMRグラフに一貫した要約を解析し,制御された事実不整合を注入して負の例を生成し,一貫性のない事実不整合要約を高い誤差型カバレッジで生成する。
論文 参考訳(メタデータ) (2023-11-16T02:56:29Z) - IDEAL: Influence-Driven Selective Annotations Empower In-Context Learners in Large Language Models [63.15355173909631]
本稿では,影響駆動型選択的アノテーション手法を提案する。
アノテーションのコストを最小限に抑えつつ、コンテキスト内サンプルの品質を向上させることを目的としている。
様々なベンチマークで提案手法の優位性を確認する実験を行った。
論文 参考訳(メタデータ) (2023-10-16T22:53:54Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。