論文の概要: When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison
- arxiv url: http://arxiv.org/abs/2607.26795v1
- Date: Wed, 29 Jul 2026 11:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.654623
- Title: When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison
- Title(参考訳): Span-Guided detoxification はいつ有効か? : 制御された比較におけるヒトの選好と評価者診断
- Abstract要約: span-guided rewritingは、注釈付き有害なスパンに編集をローカライズすることで意味を保つことを目的としているが、同じ制約は有害な意図を十分に緩和することができない。
我々は、固定された単世代環境下で、密集した盲目評価を行う。
人間の好みは、一様に優れた書き直し戦略というよりも、トレードオフを明らかにする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Span-guided rewriting aims to preserve meaning by localizing edits to annotated harmful spans, but the same constraint can leave harmful intent insufficiently mitigated. We present a controlled exploratory comparison of span-guided and unguided detoxification on a mixed-source English evaluation set comprising manually curated inputs and HateXplain test items. We conduct a dense blinded human evaluation under a fixed single-generator setting. Human preferences reveal a trade-off rather than a uniformly superior rewriting strategy. Span-guided outputs are favored when localized editing preserves the original stance and avoids unnecessary modification, whereas unguided outputs are favored when broader rewriting achieves more complete mitigation. This contrast varies substantially across the study-defined strata: the two strategies are competitive in the strong stratum, while unguided rewriting is clearly preferred in the mild stratum. Rationale annotations trace this difference to complementary failure risks: residual harm after localized editing and over-modification after broader rewriting. We treat automatic evaluation as a diagnostic rather than a substitute for human judgment. Toxicity-similarity scalarizations, a multi-generator analysis, and two general-purpose LLM judges reproduce parts of the aggregate tendency but do not yield an analogous stratified contrast. These setting-specific findings do not establish a severity-based routing rule. Instead, they motivate evaluation protocols that assess mitigation sufficiency and meaning preservation separately and report both residual harm and over-modification alongside aggregate scores.
- Abstract(参考訳): span-guided rewritingは、注釈付き有害なスパンに編集をローカライズすることで意味を保つことを目的としているが、同じ制約は有害な意図を十分に緩和することができない。
本研究では,手作業による入力とHateXplainテスト項目からなる混合ソース英語評価セットに対して,スパンガイドおよびアンガイドデトックス化の制御された探索比較を行った。
我々は、固定された単世代環境下で、密集した盲目評価を行う。
人間の好みは、一様に優れた書き直し戦略というよりも、トレードオフを明らかにする。
局所的な編集が元の姿勢を保ち、不要な修正を避ける際には、スパン誘導の出力が好まれる一方、より広範な書き換えがより完全な緩和を達成する際には、非ガイド出力が好まれる。
このコントラストは研究が定義した地層によって大きく異なり、二つの戦略は強い地層では競争力があり、一方、軽微な地層ではガイドなしの地層では明らかに好まれる。
Rationaleアノテーションは、この違いを補完的な失敗のリスク、すなわち、局所的な編集後の残酷さと、より広範な書き換え後の過度な修正に言及している。
我々は人的判断の代用としてではなく診断として自動評価を扱う。
毒性類似性スカラー化、多世代解析、および2つの汎用LCM判定器は、凝集傾向の一部を再現するが、類似の層状コントラストは生じない。
これらの設定特異的な発見は、深刻度に基づくルーティングルールを確立しない。
その代わりに、緩和能力と保存の意味を別々に評価する評価プロトコルをモチベーションし、アグリゲーションスコアとともに残余の害と過度な修正の両方を報告します。
関連論文リスト
- LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition [19.651323641444726]
決定論的TEDS評価は、FinTabNetとOmniDocBenchを使って制御されたテストベッドを提供する。
判定信号は両方のデータセットで弱かった。
厳しい損害は 特定の判事のフィードバックなしに 発生しました
論文 参考訳(メタデータ) (2026-07-15T00:14:31Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement [50.34437999083224]
オートレーダは、評価と自動モデレーションコンテンツにますます使われています。
ヒトとオートレーダの両方に提示されるルーブリックの修正がスコアアグリーメントにどのように影響するかは、統計学的に限定されている。
論文 参考訳(メタデータ) (2026-05-07T13:55:11Z) - How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation [0.38991526486631006]
優先信号がプロンプト間で拡散している場合、比例アロケーションは最小値最適であることを示す。
以上の結果から,非決定的あるいは否定的な評価結果が,モデル等価性よりも低パワー評価を反映していることが示唆された。
論文 参考訳(メタデータ) (2026-01-14T02:34:58Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z) - Weakly-Supervised Cross-Domain Adaptation for Endoscopic Lesions
Segmentation [79.58311369297635]
異なるデータセットにまたがるトランスファー可能なドメイン不変知識を探索できる,新しい弱い教師付き病巣移動フレームワークを提案する。
wasserstein quantified transferability frameworkは、広い範囲の転送可能なコンテキスト依存性を強調するために開発されている。
新規な自己監督型擬似ラベル生成器は、送信困難かつ転送容易なターゲットサンプルの両方に対して、確実な擬似ピクセルラベルを等しく提供するように設計されている。
論文 参考訳(メタデータ) (2020-12-08T02:26:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。