論文の概要: Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges
- arxiv url: http://arxiv.org/abs/2609.01210v1
- Date: Tue, 01 Sep 2026 13:15:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.67923
- Title: Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges
- Title(参考訳): 審査員は誰か? 中国の安全QAベンチマークによるLCMの対応評価と安全判断
- Authors: Rui Yang, Shuang Huang, Junhua Liu, Ziqi Zhao, Qingzhong Yan, Yuhang Sun, Cong Liu, Guoping Hu, Rui Mei, Jing Shao,
- Abstract要約: C-SafeQAは中国の有害物質評価のための政策ベースベンチマークである。
538のベースクエリと8,877の逆クエリで構成される。
目標モデル安全性の評価と7人の自動安全判事の監査の両方をサポートする。
- 参考スコア(独自算出の注目度): 32.82564087054653
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety benchmarks for large language models often assess the risk of a user query, although the outcome of question answering depends on whether the response violates a policy. This distinction is critical in Chinese harmful-content evaluation, where linguistic variation and adversarial transformations can obscure risky intent. We introduce C-SafeQA, a policy-grounded benchmark for response-level Chinese safety evaluation. It comprises 538 base queries and 8,877 adversarial queries answered by four full-model LLM deployments, yielding 37,660 query-response records labeled safe, unsafe, or disputed. Reference labels are generated through agreement-aware multi-model adjudication and blind audits of stratified subsets by three safety experts. C-SafeQA supports both evaluation of target-model safety and auditing of seven automated safety judges against shared reference labels. Unsafe-response rates range from 0.93% to 3.35% on base queries and from 11.68% to 30.05% on adversarial queries. On the adversarial subset, judges show substantial trade-offs between unsafe-response recall and risk-query-conditioned safe-response false positive rate, and no judge dominates all metrics. Both acrostic transformations reduce unsafe recall for all seven judges, revealing mechanism-specific evaluator weaknesses. Dataset records, metadata, verification code, and judge scripts are publicly released to support recomputation, while benchmark construction, target-response generation, and private adjudication remain outside the release boundary.
- Abstract(参考訳): 大きな言語モデルの安全性ベンチマークは、ユーザクエリのリスクを評価することが多いが、質問応答の結果は、レスポンスがポリシーに違反しているかどうかによって異なる。
この区別は、言語的変化と敵対的変換がリスクのある意図を曖昧にする中国の有害コンテンツ評価において重要である。
C-SafeQA(C-SafeQA)は,中国の安全度評価のための評価基準である。
538のベースクエリと8,877の逆クエリを4つのフルモデルLCMデプロイメントで回答し、37,660のクエリ応答レコードをセーフ、アンセーフ、あるいは競合するとして出力する。
基準ラベルは、3人の安全専門家による合意を意識したマルチモデル適応と、階層化されたサブセットの盲目監査によって生成される。
C-SafeQAは、目標モデル安全性の評価と、共有基準ラベルに対する7人の自動安全判事の監査の両方をサポートする。
非安全応答速度は、ベースクエリでは0.93%から3.35%、逆クエリでは11.68%から30.05%である。
反対のサブセットでは、裁判官は安全でないリコールとリスク条件の安全応答の偽陽性率の間にかなりのトレードオフを示しており、すべての指標を支配している裁判官はいない。
どちらのアクロスティック変換も、7人の裁判官全員の安全でないリコールを減らし、メカニズム固有の評価器の弱点を明らかにする。
データセットレコード、メタデータ、検証コード、および判定スクリプトは、再計算をサポートするために公開され、ベンチマークの構築、ターゲット応答生成、およびプライベートな調整は、リリースバウンダリの外にある。
関連論文リスト
- EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models [3.659020283346239]
VLM安全性のためのエビデンス基盤フレームワークであるEviSafeを紹介する。
自然なユーザ向け行動、テキストおよび視覚的証拠の明確な根拠、および反事実的変化に対する行動感受性を共同で評価する。
EviSafeBenchは、フレームワークを1,181金の画像テキストシナリオで制御されたベンチマークとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-08-24T14:32:25Z) - On the Adversarial Robustness of Multimodal LLM Judges [49.80009278197918]
審査員として機能する汎用MLLMの対角的堅牢性を評価するための最初のフレームワークであるRobustMLLMJudgeを紹介する。
RobustMLLMJudgeを用いて、異なるMLLM審査員は、スコアを膨らませる敵攻撃に対して非常に脆弱であることを明らかにした。
MGSIAは,MLLM審査員に対するより効果的かつ伝達可能な攻撃を可能にするために,これらの制約を回避した新しい手法である。
論文 参考訳(メタデータ) (2026-06-14T05:30:20Z) - LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories [9.66073988835485]
大規模言語モデルは、金融などの規制領域における機械によるアドバイスに関連する安全性の問題を特定する上で、信頼性の低い判断である。
モデルの判断の不整合度は、選択された安全基準によって大きく異なる。
異なる裁判官の間では、ドメイン、安全基準、言語にまたがる同じアウトプットについて高い意見の相違がある。
論文 参考訳(メタデータ) (2026-05-29T14:50:08Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation [21.864019348357303]
大規模言語モデル(LLM)は、質問応答(QA)のための自動判断器として、ますます使われている。
提案した基準が判定モデルのパラメトリック知識と矛盾すると,結果の信頼性が低下し,評価精度が著しく低下することを示す。
我々は、この脆弱性は、裁判官がパラメトリック知識を過度に信頼していることによって引き起こされていることを実証的に示す。
論文 参考訳(メタデータ) (2026-01-12T13:05:13Z) - Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges [3.168632659778101]
我々は、一般的に見落とされがちな2つの重要な課題について強調する: (i) 迅速な感度や分布シフトなどの要因がパフォーマンスに影響を及ぼす野生における評価、(ii) 裁判官を標的とする敵攻撃。
モデル出力のスタイルなどの小さな変更は、同じデータセット上の偽陰性率で最大0.24のジャンプを引き起こす可能性がある一方で、モデル生成に対する敵対的な攻撃は、一部の裁判官を騙して、有害な世代を100%安全なものと誤分類する可能性があることを示す。
論文 参考訳(メタデータ) (2025-03-06T14:24:12Z) - SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models [75.67623347512368]
MLLMの安全性評価を行うための総合的なフレームワークであるツールンを提案する。
我々のフレームワークは、包括的な有害なクエリデータセットと自動評価プロトコルで構成されています。
本研究では,広く利用されている15のオープンソースMLLMと6つの商用MLLMの大規模実験を行った。
論文 参考訳(メタデータ) (2024-10-24T17:14:40Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。