論文の概要: Raising the Bar for Chinese Adolescent LLM Safety: A Culturally-Grounded, Fine-Grained Benchmark
- arxiv url: http://arxiv.org/abs/2609.35902v1
- Date: Mon, 28 Sep 2026 03:43:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.884601
- Title: Raising the Bar for Chinese Adolescent LLM Safety: A Culturally-Grounded, Fine-Grained Benchmark
- Title(参考訳): 青少年の安全を守るためのバーを作る: 文化的に見事なベンチマーク
- Abstract要約: 既存の中国の安全ベンチマークは主に一般ユーザーをターゲットにしており、青少年の安全に限定的な注意を払っている。
QH-Benchは、青年期のコンテンツ安全性のための中国語のベンチマークである。
13のオープンウェイトモデルの評価では、オフライン接触シナリオを共通の弱点として認識している。
- 参考スコア(独自算出の注目度): 31.42592774893967
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety risks in conversations with adolescents are not always explicit. A request may appear harmless unless a model considers the user's age, circumstances, and earlier turns. Existing Chinese safety benchmarks mainly target general users and give limited attention to adolescent safety. Single-turn tests also miss risks that emerge over several turns. QH-Bench is a Chinese-language benchmark for adolescent content safety, with scenarios grounded in Chinese social and cultural settings. The single-turn track contains 715 test items organized into 10 risk domains, 50 subdomains, and 143 fine-grained risk scenarios. The multi-turn track contains 100 four-turn trajectories in a balanced 10-by-10 design that combines the same ten domains with ten cross-turn mechanisms. Both tracks use the same five-level safety-helpfulness scale and automatic judge, with track-specific criteria. Evaluation of 13 open-weight models identifies offline-contact scenarios as a shared weakness. Every model receives negative scores on more than half of the items involving offline meetings with online contacts, unfamiliar groups, and adults. This includes InternLM2.5-20B, the single-turn leader; negative scores indicate responses that partially or clearly facilitate risk. GLM-4-32B, the multi-turn leader, receives negative scores on 60% of complete trajectories in which users build relationships before invoking loyalty or confidentiality. These findings identify two priorities for the evaluated models: handling adolescent offline-contact risks and maintaining safety boundaries under relational pressure. Leading aggregate scores do not establish that these specific weaknesses have been resolved.
- Abstract(参考訳): 青少年との会話における安全リスクは必ずしも明確ではない。
モデルがユーザの年齢、状況、およびそれ以前のターンを考慮しなければ、要求は無害に見える可能性がある。
既存の中国の安全ベンチマークは主に一般ユーザーをターゲットにしており、青少年の安全に限定的な注意を払っている。
シングルターンテストは、数回にわたって発生するリスクも見逃す。
QH-Benchは、青少年向けコンテンツ安全性のための中国語のベンチマークで、中国の社会的・文化的設定に基礎を置いている。
シングルターントラックには、10のリスクドメイン、50のサブドメイン、143のきめ細かいリスクシナリオで構成された715のテスト項目が含まれている。
マルチターントラックは、同じ10ドメインと10のクロスターン機構を組み合わせたバランスのとれた10~10の設計で100個の4ターン軌道を含んでいる。
両方のトラックは同じ5段階の安全ハーフネススケールと自動判断器を使用しており、トラック固有の基準がある。
13のオープンウェイトモデルの評価では、オフライン接触シナリオを共通の弱点として認識している。
各モデルは、オンラインの連絡先、馴染みのないグループ、そして大人とのオフラインミーティングを含む項目の半数以上で負のスコアを受け取る。
これにはシングルターンのリーダであるInternLM2.5-20Bが含まれている。
マルチターンリーダーであるGLM-4-32Bは、ユーザーが忠誠心や機密性を呼び出す前に関係を構築する完全な軌道の60%で負のスコアを受け取る。
これらの結果から, 青年期におけるオフライン接触リスクの扱いと, リレーショナルプレッシャー下での安全境界維持の2つの優先順位が示された。
集計スコアのリードは、これらの特定の弱点が解決されたことを証明していない。
関連論文リスト
- SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models [73.04773649437375]
マルチモーダル・セーフティ・モデレーションは、視覚的コンテンツ、ユーザ意図、およびアシスタント行動から生じるリスクを区別する必要がある。
SafeAtlas-VLは、1.5Mのトレーニングインスタンスのデータセットで、画像、要求レベル、応答レベルを5段階の順序で判定する。
SafeAtlas-Benchは5段階の予測と継続的なリスクスコアを評価するための5000のインスタンスである。
論文 参考訳(メタデータ) (2026-08-29T07:08:01Z) - Beyond Unsafe Detection: Counterfactually Anchored Evidence Attribution for Multi-Turn LLM Safety Failures [0.0]
行動検証とエビデンス監視を備えたマルチターンデータセットを構築した。
データセットには、敵対的な会話、良性双生児、高リスク語彙の良性変異を含む1,762の会話が含まれている。
我々は、安全違反を予測する軽量な階層属性モデルをトレーニングし、それらがユーザのターンとトークンスパンに寄与しているとみなす。
論文 参考訳(メタデータ) (2026-08-17T00:37:56Z) - CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment [55.74660714572696]
大きな言語モデル(LLM)から生成された悪意のあるコンテンツは、深刻な安全リスクと倫理的懸念を引き起こす可能性がある。
既存のLLMの安全ガードレールは英語や多言語の設定では優れているが、中国固有の規制政策、文化的文脈、言語的ニュアンスには適応していない。
我々は,中国のシナリオに対して,5マクロ,31マイクロカテゴリの細粒度リスク分類を導入し,中国向けLLMコンテンツ安全ガードレールであるCHILLGuardを構築した。
論文 参考訳(メタデータ) (2026-06-13T16:57:51Z) - The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models [35.56441154476198]
7~11歳の子ども向け大規模言語モデルの安全性を評価するベンチマークであるKIDBenchを紹介する。
KIDBenchには10のカテゴリにわたる現実的な子クエリがあり、シングルターンプロンプトとマルチターンの子-アクターシミュレーションがある。
KIDGuardLlamaは子供指向の反応モデルであり、KIDBenchがより安全な子供向けAIをどのようにサポートするかを示している。
論文 参考訳(メタデータ) (2026-05-25T07:14:58Z) - XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity [3.342964361434013]
XL-SafetyBenchは10の国語対にわたる5500のテストケーススイートである。
国に面した敵のプロンプトのジェイルブレイクベンチマークと、地元の感性が無害な要求に埋め込まれた文化ベンチマークで構成されている。
各アイテムは多段階パイプラインを通じて構築され、LSM支援の原則的発見、自動検証ゲート、国毎に独立したネイティブスピーカーアノテーションが組み合わされている。
論文 参考訳(メタデータ) (2026-05-07T04:35:03Z) - CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models [55.0103764229311]
本稿では,学生用個人安全の概念を提案し,教育理論に基づくCASTLEの構築を行う。
このベンチマークは、92,908のバイリンガルシナリオを含む15の教育安全リスクと14の学生属性をカバーしている。
論文 参考訳(メタデータ) (2026-02-05T13:13:19Z) - SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth [14.569766143989531]
子供や青年を対象とするアプリケーションにおける大規模言語モデル(LLM)の急速な普及は、一般的なAI安全フレームワークの根本的な再評価を必要とする。
本稿では,年齢別認知,情緒的,社会的リスクなどの不適切な範囲を含む,既存のLCM安全性ベンチマークにおける重要な欠陥を明らかにする。
SproutBenchは,情緒的依存やプライバシー侵害,危険行動の模倣といったリスクを調査するための,1,283の発達的根拠を持つ敵のプロンプトからなる,革新的な評価スイートである。
論文 参考訳(メタデータ) (2025-08-14T18:21:39Z) - AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons [62.374792825813394]
本稿ではAI製品リスクと信頼性を評価するための業界標準ベンチマークとして,AIluminate v1.0を紹介する。
このベンチマークは、危険、違法、または望ましくない行動を12の危険カテゴリーで引き起こすように設計されたプロンプトに対するAIシステムの抵抗を評価する。
論文 参考訳(メタデータ) (2025-02-19T05:58:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。