論文の概要: Benchmarking LLM Compliance with China AI Generated Content Regulations
- arxiv url: http://arxiv.org/abs/2609.19989v1
- Date: Thu, 17 Sep 2026 09:58:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.211846
- Title: Benchmarking LLM Compliance with China AI Generated Content Regulations
- Title(参考訳): LLM準拠の中国AI生成コンテンツ規制のベンチマーク
- Abstract要約: 本稿は、中国の現在のAI生成コンテンツコンプライアンス要件に従い、20の著名なLCMに対して評価結果を提供する。
自己構築型憲法問題203件を含む6次元にわたる2303件の質問に対するコンプライアンスと拒絶率を評価するための新しい枠組みを設計する。
国際モデルは、標準中国語の質問が使われているにもかかわらず、高いレベルのコンプライアンスを示しており、主な違いはイデオロギーのアライメントと密接に関連する次元に由来する可能性がある。
- 参考スコア(独自算出の注目度): 6.157895491517149
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The widespread adoption of LLMs has led to escalating content compliance risks. Prior works have contributed to addressing these risks in the English context, downplaying the complexity of Chinese language content. This paper follows China's current AI-Generated content compliance requirements and provides evaluation results on 20 notable LLMs, offering insight into China's regulatory landscape. We design a novel framework to assess the compliance and refusal rates with 2303 questions spanning six distinct dimensions, including 203 self-constructed constitutional questions. The framework employs several judges to generate verdicts independently based on their hierarchical alignment memory. Our findings show that international models also exhibit high levels of compliance despite the use of standard Chinese questions, and the main differences may stem from dimensions closely related to ideological alignment. We establish a regulatory benchmark that enables the global AI community to evaluate both Chinese and non-Chinese LLMs under a unified set of legally grounded compliance requirements.
- Abstract(参考訳): LLMの普及により、コンテンツコンプライアンスのリスクがエスカレートされた。
以前の研究は、これらのリスクを英語の文脈で解決し、中国語の内容の複雑さを軽視している。
本稿は、中国の現行のAI生成コンテンツコンプライアンス要件に従い、20の著名なLCMの評価結果を提供し、中国の規制状況に関する洞察を提供する。
自己構築型憲法問題203件を含む6次元にわたる2303件の質問に対するコンプライアンスと拒絶率を評価するための新しい枠組みを設計する。
このフレームワークは、階層的なアライメントメモリに基づいて、独立して検証を生成するために、複数の裁判官を雇っている。
以上の結果から,国際モデルでは標準中国語の質問に対して高いコンプライアンスが得られており,その主な違いはイデオロギーのアライメントと密接に関連していると考えられる。
我々は、国際AIコミュニティが、法的根拠のあるコンプライアンス要件の統一セットの下で、中国と中国以外のLLMを評価できるようにするための規制ベンチマークを確立する。
関連論文リスト
- ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance [49.524070843587594]
本研究では,大規模言語モデル(LLM)を活用し,法的領域における入力コンテキストを基盤とするセミルールベースのフレームワークであるContextLensを提案する。
我々は、General Data Protection Regulation()とEU AI Actをカバーする既存のコンプライアンスベンチマークの実験を行います。
その結果、ContextLensはLLMのコンプライアンス評価を大幅に改善し、トレーニングなしで既存のベースラインを越えられることが示唆された。
論文 参考訳(メタデータ) (2026-04-14T05:35:38Z) - CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs [71.01843542502438]
我々は,中国語大言語モデル(CB-ECLLM)を評価するための総合的ベンチマークを提案する。
CB-ECLLMは、新たに構築された中国データテキストペア(CDTP)データセットに基づいている。
CDTPは700万以上のテキストペアで構成されており、それぞれが1つ以上の対応する3重テキストと、4つの重要なドメインにまたがる合計1500万の3重テキストで構成されている。
論文 参考訳(メタデータ) (2025-10-07T15:33:52Z) - Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM [42.11889345473452]
法律記事予測(LAP)は、法的テキスト分類において重要な課題である。
法律記事予測のための普遍的な枠組みであるUni-LAPを提案する。
論文 参考訳(メタデータ) (2025-09-26T09:42:20Z) - MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation [86.7047714187813]
MMLU-ProXは29の言語をカバーするベンチマークであり、英語のベンチマーク上に構築されている。
それぞれの言語バージョンは11,829の同一の質問で構成されており、直接言語間比較を可能にする。
効率的な評価ニーズを満たすため,言語毎の質問数は658件である。
論文 参考訳(メタデータ) (2025-03-13T15:59:20Z) - LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models [17.90483181611453]
大規模言語モデル (LLM) は自然言語処理タスクにおいて大きな進歩を遂げており、法的領域においてかなりの可能性を示している。
既存のLLMを法制度に適用し、その可能性や限界を慎重に評価することなく適用することは、法律実務において重大なリスクをもたらす可能性がある。
我々は、標準化された総合的な中国の法律ベンチマークLexEvalを紹介する。
論文 参考訳(メタデータ) (2024-09-30T13:44:00Z) - CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models [53.9835961434552]
本研究では,中国語に対する大規模言語モデル(LLM)の一般化性を評価するために,中国語命令追跡ベンチマーク(CIF-Bench)を導入する。
CIF-Benchは150のタスクと15,000の入力出力ペアで構成され、複雑な推論と中国の文化的ニュアンスをテストするためにネイティブスピーカーによって開発された。
データ汚染を軽減するため、データセットの半分しか公開せず、残りは非公開であり、スコア分散を最小限に抑えるために多種多様な命令を導入する。
論文 参考訳(メタデータ) (2024-02-20T16:02:12Z) - CMMLU: Measuring massive multitask language understanding in Chinese [133.70911295934746]
本稿では, 自然科学, 社会科学, 工学, 人文科学など, さまざまな分野をカバーする総合的な中国のベンチマークを紹介する。
CMMLUは、中国語の文脈における大きな言語モデルの知識と推論能力の評価におけるギャップを埋める。
論文 参考訳(メタデータ) (2023-06-15T15:49:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。