論文の概要: Understanding Censorship in Large Language Models: From Mechanisms to Governance
- arxiv url: http://arxiv.org/abs/2606.30661v1
- Date: Tue, 16 Jun 2026 18:48:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.61252
- Title: Understanding Censorship in Large Language Models: From Mechanisms to Governance
- Title(参考訳): 大規模言語モデルにおける検閲の理解:メカニズムからガバナンスへ
- Abstract要約: 大規模言語モデル(LLM)は情報へのアクセスを仲介する傾向にあるが、その応答はトレーニングデータキュレーション、アライメント手順、プロバイダポリシー、推論時モデレーション、司法規制によって形成されている。
本稿では, LLM検閲を, 排他的排除, 選択的強調, フレーミング効果, 地理的に変化するコンテンツ制御を含む社会技術的現象として検討する。
- 参考スコア(独自算出の注目度): 20.036142577511455
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) increasingly mediate access to information, yet their responses are shaped by training-data curation, alignment procedures, provider policies, inference-time moderation, and jurisdictional regulation. This paper examines LLM censorship as a sociotechnical phenomenon that extends beyond explicit refusals to include omissions, selective emphasis, framing effects, and geographically variable content controls. We synthesize recent empirical studies, provider case studies, regulatory developments, auditing methods, and mitigation strategies to clarify how censorship-like behavior emerges across the model lifecycle. The analysis highlights the tension between safety and openness, the difficulty of measuring soft censorship, the geopolitical divergence of moderation regimes, and the need for transparent, contestable, and independently auditable governance mechanisms. We argue that the central challenge is not whether LLMs should moderate content, but how moderation can be made proportionate, accountable, pluralistic, and resistant to opaque epistemic control.
- Abstract(参考訳): 大規模言語モデル(LLM)は情報へのアクセスを仲介する傾向にあるが、その応答はトレーニングデータキュレーション、アライメント手順、プロバイダポリシー、推論時モデレーション、司法規制によって形成されている。
本稿では, LLM検閲を, 排他的排除, 選択的強調, フレーミング効果, 地理的に変化するコンテンツ制御を含む社会技術的現象として検討する。
我々は,最近の実証研究,提供者事例研究,規制開発,監査方法,緩和戦略を合成し,モデルライフサイクル全体にわたって検閲のような行動がどのように出現するかを明らかにする。
この分析は、安全性とオープン性の間の緊張、ソフト検閲の測定の難しさ、モデレーション体制の地政学的分散、透明性、競争性、独立した監査可能なガバナンスメカニズムの必要性を強調している。
中心的な課題は,LSMが適度な内容を持つべきか否かではなく,不透明なてんかんのコントロールに比例して,説明責任,多元的,抵抗性を持たせることができるか,という点である。
関連論文リスト
- CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - Large Language Models in the Abuse Detection Pipeline [0.23301643766310373]
オンラインの虐待はますます複雑化しており、有害な言語、ハラスメント、操作、不正行為にまたがっている。
従来の機械学習アプローチは、静的分類器や労働集約的なラベル付けに頼って、進化する脅威パターンや、曖昧なポリシー要件に追従する。
大規模言語モデルは、文脈的推論、ポリシー解釈、説明生成、モーダル間理解のための新しい機能を導入します。
論文 参考訳(メタデータ) (2026-03-31T23:42:06Z) - How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities [75.10343190811592]
大規模言語モデル(LLM)は、社会的に敏感なドメインにますますデプロイされる。
私たちのベンチマークでは、安全で制御可能な振る舞いのための原則的で解釈可能なフレームワークを提供しています。
論文 参考訳(メタデータ) (2026-03-03T03:50:13Z) - Information Suppression in Large Language Models: Auditing, Quantifying, and Characterizing Censorship in DeepSeek [8.528757656543604]
本研究では中国で開発されたオープンソースの大規模言語モデル(LLM)であるDeepSeekにおける情報抑制機構について検討する。
我々は、監査フレームワークを提案し、それを646の政治的に敏感なプロンプトに対するモデルの応答を分析するために利用する。
調査では,DeepSeekにおける意味レベルの情報抑圧の証拠を明らかにした。
論文 参考訳(メタデータ) (2025-06-14T05:01:50Z) - Say It Another Way: Auditing LLMs with a User-Grounded Automated Paraphrasing Framework [17.91981142492207]
本稿では,ユーザ行動に根ざした制御されたフレーズを生成するフレームワークであるAUGMENTを紹介する。
AUGMENTは言語的に情報を得た規則を活用し、命令の順守、意味的類似性、リアリズムのチェックを通じて品質を強制する。
ケーススタディでは、制御されたパラフレーズは、制約のない変動の下で隠されたままの系統的な弱点を明らかにする。
論文 参考訳(メタデータ) (2025-05-06T14:17:30Z) - Media and responsible AI governance: a game-theoretic and LLM analysis [61.132523071109354]
本稿では,信頼できるAIシステムを育成する上での,AI開発者,規制当局,ユーザ,メディア間の相互作用について検討する。
進化的ゲーム理論と大言語モデル(LLM)を用いて、異なる規制体制下でこれらのアクター間の戦略的相互作用をモデル化する。
論文 参考訳(メタデータ) (2025-03-12T21:39:38Z) - Algorithmic Arbitrariness in Content Moderation [1.4849645397321183]
コンテンツモデレーションツールは、サンプルを任意に有毒と分類する方法を示す。
我々は、国際公民権条約(ICCPR)が定める人権の観点からこれらの知見について議論する。
本研究は、コンテンツモデレーションアプリケーションにおいて、任意性の透明性を識別し、向上する必要性を浮き彫りにする。
論文 参考訳(メタデータ) (2024-02-26T19:27:00Z) - Exploring the Jungle of Bias: Political Bias Attribution in Language Models via Dependency Analysis [86.49858739347412]
大規模言語モデル(LLM)は、これらのモデルにおけるバイアスの頻度とその緩和に関する激しい議論を引き起こしている。
本稿では,意思決定プロセスに寄与する属性の抽出と仲介を行うためのプロンプトベースの手法を提案する。
観察された異なる治療は、少なくとも部分的には、属性の相違とモデルの相違によるものであることが判明した。
論文 参考訳(メタデータ) (2023-11-15T00:02:25Z) - Accountability in Offline Reinforcement Learning: Explaining Decisions
with a Corpus of Examples [70.84093873437425]
本稿では、オフラインデータセットを決定コーパスとして利用するAOC(Accountable Offline Controller)を紹介する。
AOCはローデータシナリオで効果的に動作し、厳密なオフラインの模倣設定まで拡張でき、保存性と適応性の両方の品質を示す。
シミュレーションおよび実世界の医療シナリオにおいて、AOCのパフォーマンスを評価し、説明責任を維持しながら高いレベルのパフォーマンスでオフライン制御タスクを管理する能力を強調した。
論文 参考訳(メタデータ) (2023-10-11T17:20:32Z) - LLM Censorship: A Machine Learning Challenge or a Computer Security
Problem? [52.71988102039535]
セマンティック検閲は決定不能な問題として認識できることを示す。
我々は、知識のある攻撃者が不寛容なアウトプットを再構築できるため、これらの課題はセマンティックな検閲を超えて拡張されていると論じる。
論文 参考訳(メタデータ) (2023-07-20T09:25:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。