論文の概要: Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages
- arxiv url: http://arxiv.org/abs/2608.22490v1
- Date: Sun, 23 Aug 2026 16:18:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.978733
- Title: Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages
- Title(参考訳): 安全の代償は誰か? 言語間での安全アライメントの異なるコストを測る
- Authors: Chanwoong Yoon, Jungsoo Park, Alan Ritter,
- Abstract要約: 非英語利用者は、英語利用者よりも常に高い安全コストを負担していることが示される。
高リソース言語でさえ、同じレベルの安全性を達成するために、英語よりも大きな安全コストを支払っている。
- 参考スコア(独自算出の注目度): 27.023351936206637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment helps models adhere to human values, but it often reduces response utility. We ask a critical but understudied question: Does safety alignment impose the cost equally across language groups? To answer this, we introduce a rigorous protocol to measure the utility loss imposed solely by safety alignment, which we term Safety Cost. Through direct pairwise comparisons between safety-aligned models and their unaligned counterparts, we find a systematic inequity: non-English users consistently bear a higher Safety Cost than English users. We further identify three underlying patterns. First, multiple languages lie in a double-penalty zone, experiencing both weaker safety protection and larger utility loss. Second, certain languages exhibit apparent utility gains that are in fact a consequence of safety filters failing to engage. Third, even high-resource languages pay a larger Safety Cost than English to reach the same level of safety. We show that these disparities arise from both explicit refusals and implicit qualitative differences across multiple dimensions. By accurately measuring the disparate effects of safety alignment, our findings expose a systematic disparity in current safety alignment practices.
- Abstract(参考訳): 安全アライメントは、モデルが人間の価値に準拠するのに役立つが、応答ユーティリティを減少させることが多い。
セーフティアライメントは、言語グループ全体で均等にコストを課すか?
これに対応するために、安全対策のみに課される実用上の損失を計測する厳格なプロトコルを導入し、安全コストとよばれる。
安全に整合したモデルと不整合なモデルを直接比較した結果、体系的な不平等が判明した。
さらに3つの基本パターンを特定します。
第一に、複数の言語は二重のペナルティゾーンにあり、より弱い安全保護とより大きなユーティリティ損失の両方を経験する。
第二に、一部の言語は、実際に安全フィルタが関与できない結果である明らかな実用性の向上を示している。
第3に、高リソース言語でさえ、同じレベルの安全性に達するために、英語よりも大きな安全コストを支払っている。
これらの相違は、複数の次元にまたがる明示的な拒絶と暗黙的な質的差異の両方から生じることを示す。
安全アライメントの異なる効果を正確に測定することにより,現在の安全アライメントの実践における系統的差異を明らかにすることができる。
関連論文リスト
- Why Do Safety Guardrails Degrade Across Languages? [21.521293656854183]
大規模な言語モデルは、英語以外の言語で安全性の低下を示す。
我々は、安全運転要因を分離する潜在変数モデル、多群項目応答理論(IRT)フレームワークを導入する。
5つの閉モデルファミリーと10の言語にまたがる61のモデル構成の安全性のロバスト性を評価する。
論文 参考訳(メタデータ) (2026-05-16T22:08:54Z) - LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety [88.98698230989186]
大規模言語モデル(LLM)は、しばしば高リソース言語で強力な安全性性能を示すが、低リソース言語では深刻な脆弱性を示す。
このギャップは、言語に依存しない意味理解能力と、高リソース言語に偏った言語に支配的な安全アライメントのミスマッチによるものと考えられる。
セマンティック・アライメント(LASA)を提案し,セマンティック・ボトルネックに直接安全アライメントを固定する。
論文 参考訳(メタデータ) (2026-04-13T15:59:50Z) - Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms [0.5376203747548287]
大きな言語モデル(LLM)のほとんどの安全性評価は、英語で固定されている。
いくつかの害は翻訳のほとんど無傷で生き残るが、他の害は歪んだり消えたりする。
翻訳ベースのベンチマークであるCompositeHarmを導入し、シンタックスとセマンティクスの両方のシフトが安全アライメントをどのように支えているかを検証した。
論文 参考訳(メタデータ) (2026-02-08T13:22:50Z) - Layer-wise Swapping for Generalizable Multilingual Safety [8.658596218544773]
既存の安全データセットは主に英語中心であり、多言語安全アライメントの進歩を制限する。
本稿では、英語の安全専門家から低リソース言語専門家への安全アライメントを追加訓練なしで伝達する安全意識層スワップ手法を提案する。
論文 参考訳(メタデータ) (2026-01-30T06:22:02Z) - Qwen3Guard Technical Report [127.69960525219051]
Qwen3Guardは、多言語安全ガードレールモデルである。
生成的Qwen3Guardは、きめ細かい三級判定を可能にする命令追従タスクとして安全分類をキャストする。
Stream Qwen3Guardは、リアルタイム安全監視のためのトークンレベルの分類ヘッドを導入している。
論文 参考訳(メタデータ) (2025-10-16T04:00:18Z) - MPO: Multilingual Safety Alignment via Reward Gap Optimization [88.76638442683391]
大規模言語モデル(LLM)は、世界中でAIアプリケーションの中心となっている。
RLHFやDPOのような既存の安全アライメントのための選好学習手法は、主に単言語であり、ノイズの多い多言語データと競合する。
本稿では,複数言語間の安全アライメントを改善するために,支配言語(英語)の安全能力の整合性を活用した新しいアプローチである多言語報酬gaP Optimization(MPO)を紹介する。
論文 参考訳(メタデータ) (2025-05-22T16:24:51Z) - LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies [63.10843814055688]
M-ALERTは5つの言語における大規模言語モデルの安全性を評価するベンチマークである。
M-ALERTには言語毎に15kの高品質なプロンプトが含まれており、合計で75k、カテゴリワイドアノテーションがある。
39種類のLLMに関する実験は,言語固有の安全性解析の重要性を強調した。
論文 参考訳(メタデータ) (2024-12-19T16:46:54Z) - All Languages Matter: On the Multilingual Safety of Large Language Models [96.47607891042523]
我々は、大規模言語モデル(LLM)のための最初の多言語安全ベンチマークを構築した。
XSafetyは、複数の言語ファミリーにまたがる10言語にわたる14種類の一般的な安全問題をカバーしている。
本稿では,ChatGPTの多言語安全性向上のための簡易かつ効果的なプロンプト手法を提案する。
論文 参考訳(メタデータ) (2023-10-02T05:23:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。