論文の概要: Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
- arxiv url: http://arxiv.org/abs/2607.06196v1
- Date: Tue, 07 Jul 2026 12:21:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.510137
- Title: Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
- Title(参考訳): Pluralis v0.1:AIリスクと信頼性のための多文化多言語ベンチマークを目指す
- Abstract要約: 現在のAIの安全性評価とベンチマークフレームワークは、重要な地域法、社会言語的ニュアンス、文化タブーを隠蔽する西洋中心の文化非依存のデフォルトに依存している。
Pluralis v0.1は、文化第一の観点から構築された、新しいマルチモーダル、マルチリージョン、マルチ言語データセットである。
- 参考スコア(独自算出の注目度): 46.80780735011334
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Current AI safety evaluation and benchmarking frameworks predominantly rely on Western-centric culture-agnostic defaults that mask critical regional laws, socio-linguistic nuances, and cultural taboos, leaving Vision-Language Models (VLMs) vulnerable in global deployments. We introduce Pluralis v0.1: a novel multimodal, multi-regional, and multilingual dataset built from a culture-first perspective. Spanning 6,448 prompts across six Asia-Pacific countries (Bangladesh, India, Korea, Pakistan, Singapore, Taiwan) and eight languages, Pluralis diverges from prior work by natively sourcing localized safety hazards rather than adapting Western datasets. Crucially, it introduces a multimodal evaluation paradigm: user text (e.g., "Should I gift this?") and an image referring to "this" (e.g., a clock) - both innocuous in isolation, but synergistically triggering specific legal or cultural violations. Pluralis disentangles universal safety violations from localized cultural appropriateness, establishing the latter as a first-class evaluation axis. To operationalize this, we present Judge-Pluralis, an agreement-gated LLM-as-a-Judge ensemble trained on examples classified in an empirically derived cultural taxonomy. Observing VLM behavior on a subset of the Pluralis surfaces recurring, locale-specific failure modes such as image misidentifications with downstream harm, missed item-context-locale interactions, and inadequate refusals. These failure modes vary systematically across locales and languages, exposing blind spots that globally averaged metrics conceal. Ultimately, Pluralis is not presented as a solved evaluation framework for cultural alignment, but rather as a first step and catalyst for future innovation. We call upon the research community to utilize this foundation to advance the science of multilingual, multicultural evaluation to better support AI cultural alignment globally.
- Abstract(参考訳): 現在のAIの安全性評価とベンチマークフレームワークは、主に、重要な地域法、社会言語的ニュアンス、文化タブーを隠蔽する西洋中心の文化非依存のデフォルトに依存しており、ヴィジュアル・ランゲージ・モデル(VLM)は世界展開に脆弱である。
Pluralis v0.1は、文化第一の観点から構築された、新しいマルチモーダル、マルチリージョン、マルチ言語データセットである。
648のアジア太平洋諸国(バングラデシュ、インド、韓国、パキスタン、シンガポール、台湾)と8つの言語にまたがる6,448のプロンプトと、Pluralisは、西洋のデータセットに適応するのではなく、ネイティブにローカライズド・セーフハザードをソーシングすることで、以前の作業から分岐している。
重要なのは、ユーザテキスト(例: "Should I gift this?")と"This"(例: 時計)を参照するイメージ(例: 時計)の両方が独立して無害であるが、相乗的に特定の法的または文化的違反を引き起こす、というマルチモーダルな評価パラダイムを導入することだ。
Pluralisは、普遍的な安全違反を、地域化された文化的適切性から切り離し、後者を第一級評価軸として確立する。
これを運用するために、実証的に派生した文化分類学に分類された事例に基づいて訓練された合意付きLPM-as-a-Judgeアンサンブルであるジャッジ・プラウリスを提示する。
Pluralis面のサブセット上でのVLM動作の観察、下流の害を伴う画像の誤識別、アイテム-コンテキスト-ローカル相互作用の欠如、不適切な拒絶など、ローカライズ固有の障害モード。
これらの障害モードは、地域や言語によって体系的に異なり、世界平均のメトリクスを隠蔽する盲点が明らかになる。
究極的には、プルリスは文化的アライメントのための解決された評価フレームワークとしてではなく、むしろ将来のイノベーションのための第一歩と触媒として提示される。
我々は、この財団を利用して多言語・多文化評価の科学を推進し、世界中のAI文化アライメントを支援するよう研究コミュニティに呼びかける。
関連論文リスト
- Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning [80.05116806217397]
大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
CLLPU(Cross-Lingual and Language-Bound Protocol for LLM Unlearning)は,この問題を2つの設定で定式化する多言語ベンチマークである。
目標とする知識がすべての言語で抑制されるべき共通目標の忘れ、言語条件の忘れ、抑圧は指定された言語に限定されるべきである。
論文 参考訳(メタデータ) (2026-09-05T08:26:15Z) - CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs [59.09971492475217]
TextitCultural Norm Grounded ReasoningのベンチマークであるCultureForestを紹介する。
CultureForestは8つのドメインで5,378のサンプルと53の国/リージョンで構成されている。
大規模な実験では、トップ層モデルでさえ、オープンな設定で大幅に劣化していることが明らかになった。
論文 参考訳(メタデータ) (2026-06-01T08:25:12Z) - When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models [17.6283905669333]
大規模言語モデル(LLM)は言語間知識インターフェースとして広く使われている。
文化に根ざした質問は、しばしば現地の文脈よりも世界的な支配的な物語を反映している。
バングラ語-英語-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ/問合せ-問合せ-問合せ/問合せ-問合せ/問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-問合せ-答
論文 参考訳(メタデータ) (2026-05-28T18:58:32Z) - Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation [58.01855677487771]
本研究では,多言語大言語モデル (MLLM) が,プロンプトの言語変化に伴う不整合性を示すことを示す。
コンセンサス駆動型アライメントフレームワークであるC-3POを提案する。
C-3POは、非整合モデルよりも0.10ポイントの$_S$を絶対的に増加させ、強力なプロンプトと表現のステアリングベースラインを上回る。
論文 参考訳(メタデータ) (2026-04-02T14:04:06Z) - Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion [8.443928474148114]
大規模言語モデル(LLM)は、多言語で多文化的な設定で徐々に展開されている。
本研究は、宗教のセンシティブな領域を、より広いアライメントのためのプリズムとして重視する。
一般的なモデルは一般に広い社会問題に関する世論と一致しているが、宗教的視点を正確に表現することができない。
論文 参考訳(メタデータ) (2026-03-06T13:29:54Z) - I Am Aligned, But With Whom? MENA Values Benchmark for Evaluating Cultural Alignment and Multilingual Bias in LLMs [5.060243371992739]
大規模言語モデル(LLM)の文化的アライメントと多言語バイアスを評価するための新しいベンチマークであるMENAValuesを紹介する。
大規模で権威ある人的調査から、我々は16カ国の人口レベルの応答分布を持つMENAの社会文化的景観を捉えた構造化データセットをキュレートした。
分析の結果,同じ質問が言語に基づいて大きく異なる反応をもたらす「クロス・Lingual Value Shifts」,その理由の説明を促す「Reasoning-induced Degradation」,モデルがセンシティブな質問を拒否する「Logit Leakage」,内部確率が強く隠蔽される「Logit Leakage」の3つの重要な現象が明らかになった。
論文 参考訳(メタデータ) (2025-10-15T05:10:57Z) - MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation [91.22008265721952]
MMA-ASIAは、アジア8か国と10か国を対象とする人為的、多言語的、マルチモーダルなベンチマークに重点を置いている。
これは、テキスト、画像(視覚的質問応答)、音声の3つのモードにまたがる入力レベルで整列された最初のデータセットである。
i) 国間の文化的認識格差、(ii) 言語間の整合性、(iii) 言語間の整合性、(iv) 文化知識の一般化、(v) 基礎的妥当性を評価する5次元評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-07T14:12:12Z) - Which Cultural Lens Do Models Adopt? On Cultural Positioning Bias and Agentic Mitigation in LLMs [53.07843733899881]
大規模言語モデル(LLM)は、幅広い下流生成アプリケーションをアンロックした。
また、米国主流の文化の観点から、文化にまつわる微妙な公平性の問題に対処し、世代を配置するリスクも見いだす。
本稿では、これらのバイアスを解決するための2つの推論時間緩和法を提案する。
論文 参考訳(メタデータ) (2025-09-25T12:28:25Z) - SESGO: Spanish Evaluation of Stereotypical Generative Outputs [1.1549572298362782]
本稿では,多言語大言語モデル(LLM)におけるバイアス評価における限界ギャップについて論じる。
現在の評価は、主に米国英語中心であり、他の言語や文化の文脈で潜在的に危害が及ばないままである。
教科学習における社会的偏見を検出するための,新しい文化的な枠組みを提案する。
論文 参考訳(メタデータ) (2025-09-03T14:04:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。