論文の概要: CC-Mediation: Evaluating Large Language Models for Cross-Cultural Conflict Mediation
- arxiv url: http://arxiv.org/abs/2609.04855v1
- Date: Fri, 04 Sep 2026 08:10:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.969353
- Title: CC-Mediation: Evaluating Large Language Models for Cross-Cultural Conflict Mediation
- Title(参考訳): CC-Mediation:クロスカルチュラル・コンフリクト・メディエーションのための大規模言語モデルの評価
- Abstract要約: 大規模言語モデル(LLM)による異文化間の仲裁は、いつ介入するか、文化に根ざした紛争にどのように対処するかを判断する必要がある。
これらのギャップに対処するために,DMIS (Developmental Model of Intercultural Sensitivity) を基盤とした,1,661ドル10ターン対話の異文化間媒介ベンチマークであるCC-Mediationを導入する。
本稿では,時間とともに文化間改善の持続性を測定するトラジェクトリAUCと,文化間スタンスにおける変化の大きさと方向を測定する署名付きワッサースタイン1距離の2つのDMISに基づく評価指標を提案する。
- 参考スコア(独自算出の注目度): 29.76559343308902
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-cultural mediation by large language models (LLMs) requires deciding both when to intervene and how to respond in culturally grounded conflicts. Progress on this problem has been limited by the lack of (1) mediation datasets with measurable downstream effects and (2) principled metrics for evaluating intercultural stance change. To address these gaps, we introduce CC-Mediation, a cross-cultural mediation benchmark of $1{,}661$ ten-turn dialogues grounded in the Developmental Model of Intercultural Sensitivity (DMIS), containing culturally grounded conflicts, mediation interventions, and post-intervention trajectories. We further propose two DMIS-based evaluation metrics: Trajectory AUC, which measures the persistence of intercultural improvement over time, and a signed Wasserstein-1 distance, which measures the magnitude and direction of shifts in intercultural stance. Both metrics show strong agreement with human judgment of DMIS-grounded stance shift. Using CC-Mediation, we find that current LLMs have limitations on both axes: intervention timing (when) failure stems from a positional prior that ignores dialogue content, while mediation strategy (how) failure arises from a late-layer elicitation collapse rather than a knowledge deficit.
- Abstract(参考訳): 大規模言語モデル(LLM)による異文化間の仲裁は、いつ介入するか、文化に根ざした紛争にどのように対処するかを判断する必要がある。
この問題の進展は,(1)下流効果の測定可能な媒介データセットの欠如,(2)文化間スタンスの変化を評価するための原則的指標の欠如によって制限されている。
これらのギャップに対処するために,文化的な対立や媒介の介入,介入後の軌跡を含む,文化間感性発達モデル(DMIS)に基づく文化間媒介ベンチマークであるCC-Mediationを紹介した。
さらに、時間とともに文化間改善の持続性を測定するトラジェクトリAUCと、文化間スタンスにおける変化の大きさと方向を測定する署名付きワッサーシュタイン-1距離の2つのDMISに基づく評価指標を提案する。
いずれの指標も、DMISに基づくスタンスシフトの人的判断と強い一致を示している。
CC-Mediation を用いて、現在の LLM には両方の軸に制限がある。介入タイミング(障害発生時)は、対話内容を無視した位置先から生じるものであり、一方、仲介戦略(障害発生時)は、知識不足ではなく、後期階層のエレクテーション崩壊によるものである。
関連論文リスト
- Cultural Value Alignment Via Latent Activation Steering in Large Language Models [4.181458436156503]
文化的評価と介入のための一般化可能な枠組みを提案する。
300のジレンマから暗黙のトークン確率を抽出することにより、表面レベルのアライメントをバイパスする。
適応性にはかなりの変化が見られ、潜伏絡みの一貫した現象が明らかになる。
論文 参考訳(メタデータ) (2026-05-25T22:20:52Z) - Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images [28.09239790313765]
我々は,この課題に対する多カテゴリ・異文化間ベンチマークを導入し,視覚言語モデル(VLM)を評価する。
文化的推論を評価するため,文化地域全体での正確なマッチング,部分マッチング,属性レベルの精度について報告する。
その結果、モデルは断片化された信号をキャプチャし、文化やメタデータのタイプ間で大きなパフォーマンス変化を示し、一貫性がなく、基盤の弱い予測に繋がることがわかった。
論文 参考訳(メタデータ) (2026-04-08T17:53:26Z) - CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs [24.598338950728234]
大規模言語モデル(LLM)は、文化的に多様な環境にますます展開されている。
既存の方法は、非文脈的正当性や強制選択判断に重点を置いている。
現実的な状況下でモデルを提示するベンチマークのセットを紹介する。
論文 参考訳(メタデータ) (2025-11-15T03:39:13Z) - Rethinking Cross-lingual Alignment: Balancing Transfer and Cultural Erasure in Multilingual LLMs [13.444040667645979]
言語間のアライメントは多言語表現の整合を目標とし、大規模言語モデルが言語間の知識をシームレスに伝達することを可能にする。
直観的ではあるが、この表現的収束の追求は必然的に「文化的消去」を引き起こす可能性があると仮定する。
この2つの目的を解消する新しい推論時間法である手術ステアリングを提案する。
論文 参考訳(メタデータ) (2025-10-29T23:37:54Z) - MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation [91.22008265721952]
MMA-ASIAは、アジア8か国と10か国を対象とする人為的、多言語的、マルチモーダルなベンチマークに重点を置いている。
これは、テキスト、画像(視覚的質問応答)、音声の3つのモードにまたがる入力レベルで整列された最初のデータセットである。
i) 国間の文化的認識格差、(ii) 言語間の整合性、(iii) 言語間の整合性、(iv) 文化知識の一般化、(v) 基礎的妥当性を評価する5次元評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-07T14:12:12Z) - A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs [10.655783463895325]
大型言語モデル (LLMs) は、WEIRD (Western, Educated, Industrialized, Rich, Democratic) の文化的偏見を示す。
この単文化的な観点は、支配的な価値観を強化し、多様な文化的視点を疎外する可能性がある。
公正で堅牢な異文化間の合意を促進するために設計された体系的枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-16T08:42:39Z) - Cross-Modality Earth Mover's Distance for Visible Thermal Person
Re-Identification [82.01051164653583]
Visible thermal person re-identification (VT-ReID) は、モダリティ間の相違と同一性内変異に悩まされる。
我々は,モーダルアライメント中の個人内変動の影響を軽減することができるクロスモーダルアースモーバー距離(CM-EMD)を提案する。
論文 参考訳(メタデータ) (2022-03-03T12:26:59Z) - Towards Quantifiable Dialogue Coherence Evaluation [126.55560816209756]
量的対話コヒーレンス評価(QuantiDCE)は,量的対話コヒーレンス尺度の学習を目的とした新しいフレームワークである。
QuantiDCEには、Multi-Level Ranking (MLR) pre-training (KD) fine-tuning (Multi-Level Ranking)とKD (KD) fine-tuning (KD) という2つの訓練段階が含まれている。
実験結果から,QuantiDCEによりトレーニングされたモデルは,他の最先端の指標に比べて,人間の判断と強い相関関係を示すことが示された。
論文 参考訳(メタデータ) (2021-06-01T14:11:17Z) - Learning Relation Alignment for Calibrated Cross-modal Retrieval [52.760541762871505]
言語的・視覚的関係のセマンティックな距離を計測し,関係の一貫性を定量化するための新しい指標ISD(Intra-modal Self-attention Distance)を提案する。
ISDを最適化し、モダル間アライメントを介してモダル内アライメントを相互に調整するための正規化訓練法である、モダル内アライメント(IAIS)について述べる。
論文 参考訳(メタデータ) (2021-05-28T14:25:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。