論文の概要: SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses
- arxiv url: http://arxiv.org/abs/2607.02049v1
- Date: Thu, 02 Jul 2026 11:22:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.812711
- Title: SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses
- Title(参考訳): SPLIT:英語とウクライナのLLM応答における言語間の共感と文化的接地
- Authors: Anna Chorna,
- Abstract要約: 大規模言語モデルは、感情的な状況や危機に関連した状況にますます展開されている。
既存のベンチマークでは、多言語のパフォーマンスを強調しているが、危機に関連した共感と低-中-リソース言語における文化的基盤を調べることはめったにない。
SPLITは、ストレス、パニック、孤独、内部変位、緊張という5つのカテゴリにまたがる感情的根拠を持つ応答を生成する上で、LCMの一貫性を評価するために設計されたベンチマークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models are increasingly deployed in emotional-support contexts and crisis-related situations. Nevertheless, their cross-lingual abilities in these circumstances remain underexplored. Existing benchmarks emphasize multilingual performance but rarely examine crisis-related empathy and cultural grounding in low-to-mid-resource languages. We introduce SPLIT, a 500-prompt benchmark designed to evaluate LLM consistency in generating emotionally grounded responses across five categories: Stress, Panic, Loneliness, Internal Displacement, and Tension. We evaluate three technically diverse LLMs across three dimensions: Empathetic Accuracy, Linguistic Naturalness, and Contextual & Cultural Grounding. The framework aims to assess and compare the quality of LLM responses in both English and Ukrainian languages, as well as to explore the reliability of the LLM-as-a-jury paradigm. Our findings reveal that Gemini-2.5-Flash and LLaMA-3.3-70B-Instruct degrade when transitioning to Ukrainian, while DeepSeek-V3 remains comparatively stable within our benchmark. We additionally find that human and AI evaluators agree weakly on empathy and naturalness but diverge on cultural grounding. We further argue that producing Ukrainian text is not equivalent to producing Ukrainian emotional support. Our findings may assist in the future development of more culturally tailored benchmark designs, as well as encourage a stronger emphasis on human-centered evaluation.
- Abstract(参考訳): 大規模言語モデルは、感情的な状況や危機に関連した状況にますます展開されている。
しかし、これらの状況下での言語横断能力はいまだに未解明のままである。
既存のベンチマークでは、多言語のパフォーマンスを強調しているが、危機に関連した共感と低-中-リソース言語における文化的基盤を調べることはめったにない。
SPLITは,ストレス,パニック,孤独,内部変位,緊張という5つのカテゴリにまたがる感情的接地応答の生成において,LLMの一貫性を評価するために設計された500プロンプトのベンチマークである。
我々は3次元の技術的に多様である3つのLCM(共感的正確性、言語的自然性、文脈的・文化的グラウンディング)を評価した。
このフレームワークは、英語とウクライナ語の両方におけるLLM応答の質を評価し比較すること、およびLLM-as-a-juryパラダイムの信頼性を検討することを目的としている。
この結果,Gemini-2.5-FlashとLLaMA-3.3-70B-Instructはウクライナへの移行時に分解され,DeepSeek-V3はベンチマークで比較的安定していることがわかった。
また、人間とAIの評価者は共感と自然性には弱いが、文化的な根拠にはとらわれている。
さらに、ウクライナのテキストの作成はウクライナの感情的支援の創出と同等ではないと論じる。
我々の発見は、より文化的に調整されたベンチマークデザインの開発を支援し、人間中心の評価をより強調するのに役立つかもしれない。
関連論文リスト
- Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses [28.3173238194554]
CEDARは、文化的にアンダーラインのscElicited underlinetextscDistinct underlinetextscAffective underlinetextscResponsesをキャプチャするシナリオから構築されたベンチマークである。
その結果得られたベンチマークは、7つの言語に10,962のインスタンスと14のきめ細かい感情カテゴリで構成され、各言語には400のマルチモーダルと1,166のテキストのみのサンプルが含まれている。
論文 参考訳(メタデータ) (2026-01-19T13:04:26Z) - MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation [91.22008265721952]
MMA-ASIAは、アジア8か国と10か国を対象とする人為的、多言語的、マルチモーダルなベンチマークに重点を置いている。
これは、テキスト、画像(視覚的質問応答)、音声の3つのモードにまたがる入力レベルで整列された最初のデータセットである。
i) 国間の文化的認識格差、(ii) 言語間の整合性、(iii) 言語間の整合性、(iv) 文化知識の一般化、(v) 基礎的妥当性を評価する5次元評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-07T14:12:12Z) - MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs [56.87573414161703]
大規模言語モデル(LLM)を評価するベンチマークであるMultiNRC(MultiNRC)を導入する。
MultiNRCは4つの中核的推論カテゴリをカバーしている: 言語固有の言語推論、単語プレイとライドル、文化的/トラディション推論、文化的関連性のある数学推論である。
文化的・貿易的推論や文化的関連性を考慮した数学的推論については、英語に習熟した母語話者のマニュアル翻訳による多言語質問の英訳も提供する。
論文 参考訳(メタデータ) (2025-07-23T12:56:31Z) - XToM: Exploring the Multilingual Theory of Mind for Large Language Models [57.9821865189077]
LLMにおける既存の心の理論の評価は英語に限られている。
XToMは5言語にまたがってToMを評価する,厳格に検証された多言語ベンチマークである。
以上の結果から,LLMが言語的文脈にまたがって人間的なメンタライゼーションを再現する能力に限界があることが判明した。
論文 参考訳(メタデータ) (2025-06-03T05:23:25Z) - CULEMO: Cultural Lenses on Emotion -- Benchmarking LLMs for Cross-Cultural Emotion Understanding [7.308914305652415]
カルチャー・レンズ・オン・エモーション (CuLEmo) は、6つの言語にまたがるカルチャー・アウェア・感情予測を評価するための最初のベンチマークである。
キュレモ語は言語ごとに400の工芸的な質問で構成されており、それぞれに微妙な文化的推論と理解が必要である。
このベンチマークを用いて、カルチャーを意識した感情予測と感情分析タスクにおける、最先端のLCMの評価を行う。
論文 参考訳(メタデータ) (2025-03-12T01:01:30Z) - Arabic Dataset for LLM Safeguard Evaluation [62.96160492994489]
本研究では,アラビア語における大言語モデル(LLM)の安全性と,その言語的・文化的複雑さについて考察する。
本稿では, 直接攻撃, 間接攻撃, センシティブな単語による無害な要求を含む5,799の質問からなるアラブ地域固有の安全評価データセットを提案する。
論文 参考訳(メタデータ) (2024-10-22T14:12:43Z) - Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection [10.129235204880443]
非英語文脈におけるタスクに対する異なるプロンプト言語と拡張翻訳データの影響を評価する。
本稿では, LLMにおける固有バイアスと, センシティブなトピックに関する誤予測におけるデータセットの影響について論じる。
論文 参考訳(メタデータ) (2024-10-21T04:08:16Z) - LLaMA Beyond English: An Empirical Study on Language Capability Transfer [49.298360366468934]
我々は、言語生成の能力と指示を英語以外の言語に効果的に伝達する方法に焦点をあてる。
本稿では,語彙拡張や事前学習,トランスファーに対する指導指導などの重要な要因が与える影響について分析する。
C-Eval、MMLU、AGI-Eval、GAokao-Benchの4つの広く使われている標準テストベンチマークを採用しています。
論文 参考訳(メタデータ) (2024-01-02T06:29:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。