論文の概要: VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP
- arxiv url: http://arxiv.org/abs/2608.03095v1
- Date: Tue, 04 Aug 2026 04:13:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.027318
- Title: VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP
- Title(参考訳): VIVID:ベトナムのNLPにおける言語ギャップを文化的に評価したベンチマーク
- Abstract要約: VIVIDは,ベトナムにおける文化的基盤の具体的言語理解を評価するための最初の体系的ベンチマークである。
VinaVIDは1,636個のイディオムと5つの意味的特徴を付加した証明を含む。
本分析は,リテラル過剰解釈,語彙的ギャップ,実用的平坦化などの系統的障害を明らかにする。
- 参考スコア(独自算出の注目度): 3.9663884829149523
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present VIVID (Vietnamese Idioms for Validation and Interpretation Depth), the first systematic benchmark for evaluating culturally grounded figurative language understanding in Vietnamese. VIVID comprises 1,636 idioms and proverbs annotated with five complexity traits (literal expressions, pragmatic nuances, Sino-Vietnamese terms, uncommon vocabulary, folk knowledge) and seven semantic themes. We establish an evaluation framework combining generative and discriminative tasks, proposing an LLM-as-a-Judge approach with aspect-based prompting validated against human judgment (Cohen's kappa = 0.792). Evaluating eight state-of-the-art models reveals critical gaps: Vietnamese-specialized models drastically underperform multilingual systems (VinaLLaMA-7B: 0.13 vs. GPT-4o: 2.46), and even top models achieve less than 50% of maximum scores. Notably, few-shot prompting does not universally improve performance, with GPT-4o exhibiting degradation due to stylistic overfitting. Our analysis exposes systematic failures including literal over-interpretation, lexical gaps, and pragmatic flattening, demonstrating that current models lack cultural competence for nuanced figurative interpretation. VIVID provides an essential tool for advancing figurative language understanding in culturally rich contexts.
- Abstract(参考訳): VIVID(ベトナム語: Vietnamese Idioms for Validation and Interpretation Depth)は、ベトナムにおける文化基盤の具体的言語理解を評価するための最初の体系的ベンチマークである。
VIVIDは1,636のイディオムと5つの複雑な特徴(文体表現、プラグマティックなニュアンス、中・ベトナム語の用語、一般的でない語彙、民間知識)と7つの意味的テーマで注釈付けされた証明を含む。
我々は,LLM-as-a-Judgeアプローチと人間の判断に反するアスペクトベースのプロンプト(Cohen's kappa = 0.792)を提案することによって,生成的タスクと識別的タスクを組み合わせた評価枠組みを確立する。
ベトナム特化モデルは多言語システム(VinaLLaMA-7B: 0.13 vs. GPT-4o: 2.46)を大幅に過小評価しており、トップモデルでさえ最大スコアの50%以下である。
特に、GPT-4oはスタイリスティックなオーバーフィッティングによる劣化を示すため、少ないショットプロンプトは性能を普遍的に改善しない。
我々の分析では、リテラル過剰解釈、語彙ギャップ、実用的平坦化など、体系的な失敗を露呈し、現在のモデルにはニュアンスド・フィギュラティブな解釈の文化的能力がないことを示した。
VIVIDは、文化的に豊かな文脈において、図形言語を理解するために不可欠なツールを提供する。
関連論文リスト
- When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models [11.355899871129559]
本稿では, ヒンディー語, ベンガル語, タイ語などの低資源の東南アジア諸言語において, 図形的・文化的意味を保ち続ける航法を示す。
このような複雑さに対処するため、3,533個の多言語イディオムからなる再構成された多モーダルコーパスであるVarnikaを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:28:44Z) - PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions [48.69228180369574]
PersLitEvalは8つのきめ細かいカテゴリにわたる4,514のペルシア文学の多重選択質問のベンチマークである。
課題の難易度を3段階に分けて,カテゴリーレベルの相違が顕著であることを示す。
エラー解析では、意味的理解のギャップ、形式的言語的知識のギャップ、カウント/列挙エラーの3つの障害モードを識別する。
論文 参考訳(メタデータ) (2026-05-26T13:34:19Z) - When Words Don't Mean What They Say: Figurative Understanding in Bengali Idioms [1.5840067220859924]
大規模言語モデル(LLM)にとって、図形言語理解は依然として重要な課題である。
我々は,10,361個のベンガルイディオムからなる大規模かつ文化的基盤を持つ新しいイディオムデータセットを導入する。
各イディオムは、包括的な19フィールドスキーマの下で注釈付けされ、熟考専門家の合意プロセスを通じて確立され、洗練される。
図形的意味を推定する作業において,30の最先端の多言語言語と命令調整型LLMを評価した。
論文 参考訳(メタデータ) (2026-02-13T13:26:11Z) - From Polyester Girlfriends to Blind Mice: Creating the First Pragmatics Understanding Benchmarks for Slovene [0.12277343096128711]
我々はSloPragEvalとSloPragMegaを紹介した。
本稿では,翻訳の難しさについて論じ,人間のベースラインを確立するためのキャンペーンについて述べるとともに,パイロット評価をLCMで報告する。
以上の結果から,現在のモデルではニュアンス言語理解が大幅に改善されているものの,非文節発話におけるインプリート話者の意味を推測できない可能性が示唆された。
論文 参考訳(メタデータ) (2025-10-24T15:43:42Z) - KoBALT: Korean Benchmark For Advanced Linguistic Tasks [0.6971903955510721]
KoBALT (Korean Benchmark for Advanced Linguistic Tasks) は700の質問からなる言語的に動機付けられたベンチマークである。
韓国語における大規模言語モデル(LLM)の評価を推し進めるために設計された。
韓国の標準コーパスとn-gramの重複が最小限に抑えられた専門家による言語的動機付けの質問スイートを導入している。
論文 参考訳(メタデータ) (2025-05-22T02:03:07Z) - InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models [30.986157664865534]
画像中の暗黙の意味の理解を評価するための,総合的,多レベルな中国語ベースのベンチマークを初めて紹介する。
このベンチマークは、表面レベルのコンテンツ理解、象徴的な意味解釈、背景知識理解、暗黙的な意味理解の4つのサブタスクに分類される。
このベンチマークを用いて、15個のオープンソースの大規模視覚言語モデル (LVLM) と GPT-4o を評価し、人間のパフォーマンスに最も優れたモデルラグでさえ、暗黙的な意味を理解するのに約14%遅れていることを明らかにする。
論文 参考訳(メタデータ) (2025-02-19T13:42:37Z) - SOUL: Towards Sentiment and Opinion Understanding of Language [96.74878032417054]
我々は、言語感覚とオピニオン理解(SOUL)と呼ばれる新しいタスクを提案する。
SOULは2つのサブタスクを通して感情理解を評価することを目的としている:レビュー(RC)と正当化生成(JG)。
論文 参考訳(メタデータ) (2023-10-27T06:48:48Z) - Disco-Bench: A Discourse-Aware Evaluation Benchmark for Language
Modelling [70.23876429382969]
本研究では,多種多様なNLPタスクに対して,文内談話特性を評価できるベンチマークを提案する。
ディスコ・ベンチは文学領域における9つの文書レベルのテストセットから構成されており、豊富な談話現象を含んでいる。
また,言語分析のために,対象モデルが談話知識を学習するかどうかを検証できる診断テストスイートを設計する。
論文 参考訳(メタデータ) (2023-07-16T15:18:25Z) - We're Afraid Language Models Aren't Modeling Ambiguity [136.8068419824318]
あいまいさの管理は人間の言語理解の重要な部分です。
文中のあいまいさは,他の文との係り受け関係に与える影響によって特徴付けられる。
我々は,多ラベルNLIモデルが曖昧さによって誤解を招く野生の政治的主張にフラグを付けることができることを示す。
論文 参考訳(メタデータ) (2023-04-27T17:57:58Z) - Testing the Ability of Language Models to Interpret Figurative Language [69.59943454934799]
比喩的・比喩的な言語は言論において一般的である。
現代の言語モデルが非リテラルなフレーズをどの程度解釈できるかについては、未解決の疑問が残る。
ウィノグラードスタイルの非文字言語理解タスクであるFig-QAを紹介する。
論文 参考訳(メタデータ) (2022-04-26T23:42:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。