論文の概要: Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs
- arxiv url: http://arxiv.org/abs/2608.08090v1
- Date: Sat, 08 Aug 2026 12:15:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.661845
- Title: Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs
- Title(参考訳): 統一における知恵--動詞の言語識別における多言語学習の役割
- Authors: Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Aldayel,
- Abstract要約: 多言語エンコーダや命令調律LPMを含む5つのモデルを評価する。
本研究では,4つの相補的図形形式を特徴付ける証明のための多次元アノテーションフレームワークを提案する。
その結果,翻訳された多言語学習データの約50%は,ほぼ最適な言語識別性能を達成するのに十分であることがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although multilingual approaches to figurative language identification are not new, the shift beyond language homogeneous training data requires a clearer understanding of the contribution of translated multilingual supervision. We examine this question using 742 proverb concepts across 6,787 translated instances in seven languages. We evaluate five models, including multilingual encoders and instruction tuned LLMs, under progressively increasing levels of multilingual supervision. Moreover, we introduce a multidimensional annotation framework for proverbs that characterizes them through four complementary figurative forms: Metaphorical, Moral/Advisory, Cause-Effect, and Culture Specific. Our findings show that approximately 50% of the translated multilingual training data is sufficient to achieve near-optimal figurative language identification performance. We further show that combining diverse figurative forms yields the strongest overall performance. A notable finding is that the least frequent figurative form, Culture Specific, exhibits the largest performance gains under multilingual supervision. Furthermore, the Moral/Advisory and Culture Specific forms contribute most to the performance of instruction-tuned LLMs on figurative language identification. These findings motivate multilingual figurative language identification to move beyond metaphor-centric taxonomies toward concept level multidimensional frameworks that explicitly model complementary forms of figurative meaning.
- Abstract(参考訳): 比喩的言語識別に対する多言語的アプローチは新しいものではないが、言語均質な訓練データを超えたシフトは、翻訳された多言語的監督の貢献をより明確に理解する必要がある。
7言語で6,787の翻訳例を対象に,772の証明概念を用いてこの問題を検証した。
多言語エンコーダや命令調律LPMを含む5つのモデルを評価する。
さらに, メタフォリカル, モラル・アドバイザリー, 因果関係, 文化特化という4つの相補的図形を特徴付ける, 証明のための多次元アノテーションフレームワークを導入する。
その結果,翻訳された多言語学習データの約50%は,ほぼ最適な言語識別性能を達成するのに十分であることがわかった。
さらに、多種多様な図形を組み合わせることで、全体的なパフォーマンスが最も高いことを示す。
注目すべき発見は、最も頻度の低い図形形式であるCulture Specificは、多言語による監督の下で最大のパフォーマンス向上を示していることである。
さらに,Moral/Advisory and Culture Specific 形式は,図形言語識別における命令調整 LLM の性能に大きく寄与する。
これらの知見は、比喩中心の分類を超越して、比喩的意味の相補的な形式を明示的にモデル化する概念レベルの多次元フレームワークへと移行する多言語言語識別を動機付けている。
関連論文リスト
- When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models [11.355899871129559]
本稿では, ヒンディー語, ベンガル語, タイ語などの低資源の東南アジア諸言語において, 図形的・文化的意味を保ち続ける航法を示す。
このような複雑さに対処するため、3,533個の多言語イディオムからなる再構成された多モーダルコーパスであるVarnikaを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:28:44Z) - IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation [88.98544786373212]
既存の文表現は主に、その表現方法ではなく、ある文が何を言っているかを符号化する。
本研究は,意味内容から分離したスタイルと方言をキャプチャする文表現を開発する。
IDIOLEX(IDIOLEX)は,文の証明から文の内容の言語的特徴までを統括するモデルを訓練するためのフレームワークである。
論文 参考訳(メタデータ) (2026-04-06T14:17:24Z) - Multilingual Multi-Figurative Language Detection [14.799109368073548]
比喩的言語理解は多言語環境では 非常に過小評価されています
我々は,多言語多言語言語モデリングを導入し,文レベル図形言語検出のためのベンチマークを提供する。
テンプレートに基づく即時学習に基づく図形言語検出のためのフレームワークを開発する。
論文 参考訳(メタデータ) (2023-05-31T18:52:41Z) - Multi-lingual and Multi-cultural Figurative Language Understanding [69.47641938200817]
図形言語は人間のコミュニケーションに浸透するが、NLPでは比較的過小評価されている。
Hindi, Indonesian, Javanese, Kannada, Sundanese, Swahili, Yorubaの7つの多様な言語に関するデータセットを作成しました。
我々のデータセットから,各言語は,同じ領域から派生した言語間で最も高い重なり合いを持つ,図形表現の文化的・地域的概念に依存していることが明らかとなった。
全ての言語は、事前学習データと微調整データの可用性を反映した性能の変化により、英語と比較して大きな欠陥がある。
論文 参考訳(メタデータ) (2023-05-25T15:30:31Z) - IRFL: Image Recognition of Figurative Language [20.472997304393413]
図形は、しばしば複数のモダリティ(例えば、テキストと画像の両方)を通して伝達される。
我々は、図形言語データセットの画像認識を開発する。
マルチモーダルな図形言語理解のためのベンチマークとして,2つの新しいタスクを導入する。
論文 参考訳(メタデータ) (2023-03-27T17:59:55Z) - Testing the Ability of Language Models to Interpret Figurative Language [69.59943454934799]
比喩的・比喩的な言語は言論において一般的である。
現代の言語モデルが非リテラルなフレーズをどの程度解釈できるかについては、未解決の疑問が残る。
ウィノグラードスタイルの非文字言語理解タスクであるFig-QAを紹介する。
論文 参考訳(メタデータ) (2022-04-26T23:42:22Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - Learning to Scale Multilingual Representations for Vision-Language Tasks [51.27839182889422]
SMALRの有効性は、これまでビジョン言語タスクでサポートされた2倍以上の10の多言語で実証されている。
単語の埋め込み手法と比較して,訓練パラメータの1/5以下で,複数言語による画像文検索と先行作業の3~4%の性能評価を行った。
論文 参考訳(メタデータ) (2020-04-09T01:03:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。