論文の概要: Instruction-Guided Poetry Generation in Arabic and Its Dialects
- arxiv url: http://arxiv.org/abs/2604.27766v1
- Date: Thu, 30 Apr 2026 11:58:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.07861
- Title: Instruction-Guided Poetry Generation in Arabic and Its Dialects
- Title(参考訳): アラビア語における指導指導による詩生成とその方言
- Authors: Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto,
- Abstract要約: 我々は、現代標準アラビア語(MSA)および様々なアラビア方言において、大規模かつ慎重に訓練された命令ベースデータセットを提示する。
このデータセットは、スタイルや韻律など、事前に定義された基準に基づいて、詩を書き、修正し、継続するといったタスクを可能にする。
実験により、このデータセット上の微調整 LLM は、ユーザの要求に合致した詩を効果的に生成できるモデルを生成する。
- 参考スコア(独自算出の注目度): 44.29808445432812
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Poetry has long been a central art form for Arabic speakers, serving as a powerful medium of expression and cultural identity. While modern Arabic speakers continue to value poetry, existing research on Arabic poetry within Large Language Models (LLMs) has primarily focused on analysis tasks such as interpretation or metadata prediction, e.g., rhyme schemes and titles. In contrast, our work addresses the practical aspect of poetry creation in Arabic by introducing controllable generation capabilities to assist users in writing poetry. Specifically, we present a large-scale, carefully curated instruction-based dataset in Modern Standard Arabic (MSA) and various Arabic dialects. This dataset enables tasks such as writing, revising, and continuing poems based on predefined criteria, including style and rhyme, as well as performing poetry analysis. Our experiments show that fine-tuning LLMs on this dataset yields models that can effectively generate poetry that is aligned with user requirements, based on both automated metrics and human evaluation with native Arabic speakers. The data and the code are available at https://github.com/mbzuai-nlp/instructpoet-ar
- Abstract(参考訳): 詩は長い間、アラビア語話者にとって中心的な芸術形式であり、表現と文化的アイデンティティの強力な媒体として機能してきた。
現代アラビア語話者は詩を重んじる一方で、Large Language Models (LLMs) 内のアラビア語詩に関する既存の研究は、解釈やメタデータ予測、例えば韻律、タイトルなどの分析タスクに重点を置いている。
対照的に、われわれの研究は、ユーザが詩を書くのを補助する制御可能な生成機能を導入することで、アラビア語による詩作成の実践的な側面に対処している。
具体的には、現代標準アラビア語(MSA)および様々なアラビア方言において、大規模かつ慎重に訓練された命令ベースデータセットを提示する。
このデータセットは、スタイルや韻律など、事前に定義された基準に基づいて、詩の執筆、改訂、継続といったタスクを可能とし、詩の分析を行うことができる。
実験の結果,このデータセットを用いた微調整 LLM は,自動測定とネイティブアラビア話者による人的評価の両方に基づいて,ユーザの要求に合致した詩を効果的に生成できるモデルが得られることがわかった。
データとコードはhttps://github.com/mbzuai-nlp/instructpoet-arで公開されている。
関連論文リスト
- A Rhythm-Aware Phrase Insertion for Classical Arabic Poetry Composition [1.439518478021091]
本稿では、バイトレベルの多言語トランスフォーマーモデルであるByT5を用いて、アラビア語の詩にフレーズを挿入して特定のリズムに適合させる手法を提案する。
提案手法では,ターゲットリズムに一致するようにマスク付き単語を再構成したByT5を微調整する。
実験結果から,本モデルはセマンティックコヒーレンスを維持しつつ,高いリズムアライメントを実現することが示された。
論文 参考訳(メタデータ) (2025-09-23T01:22:15Z) - Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs [32.247169514152425]
EmphFannまたはFlopは、アラビア語詩の理解を大規模言語モデルで評価するための最初のベンチマークである。
このベンチマークは、意味的理解、比喩的解釈、韻律的認識、文化的文脈を評価するための説明付き詩のコーパスで構成されている。
論文 参考訳(メタデータ) (2025-05-23T17:59:29Z) - Poem Meter Classification of Recited Arabic Poetry: Integrating High-Resource Systems for a Low-Resource Task [6.562541994801405]
アラビア語の詩は、言語学から何十年にもわたって大きな注目を集めてきた。
詩のメーターを特定することは長く複雑なプロセスである。
我々は、暗唱されたアラビア詩の詩のメーターを特定するための最先端の枠組みを提案する。
論文 参考訳(メタデータ) (2025-04-16T15:25:45Z) - Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion [70.23624194206171]
本稿では,アラブ世界における大規模言語モデル(LLM)の民主化の必要性に対処する。
アラビア語のLLMの実用的な目的の1つは、復号を高速化するトークン化器にアラビア語固有の語彙を使用することである。
第二言語(アラビア語)による人への獲得の間に語彙学習に触発されたAraLLaMAは、進歩的な語彙拡張を採用している。
論文 参考訳(メタデータ) (2024-12-16T19:29:06Z) - AceGPT, Localizing Large Language Models in Arabic [73.39989503874634]
本稿では,アラビア語のテキストによる事前学習,ネイティブなアラビア語命令を利用したSFT(Supervised Fine-Tuning),アラビア語のGPT-4応答を含む総合的なソリューションを提案する。
目標は、文化的に認知され、価値に整合したアラビア語のLLMを、多様で応用特有のアラビア語コミュニティのニーズに適応させることである。
論文 参考訳(メタデータ) (2023-09-21T13:20:13Z) - Ashaar: Automatic Analysis and Generation of Arabic Poetry Using Deep
Learning Approaches [7.021140304091526]
本稿では,アラビア詩の分析・生成に特化して設計されたデータセットと事前学習モデルの集合を含むtextitAshaar というフレームワークを紹介する。
提案手法で確立されたパイプラインは, メーター, テーマ, 年代分類など, 詩の様々な側面を包含する。
この取り組みの一環として、詩生成のためのデータセットと、診断のためのデータセットと、Arudiスタイルの予測のためのデータセットを4つ提供します。
論文 参考訳(メタデータ) (2023-07-12T15:07:16Z) - CCPM: A Chinese Classical Poetry Matching Dataset [50.90794811956129]
本稿では,詩のマッチングによるモデルの意味的理解を評価するための新しい課題を提案する。
この課題は、現代漢訳の漢詩では、4人の候補者の中から1行の漢詩を選ばなければならない。
このデータセットを構築するために、まず中国古典詩と現代中国語の翻訳の並列データを得る。
論文 参考訳(メタデータ) (2021-06-03T16:49:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。