論文の概要: TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding
- arxiv url: http://arxiv.org/abs/2609.01810v1
- Date: Tue, 01 Sep 2026 19:35:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.964656
- Title: TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding
- Title(参考訳): TalkFa: 対話生成と理解のための統一ベンチマーク
- Authors: Neda Jamshidi, Kamyar Zeinalipour, Fahimeh Akbari, Monica Bianchini, Marco Maggini, Marco Gori,
- Abstract要約: TalkFaは3つの補完的なデータセットからなる統合ベンチマークである。
すべての対話は、ネイティブのFarsiスピーカーによるマルチステージレビューとリビジョンが行われる。
LoRAは、最終的なパフォーマンス向上の90%以上を回復するために、トレーニングデータの25~50%しか必要とせず、対話生成を大幅に改善する。
- 参考スコア(独自算出の注目度): 8.98948570927933
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Farsi, spoken by more than 120 million people, lacks a comprehensive benchmark for dialogue generation and understanding. We introduce TALKFA, a unified benchmark comprising three complementary datasets: (1) WIKI-FADIAL, 4.2K Wikipedia-grounded dialogues for knowledge-grounded generation; (2) DAILYDIALOG-FA, 6.6K dialogues annotated for dialogue acts and emotions; and (3) PLAYDIAL-FA, 2.1K theatrical dialogues with sentiment labels. While LLMs assist data construction, every dialogue undergoes multi-stage review and revision by native Farsi speakers, and only the final human-approved dialogues are released. Experiments with six LLAMA and MISTRAL models show that LoRA substantially improves dialogue generation while requiring only 25-50% of the training data to recover over 90% of the final performance gains. Across classification tasks, FABERT achieves the best dialogue-act performance, LORA-MISTRAL-7B performs best on emotion recognition, and MISTRAL-24B achieves the highest sentiment score. Human evaluation and independent external validation demonstrate the reliability of the benchmark, while comparisons with GPT-4.1 as an LLM judge reveal that automatic metrics substantially overestimate dialogue quality. Zero-shot evaluation with frontier LLMs further shows that TalkFa remains a challenging benchmark. We will release all datasets, annotation guidelines, code, and checkpoints.
- Abstract(参考訳): Farsiは1億2000万人以上の人々に話され、対話生成と理解のための包括的なベンチマークを欠いている。
1) WIKI-FADIAL, 4.2K Wikipedia-grounded dialogues for knowledge-grounded generation, (2) DAILYDIALOG-FA, 6.6K dialogues annotated for dialogue act and emotions, (3)PLAYDIAL-FA, 2.1K theatrical dialogues with sentiment labels。
LLMはデータ構築を支援する一方で、すべての対話はネイティブのFarsi話者によるマルチステージレビューとリビジョンが行われ、最終承認された対話のみがリリースされる。
6つのLAMAモデルとMISTRALモデルによる実験により、LoRAは最終的なパフォーマンス向上の90%以上を回復するためにトレーニングデータの25-50%しか必要とせず、対話生成を大幅に改善することが示された。
分類タスク全体では、FABERTは最高の対話実行パフォーマンス、LORA-MISTRAL-7Bは感情認識でベスト、MISTRAL-24Bは最高スコアを得る。
人間の評価と独立した外部検証は、ベンチマークの信頼性を実証する一方で、LCMの判断としてGPT-4.1と比較すると、自動メトリクスが対話の質を大幅に過大評価していることが分かる。
Frontier LLMsによるゼロショット評価は、TalkFaが依然として挑戦的なベンチマークであることを示している。
すべてのデータセット、アノテーションガイドライン、コード、チェックポイントをリリースします。
関連論文リスト
- Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models [58.43486430996411]
LALM(Large Audio-Language Models)は、最近、人間との直接の音声交換を可能にする音声対話機能をアンロックした。
オープンエンド音声対話理解におけるLALMの性能を評価するための音声対話理解ベンチマーク(ADU-Bench)を提案する。
ADU-Benchには、LALMの評価のための2万以上のオープンエンドオーディオダイアログが含まれている。
論文 参考訳(メタデータ) (2024-12-06T16:34:15Z) - Context Does Matter: Implications for Crowdsourced Evaluation Labels in Task-Oriented Dialogue Systems [57.16442740983528]
クラウドソースラベルは、タスク指向の対話システムを評価する上で重要な役割を果たす。
従来の研究では、アノテーションプロセスで対話コンテキストの一部だけを使用することが提案されている。
本研究では,対話文脈がアノテーション品質に及ぼす影響について検討する。
論文 参考訳(メタデータ) (2024-04-15T17:56:39Z) - Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models [51.75805497456226]
本研究は,対話要約タスクの助けを借りて,事実整合性の問題に焦点を当てる。
評価の結果,LLMが生成する要約の26.8%が事実整合性を含んでいることがわかった。
LLMの対話理解能力を高めるために,自動構築マルチタスクデータを用いた微調整パラダイムを提案する。
論文 参考訳(メタデータ) (2023-11-13T09:32:12Z) - BotChat: Evaluating LLMs' Capabilities of Having Multi-Turn Dialogues [72.65163468440434]
本報告では,人間型マルチターンチャットのための既存大規模言語モデルの予備的評価を行う。
そこで我々は,ChatSEEDに基づくマルチターン対話を発話によって生成する大規模言語モデル(LLM)を提案する。
GPT-4は優れた品質の人型多元対話を生成できるが、その性能は著しく上回っている。
論文 参考訳(メタデータ) (2023-10-20T16:53:51Z) - xDial-Eval: A Multilingual Open-Domain Dialogue Evaluation Benchmark [39.81588409521846]
我々は,オープンソースの英語対話評価データセット上に構築されたxDial-Evalを紹介する。
xDial-Evalには12のターンレベルと6のダイアログレベルの英語データセットが含まれており、それぞれ14930のアノテート・ターンと8691のアノテート・ダイアログで構成されている。
xDial-Evalでは、従来のBERTベースのメトリクスと最近導入された大規模言語モデルの包括的な分析を行う。
論文 参考訳(メタデータ) (2023-10-13T09:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。