論文の概要: A multilingual hallucination benchmark: MultiWikiQHalluA
- arxiv url: http://arxiv.org/abs/2605.02504v1
- Date: Mon, 04 May 2026 11:57:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:50.271841
- Title: A multilingual hallucination benchmark: MultiWikiQHalluA
- Title(参考訳): 多言語幻覚ベンチマーク: MultiWikiQHalluA
- Authors: Freja Thoresen, Dan Saattrup Smart,
- Abstract要約: 我々はMultiWikiQAデータセットを用いて306言語のための合成幻覚データセットを作成する。
本稿では,英語,デンマーク語,ドイツ語,アイスランド語の各言語におけるモデル幻覚の評価について述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most hallucination evaluations focus on English, leaving it unclear whether findings transfer to lower-resource languages. We investigate faithfulness hallucinations, defined as model-generated content that is fluent and plausible but diverges from the provided input or is internally inconsistent. Leveraging the multilingual MultiWikiQA dataset, we utilize the LettuceDetect framework to create synthetic hallucination datasets for 306 languages, from which we train token-level hallucination classifiers for 30 European languages. In this work, we present evaluations of model hallucinations on a selection of languages: English, Danish, German, and Icelandic. Using these classifiers, we evaluate the hallucination rates for Qwen3-0.6B, Qwen3-14B, Gemma-3-12B-IT, cogito-v1-preview-qwen-32B, and cogito-v1-preview-llama-70B. Our classifiers reveal notably higher hallucination rates for Qwen3-0.6B (up to 60\% of answers containing at least one hallucination, peaking in Icelandic) and generally lower rates for larger models, with cogito-v1-preview-qwen-32B and cogito-v1-preview-llama-70B performing best on most languages. Hallucination rates are consistently higher for lower-resource languages, particularly Icelandic.
- Abstract(参考訳): ほとんどの幻覚評価は英語に重点を置いており、発見が低リソース言語に移行するかどうかは不明である。
本研究は,提示された入力から逸脱した,あるいは内部に一貫性のないモデル生成コンテンツとして定義される忠実な幻覚について検討する。
多言語MultiWikiQAデータセットを活用することで、LettuceDetectフレームワークを使用して、306言語用の合成幻覚データセットを作成し、そこから、30言語用のトークンレベル幻覚分類器を訓練する。
本研究では,英語,デンマーク語,ドイツ語,アイスランド語の各言語におけるモデル幻覚の評価について述べる。
これらの分類器を用いて, Qwen3-0.6B, Qwen3-14B, Gemma-3-12B-IT, cogito-v1-preview-qwen-32B, cogito-v1-preview-llama-70Bの幻覚率を評価する。
我々の分類では、Qwen3-0.6Bの幻覚率(少なくとも1つの幻覚を含む回答の最大60%はアイスランド語でピーク)が顕著に高く、コギトv1-preview-qwen-32Bとコギトv1-preview-llama-70Bが多くの言語で最高の結果を示した。
低資源言語、特にアイスランド語では、幻覚率は一貫して高い。
関連論文リスト
- Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs [2.453830698820308]
Halluverse-M3は、複数の言語にまたがる幻覚の体系的な分析を可能にするデータセットである。
データセットは、エンティティレベル、関係レベル、および文レベルの幻覚を明確に区別する。
Halluverse-M3は、多言語、マルチタスク設定で幻覚を研究するための現実的で挑戦的なベンチマークを提供する。
論文 参考訳(メタデータ) (2026-02-06T18:16:09Z) - HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations [2.3732122943029164]
英語,アラビア語,トルコ語で微粒な幻覚を分類する多言語データセットであるHaluVerse25を紹介する。
我々のデータセット構築パイプラインは、LLMを使用して幻覚を実際の伝記文に注入し、続いて厳密な人間のアノテーションプロセスでデータ品質を保証します。
論文 参考訳(メタデータ) (2025-03-10T20:24:07Z) - Multilingual Hallucination Gaps in Large Language Models [5.505634045241288]
フリーフォームテキスト生成において,複数の言語にまたがる幻覚現象について検討する。
これらのギャップは、使用するプロンプトや言語による幻覚応答の頻度の違いを反映している。
その結果, 幻覚率の変動, 特に高次言語と低次言語の違いが明らかになった。
論文 参考訳(メタデータ) (2024-10-23T20:41:51Z) - ALOHa: A New Measure for Hallucination in Captioning Models [61.007542765171586]
既存の物体幻覚の計量であるCHAIRは、MS COCOオブジェクトとシノニムの固定セットに限られる。
そこで我々は,大規模言語モデル(LLM)を利用して物体の幻覚を測定する,最新のオープン語彙メトリックALOHaを提案する。
ALOHaはHAT上のCHAIRよりも13.6%多くの幻覚物質を正しく同定することを示す。
論文 参考訳(メタデータ) (2024-04-03T17:59:36Z) - Evaluating Hallucinations in Chinese Large Language Models [65.4771562909392]
我々は,中国大言語モデルにおける幻覚現象を測定するために,HaluQA(中国語幻覚質問回答)というベンチマークを構築した。
GLM-130B と ChatGPT の2種類の幻覚について考察した。
評価のために,モデル出力が幻覚的かどうかを判定するために,GPT-4を用いた自動評価手法を設計する。
論文 参考訳(メタデータ) (2023-10-05T07:57:09Z) - Plausible May Not Be Faithful: Probing Object Hallucination in
Vision-Language Pre-training [66.0036211069513]
大規模視覚言語事前学習モデルは、テキストを生成する際に、存在しない視覚オブジェクトを幻覚させる傾向がある。
標準メトリクスでより良いスコアを得るモデルは、オブジェクトをより頻繁に幻覚させる可能性があることを示す。
驚いたことに、パッチベースの機能が最も良く、より小さなパッチ解決は、オブジェクト幻覚の非自明な減少をもたらす。
論文 参考訳(メタデータ) (2022-10-14T10:27:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。