論文の概要: When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs
- arxiv url: http://arxiv.org/abs/2607.21445v1
- Date: Thu, 23 Jul 2026 15:52:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.467497
- Title: When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs
- Title(参考訳): Triviaがトライアルでないとき:多言語LLMにおける日々の知識障害
- Abstract要約: 本稿では,TriviaRoomQAについて紹介する。
欧州,アジア,北米のプロバイダから30のオープンウェイトLCMを評価し,7~70Bパラメータのモデルについて検討した。
モデルは歴史、地理、数学といった知識集約的なトピックに強く依存するが、セレブ、音楽、映画、ニュースといった日常的な大衆文化のトピックにはかなり弱い。
- 参考スコア(独自算出の注目度): 4.942653708116484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quiz rooms, trivia nights, and quiz shows challenge human knowledge across a wide range of topics, from canonical facts to everyday culture. In this paper, we examine whether large language models (LLMs) can perform competitively in such settings, using quiz-style questions to test them on both common and niche topics. We introduce TriviaRoomQA, a multilingual benchmark designed to evaluate everyday, culturally grounded, and long-tail knowledge across 288 topics. The benchmark contains 3,300 parallel multiple-choice questions in six European languages and additional 5,340 French-only questions for a more fine-grained case study. We evaluate 30 open-weight LLMs from European, Asian, and North American providers, covering models from 7 to 70B parameters. We find that models are strong on knowledge-intensive topics such as history, geography, and mathematics, but substantially weaker on everyday popular-culture topics such as celebrities, music, movies, and news. Moreover, model performance varies across languages even for the same underlying questions, suggesting that access to factual knowledge is not always language-independent. In sum, our dataset and experiments demonstrate an important knowledge gap which is not captured by existing academic-based saturated benchmarks.
- Abstract(参考訳): クイズルーム、トリビアナイト、クイズでは、標準的な事実から日常の文化に至るまで、幅広いトピックにわたる人間の知識に挑戦している。
本稿では,大規模言語モデル(LLM)がこのような環境で競争力を発揮するかどうかを,クイズスタイルの質問を用いて検証する。
我々はTriviaRoomQAを紹介した。TriviaRoomQAは288のトピックにまたがって、日常的、文化的に根ざしたロングテールな知識を評価するために設計された多言語ベンチマークである。
このベンチマークには、ヨーロッパの6言語で3300の並列多重選択質問と、さらに5,340のフランス語のみの質問が含まれている。
欧州,アジア,北米のプロバイダから30のオープンウェイトLCMを評価し,7~70Bパラメータのモデルについて検討した。
モデルは歴史、地理、数学といった知識集約的なトピックに強く依存するが、セレブ、音楽、映画、ニュースといった日常的な大衆文化のトピックにはかなり弱い。
さらに、モデル性能は、同じ基礎的問題であっても言語によって異なり、事実知識へのアクセスは常に言語に依存しないとは限らないことを示唆している。
まとめると、我々のデータセットと実験は、既存の学術ベースの飽和ベンチマークでは捉えられない重要な知識ギャップを示している。
関連論文リスト
- RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering [2.5578258168516816]
バイリンガルなラテン語と英語の設定で質問応答と翻訳のためのベンチマークデータセットを導入する。
質問は、1800年代から現在にかけての試験、クイズボール様式のトリビア、教科書など、ラテン語の教育資料から寄せられている。
データセットには、ナレッジとスキルベース、マルチホップ推論、制約付き翻訳、混合言語ペアなど、さまざまな種類の質問タイプが含まれている。
論文 参考訳(メタデータ) (2026-04-22T16:24:46Z) - Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America [4.587479593949085]
大規模言語モデル(LLM)は、グローバルノースのデータに基づいて訓練され、他の文化に対する偏見的行動を示す。
本稿では、ウィキペディアの内容、ウィキデータ知識グラフの構造、社会科学からのエキスパート知識を活用して、質問/回答ペアのデータセットを作成することを提案する。
我々は、26k以上のウィキペディア記事から抽出された26k以上の質問と関連する回答からなるLatamQAデータベースを作成し、スペイン語とポルトガル語で多重選択質問(MCQ)に変換し、その後、英語に翻訳した。
論文 参考訳(メタデータ) (2026-02-16T14:23:17Z) - Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge [68.6805229085352]
ほとんどの多言語質問答えベンチマークは、取得した情報の地域的多様性を規定していない。
XNationQAには、9カ国の地理、文化、歴史に関する合計49,280の質問が7つの言語で提示されている。
我々はXNationQA上で8つの標準多言語LLMをベンチマークし、2つの新しい転送指標を用いて評価した。
論文 参考訳(メタデータ) (2025-11-01T18:41:34Z) - SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala [39.525952729268994]
SinhalaMMLUは、Sinhala専用に設計された最初の複数選択質問応答ベンチマークである。
このデータセットには、スリランカの国家カリキュラムに適合する2次教育レベルにまたがる7000以上の質問が含まれている。
SinhalaMMLU 上で26個の LLM を評価し,Claude 3.5 sonnet と GPT-4o がそれぞれ 67% と 62% の最高精度で達成されているのに対して,モデル全体の性能は限定的である。
論文 参考訳(メタデータ) (2025-09-03T09:22:39Z) - ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects [4.2155105586549535]
我々は,ヒンディー語で17K以上の質問からなるParamBenchについて,21の多様な被験者の質問紙から回答を得た。
これらの質問は、主に歴史、音楽、楽器、ヨガ、プッシュ、文学、哲学、法律などに関する全国レベルの入学試験から導かれる。
このベンチマークで16以上のオープンソースLLMの性能を評価し,Gemma3-27Bが56.4%の精度で最高であることを確認した。
論文 参考訳(メタデータ) (2025-08-22T07:59:37Z) - WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines [74.25764182510295]
視覚言語モデル(VLM)は、特に英語以外の言語において、文化特有の知識に苦しむことが多い。
我々は多言語および多文化の視覚的理解のための大規模ベンチマークであるWorld Cuisinesを紹介した。
このベンチマークには、30の言語と方言にまたがるテキストイメージペアを備えた、視覚的質問応答(VQA)データセットが含まれている。
論文 参考訳(メタデータ) (2024-10-16T16:11:49Z) - CaLMQA: Exploring culturally specific long-form question answering across 23 languages [58.18984409715615]
CaLMQAは、文化的に異なる23言語にわたる51.7Kの質問のデータセットである。
我々は,LLM生成長文回答の事実性,関連性,表面品質を評価する。
論文 参考訳(メタデータ) (2024-06-25T17:45:26Z) - BertaQA: How Much Do Language Models Know About Local Culture? [33.27901483916244]
本稿では,英語とバスク語に平行なトリビアデータセットであるBertaQAを紹介する。
データセットは、バスク文化に関連する質問のあるローカルサブセットと、より広い関心を持つ質問を持つグローバルサブセットで構成されている。
バスク語での事前学習は、英語で質問しても、バスク語文化におけるモデルのパフォーマンスを大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-06-11T14:30:34Z) - CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark [68.21939124278065]
言語と文化の豊富なセットをカバーするために設計された、文化的に多言語なビジュアル質問回答ベンチマーク。
CVQAには文化的に駆動されたイメージと、4大陸30カ国の質問が含まれ、31の言語と13のスクリプトをカバーし、合計10万の質問を提供する。
CVQA上で複数のマルチモーダル大言語モデル (MLLM) をベンチマークし、現在の最先端モデルではデータセットが困難であることを示す。
論文 参考訳(メタデータ) (2024-06-10T01:59:00Z) - MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models [65.10456412127405]
MLaKEは5言語にわたる知識編集手法の適応性のベンチマークである。
MLaKEは、ウィキペディアから言語にまたがるファクトチェーンを集約し、フリーフォームとマルチチョイスの両方で質問を生成する。
MLaKEにおける既存手法の多言語知識編集の一般化能力を評価する。
論文 参考訳(メタデータ) (2024-04-07T15:23:28Z) - M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining
Large Language Models [76.88692952308084]
M3Examは、多言語、マルチモーダル、マルチレベルコンテキストにおける大規模言語モデル(LLM)を評価するためのベンチマークである。
M3Examには、9つの言語で12,317の質問があり、3つの教育レベルがある。
我々は,M3Exam上でのLLMの性能評価を行い,GPT-4を含む現在のモデルが多言語テキストに苦戦していることを確認した。
論文 参考訳(メタデータ) (2023-06-08T13:21:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。