論文の概要: LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs
- arxiv url: http://arxiv.org/abs/2609.01182v1
- Date: Tue, 01 Sep 2026 12:56:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.668068
- Title: LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs
- Title(参考訳): LLMPEDIA: LLMのパラメトリック百科事典知識のブラウジング,検証,比較
- Authors: Muhammed Saeed, Simon Razniewski,
- Abstract要約: LLMPEDIAでは、ビジターがこのフロンティアのクレームを一度に5つのワンクリックビューで検査できる。
均一なランダムサンプルでは、真の割合は68.4%であり、MMLUの21pp以下である。
その結果、オープンな百科事典は、ビジターがこのフロンティアのクレームを一度に5つのワンクリックビューで検査できる。
- 参考スコア(独自算出の注目度): 10.223945061944521
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flagship language models appear saturated on benchmarks like MMLU (Hendrycks et al., 2021), scoring above 90% - yet benchmarks test only what the experimenter thought to ask, the availability bias of fixed question sets. LLMPEDIA makes this bias measurable and browsable. We recursively materialized ~1.3M articles from three model families' parametric memory (GPT-5-mini, DeepSeek-V3.2, Llama-3.3-70B) without retrieval, then audited a stratified sample of atomic claims against Wikipedia and a curated web stack, coloring every claim supported, refuted, or insufficient (Saeed and Razniewski, 2026). On a uniform random sample the true rate is 68.4% - more than 21 pp below MMLU - with 30.5% of claims insufficient: assertions no benchmark probes and the world's largest encyclopedia cannot adjudicate - long-tail knowledge or plausible hallucination, the evidence cannot tell - extending to free text the coverage gap GPTKB established for triples (Hu et al., 2025). The resulting live, open encyclopedia lets visitors inspect this frontier one claim at a time through five one-click views - link-traversal exploration, claim-level factuality, cross-model and political-persona comparison, and a guided topic drill-down - each page, claim, and verdict at a stable URL. LLMPEDIA is live at https://llmpedia.net
- Abstract(参考訳): MMLU(Hendrycks et al , 2021)のようなベンチマークではフラッグシップ言語モデルが90%以上のスコアで飽和しているように見える。
LLMPEDIAは、このバイアスを測定可能でブラウズ可能にします。
我々は3つのモデルファミリーのパラメトリックメモリ(GPT-5-mini, DeepSeek-V3.2, Llama-3.3-70B)から1.3M項目を検索せずに再帰的に生成し、その後、ウィキペディアに対する原子的クレームとキュレートされたウェブスタックの階層化されたサンプルを検査し、サポートされた全てのクレーム、反感、または不十分なクレームを色付けした(Saeed and Razniewski, 2026)。
同一のランダムサンプルでは、真の割合は68.4%であり、MMLUより21pp以上で、30.5%のクレームが不十分である: アサーション ベンチマークプローブが無く、世界最大の百科事典では、長尾の知識や幻覚が否定できない 証拠は、自由テキストに拡張して三重項のために確立されたカバレッジギャップ GPTKB (Hu et al , 2025)。
その結果生まれたオープンな百科事典では、ビジターがこのフロンティアのクレームを、リンク・トラバーショナル・サーベイ、クレームレベルの事実性、クロスモデルと政治的個人比較、ガイド付きトピック・ドリルダウン(各ページ、クレーム、バリデーション)の5つのビューを通じて、一度に1つのクレームを検査することができる。
LLMPEDIAはhttps://llmpedia.netで公開されている。
関連論文リスト
- BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science [0.0]
商業的な大規模言語モデルは知識参照としてますます使われているが、競合する科学的主張に対する彼らのスタンスは安定でも透明でもない。
我々は,フランク・ソルターの生物社会学の枠組みからエスノナショナリストの擬似科学を4つのLLMファミリーで評価する方法を検証した。
グロクのFastバージョンは、他の全てのモデルより2倍から5倍高い70-75の信頼性スコアを常に割り当てた。
論文 参考訳(メタデータ) (2026-07-24T17:32:43Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses [6.004875368104112]
大規模な言語モデル(LLM)は治療として提案されているが、完全なサーベイワークフロー全体にわたる厳密な評価はほとんど残っていない。
アンケート設計, サンプル選択, パイロットテスト, 欠落データ計算, および収集後の分析を対象とする, LLM 統合のための5段階フレームワークを提示し, 評価した。
保護モチベーション理論 (PMT) 制約付き共起知識グラフを導入し, ゼロショット推論, 検索拡張ベースライン, 新規な理論インフォームド変種にまたがる7つのLLM構成を開発する。
論文 参考訳(メタデータ) (2026-05-19T00:58:36Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale [10.223945061944521]
LLMpediaはパラメトリックメモリから完全に百科事典を生成する。
ウィキペディアでカバーされた被験者の真偽は74.7%である。
Grokipediaとは異なり、すべてのプロンプト、アーティファクト、評価の評定が公開されている。
論文 参考訳(メタデータ) (2026-03-25T08:37:26Z) - One Thousand and One Pairs: A "novel" challenge for long-context language models [56.60667988954638]
NoChaは、67冊の架空の書籍に関する1,001対の真偽の主張のデータセットである。
当社のアノテータは、NoChaにおけるペアの最大シェアは、本全体に対するグローバルな推論を必要としていることを確認しています。
平均的なモデルでは、文レベルの検索しか必要としないペアの方が、グローバルな推論よりもはるかに優れています。
論文 参考訳(メタデータ) (2024-06-24T02:03:57Z) - Long-form factuality in large language models [60.07181269469043]
大規模言語モデル(LLM)は、しばしば、オープンエンドトピックの事実検索プロンプトに応答するときに、事実エラーを含むコンテンツを生成する。
我々は、GPT-4を用いて、オープンドメインにおけるモデルの長文事実をベンチマークし、LongFactを生成する。
そこで我々は,LLMエージェントを検索拡張現実性評価器 (SAFE) と呼ぶ手法により,長期的事実性の自動評価器として使用できることを提案する。
論文 参考訳(メタデータ) (2024-03-27T17:48:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。