論文の概要: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
- arxiv url: http://arxiv.org/abs/2607.19322v1
- Date: Tue, 21 Jul 2026 17:42:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.518191
- Title: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
- Title(参考訳): オープンエンデッドジェネレーション評価のための2レベルメタルーブリック:Factual CompletenessのベンチマークであるGAMUT
- Abstract要約: Gamutは、長文生成における事実完全性のベンチマークである。
10の異なる領域にまたがって、実際のウェアラブル画像に基づく1,813の質問を作成します。
- 参考スコア(独自算出の注目度): 8.98920719663984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating the factuality of long-form generations has focused predominantly on precision, measuring whether the claims a model makes are correct. The dominant decompose-search-verify pipeline catches incorrect claims well but says little about whether a response contains all the information it should. Measuring factual completeness, the missing half of factuality, is harder: it requires enumerating the full set of facts a complete answer should contain, and these facts rarely form a flat list. They often involve open-ended sets where coverage is what matters, ordered processes, and relationships among facts that a list of independent boolean checks fails to capture. We introduce a two-level meta-rubric framework for evaluating open-ended generation, and instantiate it as Gamut (Grounded Assessment of Multimodal Factuality), a benchmark for factual completeness in long-form generation. The framework rests on a two-level rubric representation: a structured meta-rubric captures the organization and importance of the required content, which is then mechanically compiled into a flat checklist of binary, machine-gradable rubrics that an LLM judge scores reliably. We construct 1,813 questions grounded in real wearable imagery across 10 diverse domains, each paired with an evidence-backed rubric verified by expert human annotators. Because the framework is modality-agnostic, we also release a text-only variant. Evaluating 14 frontier and open-weight models, we find the benchmark genuinely challenging (best score 58.7% from Gemini 3.1 Pro), highly discriminative, and robust to the choice of judge.
- Abstract(参考訳): ロングフォーム世代における事実性を評価することは、モデルが主張する主張が正しいかどうかを測定することに集中している。
支配的な分解-探索-検証パイプラインは、誤ったクレームをうまくキャッチするが、レスポンスが必要な情報をすべて含んでいるかどうかについては、ほとんど語っていない。
完全な答えが含むべき事実の完全なセットを列挙する必要があるし、これらの事実がフラットリストを形成することはめったにない。
それらはしばしば、カバー範囲、順序付けられたプロセス、および独立したブールチェックのリストがキャプチャーに失敗する事実間の関係が重要となるオープンエンドセットを含んでいる。
オープンエンド世代を評価するための2段階のメタルブリックフレームワークを導入し、それをガムート(Grounded Assessment of Multimodal Factuality)としてインスタンス化する。
構造化されたメタルーブリックは、必要なコンテンツの組織と重要性をキャプチャし、機械的にコンパイルされ、LLMの審査員が確実に評価する、バイナリで機械分解可能なルーブリックのフラットなチェックリストになる。
10のドメインにまたがって、実際のウェアラブル画像に基づいた1,813の質問を、専門家のアノテータが検証したエビデンスベースのルーリックと組み合わせて構築する。
フレームワークはモダリティに依存しないため、テキストのみのバリエーションもリリースします。
14のフロンティアとオープンウェイトモデルを評価すると、このベンチマークは真に難しい(ゲミニ3.1 Proの58.7%)。
関連論文リスト
- Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models [0.0]
我々は、Noesisアーキテクチャの決定論的第一のクエリプレーンであるNoesisを提示する。
ノイズは生成前にすべての決定論的判断を下す。
報告されたすべての値は、その正確なソースと構築による位置にトレース可能である。
論文 参考訳(メタデータ) (2026-09-07T15:49:16Z) - Achieving Text-based Person Retrieval with Any Granularity [80.69427598925718]
本稿では、任意の粒度を持つテキストベースの人物検索という新しいパラダイムを紹介する。
5段階の粒度スペクトルを定式化し,高品質な多粒度アノテートデータセットであるUFine6926-MGを構築した。
次に、クロスモーダルな多重粒度アライニングおよびマッチングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-23T08:42:25Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle [0.0]
基準自由忠実度測定は、モデルが基底真理に対して行う各原子的クレームを検証する。
彼らが盲点を共有していることを示す:彼らは精度だけを計測し、主張されている主張は支持されているか?
戦略的基底真理が決定論的に導出される領域であるF1テレメトリを用いて、この測定を可能にする。
論文 参考訳(メタデータ) (2026-06-08T11:56:25Z) - DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark [48.84943754804533]
マルチモーダル文書には、テーブル、フィギュア、レイアウトなど、さまざまな要素が含まれている。
現在のアプローチでは、高精度の検索を実現するために、高密度の視覚埋め込みモデルと教師付きリランカを組み合わせるのが一般的である。
本稿では,レイアウトを意識したスパース埋め込み技術による視覚検索を支援するプラグイン・アンド・プレイフレームワークDocRetrieverを提案する。
論文 参考訳(メタデータ) (2026-05-28T14:50:53Z) - AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications [7.797719198801956]
本稿では,ハードウェア検証における現実的なアサーション生成のためのオープンソースのベンチマークであるAssertLLM2を紹介する。
AssertLLM2には13の機能カテゴリにわたる83の現実世界の設計が含まれている。
それぞれの設計について、このベンチマークは構造化された設計仕様、検証済みの依存性完全ゴールデンRTL、系統的に変更されたバグギーRTLの亜種を提供する。
論文 参考訳(メタデータ) (2026-05-26T10:49:25Z) - DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding [29.270128057512284]
本稿では,長期文書QAを構造化推論軌道予測問題として定式化するベンチマークであるDocScopeを紹介する。
軌道の各レベルを独立に監査する4段階評価プロトコルを設計する。
6つのプロプライエタリなモデル、12のオープンウェイトモデル、いくつかのドメイン固有のシステムをベンチマークします。
論文 参考訳(メタデータ) (2026-05-09T11:12:59Z) - FABLE: Fine-grained Fact Anchoring for Unstructured Model Editing [28.870053452479443]
構造化されていないモデル編集は、実際のテキストでモデルを更新することを目的としている。
本稿では, 全体テキスト生成から微細なファクトインジェクションを分離する階層型フレームワークFABLEを提案する。
実験により、FABLEは最先端の総合的な編集性能を維持しながら、きめ細かい質問応答を大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-04-14T10:41:36Z) - The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality [70.45240108873001]
FACTS Leaderboardは、実際に正確なテキストを生成する言語モデルの能力を総合的に評価するオンラインのリーダーボードスイートである。
このスイートは、4つの異なるサブリーダーボード上でのモデルのパフォーマンスを集約することで、事実性の総合的な尺度を提供する。
論文 参考訳(メタデータ) (2025-12-11T16:35:14Z) - MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval [86.35779264575154]
マルチモーダル検索は、現代のAIアプリケーションにおいて重要なコンポーネントになりつつあるが、その評価は、より現実的で困難なシナリオの要求に遅れている。
マルチモーダル検索のための推論集約型ベンチマークであるMR$2$-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-30T15:09:14Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。