論文の概要: Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding
- arxiv url: http://arxiv.org/abs/2608.08512v1
- Date: Sun, 09 Aug 2026 06:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.847078
- Title: Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding
- Title(参考訳): 時間と過去: 文書理解の時間的進化に基づく大規模言語モデルのベンチマーク
- Authors: Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda,
- Abstract要約: 法律、税法、ソフトウェア文書などの進化した文書は、修正され、置き換えられ、時には時間とともに復活する。
我々は、バングラデシュ政府によって発行された644の公式税関の計3,050対のQAに関する専門家が検証したベンチマークであるTIDEを提示する。
- 参考スコア(独自算出の注目度): 3.285110528753401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evolving documents, such as laws, tax codes, and software documentation, are amended, replaced, and sometimes reverted over time, so a question has different correct answers at different dates. In contrast to encyclopedic knowledge, where an old fact is simply overwritten, an amendment is itself an official text that states what it replaces and when it takes effect, and the earlier version stays correct for its validity period. The central challenge is therefore version resolution, that is, identifying the version in force on the queried date. Existing temporal QA datasets treat time only as an annotation, so version resolution stays untested. We present TIDE, an expert-verified benchmark of 3,050 QA pairs over 644 official customs instruments issued between 1969 and 2025 by the Government of Bangladesh, covering eight task types over deeply code-mixed documents that are heterogeneous in layout and dated in two calendars. In addition, we evaluate nine recent LLMs under a single protocol across parametric, gold-context, and retrieval access, scored by a three-judge LLM council with a hard date gate separating correct meaning from correct time. The best macro-averaged accuracy is only 68.5%. Resolving a version from an implicit date reaches 59.7%, and detecting that the supplied version does not govern the query reaches only 26.7%. Models are more likely to find correct versions than to reject incorrect ones, and they tend to follow a confident parametric answer over the supplied authoritative text. All code and data are available at https://github.com/icsetepa44/TIDE
- Abstract(参考訳): 法律、税法、ソフトウェア文書などの文書の進化は、修正され、置き換えられ、時には時間が経つにつれて戻されるため、質問は異なる日付で正しい答えを持っている。
古い事実が単に上書きされている百科事典の知識とは対照的に、修正はそれ自体が何を置き換えるのか、いつ有効になるかを記述する公式のテキストであり、初期のバージョンはその有効期間について正しいままである。
したがって、中心的な課題はバージョン解決であり、すなわち、クエリされた日に有効であるバージョンを特定することである。
既存の時間的QAデータセットはアノテーションとしてのみ時間を扱うため、バージョン解決は未テストのままである。
我々は,1969年から2025年にかけてバングラデシュ政府によって発行された644の税関で,3,050のQAペアを専門家が検証したベンチマークTIDEを紹介した。
さらに,パラメトリック,ゴールドコンテクスト,検索アクセスにまたがる1つのプロトコルに基づく最近の9つのLCMの評価を行った。
マクロ平均精度は68.5%である。
暗黙の日付からバージョンを解くことは59.7%に達し、供給されたバージョンがクエリを管理していないことを検出するのは26.7%である。
モデルは間違ったバージョンを拒絶するよりも正しいバージョンを見つける傾向があり、供給された権威テキストに対して自信あるパラメトリックな回答に従う傾向にある。
すべてのコードとデータはhttps://github.com/icsetepa44/TIDEで入手できる。
関連論文リスト
- Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law [0.0]
我々は,現在施行中の法律記事の体系的検索と引用という,時間的誤動作を特定し,定量化する。
われわれはFiscalQA Proを導入し、フランスの税法典の32,436項目のコーパスと、すべてモデルに固執した時間的推論トラックを組み合わせている。
オラクルなしのマルチバージョンインデックス上のエンドツーエンドレトリバーは、98.3%という厳密な値に達した。
論文 参考訳(メタデータ) (2026-08-10T10:20:13Z) - When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses [1.5770673503612611]
メモリ拡張されたエージェントは、ユーザの格納された状態が時代遅れであることを知ることができ、なおも古い値を計画する。
私たちは1つの構造的コントリビュータを特定します。 ドラフトアンコールによる検証は、応答が何を言っているかをチェックします。
論文 参考訳(メタデータ) (2026-08-03T02:49:08Z) - Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets [0.0]
言語モデルベンチマークは、2つの異なる測定質問を1つの精度スコアに分解する。
スコアラーに依存しない実行証拠を分離する2層評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-27T11:04:17Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - TimeStampEval: A Simple LLM Eval and a Little Fuzzy Matching Trick to Improve Search Accuracy [0.0]
TimeStampEvalは、非バーバティムな引用を与えられた長い書き起こしから正確にミリ秒のタイムスタンプを取得するためのベンチマークである。
簡単な2段階法では,推論コストを90%以上削減しながら,検索精度を劇的に向上させる。
モチベーションのユースケースは、議会記録のクリップをAIがホストする動詞のナレーションにまとめる、自動化されたロングフォームポッドキャストである。
論文 参考訳(メタデータ) (2025-10-27T21:54:56Z) - VersionRAG: Version-Aware Retrieval-Augmented Generation for Evolving Documents [2.657536539253924]
既存のアプローチは、バージョンに敏感な質問に対して58~64%の精度しか達成していない。
文書の進化を明示的にモデル化するバージョン対応RAGフレームワークであるVersionRAGを紹介します。
検索中、VersionRAGはインテント分類に基づいて、クエリを特定のパスにルーティングする。
論文 参考訳(メタデータ) (2025-10-09T11:48:58Z) - LEXam: Benchmarking Legal Reasoning on 340 Law Exams [76.3521146499006]
textscLEXamは,法科116科の法科試験を対象とする340件の法科試験を対象とする,新しいベンチマークである。
このデータセットは、英語とドイツ語で4,886の法試験質問で構成されており、その中には2,841の長文のオープンエンド質問と2,045の多重選択質問が含まれている。
この結果から,モデル間の差分化におけるデータセットの有効性が示唆された。
論文 参考訳(メタデータ) (2025-05-19T08:48:12Z) - GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence [64.95492752484171]
GenAudit - 文書基底タスクの事実チェック LLM 応答を支援するためのツール。
GenAuditは、レファレンス文書でサポートされていないクレームを修正したり削除したりすることでLCMレスポンスを編集することを提案し、また、サポートしているように見える事実の参照から証拠を提示する。
GenAuditは、さまざまなドメインから文書を要約する際に、8つの異なるLCM出力でエラーを検出することができる。
論文 参考訳(メタデータ) (2024-02-19T21:45:55Z) - A Dataset for Answering Time-Sensitive Questions [88.95075983560331]
時間とは、我々の物理的世界において重要な次元である。多くの事実が時間に関して進化することができる。
時間次元を考慮し、既存のQAモデルに時間とともに推論する権限を与えることが重要です。
既存のQAデータセットには、時間に敏感な質問がほとんどないため、モデルの時間的推論能力の診断やベンチマークには適さない。
論文 参考訳(メタデータ) (2021-08-13T16:42:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。