論文の概要: When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
- arxiv url: http://arxiv.org/abs/2606.32029v1
- Date: Tue, 30 Jun 2026 17:54:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.347308
- Title: When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
- Title(参考訳): LLMがテーブルを不注意に読むとき - データ参照エラーの測定と削減
- Abstract要約: 本稿では,データ参照エラー(DRE)を,異なるモデルやタスク間で初めて体系的に評価する。
以上の結果から,DREは全試験モデル (1.7Bから20Bパラメータ) にまたがって発生することが明らかとなった。
我々は,データ参照を批評家として取り入れることで,解答精度が最大12.0%向上することが実証された。
- 参考スコア(独自算出の注目度): 36.695407633693286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While large language models (LLMs) perform well on table tasks, they still make data referencing errors (DREs), i.e., incorrectly citing or omitting table values, despite understanding the table structure. Beyond final-answer accuracy, DREs directly compromise the correctness and reliability of intermediate reasoning steps. Yet prior studies have only offered limited, small-scale analyses. In this work, we present the first systematic evaluation of tabular data referencing errors across different models and tasks. Our results show that DREs occur across all tested models (1.7B to 20B parameters). Furthermore, we demonstrate that incorporating data referencing as a critic significantly improves answer accuracy up to 12.0%, through critic-based filtering and rejection sampling. Finally, we trained a lightweight 4B-parameter critic model that achieves an average F1 score of 78.2% in detecting both in-distribution and out-of-distribution DREs, and effectively assists inference for larger models.
- Abstract(参考訳): 大規模言語モデル(LLM)はテーブルタスクでよく機能するが、テーブル構造を理解するにもかかわらず、データ参照エラー(DRE)、すなわちテーブル値の誤った引用や省略を行う。
最終回答の精度以外に、DREは中間推論ステップの正確性と信頼性を直接侵害する。
しかし、以前の研究では限定された小規模な分析しか提供されていなかった。
そこで本研究では,異なるモデルやタスク間での表型データ参照エラーについて,初めて体系的に評価する。
その結果,DREは全試験モデル (1.7Bから20Bパラメータ) で発生することがわかった。
さらに,データ参照を批判として取り入れることで,批判に基づくフィルタリングと拒否サンプリングによって解答精度が最大12.0%向上することが実証された。
最後に、分布内DREと分布外DREの両方を検出することで平均F1スコア78.2%を達成する軽量な4Bパラメータ批判モデルを訓練し、より大きなモデルに対する推論を効果的に支援した。
関連論文リスト
- Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions [8.023379679609151]
大規模言語モデル(LLM)は、他の標準表現の表計算データが意味的および構造的歪みを受けると失敗する。
システムプロンプトを通じて明示的な事前情報を提供する場合のみ、モデルは推論戦略を部分的に調整し、いくつかの歪みを修正する。
論文 参考訳(メタデータ) (2026-01-08T15:10:32Z) - Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models [15.985949745494747]
TableEGは、大規模な言語モデルを利用して、真のエラーを生成するフレームワークである。
10の異なるドメインにまたがる12の現実世界のデータセットをトレーニングしました。
TableEGは、合成エラーと実世界のエラーのギャップを埋めるだけでなく、その後のエラー検出と修正タスクの堅牢なベンチマークも確立している。
論文 参考訳(メタデータ) (2025-07-15T02:58:25Z) - Assessing Judging Bias in Large Reasoning Models: An Empirical Study [99.86300466350013]
DeepSeek-R1やOpenAI-o1のような大きな推論モデル(LRM)は、顕著な推論能力を示している。
本稿では、主観的嗜好アライメントデータセットと客観的事実ベースデータセットの両方において、LLMとLRMの偏りを判定するベンチマークを示す。
論文 参考訳(メタデータ) (2025-04-14T07:14:27Z) - Protecting multimodal large language models against misleading visualizations [94.71976205962527]
この結果から,誤解を招く可視化に対する質問応答(QA)の精度が,ランダムなベースラインのレベルに平均で低下していることが示唆された。
本研究では,非ミスリーディングの精度を損なうことなく,誤解を招くビジュアライゼーションにおけるQA性能を改善するための最初の推論時間手法を提案する。
テーブルベースのQAと視覚化を再描画する2つの方法が有効であり、最大19.6ポイントの改善が期待できる。
論文 参考訳(メタデータ) (2025-02-27T20:22:34Z) - Precise Model Benchmarking with Only a Few Observations [6.092112060364272]
本稿では,各サブグループの直接推定と回帰推定を個別にバランスする経験的ベイズ推定器を提案する。
EBは、直接的および回帰的アプローチと比較して、LCM性能のより正確な推定を一貫して提供する。
論文 参考訳(メタデータ) (2024-10-07T17:26:31Z) - CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation [76.31621715032558]
グラウンデッドジェネレーションは、言語モデル(LM)に、より信頼性が高く説明可能な応答を生成する能力を持たせることを目的としている。
本稿では,新しい検証フレームワークであるCaLMを紹介する。
我々のフレームワークは、より少ないパラメトリックメモリに依存する小さなLMを有効活用し、より大きなLMの出力を検証する。
論文 参考訳(メタデータ) (2024-06-08T06:04:55Z) - Exploring Multimodal Large Language Models for Radiology Report
Error-checking [1.7217842380976978]
本稿では, 放射線技師が報告の誤りを確認するための補助として, マルチモーダル大言語モデル (LLMs) を用いた最初の臨床応用の1つを提案する。
我々は、実世界の放射線学データセット(X線とCTスキャンを含む)から評価データセットを作成しました。
SIMPLEレベルでは,MIMIC-CXRとIU X線データでそれぞれ47.4%,25.4%向上した。
論文 参考訳(メタデータ) (2023-12-20T15:20:33Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Annotating and Detecting Fine-grained Factual Errors for Dialogue
Summarization [34.85353544844499]
本稿では,DIASUMFACTというファクトエラーアノテーションを用いた最初のデータセットを提案する。
文レベルのマルチラベル分類問題として,ファクト・ファクト・エラー検出を定義する。
事前学習したエンコーダ-デコーダモデルを用いた候補ランキングによる教師なしモデルENDERANKERを提案する。
論文 参考訳(メタデータ) (2023-05-26T00:18:33Z) - Discover, Explanation, Improvement: An Automatic Slice Detection
Framework for Natural Language Processing [72.14557106085284]
スライス検出モデル(SDM)は、データポイントの低パフォーマンスなグループを自動的に識別する。
本稿では,NLPタスクの分類のための "Discover, Explain, improve (DEIM)" というベンチマークを提案する。
評価の結果,Edisaは情報的セマンティックな特徴を持つ誤り発生データポイントを正確に選択できることがわかった。
論文 参考訳(メタデータ) (2022-11-08T19:00:00Z) - Re-TACRED: Addressing Shortcomings of the TACRED Dataset [5.820381428297218]
TACREDは、最大かつ最も広く使われている文レベルの関係抽出データセットの1つである。
このデータセットを用いて評価された提案モデルは、新しい最先端のパフォーマンスを一貫して設定する。
しかし、彼らはまだ大規模なテキストコーポラで外部の知識と教師なしの事前訓練を利用しながら大きなエラー率を示しています。
論文 参考訳(メタデータ) (2021-04-16T22:55:11Z) - Identifying Statistical Bias in Dataset Replication [102.92137353938388]
モデルが(11-14%) の精度低下を示すImageNetデータセットの再現について検討した。
同定された統計バイアスを補正した後、推定3.6%のpm 1.5%の当初の11.7%のpm 1.0%の精度低下しか記録されていない。
論文 参考訳(メタデータ) (2020-05-19T17:48:32Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。