論文の概要: Understanding Errors in LLM-Based Question Answering over Imperfect Tables
- arxiv url: http://arxiv.org/abs/2610.04687v1
- Date: Sat, 03 Oct 2026 18:03:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.326148
- Title: Understanding Errors in LLM-Based Question Answering over Imperfect Tables
- Title(参考訳): LLMによる不完全な質問応答における誤りの理解
- Abstract要約: 不完全な表に対する質問応答における誤り発見と処理について検討する。
オリジナル、エラーマーク付き、修復済みのテーブルを比較します。
正確なQAには、検証済みのエラーロケーションのみを提供することは不十分である。
- 参考スコア(独自算出の注目度): 9.914974837876635
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate error discovery and handling in question answering over imperfect tables through controlled studies across three large language models (LLMs) on human-reviewed RADAR-T examples. Answering questions over these tables requires handling errors that can affect the answer. We vary row order and compare original, error-marked, and repaired tables to test whether discovery depends on where errors appear and whether providing their locations is sufficient for accurate question answering. First, reordering rows changes error discovery even when the table contents and gold answer remain unchanged. Complete discovery is higher for back than front placements and, averaged over the tested mean positions, for compact than widely spaced layouts. Second, providing verified error locations alone is insufficient for accurate QA, leaving a substantial accuracy gap between error-marked and repaired tables. Providing tables with human-reviewed repairs already applied raises code-assisted QA accuracy by 39.0-59.1 percentage points over the error-marked tables across the three systems. GBDI, a simple workflow, puts these findings into practice by combining error discovery across shuffled table views with explicit guidance for verifying and handling the reported errors. On RADAR-T, GBDI raises observed QA accuracy by 3.8-18.5 percentage points over a code-agent baseline across five systems. These results highlight the importance of both reliable error discovery and effective error handling in question answering over imperfect tables. Our anonymous repository is available at https://anonymous.4open.science/r/GBDI-ICLR-2027-85BD/
- Abstract(参考訳): 本研究では,3つの大規模言語モデル (LLM) を対象とし,人間レビューしたRADAR-T の例を用いて,不完全表に対する誤り発見と問合せ処理について検討した。
これらのテーブル上で質問に答えるには、答えに影響を与える可能性のあるエラーを処理する必要がある。
行順を変えて、元の、エラーマーク付き、修正済みのテーブルを比較して、発見がエラーの出現場所に依存しているか、その場所を提供することが正確な質問応答に十分かどうかを調べる。
まず、表の内容と金の答えが変わらない場合でも、並べ替え行がエラー発見を変更する。
完全な発見は、前方配置よりも後方配置の方が高く、テストされた平均位置よりも平均的に、広い範囲のレイアウトよりもコンパクトである。
第二に、検証済みのエラー位置のみを提供することは正確なQAには不十分であり、エラーマーク付きテーブルと修正済みテーブルの間には相当な精度のギャップが残っている。
人間がレビューした修復を施したテーブルを提供することで、3つのシステムにまたがるエラーマーク付きテーブルに対してコードアシストされたQAの精度が39.0-59.1ポイント向上する。
単純なワークフローであるGBDIでは、シャッフルテーブルビュー全体にわたるエラー発見と、報告されたエラーの検証と処理に関する明確なガイダンスを組み合わせることで、これらの発見を実践している。
RADAR-Tでは、GBDIは5つのシステムにまたがるコードエージェントベースラインに対して、観測されたQAの精度を3.8-18.5ポイント向上させる。
これらの結果は、不完全なテーブルに対する質問応答において、信頼性の高いエラー発見と効果的なエラー処理の両方の重要性を強調している。
私たちの匿名リポジトリはhttps://anonymous.4open.science/r/GBDI-ICLR-2027-85BD/で利用可能です。
関連論文リスト
- SALUS: Automated Auditing of NL-to-SQL Benchmarks through Weak Supervision of Multi-Agent Output [11.568071613299553]
本稿では,ベンチマーク中のアノテーションエラーを自動的に検出するシステムであるSALUSを提案する。
SALUSは、弱い教師付きエラー検出としてベンチマーク監査を行う。
我々は,BIRDで約37%,Spiderで約27%のアノテーション誤差率を推定した。
論文 参考訳(メタデータ) (2026-10-04T21:12:58Z) - From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing [50.70862449978062]
最近の文書では OmniDocBench v1.6 の 93 以上の TEDS スコアが達成されている。
このギャップを定量化するために、916の現実世界のテーブルの診断ベンチマークであるTableParseMapを紹介します。
論文 参考訳(メタデータ) (2026-08-10T16:59:30Z) - ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement [57.98138819417949]
テキスト・ツー・クエリを明示的にモデル化するフレームワークであるErrorLLMを提案する。
ErrorLLMは、バックボーンの初期生成よりも大幅に改善されていることを示す。
ErrorLLMは、精錬効率を維持しつつ、高い検出F1スコアで両面に対処する。
論文 参考訳(メタデータ) (2026-03-04T05:27:20Z) - Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models [15.985949745494747]
TableEGは、大規模な言語モデルを利用して、真のエラーを生成するフレームワークである。
10の異なるドメインにまたがる12の現実世界のデータセットをトレーニングしました。
TableEGは、合成エラーと実世界のエラーのギャップを埋めるだけでなく、その後のエラー検出と修正タスクの堅牢なベンチマークも確立している。
論文 参考訳(メタデータ) (2025-07-15T02:58:25Z) - Protecting multimodal large language models against misleading visualizations [94.71976205962527]
この結果から,誤解を招く可視化に対する質問応答(QA)の精度が,ランダムなベースラインのレベルに平均で低下していることが示唆された。
本研究では,非ミスリーディングの精度を損なうことなく,誤解を招くビジュアライゼーションにおけるQA性能を改善するための最初の推論時間手法を提案する。
テーブルベースのQAと視覚化を再描画する2つの方法が有効であり、最大19.6ポイントの改善が期待できる。
論文 参考訳(メタデータ) (2025-02-27T20:22:34Z) - Interpretable LLM-based Table Question Answering [5.484058026469263]
テーブル質問回答(Table QA)の解釈可能性は非常に重要です。
本稿では,モデルの意思決定過程を解釈可能なテーブルQA法を提案する。
論文 参考訳(メタデータ) (2024-12-16T22:44:31Z) - Context-Aware SQL Error Correction Using Few-Shot Learning -- A Novel Approach Based on NLQ, Error, and SQL Similarity [0.0]
本稿では,誤り訂正 insql 生成のための新しい数ショット学習手法を提案する。
与えられた自然言語質問(NLQ)に対して最も適した少数ショット誤り訂正例を選択することにより、生成されたクエリの精度を向上させる。
オープンソースデータセットを用いた実験では、単純な誤り訂正法により、誤り訂正のない修正エラーが39.2%増加し、10%増加した。
論文 参考訳(メタデータ) (2024-10-11T18:22:08Z) - Increasing the LLM Accuracy for Question Answering: Ontologies to the Rescue! [1.0786522863027366]
本稿では,1)オントロジーに基づくクエリチェック (OBQC) と2) LLM修復からなるアプローチを提案する。
当社のアプローチでは、"知らない"結果の8%を含む、全体的な精度を72%に向上しています。
論文 参考訳(メタデータ) (2024-05-20T00:28:00Z) - KET-QA: A Dataset for Knowledge Enhanced Table Question Answering [63.56707527868466]
本研究では,TableQAの外部知識源として知識ベース(KB)を用いることを提案する。
すべての質問は、答えるテーブルとサブグラフの両方からの情報を統合する必要がある。
我々は,膨大な知識サブグラフから関連する情報を抽出するために,レトリバー・レゾナー構造パイプラインモデルを設計する。
論文 参考訳(メタデータ) (2024-05-13T18:26:32Z) - The Earth is Flat? Unveiling Factual Errors in Large Language Models [89.94270049334479]
ChatGPTのような大規模言語モデル(LLM)は、事前学習や微調整の知識が豊富にあるため、様々な応用がある。
それにもかかわらず、医療、ジャーナリズム、教育といった重要な分野に懸念を抱き、事実と常識の誤りを引き起こす傾向にある。
LLMにおける事実不正確な事実を明らかにすることを目的とした,新しい自動テストフレームワークであるFactCheckerを紹介する。
論文 参考訳(メタデータ) (2024-01-01T14:02:27Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。