論文の概要: DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification
- arxiv url: http://arxiv.org/abs/2607.25069v1
- Date: Mon, 27 Jul 2026 20:59:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.620818
- Title: DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification
- Title(参考訳): DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification
- Authors: Sagnik Sinha, Shreyas Shrestha,
- Abstract要約: 本稿では,大規模言語モデル(LLMs)が生成する推論トレースのランク付けと,英語とアラビア語における数値的主張の最終的な検証について述べる。
最初のアプローチは、LORAを用いたLLMベースの検証器を微調整し、各推論トレースをバイナリ分類問題として独立にスコア付けする。
第2のアプローチでは、手作りの数値と時間重なり合う特徴を持つ軽量IDF報酬モデルを使用してトレースを記録し、判定グループによるスコアを集計して最終的な予測を決定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated verification of numerical claims is a challenging problem, as it requires both language understanding and quantitative reasoning. This paper describes our system for CLEF 2026 CheckThat! Task 2, which focuses on ranking reasoning traces generated by large language models (LLMs) and predicting a final verdict for numerical claims in English and Arabic. We explore two approaches. The first approach fine-tunes an LLM-based verifier using LoRA to score each reasoning trace independently as a binary classification problem, and selects the final verdict using Best-of-N selection. We further experiment with adaptive sub-claim decomposition to break complex claims into simpler parts before verification. The second approach uses a lightweight TF-IDF reward model with handcrafted numeric and temporal overlap features to score traces, and aggregates scores by verdict group to determine the final prediction. For Arabic, we compare a general multilingual model against AraBERT, a language-specific model pretrained on Arabic text. Our results show that the LLM-based approach outperforms the lightweight reward model on most metrics, particularly Recall@5, while the reward-based approach shows stronger performance on the Conflicting class. Sub-claim decomposition did not improve performance, suggesting that claim splitting introduces noise rather than aiding reasoning. For Arabic, AraBERT outperforms the multilingual baseline across most metrics.
- Abstract(参考訳): 数値的クレームの自動検証は、言語理解と量的推論の両方を必要とするため、難しい問題である。
CLEF 2026 CheckThat!
タスク2は、大規模言語モデル(LLM)が生成したランキング推論トレースに焦点をあて、英語とアラビア語における数値的クレームの最終的な判定を予測する。
我々は2つのアプローチを探求する。
最初のアプローチは、LORAを用いたLCMベースの検証器を微調整し、各推論トレースをバイナリ分類問題として独立にスコアし、Best-of-N選択を用いて最終判定を選択する。
さらに、複雑なクレームを検証前により単純な部分に分割するために、適応的なサブステート分解を実験する。
第2のアプローチでは、手作りの数値と時間重なり合う特徴を持つ軽量なTF-IDF報酬モデルを使用してトレースを記録し、判定グループによるスコアを集計して最終的な予測を決定する。
アラビア語では、アラビア文字で事前訓練された言語固有のモデルであるAraBERTに対して、一般的な多言語モデルを比較する。
以上の結果から,LLMに基づくアプローチは,ほとんどの指標,特にRecall@5において軽量な報酬モデルよりも優れており,一方,報酬ベースのアプローチは競合クラスにおいてより強力なパフォーマンスを示している。
サブステート分解では性能が向上せず、クレーム分割は推論を補助するよりもノイズをもたらすことを示唆している。
アラビア語では、AraBERTは多くの指標で多言語ベースラインを上回っている。
関連論文リスト
- LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics [21.604030114864642]
オフザシェルフの大規模言語モデル(LLM)は、テキストアノテーションの自動化にますます利用されている。
デンマークのテキスト分類データセットであるRAB-Credを紹介した。
本研究は,21個のオープンウェイトモデルと30個のシステム・ユーザ・プロンプトの組み合わせをベンチマークし,ゼロショットと少数ショットの分類におけるモデルとプロンプトの選択の効果を体系的に評価する。
論文 参考訳(メタデータ) (2026-05-13T12:07:47Z) - TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - ClaimIQ at CheckThat! 2025: Comparing Prompted and Fine-Tuned Language Models for Verifying Numerical Claims [1.6376648444927477]
本稿では CLEF 2025 CheckThat! Lab のタスク3について述べる。
命令調整型大言語モデル(LLM)によるゼロショットプロンプトと,パラメータ効率の高いLoRAを用いた微調整の2つの補完手法について検討する。
LLaMAをLoRAで微調整することで、英語の検証セット上で高い性能が得られる。
論文 参考訳(メタデータ) (2025-09-15T01:03:09Z) - CEA-LIST at CheckThat! 2025: Evaluating LLMs as Detectors of Bias and Opinion in Text [3.9845507207125967]
本稿では,大言語モデル (LLM) を用いた多言語主観性検出の競争的アプローチを提案する。
LLMは、慎重に設計されたプロンプトと組み合わせることで、微調整されたより小さな言語モデル(SLM)に適合または優れることを示す。
このシステムは,2025年の主観性検出タスクにおいて,複数の言語で上位にランクインした。
論文 参考訳(メタデータ) (2025-07-10T08:35:05Z) - Multilingual vs Crosslingual Retrieval of Fact-Checked Claims: A Tale of Two Approaches [8.127643463046516]
マルチリンガルおよびクロスリンガルのパフォーマンスを改善するための戦略を検討する。
47言語におけるポストとクレームを含むデータセットに対するアプローチを評価する。
最も重要なことは、多言語性は多言語性よりも独自の特徴を持つセットアップであることが示される。
論文 参考訳(メタデータ) (2025-05-28T08:47:10Z) - Graph-Structured Speculative Decoding [52.94367724136063]
投機的復号化は、大規模言語モデルの推論を加速する有望な手法として登場した。
本稿では, 有向非巡回グラフ(DAG)を応用して, 起案された仮説を管理する革新的な手法を提案する。
我々は1.73$times$から1.96$times$に顕著なスピードアップを観察し、標準投機的復号法を大幅に上回った。
論文 参考訳(メタデータ) (2024-07-23T06:21:24Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Modeling Sequential Sentence Relation to Improve Cross-lingual Dense Retrieval [80.43859162884353]
マスク付き文モデル(MSM)と呼ばれる多言語多言語言語モデルを提案する。
MSMは、文表現を生成する文エンコーダと、文書から文ベクトルのシーケンスに適用される文書エンコーダとから構成される。
モデルをトレーニングするために,サンプル負の階層的コントラスト損失によって文ベクトルをマスクし,予測するマスク付き文予測タスクを提案する。
論文 参考訳(メタデータ) (2023-02-03T09:54:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。