論文の概要: SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task
- arxiv url: http://arxiv.org/abs/2609.00654v1
- Date: Tue, 01 Sep 2026 03:30:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.270177
- Title: SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task
- Title(参考訳): SciTrue: NTCIR SciClaimEval Taskにおけるフロンティアとオープン言語モデルによる信頼性の高い科学的クレーム検証
- Authors: Qiming Bao, Neşet Özkan Tan, Siyuan Wang, Mark Gahegan,
- Abstract要約: 11のフロンティアとオープンなマルチモーダルモデルを1つの正直なサンプル・プロトコルでベンチマークする。
SciTrueは4つのエビデンスカテゴリ/サブタスクの組み合わせのうち3つに明確なマージンを付けている。
- 参考スコア(独自算出の注目度): 15.259880314614117
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We describe the SciTrue team's participation in both subtasks of the NTCIR-19 SciClaimEval task~\cite{sciclaimeval}, which asks systems to verify scientific claims against the tables and figures of a paper. Rather than tuning a single model, we benchmark eleven frontier and open multimodal models under one honest, per-sample protocol and combine them with light, transparent post-processing. On the official, blind test leaderboard (Section~\ref{sec:results}), SciTrue placed first by a clear margin in three of the four evidence-category/subtask combinations, and tied for first on the primary metric in the fourth. Three findings explain the result. First, strong instruction-tuned models are already competitive: Claude Opus~4.8 and Gemma-4-31B each exceed the strongest public baseline (o4-mini), and GPT-5.5 and Claude Fable~5 lead both subtasks (97.7 on Subtask~2). Second, the task's pairing structure is the largest lever: a \emph{leak-free pair prior} that recovers the Supported/Refuted pairing from the claim text alone (a visible field) and assigns Supported to the higher-confidence evidence raises Subtask-1 pair-accuracy from 72.2 to 93.5, far more than any model swap or ensemble weighting. Third, a case-by-case audit finds that most residual errors are visually-undetectable label-mapping swaps or dataset label noise, so measured accuracy understates the true ability and the fixable-by-modeling headroom is small. Controlled fine-tuning, distillation, and agentic consistency-checking support the same conclusions, and we document throughout a measurement leak---label information reaching a system through the packaging of the data rather than its content---in which the released file ordering encodes the label, including one instance that briefly misled our own pipeline.
- Abstract(参考訳): NTCIR-19 SciClaimEval task~\cite{sciclaimeval}では,論文の表や図面に対する科学的主張の検証をシステムに依頼している。
単一モデルをチューニングするのではなく、正直でサンプルごとのプロトコルの下で11のフロンティアとオープンなマルチモーダルモデルをベンチマークし、それらを軽量で透明な後処理と組み合わせます。
公式のブラインドテストのリーダーボード(Section~\ref{sec:results})では、SciTrueが4つのエビデンスカテゴリ/サブタスクの組み合わせのうち3つにクリアマージンを付け、第4のプライマリメトリックで最初に結びついた。
3つの結果が得られた。
Claude Opus~4.8 と Gemma-4-31B はそれぞれ最強のベースライン(o4-mini)を超えており、GPT-5.5 と Claude Fable~5 はどちらもサブタスク(Subtask~2)をリードしている。
第二に、タスクのペアリング構造は最大のレバーである: \emph{leak-free pair prior} はクレームテキストのみ(可視界)からサポートされた/再利用されたペアリングを復元し、高信頼のエビデンスのサポートを割り当て、Subtask-1のペア精度を72.2から93.5に引き上げ、どのモデルスワップやアンサンブル重みよりもはるかに高くなる。
第3に、ケースバイケース監査では、ほとんどの残差が視覚的に検出不能なラベルマッピングスワップやデータセットラベルノイズであることがわかったため、測定精度は真の能力を下記し、固定可能なヘッドルームは小さい。
制御された微調整, 蒸留, エージェントの整合性チェックは, 同一の結論を支持し, 測定リークの全体にわたって記録する。 - リリースしたファイル順序付けがラベルをエンコードするコンテンツではなく, データのパッケージングを通じて, システムに到達したラベル情報 - パイプラインを短時間に誤解させた1例を含む。
関連論文リスト
- Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling [8.467936416935986]
Admitorは、校正された外部行動証拠に基づいて構築された入場ゲートである。
これは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
論文 参考訳(メタデータ) (2026-08-16T06:18:54Z) - One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions [0.0]
APIアグリゲータ、再販業者、推論プロバイダは、大きな言語モデル(LLM)を使用する。
既存の識別技術には、長いテキスト、トークンレベルのログ確率、反対に作られたプロンプト、またはモデル所有者の協力が必要である。
我々は,LLMの行動指紋を,自明なワンワードプロンプトに対する応答の実証的分布として定義する。
論文 参考訳(メタデータ) (2026-07-11T10:34:17Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning [64.33887406863899]
マルチモーダル偽装検出は、法医学とセキュリティのための聴覚的手がかりを解析することにより、偽装行動を特定することを目的としている。
既存のベンチマークでは、中間的な推論手段を使わずにバイナリラベルのみを提供する。
構造的キューレベルの記述と推論チェーンを用いた推論データセットを構築した。
1695年のサンプルでは、非実験的偽装検出データセットとしては最大である。
論文 参考訳(メタデータ) (2026-03-25T04:06:36Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Document Attribution: Examining Citation Relationships using Large Language Models [62.46146670035751]
そこで本研究では,帰属を簡単なテキスト・エンタテインメント・タスクとみなすゼロショット・アプローチを提案する。
また,アトリビューションプロセスの強化におけるアテンションメカニズムの役割についても検討する。
論文 参考訳(メタデータ) (2025-05-09T04:40:11Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。