論文の概要: NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models
- arxiv url: http://arxiv.org/abs/2601.08852v1
- Date: Fri, 26 Dec 2025 19:17:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-25 16:54:51.678402
- Title: NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models
- Title(参考訳): NewsScope: オープンモデルを用いたスキーマ付きクロスドメインニュースクレーム抽出
- Abstract要約: NewsScopeは、スキーマ付きニュースクレーム抽出のためのクロスドメインデータセット、ベンチマーク、微調整モデルである。
データセットには政治、健康、科学/環境、ビジネスに関する455の記事が含まれている。
LLaMA 3.1 8Bは、LoRAを315のトレーニング例で微調整し、保持領域内(80記事)とアウト・オブ・ソース(60記事)のテストセットで評価した。
- 参考スコア(独自算出の注目度): 0.15039745292757667
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated news verification requires structured claim extraction, but existing approaches either lack schema compliance or generalize poorly across domains. This paper presents NewsScope, a cross-domain dataset, benchmark, and fine-tuned model for schema-grounded news claim extraction. The dataset contains 455 articles across politics, health, science/environment, and business, consisting of 395 in-domain articles and 60 out-of-source articles for generalization testing. LLaMA 3.1 8B was fine-tuned using LoRA on 315 training examples and evaluated on held-out in-domain (80 articles) and out-of-source (60 articles) test sets. Human evaluation on 400 claims shows NewsScope achieves 89.4% human-evaluated accuracy compared to GPT-4o-mini's 93.7% (p=0.07). NewsScope outperforms GPT-4o-mini on political claims (94.3% vs. 87.8%). A numeric grounding filter further improves accuracy to 91.6%, narrowing the gap to 2.1 percentage points. Inter-annotator agreement studies (160 claims) confirm labeling reliability (94.6% positive agreement on SUPPORTED judgments). The open-weight model enables offline deployment at approximately $15 on-demand compute (or $0 on free tiers). Code and benchmark are publicly released.
- Abstract(参考訳): 自動ニュース検証には構造化されたクレーム抽出が必要であるが、既存のアプローチではスキーマコンプライアンスが欠如しているか、ドメイン間での一般化が不十分である。
本稿では,スキーマ付きニュースクレーム抽出のためのクロスドメインデータセット,ベンチマーク,微調整モデルであるNewsScopeを提案する。
このデータセットには、政治、健康、科学、環境、ビジネスにまたがる455の記事が含まれており、395のドメイン内記事と60のアウト・オブ・ソース記事で構成されている。
LLaMA 3.1 8Bは、LoRAを315のトレーニング例で微調整し、保持領域内(80記事)とアウト・オブ・ソース(60記事)のテストセットで評価した。
400件の主張に対する人間の評価は、GPT-4o-miniの93.7%(p=0.07)と比較して、NewsScopeが89.4%の精度で評価されていることを示している。
NewsScopeは政治的主張でGPT-4o-mini(94.3%対87.8%)を上回っている。
数値接地フィルタはさらに精度を91.6%に改善し、ギャップを2.1ポイントに縮める。
アノテーション間合意研究(160クレーム)は、ラベル付けの信頼性(支持された判断について94.6%の肯定的な合意)を確認している。
オープンウェイトモデルは、約15ドルのオンデマンド計算(無料プランで0ドル)でオフラインでのデプロイを可能にする。
コードとベンチマークが公開されている。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - SerenAI: State-transition system inspired by text-based world AI models [0.0]
我々は、単にテキストではなく、検証可能な予測を出力するSerenAIと呼ばれるテキストベースのシステムを実証する。
本モデルでは,2段階の適応訓練,すなわちパラメータ効率のよい微調整,および5万以上の原因効果に基づく検証RLを用いる。
8Bオープンウェイトベースラインの最初の内部評価と比較すると、SerenAIは85.0%から93.2%に、55.0%から84.0%に、正確な構造化出力マッチを0.0%から41.5%に、因果デルタの正確な一致を0.0%から41.5%に、その結果状態の正確な一致を0.0%から41.5%に引き上げた。
論文 参考訳(メタデータ) (2026-09-06T14:57:18Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System [0.0]
本研究では、Qwen 3.5 27Bモデルに基づいて構築されたセキュリティ文書分類のためのオープンソースのローカルシステムであるTorchSightについて述べる。
このモデルは、13の許可を受けたソースから78,358のサンプルと、7つのセキュリティカテゴリと51のサブカテゴリをカバーするGPT-4合成データに基づいて訓練された。
その結果、微調整されたローカルモデルでは、文書処理をローカル制御下に保ちながら、正確なセキュリティ文書分類が可能であることがわかった。
論文 参考訳(メタデータ) (2026-05-19T18:18:19Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation [0.0]
テストモデルとEpoch AI能力指数の同時フロンティアを比較した。
これらの回答のギャップは、+5.53 ECI/年で拡大している。
提案されている改善には、APIアクセス助成金と報告フレームワークの編集執行が含まれる。
論文 参考訳(メタデータ) (2026-05-05T17:58:35Z) - Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis [0.0]
敵対的なコメントは、検出精度に小さな、統計的に重要でない効果をもたらす。
複雑な敵戦略は単純な操作的コメントに勝るものではない。
コメントストリッピングは、有用なコンテキストを削除することで、より弱いモデルの検出を減らす。
論文 参考訳(メタデータ) (2026-02-18T00:34:17Z) - FormationEval, an open multiple-choice benchmark for petroleum geoscience [0.0]
FormationEvalは、石油地球科学の分野における言語モデルを評価するための、オープンな多重選択質問ベンチマークである。
評価対象はOpenAI, Anthropic, Google, Meta, オープンウェイトな代替品など,主要なプロバイダの72モデルである。
トップパフォーマーは97%以上の精度を達成し、Gemini 3 Pro Previewは99.8%に達した。
論文 参考訳(メタデータ) (2026-01-05T14:36:02Z) - A Domain-Adapted Pipeline for Structured Information Extraction from Police Incident Announcements on Social Media [11.463924147467297]
我々は,警察のインシデント発表から構造化情報を取り出すためのドメイン適応抽出パイプラインを開発した。
中国語Weiboの27,822人の警察ブリーフィング投稿から得られた4,933件の高品質で手動の注釈付きデータセットを使用します。
また,LoRAを用いたファインチューニングにより,ベースモデルと命令調整モデルの両方で性能が大幅に向上した。
論文 参考訳(メタデータ) (2025-12-18T05:08:26Z) - Retrieval-Augmented Generation for Reliable Interpretation of Radio Regulations [49.671779378073886]
無線規制分野における質問応答について検討する。
本稿では,通信事業者固有のレトリーバル拡張生成(RAG)パイプラインを提案する。
当社のアプローチは,テスト対象モデル全体の生成精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-09-11T17:43:42Z) - An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment [0.0]
フルテキストのスクリーニングは、体系的なレビューの大きなボトルネックです。
私たちは、ファジィな決定問題として包摂/排除を再設計する、スケーラブルで監査可能なパイプラインを提示します。
論文 参考訳(メタデータ) (2025-08-17T17:41:50Z) - Recon, Answer, Verify: Agents in Search of Truth [36.56689822791777]
Politi Fact Only (PFO)は、politifact.comの2,982件の政治的主張のベンチマークデータセットである。
すべてのポストクレーム分析とアノテーションキューが手作業で削除された。
本稿では,質問生成,回答生成,ラベル生成という3つのエージェントからなるエージェントフレームワークであるRAVを提案する。
論文 参考訳(メタデータ) (2025-07-04T15:44:28Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Probabilistic Consensus through Ensemble Validation: A Framework for LLM Reliability [0.0]
大規模言語モデル(LLM)は、テキスト生成の大幅な進歩を示しているが、自律的なデプロイメントに必要な信頼性を欠いていることが多い。
本稿では,モデルコンセンサスを通じて,コンテンツ検証のためのアンサンブル手法を再利用する新しいフレームワークを提案する。
事実の精度と因果一貫性を必要とする78症例を対象としたテストでは, 精度が73.1%から93.9%に向上した。
論文 参考訳(メタデータ) (2024-11-10T17:32:16Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts [54.07541591018305]
提案するMAD-Benchは,既存のオブジェクト,オブジェクト数,空間関係などの5つのカテゴリに分割した1000の試験サンプルを含むベンチマークである。
我々は,GPT-4v,Reka,Gemini-Proから,LLaVA-NeXTやMiniCPM-Llama3といったオープンソースモデルに至るまで,一般的なMLLMを包括的に分析する。
GPT-4oはMAD-Bench上で82.82%の精度を達成するが、実験中の他のモデルの精度は9%から50%である。
論文 参考訳(メタデータ) (2024-02-20T18:31:27Z) - Less is More: Fewer Interpretable Region via Submodular Subset Selection [54.07758302264416]
本稿では,上述の画像帰属問題を部分モジュラ部分選択問題として再モデル化する。
我々は、より正確な小さな解釈領域を発見するために、新しい部分モジュラー関数を構築する。
正しく予測されたサンプルに対しては,HSIC-Attributionに対する平均4.9%と2.5%の利得で,Deletion and Insertionスコアを改善した。
論文 参考訳(メタデータ) (2024-02-14T13:30:02Z) - Box-Level Active Detection [47.41635810670186]
ボックスベース1サイクル当たりの予算を制御する,ボックスレベルのアクティブ検出フレームワークを導入する。
我々は,人間のアノテーションとモデルインテリジェンスの両方を活用するために,補完的擬似アクティブストラテジー(ComPAS)を提案する。
ComPASは、統一された設定で4つの設定で10の競争相手を上回っている。
論文 参考訳(メタデータ) (2023-03-23T08:06:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。