論文の概要: Evidence-Grounded Auditing of Identification Assumptions in Climate-Policy Causal Evaluations
- arxiv url: http://arxiv.org/abs/2609.30867v1
- Date: Fri, 25 Sep 2026 06:18:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.255952
- Title: Evidence-Grounded Auditing of Identification Assumptions in Climate-Policy Causal Evaluations
- Title(参考訳): 気候政策の因果性評価における身元推定の検証
- Abstract要約: ARGUSは構造化された言語モデルパイプラインであり、11次元の仮定のエビデンスルーリックに対して報告された証拠を監査する。
インジェクト欠陥, 経済論文, ラベルを調整した小型パイロットを用いてARGUSを評価した。
- 参考スコア(独自算出の注目度): 2.5274989947146644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Difference-in-differences (DID) studies are widely used to evaluate climate policy, but assessing the evidence supporting their identification assumptions remains challenging. We introduce ARGUS, a structured language-model pipeline that audits reported evidence against an eleven-dimension assumption-implication-evidence rubric and abstains when relevant evidence cannot be retrieved. We evaluate ARGUS using injected flaws, economics papers, and a small pilot with reconciled labels. On the 11-flaw benchmark, ARGUS detects 73% of planted flaws, compared with 18% for a keyword-based pipeline. Across 26 economics papers, ARGUS abstains on about 40% of paper-dimension assessments for lack of retrievable evidence. In a five-paper pilot with labels reconciled by two annotators, it assigns a higher risk level than the labels on 25 of the 33 assessments it completes. A rule fixed before the labels arrived removes most of this in-sample; weighted agreement stays low. ARGUS provides evidence-linked risk reports that localize potential weaknesses for expert review, without adjudicating causal claims. Code and data: https://github.com/yonghongzhang-io/ARGUS
- Abstract(参考訳): 差分差分法(DID)研究は、気候政策を評価するために広く用いられているが、それらの識別仮説を支持する証拠を評価することは依然として困難である。
我々は,11次元の仮定-含意-証拠ルーブリックに対する証拠を監査し,関連する証拠を回収できない場合の保証を行う構造化言語モデルパイプラインARGUSを紹介する。
インジェクト欠陥, 経済論文, ラベルを調整した小型パイロットを用いてARGUSを評価した。
11-flawベンチマークでは、ARGUSが73%の欠陥を検知し、キーワードベースのパイプラインでは18%だった。
26の経済学論文のうち、ARGUSは、回収可能な証拠がないとして約40%の紙寸法評価を棄却している。
ラベルを2つのアノテータで調整した5紙のパイロットでは、ラベルよりも高いリスクレベルを、完成した33のアセスメントのうち25に割り当てている。
ラベルが到着する前に固定されたルールは、このインサンプルの大半を取り除き、重み付けされた合意は低いままである。
ARGUSは、専門家レビューの潜在的な弱点を、因果的主張を判断することなくローカライズするエビデンス関連リスクレポートを提供している。
コードとデータ:https://github.com/yonghongzhang-io/ARGUS
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs [0.0]
下流検証が存在しない領域では、科学的なエージェントとして大きな言語モデルが提案されている。
筆者らは,42枚の抽出,不正,疑似科学的論文からなるプローブコーパスを,各論文のフレーミングと単発モデルエンゲージメントを抽出・評価する手法と組み合わせて導入した。
プローブは、5つのクレームタイプ、製造された観測、擬似物理機構、魔法の前提、合法化橋、貨物カルト実験である。
論文 参考訳(メタデータ) (2026-08-11T20:30:32Z) - Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning [72.86819994769634]
全体スライド画像推論(WSI)では、診断問題に答える前に、エージェントが視覚的証拠を逐次取得する必要がある。
本稿では,WSI推論をベイズ証拠取得問題として再検討する,プラグイン・アンド・プレイのエージェント・フレームワークBEACONを提案する。
論文 参考訳(メタデータ) (2026-08-06T08:40:57Z) - Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks [0.0]
オープンなPlato/Denarioアーキテクチャの拡張であるPlato-Bioを開発した。
Plato-Bioは明示的なワークフローステートを、プロファイランスレコード、引用チェック、クレーム・ツー・エビデンスリンク、スコープドファイル書き込み、パブリッシュゲートと結合する。
現在のクリーンリビジョンでは、完全なPythonスイートが931パス、6スキップ、エラーやエラーは発生しない。
論文 参考訳(メタデータ) (2026-07-27T03:55:39Z) - CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models [8.057966659934769]
大規模言語モデル (LLMs) は研究助手としての利用が増えているが, 支持する証拠の強さと範囲について, 研究成果を校正できるかどうかは不明である。
我々は,エビデンスを校正した科学的ブリーフィングについて検討する: 関連論文の束縛されたパッケージを考えると,システムはエビデンス強度,スコープ境界,欠落したエビデンス注意点を備えたパッケージレベルのテイクアウトを生成するべきである。
私たちは、ブリーフィングが故障した場所を特定するための診断プローブとして、監査可能なロール/ギャップ/強度フレームワークであるCalBriefを使用します。
論文 参考訳(メタデータ) (2026-06-11T06:49:52Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Scalable and Reliable Evaluation of AI Knowledge Retrieval Systems: RIKER and the Coherent Simulated Universe [0.0]
RIKER (Retrieval Intelligence and Knowledge extract Rating) は、パラダイムの逆転に基づくベンチマークであり、複製可能な方法論である。
このアプローチは、人間のアノテーションや参照モデルなしで決定論的スコアリングとスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2025-12-22T11:58:50Z) - Contrastive Learning to Improve Retrieval for Real-world Fact Checking [84.57583869042791]
ファクト・チェッキング・リランカ(Contrastive Fact-Checking Reranker, CFR)を提案する。
我々はAVeriTeCデータセットを活用し、証拠文書からの人間による回答とクレームのサブクエストを注釈付けする。
データセットの精度は6%向上した。
論文 参考訳(メタデータ) (2024-10-07T00:09:50Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。