論文の概要: When benchmark inferences do not compose: Projectibility in AI evaluation
- arxiv url: http://arxiv.org/abs/2607.26159v1
- Date: Tue, 28 Jul 2026 18:07:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.44637
- Title: When benchmark inferences do not compose: Projectibility in AI evaluation
- Title(参考訳): ベンチマーク推論が作成されない場合:AI評価における可視性
- Authors: Brett Reynolds,
- Abstract要約: AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、能力の証拠として解釈し、新しいタスクに外挿し、他のシステムやサイトへ輸送する。
保証リンクは保証チェーンを自動的に作らない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An AI benchmark result rarely reaches a consequential claim in one step. Evaluators generalize it to further cases, interpret it as evidence of capability, extrapolate it to new tasks, transport it to another system or site, and combine it with assumptions about human review and downstream consequences. Validity-centred approaches require evidence for each claim. This paper identifies a further epistemic problem: warranted links don't automatically make a warranted chain. The target of one study may not be the source of the next; system, population, outcome, or conditions may change at the interface; and shared data or model lineage may make apparently independent support dependent. Projectibility concerns whether a bounded extension from observed to unobserved cases is warranted. Goodman supplies the problem of rival extensions; argument-based validity supplies an architecture for testing them. The paper's distinctive claim is a non-composition principle: support for adjacent projections warrants their composition only when endpoints and assumptions align and dependence and uncertainty are carried through. A legal-research case shows how benchmark evidence and a deployment study can each be sound while remaining parallel. A reanalysis and simulation show why aggregate stability can erase distinctions a later projection requires. The resulting projectibility audit diagnoses unsupported joins in benchmark-to-use arguments.
- Abstract(参考訳): AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、それを能力の証拠として解釈し、それを新しいタスクに外挿し、それを他のシステムやサイトに輸送し、人間のレビューや下流の結果に関する仮定と組み合わせる。
正当性中心のアプローチは、各主張に対して証拠を必要とする。
保証リンクは保証チェーンを自動的に作らない。
システム、人口、結果、または状態がインターフェースで変化するかもしれないし、共有データやモデル系統が明らかに独立したサポートに依存しているかもしれない。
可視性は、観測されたケースから観測されていないケースへの有界拡張が保証されるかどうかを懸念する。
Goodmanは競合する拡張の問題を提供し、引数ベースの妥当性はそれらをテストするためのアーキテクチャを提供する。
隣接射影のサポートは、エンドポイントと仮定が整列し、依存と不確実性が実行される場合にのみ、それらの構成を保証します。
法的調査のケースでは、ベンチマークエビデンスとデプロイメントスタディが、それぞれが並列性を維持しながら、それぞれが健全であることを示しています。
再解析とシミュレーションは、凝集安定性が後の射影の区別を消し去ることができる理由を示している。
結果として得られたプロジェクタビリティ監査の診断は、ベンチマークから使用までの引数に加わる。
関連論文リスト
- HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - The Digital Twin Counterfactual Framework: A Validation Architecture for Simulated Potential Outcomes [0.0]
Digital Twin Counterfactual Framework (DTCF)
五段階検証アーキテクチャは、シミュレーターが正しい反事実を生成できるという不当な主張を、観測可能なデータに対する偽証可能なテストに変換する。
分解は因果量から極端に検証されるものへと分離する。
共同因果関係の主張は明示的な前提付きとなる。
論文 参考訳(メタデータ) (2026-04-01T19:04:15Z) - Causality is Key for Interpretability Claims to Generalise [35.833847356014154]
大規模言語モデル(LLM)の解釈可能性の研究は、モデル行動に関する重要な洞察をもたらした。
繰り返し発生する落とし穴: 一般化しない発見と、証拠を突破する因果解釈。
パールの因果的階層は、解釈可能性の研究が正当化できることを明確にする。
論文 参考訳(メタデータ) (2026-02-18T18:45:04Z) - CASA: Causality-driven Argument Sufficiency Assessment [79.13496878681309]
ゼロショット因果関係に基づく議論十分性評価フレームワークであるCASAを提案する。
PSは前提イベントの導入が前提イベントと結論イベントの両方が欠落した場合の結論につながる可能性を測っている。
2つの論理的誤り検出データセットの実験により、CASAは不十分な議論を正確に識別することを示した。
論文 参考訳(メタデータ) (2024-01-10T16:21:18Z) - Nonparametric Identifiability of Causal Representations from Unknown
Interventions [63.1354734978244]
本研究では, 因果表現学習, 潜伏因果変数を推定するタスク, およびそれらの変数の混合から因果関係を考察する。
我々のゴールは、根底にある真理潜入者とその因果グラフの両方を、介入データから解決不可能なあいまいさの集合まで識別することである。
論文 参考訳(メタデータ) (2023-06-01T10:51:58Z) - Claim-Dissector: An Interpretable Fact-Checking System with Joint
Re-ranking and Veracity Prediction [4.082750656756811]
本稿では,ファクトチェックと分析のための新しい潜在変数モデルであるCrim-Dissectorを提案する。
検証可能な方法で、証拠ごとの関連性確率とその最終的な妥当性確率への寄与を解き明かす。
その解釈可能な性質にもかかわらず、私たちのシステムはFEVERデータセットの最先端と競合する。
論文 参考訳(メタデータ) (2022-07-28T14:30:06Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。