論文の概要: 6.5% of the Neuro-Symbolic Literature Can Be Reproduced from Its Published Artifacts, a Six-Stage Audit Framework and First Instantiation
- arxiv url: http://arxiv.org/abs/2608.26236v1
- Date: Wed, 26 Aug 2026 17:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.133596
- Title: 6.5% of the Neuro-Symbolic Literature Can Be Reproduced from Its Published Artifacts, a Six-Stage Audit Framework and First Instantiation
- Title(参考訳): ニューロシンボリック文学の6.5%は、公開アーティファクトと6段階監査フレームワーク、そして最初のインスティファイションから再現できる
- Abstract要約: 計算機科学文学における科学的主張を監査するための6段階の枠組みを提示する。
ステージ1は5,497レコードを取得し、3,018コピーを削除した。
ステージ2は2,479のユニークな記録をタイトルと抽象でスクリーニングし、1,365のNSAI記録を同定した。
ステージ3は1,304の適格記録のそれぞれに検証可能な公開コードアーティファクトを求め、849のものは見つからなかった。
我々は85の研究を完全または部分的に再現し、6.52%が適格コーパス、18.68%が再実行を試みた。
- 参考スコア(独自算出の注目度): 4.224868133521334
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present a six-stage framework for auditing the reproducibility of scientific claims across a research literature within the computer science domain, and instantiate our framework for the neuro-symbolic AI (NSAI) subdomain. Instantiating the framework on the NSAI subdomain produced a multi-year audit. Stage one retrieved 5,497 records and removed 3,018 duplicates. Stage two screened the 2,479 unique records at title and abstract, identifying 1,365 self-identified NSAI records, then removed a further 61 at full text for off-topic, non-research, no-quantitative-evaluation, or inaccessible-full-text reasons. Stage three sought a verifiable public code artifact for each of the 1,304 eligible records and found none for 849, leaving 455 to enter the artifact inventory and bounded rerun of stages four and five. We fully or partially reproduced 85 studies, 6.52% of the eligible corpus and 18.68% of attempted reruns. We found that 321 attempted reruns were blocked by missing non- code artifacts and 42 by missing or unusable code repositories. These figures quantify a persistent reproducibility deficit that survives even nominal "code available" declarations, and signal the need for enforced, versioned, and permanently archived artifact bundles in future NSAI publications. We argue that empirical NSAI papers should be required at submission time to provide complete, versioned, and permanently archived artifact bundles.
- Abstract(参考訳): 我々は、コンピュータサイエンス領域内の研究文献にまたがる科学的主張の再現性を監査する6段階の枠組みを提示し、神経シンボルAI(NSAI)サブドメインのための枠組みをインスタンス化する。
NSAIサブドメインでのフレームワークの検証は、多年にわたる監査を生み出した。
ステージ1は5,497レコードを取得し、3,018コピーを削除した。
ステージ2は2,479の独特な記録をタイトルと抽象でスクリーニングし、1,365のNSAIレコードを特定し、さらに61のテキストをオフトピー、非検索、非定量的評価、またはアクセシブル・フルテキストの理由で削除した。
ステージ3は1,304の適格記録のそれぞれに検証可能な公開コードアーティファクトを求め、849のものは見つからず、455がアーティファクトの在庫に入り、ステージ4とステージ5がリランされた。
我々は85の研究を完全または部分的に再現し、6.52%が適格コーパス、18.68%が再実行を試みた。
321回の再実行は、非コードアーティファクトの欠如によってブロックされ、42回のコードリポジトリの欠如によってブロックされた。
これらの数字は、名目上の「利用可能なコード」宣言でも生き残る永続的再現性欠陥を定量化し、将来のNSAI出版物において強制的、バージョン付き、永久にアーカイブされたアーティファクトバンドルの必要性を示唆している。
実験的なNSAI論文は、完全な、バージョン付き、永久にアーカイブされたアーティファクトバンドルを提供するために提出時に要求されるべきである、と我々は主張する。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Entity-Constrained CBCT Retrieval for Low-Resource Dental Record Completion [0.7373060295520485]
MMDental Task 3は、わずか50のCBCTケースから7フィールドのレコード補完を必要とする。
本稿では,エビデンス・アベイラビリティーとエビデンス・アベイラビリティーを分離するパラメータフリー・フレームワークである CBCT-Guided Retrieval (ECCR) を提案する。
論文 参考訳(メタデータ) (2026-08-22T10:52:25Z) - Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence [86.61561123749011]
Apodex Discovery(アポデックスディスカバリー)は、重度解法を用いて発見的AIを構築し評価するためのフレームワークである。
まず16のセクターで511の業界を調査し、423の高価値現実問題を集め、最初のリリースで20を選定した。
第二に、共通の環境-タスク-エピソード抽象化は、データ、ツール、制約、フィードバック、軌跡記録、中間成果物と最終提出物の検証を提供する。
論文 参考訳(メタデータ) (2026-08-11T18:48:40Z) - From Runnable to Verifiable: An Independent Reproducibility Study of LLM/Agent-Driven Vulnerability Validation Artifacts [4.093009863847175]
セキュリティ研究成果物は、エージェント駆動の脆弱性によってますます生成される。
公衆に入手可能で、飛行可能で、飛行可能で、飛行可能で、飛行確認済みの人工物とのギャップは、十分に測定されていない。
我々はこの文献について事前登録されたコンセンサス監査を行う。
論文 参考訳(メタデータ) (2026-08-10T13:05:02Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - Self-Conditioned Positional HNSW for Overlap-Aware Retrieval in Chunked-Document RAG Systems: Method and Industrial Evidence-Quality Audit [0.0]
チャンク文書検索は、検索拡張生成システム(RAG)の一般的なコンポーネントである。
本稿では,低次元の位置符号をチャンク埋め込みに付加する軽量な修正法であるSelf-Conditioned Positional HNSWを提案する。
論文 参考訳(メタデータ) (2026-06-01T01:42:55Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation [0.0]
テストモデルとEpoch AI能力指数の同時フロンティアを比較した。
これらの回答のギャップは、+5.53 ECI/年で拡大している。
提案されている改善には、APIアクセス助成金と報告フレームワークの編集執行が含まれる。
論文 参考訳(メタデータ) (2026-05-05T17:58:35Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - Broken by Default: A Formal Verification Study of Security Vulnerabilities in AI-Generated Code [0.0]
Broken by Defaultは、500のセキュリティクリティカルなプロンプトにまたがる7つの広くデプロイされたLLMによって生成される3500のコードアーティファクトの正式な検証研究である。
すべてのモデル全体で、55.8%のアーティファクトは少なくとも1つのCOBALT識別された脆弱性を含んでいる。
GPT-4oは62.4%(グレードF)、Gemini 2.5 Flashは48.4%(グレードD)である。
論文 参考訳(メタデータ) (2026-04-07T00:55:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。