論文の概要: Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
- arxiv url: http://arxiv.org/abs/2609.09219v1
- Date: Mon, 07 Sep 2026 00:16:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.738127
- Title: Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
- Title(参考訳): AI研究エージェントを監査するための発見認定プロトコルScores Aloneは発見を証明しない
- Abstract要約: Discovery Certification Protocolは、AI研究に関する主張を、実行可能なリカバリとフィードバックテストに変換する。
DCPは、有用な結果、代替ルート、AI研究全体のフィードバック効果に関する共通のエビデンス言語を提供する。
- 参考スコア(独自算出の注目度): 9.791304873435243
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI research agents combine prior knowledge, public sources, and experimental feedback to produce useful results. The Discovery Certification Protocol (DCP) turns claims about these results into executable recovery and feedback tests. Gate 1 validates useful improvement on sealed evaluation. Gate 2 gives matched agents the registered starting information and observed Web content while withholding the target research history. Every valid method reaching the numerical target supplies a recovery witness and triggers the Core veto. DCP Core requires adequate controls, zero observed recoveries, and a finite-sample bound on recovery in one fresh registered episode. Optional Gate 3 measures the average effect of truthful feedback relative to a specified neutral policy from a shared checkpoint. DCP Evidence adds this effect after independent null calibration and a registered effect margin. Two controlled audits exercise the complete protocol in SQLite optimization and virtual catalyst control under different models. Each produced zero recoveries in 96 episodes, with an upper bound of 0.0468. Each paired study yielded 30 truthful recoveries and zero neutral recoveries, with passing 60-pair null studies. Additional cases exercise Core, recovered, and audit-incomplete decisions. A deterministic, LLM-free verifier reproduces the decisions from frozen evidence. DCP provides a common evidence language for useful outcomes, alternative routes, and feedback effects across AI research.
- Abstract(参考訳): AI研究エージェントは、事前の知識、公開ソース、実験的なフィードバックを組み合わせて有用な結果を生み出す。
Discovery Certification Protocol(DCP)は、これらの結果に関する主張を、実行可能なリカバリとフィードバックテストに変換する。
ゲート1はシール評価の有用な改善を検証する。
ゲート2は、対象とする研究履歴を保持しながら、登録された開始情報と観察されたWebコンテンツを与える。
数値目標に達する有効なメソッドはすべて、リカバリ証人を提供し、Core vetoをトリガーする。
DCP Coreは、適切な制御、観察されたリカバリのゼロ、新しい登録エピソードのリカバリの有限サンプルを必要とする。
オプションゲート3は、特定中立政策に対する真理フィードバックの平均効果を共有チェックポイントから測定する。
DCPエビデンス(英語版)は、独立したヌルキャリブレーションと登録効果マージンの後にこの効果を付加する。
2つの制御された監査は、SQLite最適化における完全なプロトコルと、異なるモデルの下で仮想触媒制御を実行する。
各エピソードは96話でゼロリカバリとなり、上限は0.0468である。
各ペアの研究は30の真正の回復と0の中立の回復を達成し、60対のヌルの研究をパスした。
追加のケースでは、Core、リカバリ、監査不完全な決定が実行される。
決定論的でLLMのない検証器は、凍結した証拠から決定を再現する。
DCPは、有用な結果、代替ルート、AI研究全体のフィードバック効果に関する共通のエビデンス言語を提供する。
関連論文リスト
- CiteGuard-RAG: A Validation-Centered AI System for Evidence-Grounded Question Answering [0.21748200848556343]
CiteGuard-RAGは、根拠に基づく質問応答のための検証中心のAIシステムである。
システムはセマンティックレキシカル検索、引用制約付き生成、文レベルの接地検証、シングルパス再生を統合している。
CiteGuard-RAGは、コントロールされた住宅法データセット全体で400の質問に対して評価される。
論文 参考訳(メタデータ) (2026-09-14T16:30:54Z) - From Experiments to Decisions: Reusing Evidence in Autonomous Coding Research [0.0]
我々は400タスクのNeuroGolfキャンペーンでエビデンスをどのように再利用するかを再構築する。
数値的な反例は、オーバーブロード排除を公開する。
他のエピソードでは、失敗、不完全、そして修正されたプログラムが次に行うことを正当化する。
論文 参考訳(メタデータ) (2026-09-10T03:48:31Z) - When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents [8.579680185421324]
更新の受け入れは、エラー制御と学習機会の維持によって評価されなければならない、と我々は主張する。
標準対二項構成は、結果の不一致が稀な場合、この負担を軽減する。
学習力学のストレステストは、モデルバイアスとフィードバック選択誤差を区別する。
論文 参考訳(メタデータ) (2026-09-09T22:25:16Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - DynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation [12.710406983346013]
DynaKRAGは、原子のエビデンス操作に対する状態条件制御として、マルチホップエビデンス獲得を定式化している。
Qwen2.5-7B-Instructでは、DynaKRAGはHotpotQAで0.5998、2Wikiで0.5340、MuSiQueで0.3061のスコアを達成している。
論文 参考訳(メタデータ) (2026-07-07T17:09:36Z) - Diagnosing Evidence Utilization in Long-Context and Retrieval-Augmented Language Models under Matched Evidence Conditions [0.0]
モデルはパラメトリックの先行情報から回答したり、存在する証拠を使わなかったり、関連するテキストを最終回答に変換することなく引用したりすることができる。
本稿では,エビデンス利用評価のための4条件診断プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-04T22:44:57Z) - Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation [0.0]
混在した証拠は、ある主張を支持し、別の主張の条件を必要とし、第三の主張に矛盾する可能性がある。
我々は、クレーム選択応答を検証可能なクレームに検証し、回収された証拠に対して評価し、インテントを意識したセレクタによって完全な、部分的、紛争、棄却にマッピングする。
結果として生じるインターフェースは、アクションラベル予測と、混在する証拠の下でのエビデンスリンクされたクレーム選択を分離する。
論文 参考訳(メタデータ) (2026-05-21T03:29:50Z) - Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis [0.0]
Cross-Context Verification (CCV) は、N個の独立したセッションで同じベンチマーク問題を解決するブラックボックス方式である。
9つのSWE分岐検証問題(45の試験、クロードオプス4.6、温度0)では、CCVは汚染されたものと真の推論との間の完全な分離を達成する。
論文 参考訳(メタデータ) (2026-03-23T00:18:34Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - A New Benchmark and Reverse Validation Method for Passage-level
Hallucination Detection [63.56136319976554]
大きな言語モデル(LLM)は幻覚を発生させ、ミッションクリティカルなタスクにデプロイすると大きなダメージを与える可能性がある。
本稿では,逆検証に基づく自己チェック手法を提案し,ゼロリソース方式で事実誤りを自動的に検出する。
提案手法と既存のゼロリソース検出手法を2つのデータセット上で実証的に評価した。
論文 参考訳(メタデータ) (2023-10-10T10:14:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。