論文の概要: Evidence-Gated Research: Statistically Controlled Model Adoption in Adaptive Search
- arxiv url: http://arxiv.org/abs/2610.01751v1
- Date: Thu, 01 Oct 2026 14:17:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.18324
- Title: Evidence-Gated Research: Statistically Controlled Model Adoption in Adaptive Search
- Title(参考訳): Evidence-Gated Research:Adaptive Searchにおける統計的に制御されたモデル導入
- Abstract要約: Evidence-Gated Research (EGR, Evidence-Gated Research) は, 移動既存探索のための統計層である。
EGRは、決定的証拠が明らかにされる前に、各挑戦者を凍結させ、事前に宣言された環境全体にわたって有効な証拠を構築する。
段階的にEGRは、56.1%少ない決定証拠を代表しきい値で使用しながら、定時的な代替交差決定を常に保持する。
- 参考スコア(独自算出の注目度): 1.5449235351737436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adaptive model search is path dependent: once a challenger is adopted, it becomes the reference from which later candidates are generated. A statistically unsupported replacement can therefore alter hypotheses that have not yet been proposed. We introduce Evidence-Gated Research (EGR), a statistical adoption layer for moving-incumbent search. EGR freezes each challenger before decision evidence is revealed, builds anytime-valid evidence across a predeclared set of environments, routes evidence predictably toward unresolved components, composes a persistent candidate e-value, and passes that e-value to an online controller. Under explicit conditional-validity and predictability conditions, the resulting procedure controls false discovery rate for the declared all-environment adoption target even though earlier adoptions change later challengers. In a 5,000-trajectory closed-loop benchmark, development-only e-LOND attains persistent FDR 0.621, whereas no persistent false-adoption path is observed for the audited EGR variants in that finite run. In matched replay over 600 challenger--incumbent pairs, Stagewise EGR preserves fixed-anytime alternative crossing decisions while using 56.1% less decision evidence at the representative threshold. A three-environment public-data study and a 40,000-sample controlled neural benchmark reproduce the evidence-efficiency pattern. These results identify model replacement as a distinct statistical control point in adaptive model development.
- Abstract(参考訳): 適応モデル探索はパス依存であり、挑戦者が採用されると、後続の候補が生成される参照となる。
したがって、統計的に支持されていない置換は、まだ提案されていない仮説を変更することができる。
Evidence-Gated Research (EGR, Evidence-Gated Research) は, 移動既存探索のための統計層である。
EGRは、決定的証拠が明らかにされる前に各挑戦者を凍結させ、事前宣言された環境全体にわたって有意な証拠を構築し、未解決のコンポーネントに対して証拠を予測可能にルートし、永続的な候補e-valueを構成し、そのe-valueをオンラインコントローラに渡す。
明示的な条件付き妥当性と予測可能性条件の下で、結果の手順は、宣言された全環境適用目標に対する偽の発見率を制御する。
5000トラックのクローズドループベンチマークでは、開発専用のe-LONDが永続的なFDR 0.621を達成する一方、その有限ランで監査されたEGRの変種に対して永続的な偽アロプションパスは観測されない。
既存の600組以上の挑戦者対の対戦において、ステージワイドEGRは56.1%の判定証拠を代表しきい値で使用しながら、固定された任意の代替交差決定を常に保持する。
3つの環境に関する公開データ研究と4万サンプルの制御されたニューラルベンチマークは、エビデンス・効率のパターンを再現する。
これらの結果は、適応型モデル開発において、モデル置換を明確な統計的制御点として認識する。
関連論文リスト
- BELIEFRAG: Making Adaptive RAG State-Aware under Evolving Evidence [0.0]
Adaptive RAGは、信頼性、妥当性、サポート、検索品質などの信号を使用して、証拠の検索や修正のタイミングを決定する。
BELIEFRAGはクローズドループコントローラで、充足性、信頼性、コンフリクト、不確実性、エビデンスギャップ、取得コストを明示的に更新する。
論文 参考訳(メタデータ) (2026-09-30T07:08:27Z) - Candidate Comparability Before Promotion: Conditional Validation in Adaptive Network Intrusion Detection [0.0]
後続の攻撃検出に責任があるモデルを変更するため、プロモーションはセキュリティ関連である。
自己完結型チャレンジャーパイプラインによるCICIDS 2017 UNSW-NB15とToN-IoTへの依存性をテストする。
クラス当たり512から2,000のサンプルから名目上の候補証拠の蓄積により、プール構築されたプログレッシブドリフト(+0.53, +1.67, +0.38)による昇進が向上した。
論文 参考訳(メタデータ) (2026-09-03T18:55:09Z) - Revalidation Beats Stateful Routing for Scientific Surrogates Under Distribution Shift [0.0]
サーロゲートモデルはしばしば開発中に選択され、新しい測定結果が届くとそのまま残される。
このような変更がステートフルな適応型コントローラを呼び出すのか、それとも新しいバッチ毎に候補モデルを検証するのに十分かどうかを問うた。
論文 参考訳(メタデータ) (2026-08-31T16:27:24Z) - COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation [79.43842208099619]
ソースフリードメイン適応(SFDA)は、ソースデータなしでラベルなしのターゲットドメインにソーストレーニングされたモデルを適用する。
VLM誘導型SFDAを標本単位の信頼性割当問題として定式化する。
本稿では,専門家から専門家への指導を協調適応に置き換えるために,COSMO(Consensus-Driven Shift Modulation)を提案する。
論文 参考訳(メタデータ) (2026-08-05T09:10:30Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Proposal-Guided Greedy Surrogate Refinement for PDE-Driven High-Dimensional Rare-Event Estimation [0.7566935794913996]
本稿では,サロゲートを用いた適応的重要度サンプリングフレームワークを提案する。
これは、入力空間全体ではなく、進化する提案に沿って局所的にサロゲートを洗練させる。
提案手法は,真のモデル適応的重要度サンプリングに匹敵する精度を実現する。
論文 参考訳(メタデータ) (2026-05-14T19:34:00Z) - Adaptive Conformal Prediction for Improving Factuality of Generations by Large Language Models [86.8650252164764]
大規模言語モデル(LLM)は、事実的に誤った出力を生成する傾向にある。
本研究では,LLMへのコンフォメーションスコア変換法を拡張する適応型コンフォメーション予測手法を提案する。
これにより、アクシデントに依存したキャリブレーションが可能となり、条件付きカバレッジを改善しながら、限界範囲のカバレッジ保証が維持される。
論文 参考訳(メタデータ) (2026-04-15T15:35:42Z) - The NazoNazo Benchmark: A Cost-Effective and Extensible Test of Insight-Based Reasoning in LLMs [3.9977256267361754]
そこで本研究では,日本人児童のライドルから構築した費用効果評価指標であるNazonazoについて紹介する。
GPT-5以外のモデルは人間の性能に匹敵せず、平均精度は52.9%である。
論文 参考訳(メタデータ) (2025-09-18T07:50:04Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - DOTA: Distributional Test-Time Adaptation of Vision-Language Models [69.41389326333771]
トレーニングデータとテストデータの間に大きな分散ギャップが存在する場合、視覚言語の基礎モデルは信頼できない。
本稿では,DOTA(DistributiOnal Test-time Adaptation)を提案する。
この分散中心のアプローチは、モデルが継続的に学習し、デプロイメント環境に適応することを可能にする。
論文 参考訳(メタデータ) (2024-09-28T15:03:28Z) - SUOD: Accelerating Large-Scale Unsupervised Heterogeneous Outlier
Detection [63.253850875265115]
外乱検出(OD)は、一般的なサンプルから異常物体を識別するための機械学習(ML)タスクである。
そこで我々は,SUODと呼ばれるモジュール型加速度システムを提案する。
論文 参考訳(メタデータ) (2020-03-11T00:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。