論文の概要: When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design
- arxiv url: http://arxiv.org/abs/2608.01378v1
- Date: Sun, 02 Aug 2026 16:59:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.189284
- Title: When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design
- Title(参考訳): モデルが実験を置き換えるのはいつか?サロゲート駆動設計における監査,ライセンス,信頼の価格
- Authors: Shuangxiu, Ma, Wenhe, Zhao,
- Abstract要約: 化学、材料科学、機械学習におけるデザインキャンペーンはボトルネックを共有している。
これらの結果を予測する機械学習サロゲートは、候補を提案するだけでなく、それらを格付けし、測定したように自身の予測を検索に戻すためにも使われるようになっている。
我々は、この慣行が安全で、どんな安全証明書もコストがかからず、代金が確実に支払うことを確約する。
- 参考スコア(独自算出の注目度): 8.037395295172088
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Design campaigns in chemistry, materials science, and machine learning share a bottleneck: determining how good a candidate truly is requires an expensive evaluation - an experiment, a first-principles simulation, or a full training run. Machine-learning surrogates that predict these outcomes are increasingly used not only to propose candidates but to grade them, and even to feed their own predictions back into the search as though they were measurements. Through mathematical analysis validated on three exhaustively ground-truthed design tasks, we establish when this practice is safe, what any certificate of safety must cost, and when the substitution provably pays. Predictive accuracy cannot anchor trust: near-perfect R^2 is compatible with worst-possible selections, and screening N candidates inflates the over-prediction at the selected candidate by a quantifiable "selection tax" with matching upper and lower bounds. Safety follows instead from an architectural rule - predictions may propose and train without restriction, but every certified conclusion must rest on true evaluations - which is sufficient with no assumptions on the surrogate, and necessary, since admitting predictions into certification with the standing of measurements opens a deterministic self-confirmation failure mode. We derive the minimal criterion under which a model may act as an oracle (rank preservation, not accuracy), show that trust must be purchased through selection-aware audits that are optimal in query complexity, and prove a dichotomy fixing when audited surrogates cut certified evaluation cost. Across 432 surrogate fits over six task-regime conditions, the audit statistic tracks deployed search performance at Spearman rank correlation 0.80-0.99, while the rank correlation of R^2 with deployed regret falls as low as 0.33; audited screening reduces certified oracle cost by a measured factor of 25.
- Abstract(参考訳): 化学、材料科学、機械学習におけるデザインキャンペーンはボトルネックを共有している。
これらの結果を予測する機械学習のサロゲートは、候補を提案するだけでなく、それらを格付けし、測定したように自身の予測を検索に戻すためにも使われるようになっている。
3つの基本構造を網羅的に検証した数学的解析により、このプラクティスが安全である場合、安全証明書に何の費用がかかるか、代金が確実に支払われるかどうかを確定する。
予測精度は信頼を維持できない: ほぼ完全なR^2は、最悪の可能性の選択と互換性があり、N候補のスクリーニングは、上と下の境界が一致する定量な「選択税」によって、選択された候補における過剰な予測を膨らませる。
安全性はアーキテクチャの規則に従う - 予測は制約なしで提案し、訓練するが、認定された結論はすべて真の評価に従わなければならない。
モデルがオラクルとして機能しうる最小限の基準(精度ではなく、ランク保存)を導出し、クエリの複雑さに最適である選択対応監査を通じて信頼を買わなければならないことを示し、監査されたサロゲートが認定評価コストを削減した場合に二分法を証明できることを示す。
432以上のサロゲートが6つのタスク登録条件に適合し、スピアマンのランク相関0.80-0.99でオーディション統計トラックが探索性能を展開、一方R^2とデプロイされた後悔とのランク相関が0.33まで低下する。
関連論文リスト
- FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting [8.891247829087936]
FinAbstainは、不確実性を校正したマルチモーダル検索拡張生成のためのフレームワークである。
ポイント・イン・タイム・レトリバーは、予測タイムスタンプで公開された情報のみを認め、基本、ニュース、技術、リスク、検証エージェントにモダリティ固有の証拠を提供する。
コントローラは、不確実性が検証された閾値以下である場合にのみ、強気、弱気または中立的な結果を予測する。
論文 参考訳(メタデータ) (2026-07-27T07:05:22Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Selective Test-Time Compute Scaling for Click-Through Rate Prediction via Uncertainty-Triggered Feature Path Exploration [9.542597285477683]
テスト時間計算のスケーリングは言語モデルに非常に効果的であることが証明されているが、この機会は産業用クリックスルーレート(CTR)予測では探索されていない。
UTTSI(Uncertainty-Triggered Test-Time Selective Inference)は、トレーニング不要なモデルに依存しないフレームワークで、推論深度をインスタンスごとの不確実性に比例して拡張する。
論文 参考訳(メタデータ) (2026-05-24T10:29:10Z) - Recipes for Calibration Checks in Safety-Critical Applications [0.0]
安全クリティカルな予測システムの校正チェックのためのフレームワークを提案する。
チェックは、予測器から収集されたデータに対して、単一の受け入れ/拒絶判定を生成する。
天気予報とロボットのポーズ推定という2つの相補的な事例にフレームワークの適用性を示す。
論文 参考訳(メタデータ) (2026-04-29T09:43:55Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Best Arm Identification with LLM Judges and Limited Human [18.85883540190321]
固定信頼ベストアーム識別(BAI)について検討する。
本研究では,各アームの平均値と逆正当性重み付け残差を結合した平均値の推定器を開発する。
推定器と信頼性シーケンスに基づいて,アームを適応的に選択し,監査するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-29T09:50:34Z) - Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation [25.80946316489521]
本稿では,Brierスコアに基づく損失をトレーニングした線形プローブを導入し,審査員の隠蔽状態から不確実性を校正した推定値を提供する。
我々は,目的的タスク(推論,数学,事実性,コーディング)と主観的人間の選好判断の両方に対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-12-23T22:08:46Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - SConU: Selective Conformal Uncertainty in Large Language Models [59.25881667640868]
SconU(Selective Conformal Uncertainity)と呼ばれる新しいアプローチを提案する。
我々は,特定の管理可能なリスクレベルで設定されたキャリブレーションの不確実性分布から,与えられたサンプルが逸脱するかどうかを決定するのに役立つ2つの共形p値を開発する。
我々のアプローチは、単一ドメインと学際的コンテキストの両方にわたる誤発見率の厳密な管理を促進するだけでなく、予測の効率を高める。
論文 参考訳(メタデータ) (2025-04-19T03:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。