論文の概要: From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth
- arxiv url: http://arxiv.org/abs/2607.10972v1
- Date: Mon, 13 Jul 2026 00:36:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.291031
- Title: From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth
- Title(参考訳): チェッカーからフォアキャスターへ:遅れた地盤真実下におけるモデル生成戦略経路のコードによる評価
- Authors: Aleh Manchuliantsau,
- Abstract要約: RouteCastはモデル生成型戦略ルートの仕組みをインスタンス化する。
暫定予測が作成され、後の結果で予測が評価される。
将来的な校正、因果決定の改善、経路分割の優位性、ドメイン間の妥当性は確立していない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many evaluations of model outputs rely either on contracts checkable at evaluation time or on feedback that arrives within the operating loop. We study the complementary setting in which ground truth is delayed, censored, or private, so deterministic code cannot check correctness at scoring time and must instead issue a code-owned provisional forecast. RouteCast instantiates this regime for model-generated typed strategic routes: models propose candidate routes and structured factors; point-in-time evidence, reference classes, and deterministic transformations produce a provisional forecast-ranking; later outcomes evaluate the forecast. In a retrospective venture pilot on 21 binary-outcome cases (6 positive, 15 negative), the whole-packet RouteCast score showed preliminary retrospective discrimination (AUC 0.756, 95% CI [0.471,0.980]), while a blind LLM judge reached AUC 0.678 [0.419,0.897] and an identity-exposed LLM judge reached AUC 0.761 [0.515,0.944], consistent with recognition- or outcome-related leakage risk. A preregistered decomposition ablation on the same binary subset found that converting the identical inputs into typed staged routes was indistinguishable from the whole-packet score (Delta AUC = -0.144, 95% CI [-0.471,0.176]) and from a deterministic heuristic (Delta AUC = -0.089, 95% CI [-0.412,0.278]). The pilot establishes an auditable feasibility result and exposes failure modes; it does not establish prospective calibration, causal decision improvement, route-decomposition advantage, or cross-domain validity.
- Abstract(参考訳): モデル出力の評価の多くは、評価時にチェック可能な契約か、運用ループ内に届くフィードバックに依存する。
そこで、決定論的コードはスコアリング時に正当性をチェックすることができず、代わりにコード所有の仮予測を発行しなければならない。
RouteCastはモデル生成型戦略経路をインスタンス化し、モデルが候補経路と構造化された要因を提案し、ポイント・イン・タイムのエビデンス、参照クラス、決定論的変換が一時的な予測ランクを生み出し、後の結果は予測を評価する。
AUC 0.756, 95% CI [0.471,0.980], 盲目のLCM審査員がAUC 0.678[0.419,0.897], 同一性のあるLCM審査員がAUC 0.761[0.515,0.944], 認識・結果関連リークリスクと一致した。
同じバイナリーサブセット上で事前登録された分解アブレーションにより、同一入力を型付けされたルートに変換することは、全パケットスコア(Delta AUC = -0.144, 95% CI [-0.471,0.176])と決定論的ヒューリスティック(Delta AUC = -0.089, 95% CI [-0.412,0.278])と区別できないことがわかった。
パイロットは、監査可能な実現結果を確立し、障害モードを露呈し、事前の校正、因果判定の改善、経路分割の利点、ドメイン間の妥当性を確立しない。
関連論文リスト
- Tailoring Strictly Proper Scoring Rules for Downstream Tasks: An Application to Causal Inference [48.78219918881965]
本稿では,ダウンストリーム誤差メトリックの局所曲率をマッチングすることにより,タスク固有の厳密なスコアリングルールを導出するフレームワークを提案する。
これを平均処理効果 (ATE) 推定に適用し, 閉形式損失と対応する正準確率写像を導出する。
論文 参考訳(メタデータ) (2026-06-02T08:41:25Z) - Auditable Decision Models with Learned Abstention and Real-Time Steering [6.287457666346811]
生産AIシステムは、不完全、矛盾、あるいは不十分な証拠で運用されることが多い。
我々は,不確実性が明確でなければならないAIシステムの運用上の決定制御について検討する。
本稿では,YES,NO,TBDを予測する境界決定制御モデルであるEvaluatorDPTを提案する。
論文 参考訳(メタデータ) (2026-05-26T23:37:56Z) - SGC-RML: A reliable and interpretable longitudinal assessment for PD in real-world DNS [2.4463990533701896]
本稿では,SGC-RMLを用いて,音声,歩行,ウェアラブル運動,移動作業,臨床変数を共有8次元症状ノード空間にマッピングする。
不確実性推定、共形校正、選択的な決定経路を共同で導入することにより、モデルは症状や重症度を予測するだけでなく、証拠が不十分な場合に評価を拒否したり、再検査を提案することもできる。
論文 参考訳(メタデータ) (2026-05-08T12:10:08Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding [0.0]
rubric-driven LLM-as-a-Judge frameworkは、コンテストスタイルの人間-AI共同制作のためのフレームワークである。
共同創造の成功は早期に集中していることが判明し、サクセス・アット・トゥルンは初めて観測されたターンで0.8533まで上昇した。
判定側では、ROC-AUCは0.5937、PR-AUCは0.6904、MCCテストは0.5000に達する。
論文 参考訳(メタデータ) (2026-04-30T11:20:22Z) - Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction [7.723181091241251]
本稿では、レビュー品質を評価し、自動パターンを検出するための説明可能なフレームワーク(RAG-XAI)を提案する。
XGBoost、Random Forest、LightGBMは99.61%、AUC-ROCは0.999以上、F1スコアは0.9925である。
論文 参考訳(メタデータ) (2026-04-09T08:25:49Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - The Implicit Delta Method [61.36121543728134]
本稿では,不確実性のトレーニング損失を無限に正規化することで機能する,暗黙のデルタ法を提案する。
有限差分により無限小変化が近似された場合でも, 正則化による評価の変化は評価推定器の分散に一定であることを示す。
論文 参考訳(メタデータ) (2022-11-11T19:34:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。