論文の概要: Validation-Frontier Representation Selection under Constrained Observation
- arxiv url: http://arxiv.org/abs/2608.15095v1
- Date: Sat, 15 Aug 2026 07:40:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.196519
- Title: Validation-Frontier Representation Selection under Constrained Observation
- Title(参考訳): 制約された観測下でのバリデーション・フランティエ表現選択
- Abstract要約: 本稿では,制約観測下での表現選択について検討する。
本稿では, バランスの取れた精度と, 機能コスト, 過度なギャップ, 検証テストの不安定性に対するペナルティを組み合わせた検証最前線セレクタを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI systems deployed outside clean benchmark settings often rely on observations that are incomplete, unstable, costly, or degraded by monitoring failures. This paper studies representation selection under constrained observation: choosing a state representation when raw accuracy is not the only operational criterion. We propose a validation-frontier selector that combines balanced accuracy with penalties for feature cost, overfit gap, and validation-test instability. In a focused public-tabular benchmark using three scikit-learn datasets, five observation regimes, 45 matched task cells, 720 candidate actions, and 405 representation rows, the adaptive selector improves frontier score over full trace features by 0.025801 while reducing mean feature count by 22.733. Balanced-accuracy difference is small and not statistically significant. A broader offline stress test gives mixed results. The supported claim is therefore bounded: adaptive representation selection can improve a constrained-observation robustness-efficiency frontier in matched benchmark settings, but does not universally dominate trace baselines.
- Abstract(参考訳): クリーンなベンチマーク設定外に配置されたAIシステムは、障害の監視によって不完全な、不安定で、コストがかかる、あるいは劣化した観察に依存することが多い。
本稿では,厳密な観測条件下での表現選択について考察する。
本稿では, バランスの取れた精度と, 機能コスト, 過度なギャップ, 検証テストの不安定性に対するペナルティを組み合わせた検証最前線セレクタを提案する。
3つのシキト学習データセット、5つの観察体制、45のタスクセル、720の候補アクション、405の表現行を使用して、アダプティブセレクタは、平均特徴数を22.733削減しつつ、完全なトレース特徴よりもフロンティアスコアを0.025801向上させる。
平衡精度の違いは小さく、統計的に有意ではない。
より広範なオフラインストレステストは、混合結果を与える。
適応表現の選択は、一致したベンチマーク設定において制約付き観測された堅牢性-効率のフロンティアを改善するが、トレースベースラインを普遍的に支配しない。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy [51.887915969023965]
現代のLarge Language Models (LLMs) がアライメントされ、測定可能な分布インプリントが残されていることを示す。
高エントロピー領域における不安定性を軽減するため、ログライクなアライメント・アライメント・プレフレパシー(LAPD)を導入する。
LAPDはアライメントインプリントに基づく標準化された情報重み統計である。
論文 参考訳(メタデータ) (2026-04-18T09:12:24Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Deterministic Fuzzy Triage for Legal Compliance Classification and Evidence Retrieval [0.0]
法律チームはますます、大量の契約上の証拠をトリアージするために機械学習を使用している。
多くのモデルは不透明で非決定論的であり、HIPAAやNERC-CIPのようなフレームワークと整合するのは難しい。
決定論的双対エンコーダと透明なファジィトリアージバンドに基づく簡単な再現可能な代替法について検討する。
論文 参考訳(メタデータ) (2026-03-08T00:31:34Z) - Don't stop me now: Rethinking Validation Criteria for Model Parameter Selection [3.219880761967806]
モデル選択に使用する検証基準がニューラル分類器の試験性能に与える影響について検討する。
検証精度に基づいた早期停止は最悪であり、テスト精度が低いチェックポイントを一貫して選択する。
損失ベースの検証基準は、同等で安定したテスト精度をもたらす。
論文 参考訳(メタデータ) (2026-02-25T16:56:14Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings [33.080398349395686]
適合性信号を利用して性能劣化を検出する新しいフレームワークを提案する。
テストデータとユーザデータの両方に適合する信号を集約し、これらの経験的分布を比較する。
これにより、高スループットアプリケーションにおける潜在的な障害の積極的な緩和が可能となる。
論文 参考訳(メタデータ) (2025-05-28T13:37:04Z) - Discovering Bias in Latent Space: An Unsupervised Debiasing Approach [6.67121343477106]
基礎モデルの質問応答能力は、変化を促すために非常に敏感である。
モデルの内部表現において、このバイアスを直接修正することを提案する。
実験により,SteerFairは命令調整によるモデル性能のバラツキを大幅に低減することを示した。
論文 参考訳(メタデータ) (2024-06-05T21:29:09Z) - Tune it the Right Way: Unsupervised Validation of Domain Adaptation via
Soft Neighborhood Density [125.64297244986552]
本稿では,点間の類似度分布のエントロピーを計算し,ソフト近傍の密度を測定する教師なし検証基準を提案する。
私たちの基準は、競合する検証方法よりもシンプルですが、より効果的です。
論文 参考訳(メタデータ) (2021-08-24T17:41:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。