論文の概要: Verdict Instability of OOD Scores under Reference Resampling
- arxiv url: http://arxiv.org/abs/2609.00691v1
- Date: Tue, 01 Sep 2026 04:12:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.280009
- Title: Verdict Instability of OOD Scores under Reference Resampling
- Title(参考訳): 基準サンプリングによるOODスコアの予測不安定性
- Authors: Donghoon Lee, Shinjin Kang,
- Abstract要約: ポストホック・アウト・オブ・ディストリビューション検出器は有限基準セットに収まるので、それらが生成するすべてのスコアは推定値である。
基準セットを再サンプリングし、スコアのブートストラップ標準偏差を記録することにより、検証の不安定性を測定する。
ラベルのない1つの相関から任意のスコアに対するこのサインを予測するルールを与え、間違った符号付きスコアによって駆動される棄権は、テストするデータセット毎にランダムに棄権するよりもひどい結果となる。
- 参考スコア(独自算出の注目度): 4.260015792110957
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Post-hoc out-of-distribution detectors are fitted on a finite reference set, so every score they produce is an estimate. If we had chosen a different set, some verdicts would have moved. We measure that movement by resampling the reference set and recording the bootstrap standard deviation of the score, which we call verdict instability. It admits a closed form with no fitted parameters. The instability of a verdict is the within-class dispersion of the assigned class along the query's direction, divided by the square root of that class's reference count. That count is what separates verdict instability from the geometry of the score distribution, and it is identifiable only under class imbalance. Instability grows with the local dispersion. Far-OOD queries lie along the low-variance directions of an anisotropic embedding, so every distance-based score we test assigns its highest values to the verdicts that are most reproducible. Only estimators of local dispersion carry the sign a practitioner expects. We give a rule that predicts this sign for any score from a single label-free correlation, and abstention driven by a wrong-signed score turns out worse than abstention at random on every dataset we test.
- Abstract(参考訳): ポストホック・アウト・オブ・ディストリビューション検出器は有限基準セットに収まるので、それらが生成するすべてのスコアは推定値である。
もし私たちが別のセットを選んだら、いくつかの評決は動いただろう。
我々は,基準セットを再サンプリングし,スコアのブートストラップ標準偏差を記録することで,その動きを測定する。
パラメータが不備な閉形式を許す。
評定の不安定性は、クエリの方向に沿って割り当てられたクラスのクラス内での分散であり、そのクラスの参照カウントの平方根によって分割される。
このカウントは、評価の不安定性とスコア分布の幾何学を区別するものであり、クラス不均衡の下でのみ識別可能である。
不安定性は局所的な分散とともに増大する。
Far-OODクエリは異方性埋め込みの低分散方向に沿っているので、テストした距離ベースのスコアはすべて、最も再現可能な評価値にその最高値を割り当てる。
局所分散の推定者だけが、実践者が期待するサインを運びます。
ラベルのない1つの相関から任意のスコアに対するこのサインを予測するルールを与え、間違った符号付きスコアによって駆動される棄権は、テストするデータセット毎にランダムに棄権するよりもひどい結果となる。
関連論文リスト
- Bias-Corrected Ceilings of Emotion Predictability from Human Label Variation Based on Instance-Level Fano Bounds [0.0]
本稿では, バイアス補正天井を推定し, 既約誤差と既約誤差を分離し, 得られた主張を整理する枠組みを提案する。
理論的には、制約のない点は0.38から1.03の範囲で到達可能性を推定するので、飽和度は任意の単一の推定器では決定できない。
論文 参考訳(メタデータ) (2026-08-16T08:34:46Z) - Denoised Conformal Alignment for Reliable Selection of Conditional Average Treatment Effect Predictions [10.945117945979566]
ブラックボックスCATE予測器の信頼性の選択について検討する。
疑似アウトカムから2つの堅牢なプロキシエラーを構築する。
定式化コンフォーマルアライメントを提案する。
論文 参考訳(メタデータ) (2026-07-03T10:00:28Z) - Null-Calibrated Conformal Selection via Target-Membership Scores [0.6599344783327052]
コンフォーマル選択は、未知の応答がターゲット領域に落下するテスト候補を偽発見率を制御しながら特定することを目的としている。
選択の自然なスコアは、代わりにターゲットメンバーシップの確率である、と我々は主張する。
会員スコアに基づくコンフォメーション選択について検討し、コンフォメーション・キャリブレーション・ルートの1つ、Null-Calibrated Conformal Selectionを分離する。
論文 参考訳(メタデータ) (2026-06-21T05:03:04Z) - Testing the Test: Score-Direction Instability in Class-Split Anomaly Detection [56.362776482614976]
データセット内のクラス分割評価は、完全に非条件のアウト・オブ・ディストリビューション異常検出のプロキシとして広く利用されている。
このプロトコルは、保持された異常クラスが表現空間の通常の混合と重なり合う場合、悪用される可能性があることを示す。
そこで本研究では,Fashion-MNIST,CIFAR-10,Imagenette間のスコア方向不安定性を予測する。
論文 参考訳(メタデータ) (2026-05-23T06:27:42Z) - Empirical Bayes Conformal Prediction for Vision and Language Models [20.40115871314124]
コンフォーマル予測(CP)は、現代のビジョンと言語モデルに対して、分布のないカバレッジを提供する。
標準CP は 1 つの実現法を使い、平均列キャリブレートの変種は点推定に滑らかな多重実現法を用いる。
実験的なベイズ共形予測フレームワークについて述べる。これは$r$-valuesを用いて、スコアの変動性を不確実な非整合性スコアに変換する。
論文 参考訳(メタデータ) (2026-05-22T03:17:14Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Reducing Biases in Record Matching Through Scores Calibration [1.5530839016602822]
スコアバイアスの測定と低減のためのしきい値に依存しないフレームワークを提案する。
基準しきい値に基づく基準値の下では公平に見えても,いくつかの最先端マッチング手法がかなりのスコアバイアスを示すことを示す。
本稿では,2つのポストプロセッシングスコアキャリブレーションアルゴリズムを導入する。第1のキャリブは,ワッサーシュタイン・バリセンタを用いてグループワイズスコアの分布を調整し,人口統計学的パーティを目標とする。
第2のカラリブは、ラベルに依存したバイアス、例えば平等な機会を減らそうと予測されたラベルの条件である。
論文 参考訳(メタデータ) (2024-11-03T21:01:40Z) - Correcting Underrepresentation and Intersectional Bias for Classification [49.1574468325115]
我々は、表現不足のバイアスによって破損したデータから学習する問題を考察する。
偏りのないデータの少ない場合、グループワイドのドロップアウト率を効率的に推定できることが示される。
本アルゴリズムは,有限VC次元のモデルクラスに対して,効率的な学習を可能にする。
論文 参考訳(メタデータ) (2023-06-19T18:25:44Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。