論文の概要: Is Model Instability just Noise to be Tolerated or a Property that can be Managed?
- arxiv url: http://arxiv.org/abs/2607.10420v1
- Date: Sat, 11 Jul 2026 17:56:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.427621
- Title: Is Model Instability just Noise to be Tolerated or a Property that can be Managed?
- Title(参考訳): モデル不安定性は、許容すべきノイズか、管理可能なプロパティか?
- Abstract要約: ソフトウェア分析では、同じ分析を2回繰り返すと、しばしば異なるモデルと結論が得られる。
モデル不安定が大きな問題であることに気付きました。
この不安定性は単に許容できるノイズであるだけでなく、測定と管理が可能な特性である、と我々は主張する。
- 参考スコア(独自算出の注目度): 3.632189127068905
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In software analytics, rerunning the same analysis twice often yields different models and conclusions. This reduces trust in the model and limits its use. We find that model instability is a major problem. Across 127 multi-objective SE optimization problems (12,700 test cases), repeated runs of a state-of-the-art optimizer agree on only 13.7% of test cases, even under improved settings. We argue that this instability is not merely noise to tolerate, but a property that can be measured and managed. By adjusting how labels are spent, how complex the models become, and how splits are scored, we obtain models that agree 4.8 times as often as the default configuration. The standard deviation of optimization error falls by 22% on average (mean std 17.4 to 13.6), while recommendation quality improves rather than degrades. In terms of quality, the refined settings are statistically top-ranked on 119 of 127 datasets, compared to 74 for the defaults. We then test causal and data-locality interventions and find that they help only partially, suggesting a residual stability floor. Our evidence suggests there are fundamental limits to stability set by the data itself (noise, scarce labels, proxy objectives, and the many near-equivalent models a dataset admits). We conclude that instability should be treated as a standard evaluation axis in SE optimization, which should be routinely measured, reported alongside performance, and used to calibrate trust in any single run. The methods in this paper provide a baseline against which future efforts to reduce SBSE instability can be judged. To support open science, we offer the following reproduction package: https://tinyurl.com/Model-Instability
- Abstract(参考訳): ソフトウェア分析では、同じ分析を2回繰り返すと、しばしば異なるモデルと結論が得られる。
これにより、モデルの信頼性が低下し、使用が制限される。
モデル不安定が大きな問題であることに気付きました。
127件の多目的SE最適化問題(12,700件のテストケース)において、最先端のオプティマイザの繰り返し実行は、改善された設定の下でも、わずか13.7%のテストケースで一致している。
この不安定性は単に許容できるノイズであるだけでなく、測定と管理が可能な特性である、と我々は主張する。
ラベルの使用方法、モデルの複雑化、分割の度合いを調整することで、デフォルト設定の4.8倍の頻度で一致するモデルを得る。
最適化誤差の標準偏差は平均で22%(平均17.4から13.6)低下するが、推奨品質は劣化よりも改善する。
品質面では、洗練された設定は127データセットのうち119で統計的に上位にランクされ、デフォルトは74である。
次に、因果関係とデータ局所性の介入を検証し、それらが部分的にしか役に立たないことを発見し、残った安定性の床を示唆する。
我々の証拠は、データ自体が設定する安定性に根本的な限界があることを示唆している(ノイズ、ラベルの不足、プロキシの目的、データセットが許容するほぼ等価なモデルなど)。
不安定性はSE最適化における標準評価軸として扱うべきであり、これは日常的に測定され、性能とともに報告され、単一実行時の信頼度を調整するために使用されるべきである。
本稿では,SBSE不安定度低減に向けた今後の取り組みを判断するためのベースラインを提供する。
オープンサイエンスをサポートするため、以下の再現パッケージを提供している。
関連論文リスト
- Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - The Capability Frontier: Benchmarks Miss 82% of Model Performance [7.258179693117413]
既存のベンチマークでは、1回のランで1つのモデルの精度が報告されるのが一般的である。
これにより、実世界のLLM能力、特に異種データ分布を体系的に下降させる。
論文 参考訳(メタデータ) (2026-06-25T10:20:47Z) - CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - When LLMs get significantly worse: A statistical approach to detect model degradations [33.63321816712603]
基礎モデルの推論コストと遅延を最小化することが重要な研究領域となっている。
モデル劣化を効率的に検出できる,McNemarのテストに基づく統計的に健全な仮説テストフレームワークを提案する。
実験の結果,0.3%の精度劣化でも,ノイズよりも実際の劣化が確実な原因であることが判明した。
論文 参考訳(メタデータ) (2026-02-09T10:45:13Z) - Adapt in the Wild: Test-Time Entropy Minimization with Sharpness and Feature Regularization [85.50560211492898]
テスト時適応(TTA)は、テストデータが分散シフトが混在している場合、モデルの性能を改善または損なう可能性がある。
これはしばしば、既存のTTAメソッドが現実世界にデプロイされるのを防ぐ重要な障害である。
両面からTTAを安定化させるため,SARと呼ばれる鋭く信頼性の高いエントロピー最小化手法を提案する。
論文 参考訳(メタデータ) (2025-09-05T10:03:00Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - COME: Test-time adaption by Conservatively Minimizing Entropy [45.689829178140634]
保守的に最小化されるエントロピー (COME) は従来のエントロピー (EM) の代替品である
COMEはモデル予測よりもディリクレ事前分布を特徴付けることによって、不確実性を明示的にモデル化する。
我々はCOMEが一般的なベンチマークで最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2024-10-12T09:20:06Z) - Adapting to Shifting Correlations with Unlabeled Data Calibration [6.84735357291896]
サイト間の分散シフトは、不安定な相関を利用する傾向にあるため、モデル性能を著しく低下させる可能性がある。
本稿では,モデル予測を予測対象と共同設立者間のシフト相関に適応させるフレキシブルな手法であるGeneralized Prevalence Adjustment (GPA)を提案する。
GPAは、これらのサイトからの未ラベルのサンプルを使用して、新しいサイトのターゲットと共同創設者の相互作用を推測することができる。
論文 参考訳(メタデータ) (2024-09-09T18:45:43Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Towards Stable Test-Time Adaptation in Dynamic Wild World [60.98073673220025]
テスト時間適応(TTA)は、与えられたモデルをテストサンプルに適応させることで、トレーニングとテストデータの分散シフトに取り組むのに有効であることが示されている。
TTAのオンラインモデル更新は不安定であり、これはしばしば既存のTTAメソッドが現実世界にデプロイされるのを防ぐ重要な障害である。
論文 参考訳(メタデータ) (2023-02-24T02:03:41Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。