論文の概要: StabilityBench: Benchmarking Instability in LLMs
- arxiv url: http://arxiv.org/abs/2607.20558v1
- Date: Fri, 17 Jul 2026 16:09:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.167619
- Title: StabilityBench: Benchmarking Instability in LLMs
- Title(参考訳): stabilityBench: LLMのベンチマーク不安定性
- Abstract要約: 本論文では,シングルターンベンチマークをマルチターンインタラクション履歴に変換するベンチマーク演算子であるStable Benchを提案する。
本研究では, 数学的推論, 健康質問応答, 安全性の4つのベンチマークに適用し, 9つの大言語モデルを評価する。
以上の結果から,これらのインジェクションのモデル性能は安定的に不安定であり,4つのベンチマークのうち3つに対してかなりの性能劣化が認められた。
- 参考スコア(独自算出の注目度): 5.633712097504611
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI Assistants are increasingly deployed in high-stakes settings, such as healthcare or government services. Yet their real-world behavior remains poorly understood due to strong context dependence. Current evaluation protocols follow a defense-in-depth paradigm with compounding layers of safeguards, ranging from traditional benchmarks to live or adversarial testing. Such benchmarks remain largely static and single-turn, limiting their ability to capture real-world variability in conversational settings. We propose StabilityBench, a principled, general and model-agnostic benchmark operator that transforms single-turn benchmark queries into multi-turn interaction histories. StabilityBench augments existing benchmarks by injecting realistic user simulations, through demographic proxies or sycophantic baits, while preserving original task intent. We apply StabilityBench to four benchmarks spanning mathematical reasoning, health question-answering and safety, and evaluate nine large language models under these conditions. Our results show that model performance is consistently unstable under these injections, with considerable performance degradations on three out of four benchmarks studied. These highlight important limitations of static evaluations and motivate more realistic evaluation settings. To this end, we propose StabilityBench-Mini: a size-preserving variant of StabilityBench that samples across diversification axes, enabling more realistic evaluation without increasing costs.
- Abstract(参考訳): AIアシスタントは、医療や政府サービスなど、ハイテイクな環境にますます配置されている。
しかし、彼らの現実世界の行動は、強い文脈依存のため、理解しづらいままである。
現在の評価プロトコルは、従来のベンチマークからライブや対向テストまで、複雑なセーフガード層を備えたディフェンス・イン・ディープス・パラダイムに従っている。
このようなベンチマークは、大部分が静的でシングルターンであり、会話設定で現実世界の変数をキャプチャする能力を制限する。
本論文では,シングルターンベンチマーククエリをマルチターンインタラクション履歴に変換する,原則的,汎用的,モデルに依存しないベンチマーク演算子であるStable Benchを提案する。
StabilityBenchは、人口動態プロキシやサイコファンティックベイトを通じて、現実的なユーザシミュレーションを注入し、オリジナルのタスク意図を保存することで、既存のベンチマークを強化する。
本研究では, 数学的推論, 健康質問応答, 安全性の4つのベンチマークに適用し, これらの条件下での9つの大規模言語モデルを評価する。
以上の結果から,これらのインジェクションのモデル性能は安定的に不安定であり,4つのベンチマークのうち3つに対してかなりの性能劣化が認められた。
これらは静的評価の重要な制限を強調し、より現実的な評価設定を動機付けている。
そこで本研究では,Stable Bench-Miniを提案する。Stable Benchのサイズ保存型で,分散化軸をまたいでサンプリングし,コストを増大させることなく,より現実的な評価を可能にする。
関連論文リスト
- ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness [65.3988208273595]
我々は、悪天候自律運転のための実世界のマルチモーダルベンチマークであるtextbfObsDriveBenchを紹介する。
我々のベンチマークは,textbfobservability awareness, textbfspatial reliability, textbfrisk-aware decision-makingの3つの機能ディメンションで設計されている。
実験により、既存の視覚言語モデルの一貫した性能劣化が明らかになった。
論文 参考訳(メタデータ) (2026-07-26T08:13:46Z) - Statistical Inference for Misspecified Contextual Bandits [6.178061357164435]
標準アルゴリズムは、不特定な作業モデルの下では、安定化に失敗する可能性がある。
広い範囲のモーメント対象に対する逆確率重み付きZ推定フレームワークを開発する。
いくつかの政策クラスに対して、スケールされた逆正則収束のための十分な条件を確立する。
論文 参考訳(メタデータ) (2026-06-21T18:57:13Z) - AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition [72.24180896265192]
本稿では,騒音環境下でのエージェントモデルのロバスト性を評価するためのフレームワークであるAgentNoiseBenchを紹介する。
まず、実世界のシナリオにおけるバイアスと不確実性の詳細な分析を行う。
次に,環境騒音をユーザノイズとツールノイズの2つの主要なタイプに分類する。
この分析に基づいて,既存のエージェント中心ベンチマークに制御可能なノイズを注入する自動パイプラインを開発した。
論文 参考訳(メタデータ) (2026-02-11T20:33:10Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning [2.1461777157838724]
ReasonBENCHは,大規模言語モデル(LLM)推論における基盤不安定性を定量化する最初のベンチマークである。
異なる領域からのタスク全体で、推論戦略とモデルの大部分は高い不安定性を示す。
我々はさらに、解答率と安定性のトレードオフに対するプロンプト、モデル家族、スケールの影響を解析する。
論文 参考訳(メタデータ) (2025-12-08T18:26:58Z) - SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions [54.34001921326444]
話者検証(SV)モデルは、セキュリティ、パーソナライゼーション、アクセス制御システムにますます統合されている。
既存のベンチマークでは、これらの条件のサブセットのみを評価しており、他は完全に欠落している。
SVeritasは、録音時間、自発性、コンテンツ、ノイズ、マイクロホン距離、残響、チャンネルミスマッチ、オーディオ帯域幅、コーデック、話者年齢、スプーフィングおよび敵攻撃に対する感受性などのストレス下でのSVシステムの評価を行う総合的な話者検証タスクベンチマークスイートである。
論文 参考訳(メタデータ) (2025-09-21T14:11:16Z) - Prompt Stability in Code LLMs: Measuring Sensitivity across Emotion- and Personality-Driven Variations [40.12950482269347]
本稿では,感情テンプレートと人格テンプレートを用いた意味論的に等価なプロンプト変種を生成するフレームワークであるPromptSEを提案する。
本研究は、性能と安定性が、主に分離された最適化目標として振る舞うことを示す。
PromptSEは、デプロイとモデル選択のためのパフォーマンス安定性トレードオフの定量化を可能にする。
論文 参考訳(メタデータ) (2025-09-17T04:17:42Z) - CNS-Bench: Benchmarking Image Classifier Robustness Under Continuous Nuisance Shifts [78.79936076607373]
我々は,連続ニュアンスシフトベンチマークであるCNS-Benchを導入し,連続かつ現実的なニュアンスシフトのための画像分類器の堅牢性を定量化する。
本稿では,従来の手法よりも優れたフィルタリング機構を提案し,生成モデルによる信頼性の高いベンチマークを可能にする。
論文 参考訳(メタデータ) (2025-07-23T16:15:48Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - A Comparative Analysis on Ethical Benchmarking in Large Language Models [0.0]
この研究は、インテリジェントシステムが人間の価値を正確に表現し、それに従って行動するかどうかを評価するテストを開発する機械倫理(ME)ベンチマークの分野に貢献する。
我々は,非現実的な倫理的ジレンマによる生態的妥当性の制限,包括的・排他的基準のない非構造的質問生成,人間のアノテーションへの依存によるスケーラビリティの欠如,の3つの主要な課題を明らかにした。
医用領域の現実的な倫理的ジレンマを特徴とするTriage BenchmarkとMedicical Law (MedLaw) Benchmarkの2つのMEベンチマークを紹介した。
論文 参考訳(メタデータ) (2024-10-11T05:05:21Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。