論文の概要: Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions
- arxiv url: http://arxiv.org/abs/2608.31108v2
- Date: Fri, 04 Sep 2026 13:10:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.445317
- Title: Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions
- Title(参考訳): ストレステストによるレスポンシブルAI評価:コンピューティングの節約がベンチマークの結論を変えるとき
- Abstract要約: ベンチマークおよびBBQVサブセット上での3つの密度依存モデルと混合依存モデルを評価することで、責任AIにおけるストレステストの結論を導出する。
我々は, 精度, バイアス重大度, 有病率, 推理品質, 安定性, 測定エネルギーを, フルベンチマークBF16ベースラインと比較した。
- 参考スコア(独自算出の注目度): 7.16271346063866
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Efficient evaluation changes the protocol used to support claims about model behavior, yet it is rarely tested whether those claims remain stable after the evaluation itself is made cheaper. We stress-test conclusion robustness in responsible-AI benchmarking by evaluating three dense and mixture-of-experts models on BBQ and BBQ-V under seven conditions spanning batching, quantization, benchmark reduction, and their combinations. Rather than treating preserved aggregate accuracy as sufficient, we compare accuracy, bias severity and prevalence, reasoning quality, subgroup behavior, subset-membership stability, runtime, and measured GPU energy against a full-benchmark BF16 baseline. Larger batching keeps accuracy within 0.35 percentage points of baseline and produces comparatively small subgroup changes, while reducing energy in five of six model--dataset settings. INT8 largely preserves quality but uses 1.79--4.26$\times$ baseline energy. INT4 causes larger, model- and context-dependent changes. Reduced benchmarks provide the most consistent savings, but very small subsets are substantially more sensitive to which items are retained. Efficient evaluation should therefore be treated as a measurement intervention whose validity must be checked across the conclusions the benchmark is intended to support. Our project website is https://vectorinstitute.github.io/sustainable-rai-evaluation/ and the code is available at https://github.com/VectorInstitute/sustainable-rai-evaluation.
- Abstract(参考訳): モデル動作に関するクレームをサポートするために使用されるプロトコルを効率よく評価するが、評価自体が安くなったら、それらのクレームが安定しているかどうかを検査することは滅多にない。
BBQ と BBQ-V の3つの高密度および混合実験モデルを,バッチ処理,量子化,ベンチマーク削減,それらの組み合わせにまたがる7つの条件下で評価することにより,責任AIベンチマークにおけるストレステストによる結論ロバスト性を評価する。
保存された集約精度を十分に扱うのではなく、精度、バイアス重大度、有病率、推論品質、サブグループ動作、サブメンバーシップ安定性、実行時、測定されたGPUエネルギーをフルベンチマークBF16ベースラインと比較する。
より大規模なバッチ処理は、ベースラインの0.35ポイント以内の精度を維持し、比較的小さなサブグループ変更を発生させると同時に、6つのモデルデータセット設定のうち5つのエネルギーを削減している。INT8は品質を保っているが、ベースラインエネルギーは1.79--4.26$\times$である。
INT4は、より大きく、モデルに依存し、コンテキストに依存した変更を引き起こす。
ベンチマークの縮小は、最も一貫した貯蓄を提供するが、非常に小さなサブセットは、どのアイテムが保持されているかにかなり敏感である。
したがって、効率的な評価は、ベンチマークが支持することを意図した結論を越えて妥当性を確認しなければならない測定介入として扱われるべきである。
プロジェクトのWebサイトはhttps://vectorinstitute.github.io/sustainable-rai-evaluation/で、コードはhttps://github.com/VectorInstitute/sustainable-rai-evaluationで公開されている。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - DACRI: Decision-Aware Causal Intervention Ranking for Critical Supply Chains [7.300943403522602]
提案するCriticalSCM-Bench v1は,因果的真理と実/実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実
フル情報トレイン選択静的ベンチマークとは対照的に、LambdaMARTは中央値の正規化を5.7-16.2%改善している。
デジタルインフラストラクチャーでは、ドメインインフォームド定数バッファポリシーが引き続き強く、モデル複雑性が一様に正当化されないことを示す。
論文 参考訳(メタデータ) (2026-08-11T17:12:08Z) - Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts [5.771687318105755]
この記事はBuild it, Break it, Fix it framework into Build, Break it, Repeat (BiBiR)に適合する。
BiBiR: 反復対向条件下で検出器の堅牢性をストレステストするために設計された反復セッション。
その結果、最高の逆転ブレーカーの変換は、バックトランスレーションとペルソナベースの書き換えの組み合わせによるものであることが判明した。
論文 参考訳(メタデータ) (2026-08-10T12:13:41Z) - StabilityBench: Benchmarking Instability in LLMs [5.633712097504611]
本論文では,シングルターンベンチマークをマルチターンインタラクション履歴に変換するベンチマーク演算子であるStable Benchを提案する。
本研究では, 数学的推論, 健康質問応答, 安全性の4つのベンチマークに適用し, 9つの大言語モデルを評価する。
以上の結果から,これらのインジェクションのモデル性能は安定的に不安定であり,4つのベンチマークのうち3つに対してかなりの性能劣化が認められた。
論文 参考訳(メタデータ) (2026-07-17T16:09:37Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Fluid Language Model Benchmarking [126.92394365620525]
我々は,複数の次元にわたるLMベンチマークを進展させる新しい評価手法であるFluid Benchmarkingを紹介する。
サイコメトリックスにインスパイアされたFluid Benchmarkingは、ベンチマーク項目の相対値がLMの能力レベルに依存するという洞察に基づいている。
効率性,妥当性,分散性,飽和性の4つの次元を検証した結果,Fluid Benchmarkingがすべてにおいて優れた性能を発揮することがわかった。
論文 参考訳(メタデータ) (2025-09-14T05:49:42Z) - Signal and Noise: A Framework for Reducing Uncertainty in Language Model Evaluation [103.66549325018741]
現在のベンチマークの違いを示す2つの重要な指標を紹介します。
より優れた信号対雑音比を持つベンチマークは、小規模で意思決定を行う場合、より信頼性が高いことを示す。
結論は、新しいベンチマークを作成する人や、どの既存のベンチマークを使うかを選択する人は、高い信号と低いノイズを目標にすることを推奨する。
論文 参考訳(メタデータ) (2025-08-18T17:56:04Z) - The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination [18.05548914181797]
ベンチマークデータ汚染(BDC)-トレーニングセットにベンチマークテストサンプルを含めることで、LLM(Large Language Model)評価における懸念が高まった。
これを解決するために、研究者は既存のベンチマークを更新するための様々な緩和戦略を提案している。
従来の評価手法、例えば精度低下や精度のマッチングは、集計精度のみに焦点を合わせ、しばしば不完全あるいは誤解を招く結論に至る。
論文 参考訳(メタデータ) (2025-03-20T17:55:04Z) - Do These LLM Benchmarks Agree? Fixing Benchmark Evaluation with BenchBench [15.565644819269803]
過度に見落とされた方法論的選択がベンチマークコンセンサステスト(BAT)の結果にどのように影響するかを示す。
我々は、BAT用のピソンパッケージであるBenchBenchを紹介し、ベンチマークを仲間を使って評価するためのメタベンチマークであるBenchBench- Leaderboardをリリースする。
論文 参考訳(メタデータ) (2024-07-18T17:00:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。