論文の概要: What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend
- arxiv url: http://arxiv.org/abs/2608.04714v1
- Date: Wed, 05 Aug 2026 11:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.843153
- Title: What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend
- Title(参考訳): LLMの振る舞いとして見るものは、推論バックエンドの副作用になり得る
- Authors: Shahed Masoudian, Passant Shafaei, Monorama Swain, Markus Schedl,
- Abstract要約: ベンチマークスコアはモデルのプロパティとして報告されるが、それらを生成するのに使用される推論フレームワークは非インフルエンシャルである。
本研究では,この選択がモデル出力に与える影響について検討する。
グレードでサンプリングノイズのないデコードであっても、バックエンドを変更することで、モデルのパフォーマンスを大きく変えることができる。
- 参考スコア(独自算出の注目度): 8.18791900871137
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benchmark scores are reported as properties of a model, yet the inference framework used to produce them, such as HuggingFace, vLLM, or Ollama, are considered non-influential and their names and versions are almost never disclosed. In this work we investigate how much this choice can influence the model output. In a fully-crossed study (three instruction-tuned models x five inference frameworks x six benchmarks x four generation modes) we investigate how different tools (wrappers/backend) influence benchmark scores and how their score changes is influenced by generation hyper-parameters. We find backend to be a non-negligible factor where even under greedy, sampling-noise-free decoding, changing the backend can significantly alter models performance and this effect is structural and strongly model-dependent. Decomposing the variance according to generation mode reveal that considerable portion of the variability (roughly 39\%) a practitioner sees out-of-the-box can stem from the backend, while the remaining stems from sampling noise and each framework's default generation parameters, both of which are avoidable by disclosing and matching the generation configuration. These divergences are more pronounced on factual than on social-bias benchmarks. Overall, benchmark numbers are not backend-agnostic therefore, we recommend disclosing the backend, its version, and the full generation configuration, also using deterministic decoding for cross-backend comparison.
- Abstract(参考訳): ベンチマークスコアはモデルのプロパティとして報告されるが、HuggingFace、vLLM、Ollamaといったモデルの生成に使用される推論フレームワークは非インフルエンシャルと考えられており、その名前とバージョンはほとんど公開されていない。
本研究では,この選択がモデル出力に与える影響について検討する。
フルクロス調査(3つの命令チューニングモデル x 5 の推論フレームワーク x 6 のベンチマークフレームワーク x 4 の生成モード)では、異なるツール(コンパイラ/バックエンド)がベンチマークスコアにどのように影響し、それらのスコアが生成ハイパーパラメータにどのように影響するかを調査する。
暗黙のサンプリングノイズのないデコードであっても、バックエンドを変更することでモデルのパフォーマンスが大幅に変化し、この効果は構造的でモデルに依存している。
生成モードに従ってばらつきを分解すると、実行時の変数のかなりの部分(約39 %)がバックエンドから派生し、残りの部分はサンプリングノイズと各フレームワークのデフォルト生成パラメータから派生し、どちらも生成構成の開示と整合によって回避可能であることが分かる。
これらの違いは、社会的バイアスベンチマークよりも現実的に顕著である。
全体として、ベンチマーク番号はバックエンドに依存しないため、バックエンド、バージョン、およびフルジェネレーション構成の開示を推奨します。
関連論文リスト
- The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility [4.514361164656055]
バックエンドのみを選択することで、ベンチマークスコアを最大16.6ポイントシフトできることが示されています。
これは、キャッシュやグラフ、カスタムカーネル、ロジット処理におけるエンジン固有のデフォルトなど、システムレベルの最適化によって実現されています。
論文 参考訳(メタデータ) (2026-05-19T08:37:27Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Brittlebench: Quantifying LLM robustness via prompt sensitivity [44.950999933205985]
モデル感度を定量化する理論的枠組みを導入する。
我々は、フロンティアモデルの感度を均等に評価するために、新しい評価パイプラインであるBrttlebenchを設計する。
セマンティクスを保存する入力摂動は、与えられたモデルの性能変動の最大半分を占めることができる。
論文 参考訳(メタデータ) (2026-02-27T21:12:13Z) - Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness [30.401369966789915]
Pass@kや他の推論計算のスケーリング方法は、外部検証器を持つドメインにおける言語モデルのパフォーマンスを向上させることができる。
5つのベンチマークとモデルで、驚くべきことに、それは不可能です。
不確実性の下では、モデルは真であることを識別するよりも、モデルアンサンブル内で他のモデルが何を言うかを予測するのが優れていることが分かりました。
論文 参考訳(メタデータ) (2026-02-20T03:35:01Z) - Spatial Reasoning with Denoising Models [49.83744014336816]
本稿では,連続変数の集合に対する推論を行うためのフレームワークを提案する。
初めて、その生成順序をデノナイジングネットワーク自体によって予測できる。
これらの結果から,特定の推論タスクの精度を1%から50%に向上させることができる。
論文 参考訳(メタデータ) (2025-02-28T14:08:30Z) - Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM
Evaluation [51.99752147380505]
本稿では,大規模言語モデル(LLM)を動的に評価するベンチマーク自己進化フレームワークを提案する。
マルチエージェントシステムを用いて、元のインスタンスのコンテキストや質問を操作し、信頼性の高い新しいインスタンスをフレーミングする。
我々のフレームワークは、異なるモデル間の性能の相違を拡大し、様々なタスクで同じモデル内で性能の相違を拡大します。
論文 参考訳(メタデータ) (2024-02-18T03:40:06Z) - Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction [49.15931834209624]
実世界におけるオープン情報抽出モデルの評価をシミュレートする最初のベンチマークを示す。
我々は、それぞれの例が知識不変のcliqueである大規模なテストベッドを設計し、注釈付けする。
さらにロバスト性計量を解明することにより、その性能が全体の傾きに対して一貫して正確であるならば、モデルはロバストであると判断される。
論文 参考訳(メタデータ) (2023-05-23T12:05:09Z) - Measuring the Driving Forces of Predictive Performance: Application to Credit Scoring [0.0]
本稿では,予測モデルに関連するコントリビューションに性能指標を分解するXPER手法を紹介する。
XPERは理論上はShapley値に基づいており、モデル非依存とパフォーマンスメトリック非依存の両方である。
モデル性能の驚くほど大きな部分を、少数の機能が説明できることを示す。
論文 参考訳(メタデータ) (2022-12-12T13:09:46Z) - Are Missing Links Predictable? An Inferential Benchmark for Knowledge
Graph Completion [79.07695173192472]
InferWikiは推論能力、仮定、パターンの既存のベンチマークを改善している。
各テストサンプルは、トレーニングセットの支持データで予測可能である。
実験では,大きさや構造が異なるInferWikiの2つの設定をキュレートし,比較データセットとしてCoDExに構築プロセスを適用する。
論文 参考訳(メタデータ) (2021-08-03T09:51:15Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。