論文の概要: Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
- arxiv url: http://arxiv.org/abs/2606.00920v1
- Date: Sat, 30 May 2026 23:03:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.976995
- Title: Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
- Title(参考訳): 決定論的プログラミング課題における大規模言語モデルの精度・安定性・繰り返し実行信頼性
- Abstract要約: ランレベルのパスレートは、リトライフリーのカバレッジを最大17.8ポイント上回っている。
本稿では,実行レベルの精度,再試行自由度,確率ごとの変動率を指標とした繰り返し実行評価プロトコルを提案する。
- 参考スコア(独自算出の注目度): 0.8699677835130409
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Run-level pass rate overstates retry-free coverage by up to 17.8 percentage points -- and the gap is largest precisely for mid-performing systems. We investigate this accuracy--stability relationship in large language model (LLM) evaluation for deterministic text-conditioned generation, using programming tasks as a concrete testbed. Standard code-generation benchmarks emphasize single-run accuracy or eventual success under repeated sampling, but many deployment settings also require stability: consistent outcomes across repeated invocations under the same task description. We present a repeated-run evaluation protocol with metrics for run-level accuracy, retry-free coverage, and per-problem variability. On a recency-based benchmark of 100 LeetCode-style problems, we evaluate 16 models from five provider families under two prompt templates with five repeated runs per problem, yielding 16,000 evaluation instances. Although run-level pass rate and perfect stability rate are strongly correlated (r=0.985), pass rate consistently exceeds retry-free coverage -- a gap that reaches 17.8 percentage points and reverses model rankings even among closely matched systems. Prompt effects are model-dependent rather than uniformly beneficial. These results suggest that repeated-run stability analysis is a necessary complement to conventional accuracy reporting for deterministic text-conditioned generation tasks.
- Abstract(参考訳): ランレベルのパスレートは、リトライフリーのカバレッジを最大17.8ポイントまで上回る。
プログラムタスクを具体的テストベッドとして用いて,決定論的テキスト条件生成のための大規模言語モデル(LLM)評価におけるこの精度-安定性の関係について検討する。
標準的なコード生成ベンチマークでは、繰り返しサンプリングされた場合の単一実行精度や最終的な成功が強調されるが、多くのデプロイメント設定では安定性も要求される。
本稿では,実行レベルの精度,再試行自由度,確率ごとの変動率を指標とした繰り返し実行評価プロトコルを提案する。
LeetCodeスタイルの100のリカレンシベースのベンチマークでは,5つのプロバイダファミリーから16のモデルを2つのプロンプトテンプレートで評価した。
ランレベルのパスレートと完全安定性率は強く相関している(r=0.985)が、パスレートはリトライフリーのカバレッジを一貫して上回っている。
プロンプト効果は一様利益ではなくモデル依存である。
これらの結果から, 逐次安定解析は, 決定論的テキスト条件付き生成タスクにおける従来の精度報告の補完となることが示唆された。
関連論文リスト
- Recursive Agentic Reasoning [4.7490116928645065]
反復精製、分解、繰り返しサンプリングといったテスト時間推論手法は、しばしば分離して評価される。
エージェントの推論トレース上の再帰演算子として,これらの手法の統一ビューを導入する。
同一のプロンプト、トークン予算、グレーディングコードを持つ共有ハーネスの下で、3つの演算子全てをシングルパスチェーン・オブ・ソートベースラインに対して評価する。
論文 参考訳(メタデータ) (2026-08-25T01:34:08Z) - Analysis of Federated Aggregation under Model Poisoning and Backdoor Attacks: A Reconstructed Cross-Dataset and Cross-Architecture Benchmark [0.0]
500セルのシード-1評価マトリックスを5つのアグリゲーション法で再構成した。
実行ログは454回のオリジナルランと36回の修復または再実行で特定された。
クルムは、サインフリップとガウス構成の両方で記録された最高精度を達成した。
論文 参考訳(メタデータ) (2026-08-11T20:42:56Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Learning to Assess the Reliability of Number-of-Runs Estimation in Stochastic Optimization [3.9407886544063384]
本研究では,近年のオンライン実験を学習ベースで拡張し,ハンドリングと歪度に基づく対称性チェックを用いて,必要な実行回数を適応的に推定する手法を提案する。
我々は,23個の統計量,エネルギーフリー,形状および安定性の分類器を訓練し,少数クラスのリコールによる誤推定の検出を優先し,ラン数推定が信頼できるかどうかを推定する。
その結果,不確実な推定値の信頼性を高いマイノリティクラスのリコールで検出できるが,固定構成におけるデータ多様性の制限により性能は制限されている。
論文 参考訳(メタデータ) (2026-05-27T11:08:19Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline [2.4832413743954618]
本稿では,AI会議要約をインスタンス化した,生成型AIアプリケーションのための再利用可能な評価パイプラインを提案する。
このシステムは、ソースの取り込み、構造化された参照構成、候補生成、構造化されたスコアリング、レポートの5段階にわたるタスク固有のセマンティクスから再利用可能なオーケストレーションを分離する。
オフラインループをCity_council, private_data, whitehouse_press_briefingsにまたがる114のミーティングの型付きデータセットでベンチマークする。
論文 参考訳(メタデータ) (2026-04-23T07:02:11Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Ensemble-Based Uncertainty Estimation for Code Correctness Estimation [36.53771380869671]
本研究では,モデルアンサンブル全体で集約されたサンプルの一貫性を評価することにより,不確実性を推定するEnsemble Semantic Entropy (ESE)を提案する。
LiveCodeBenchの実験では、ESEはシングルモデルセマンティックエントロピーよりもプログラムの正確性に強く関連している。
また、単一モデルスケーリングと比較してFLOPを64.9%削減しながら性能を維持できるカスケーディングテストタイムスケーリングフレームワークCasを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:37:36Z) - Solver-in-the-Loop: MDP-Based Benchmarks for Self-Correction and Behavioral Rationality in Operations Research [19.31559944205485]
運用 調査実践者は反復的なプロセスを通じて、不可能なモデルを日常的にデバッグする。
評価ループにtextbfsolver を配置するベンチマークを2つ導入する。
ドメイン固有のRLVRトレーニングによって、8BモデルがフロンティアAPIを越えられることが分かりました。
論文 参考訳(メタデータ) (2026-01-28T20:02:44Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - Self-Consistency Improves Chain of Thought Reasoning in Language Models [53.45015291520658]
我々は,大規模言語モデルの推論精度を大幅に向上させる,単純なアンサンブル戦略,自己整合性を探究する。
算術的および常識的推論ベンチマークでは、自己整合性は大幅な精度の向上をもたらす。
論文 参考訳(メタデータ) (2022-03-21T17:48:52Z) - Investigating Crowdsourcing Protocols for Evaluating the Factual
Consistency of Summaries [59.27273928454995]
要約に適用される現在の事前学習モデルは、ソーステキストを誤って表現したり、外部情報を導入したりする事実上の矛盾がちである。
評価ベースのLikertスケールとランキングベースのBest-Worst Scalingプロトコルを用いた,事実整合性のためのクラウドソーシング評価フレームワークを構築した。
ランキングベースのプロトコルは、データセット間の要約品質をより信頼性の高い尺度を提供するのに対して、Likertレーティングの信頼性はターゲットデータセットと評価設計に依存する。
論文 参考訳(メタデータ) (2021-09-19T19:05:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。