論文の概要: Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
- arxiv url: http://arxiv.org/abs/2605.08680v1
- Date: Sat, 09 May 2026 04:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.809326
- Title: Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
- Title(参考訳): セマンティック投票: LLMコード生成のための実行周辺合意
- Abstract要約: 最高の実行ベースのセレクタは、出力パターンの多数決を各構成で19-52ポイント上回る。
より深い思考は、多数決を12ppで改善するが、実行ベースのメソッドは、候補の多様性が低下するにつれて、フラットまたは低下し続ける。
これらの結果から,アグリゲーションルール問題ではなく,信号品質問題としてのフレーム推論時符号選択が可能となった。
- 参考スコア(独自算出の注目度): 11.731523303184472
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM code-generation pipelines often sample multiple candidates and select one final answer without access to a complete oracle. Existing pipelines mix textual voting, ranking, and execution-based agreement, but the relative contribution of each component remains unclear. We study 18 configurations across different models, thinking levels, and benchmarks, comparing output-pattern majority voting, weighted voting, MBR-Exec, and SemanticVote - a method that clusters candidates by execution fingerprints on LLM-generated inputs. Three findings emerge. (1) The best execution-based selector exceeds output-pattern majority voting by 19-52 percentage points on every configuration, with every execution-based selector exceeding it by at least 18 points. (2) Once candidates are executed on diverse inputs, aggregation rule has limited effect: SemanticVote, weighted voting, and MBR-Exec are statistically indistinguishable across all 18 configurations. The largest factor is input quality: sketch-based input generation consistently outperforms direct LLM generation by 0.6-2.1 pp and random fuzzing by up to 11.3 pp. (3) Thinking level interacts differently with selection families: deeper thinking improves majority voting by 12 pp but execution-based methods stay flat or degrade as candidate diversity falls. These results frame inference-time code selection as a signal-quality problem rather than an aggregation-rule problem: when oracles are unavailable, the behavioral evidence matters more than the aggregation rule.
- Abstract(参考訳): LLMコード生成パイプラインは、しばしば複数の候補をサンプリングし、完全なオラクルにアクセスせずに最後の1つの答えを選択する。
既存のパイプラインでは、テキスト投票、ランキング、実行ベースの合意が混在しているが、各コンポーネントの相対的な貢献は未だに不明である。
出力パターンの多数決,重み付け投票,MBR-Exec,SemanticVote – LLM生成した入力上での指紋の実行によって候補をクラスタリングする手法である。
3つの発見がある。
1)最高の実行ベースセレクタは、各構成において19~52ポイントの出力パターン多数決を上回り、実行ベースセレクタは少なくとも18ポイント以上である。
2) 多様な入力で候補が実行されると、アグリゲーションルールは限定的な効果を持つ: SemanticVote, weighted voting, MBR-Execは18の構成すべてで統計的に区別できない。
スケッチベースの入力生成は直接LLM生成を0.6-2.1pp、ランダムファジングを最大11.3ppまで一貫して上回り、思考レベルは選択された家族と異なる相互作用をする。
これらの結果から,アグリゲーションルール問題よりも信号品質問題としての推論時符号選択が重要となり,オラクルが利用できない場合には,行動証拠はアグリゲーションルールよりも重要である。
関連論文リスト
- Partition Scores Are Not System Scores: Deployment-Fidelity Gaps in Decomposed Algorithm Selection [7.302544154053966]
分解アルゴリズム選択において、類似の分割レベルスコアは、選択されたファミリー内の最良のアルゴリズムのオラクル選択を与える。
分割レベルとデプロイ可能なエンドツーエンドユーティリティの相違点として,デプロイメント/忠実ギャップG(R)を定義した。
論文 参考訳(メタデータ) (2026-09-12T07:55:42Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation [53.88666485159289]
OpenDeepThinkは、集団ベースのテスト時間計算フレームワークで、ペアワイズBradley-Terryの比較によって選択する。
OpenDeepThinkはGemini 3.1 ProのCodeforces Eloを8回のLCMコールラウンドで+405ポイント引き上げる。
CF-73は、国際グランドマスターアノテーションによる73の専門家評価コードフォース問題と、公式判決に対する99%の地域評価合意のキュレートされたセットである。
論文 参考訳(メタデータ) (2026-05-14T17:57:40Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Parallel Test-Time Scaling with Multi-Sequence Verifiers [23.363130292302483]
並列テストタイムスケーリングは、大規模な言語モデルのパフォーマンスを改善するための強力なテクニックである。
候補プールから正しいソリューションを正確に選択することと、多くの完全なソリューションを生成することによる高い推論レイテンシである。
我々は,全ての候補解を共同処理し,それらの相互作用をモデル化する最初の検証器であるMulti-Sequence Verifier (MSV)を紹介する。
論文 参考訳(メタデータ) (2026-03-03T18:53:56Z) - dVoting: Fast Voting for dLLMs [71.572316901001]
拡散大言語モデル(dLLMs)は自己回帰モデリングを超えた新しいパラダイムである。
dLLMは任意の位置で任意のトークンを並列に生成できるため、並列テストタイムスケーリングには大きな可能性がある。
トレーニングなしで推論能力を高める高速投票手法であるdVotingを導入する。
論文 参考訳(メタデータ) (2026-02-12T16:35:05Z) - A Single Revision Step Improves Token-Efficient LLM Reasoning [3.344806691289323]
大規模言語モデルのためのトレーニングフリーで推論のみのフレームワークであるPacket-Conditioned Revision (PACER)を紹介した。
PACERは、推論トレースを使用して、構造化された調整ステップを通じて結論を修正できる。
競争力のある数学のベンチマークでは、PACERは256サンプルの多数決の正確さと一致または超える。
論文 参考訳(メタデータ) (2026-02-02T21:28:42Z) - Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach [13.829059542429876]
大規模言語モデル(LLM)の性能評価手法として,MCQ (Multiple Choice Questioning) が広く用いられている。
LLMはMCQタスクにおいて選択バイアスを示し、その選択は内容よりも答えの位置やオプション記号などの要因に影響される。
論文 参考訳(メタデータ) (2025-11-17T21:31:37Z) - Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information [57.397381631496906]
最適重み(OW)と逆サプライシング人気度(ISP)という2つの新しいアグリゲーションアルゴリズムを開発した。
我々の理論的分析は、これらの手法が軽微な仮定の下での多数決の本質的な制限を確実に緩和することを示している。
我々は,我々のアルゴリズムを人工データセット,UltraFeedbackやMMLUなどのLLMファインチューニングベンチマーク,実世界の医療環境ARMMAN上で実証的に検証した。
論文 参考訳(メタデータ) (2025-10-01T22:21:50Z) - From Ranking to Selection: A Simple but Efficient Dynamic Passage Selector for Retrieval Augmented Generation [10.904177110367122]
本稿では,経路選択を教師付き学習問題として扱う新しいフレームワークであるDynamic Passage Selector (DPS)を紹介する。
シームレスなプラグイン・アンド・プレイモジュールとして、DPSは標準的なRAGパイプラインを変更する必要はない。
DPSは適応的エビデンス選択を可能にすることにより,複雑なRAGシナリオにおける推論能力を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-08-13T05:05:34Z) - Efficient Weighting Schemes for Auditing Instant-Runoff Voting Elections [57.67176250198289]
AWAIREは、適応的に重み付けされたテスト統計量であり、本質的には、テストに有効な仮説のセットを「学習」する。
我々は、より広範囲にスキームと設定を検討し、実践のための効率的な選択を特定し、推奨する。
現在のAWAIRE実装の制限は、少数の候補者に限られている。
論文 参考訳(メタデータ) (2024-02-18T10:13:01Z) - Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency [127.97467912117652]
大規模言語モデル(LLM)は、コード生成において顕著な能力を示した。
しかし、単一の試みで正しいソリューションを生成することは依然として課題である。
本稿では,MPSC(Multi-Perspective Self-Consistency)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T14:23:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。