論文の概要: ReMCTS: Reflection-Enhanced Monte Carlo Tree Search for Code Generation
- arxiv url: http://arxiv.org/abs/2609.34717v1
- Date: Mon, 28 Sep 2026 09:24:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 03:27:53.81928
- Title: ReMCTS: Reflection-Enhanced Monte Carlo Tree Search for Code Generation
- Title(参考訳): ReMCTS: コード生成のためのリフレクション強化モンテカルロ木探索
- Abstract要約: オープンウェイトな大規模言語モデル(LLM)は、自然言語のプロンプトから関数レベルプログラムを生成することができるが、もっともらしい候補は依然として隠れた意味論で失敗する。
本稿では,実行ベース,メモリ拡張,LLM誘導型MCTSスタイルの検索フレームワークであるReMCTSを提案する。
HumanEval と MBPP-Sanitized では、可視性テスト ReMCTS は、ホールドアウト評価の下で、10 個のモデルデータセットペアのうち 8 個で直接生成する。
- 参考スコア(独自算出の注目度): 4.063182866292708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-weight large language models (LLMs) can generate function-level programs from natural-language prompts, but plausible candidates still fail on hidden semantics and repeat mistakes across repair attempts. We present ReMCTS, an execution-grounded, memory-augmented, LLM-guided MCTS-style search framework. It organizes program candidates as tree states, retains branch-local debugging context, retrieves failure experience across branches, and distinguishes failed checks from unavailable evidence. On HumanEval and MBPP-Sanitized, visible-test ReMCTS improves over direct generation in 8 of 10 model-dataset pairs under held-out evaluation, whereas proxy-only search is less stable. Controlled tree-search, sampling, repair, and memory ablations characterize the source and limits of these gains. A 30-task HumanEval-X C++ pilot further demonstrates compatibility with compiler-backed execution, but does not constitute a broad multilingual evaluation.
- Abstract(参考訳): オープンウェイトな大規模言語モデル(LLM)は、自然言語のプロンプトから関数レベルプログラムを生成することができるが、もっともらしい候補は依然として隠れたセマンティクスで失敗し、修復の試みを繰り返す。
本稿では,実行ベース,メモリ拡張,LLM誘導型MCTSスタイルの検索フレームワークであるReMCTSを提案する。
プログラム候補をツリーステートとして整理し、ブランチローカルなデバッグコンテキストを保持し、ブランチ間での障害経験を検索し、失敗するチェックと不確実なエビデンスを区別する。
HumanEval と MBPP-Sanitized では、可視性テスト ReMCTS は、10組のモデルデータセットペアのうち8組の直接生成を改善するが、プロキシのみの検索は安定しない。
制御された木探索、サンプリング、修復、メモリ短縮は、これらの利得の源泉と限界を特徴づける。
30タスクのHumanEval-X C++パイロットは、コンパイラが支援する実行との互換性をさらに実証するが、多言語評価にはならない。
関連論文リスト
- Multi-SWT-Bench: A Multilingual Benchmark for Reproduction Test Generation [5.700741359240872]
8つのプログラミング言語にまたがる1,963インスタンスからなる再生テスト生成のベンチマークであるMulti-SWT-BENCHを紹介する。
我々は,4つの代表的手法で最先端のLLMを実証研究し,プログラム言語間の故障解析を行う。
評価されたすべてのメソッドとLLMで、Pythonでの成功率は全言語での総成功率を超え、C++は特に低い成功率を示している。
論文 参考訳(メタデータ) (2026-09-28T09:41:43Z) - When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models [92.71325249013535]
テスト時間スケーリング(TTS)は、推論時間計算を固定モデルに割り当てることで推論を改善する重要な方向として登場した。
この調査は、木探索に基づく推論の最近の進歩を体系化し、推論をデコードではなく、インスタンス固有の最適化と見なす。
論文 参考訳(メタデータ) (2026-08-31T07:49:56Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - FeedbackLLM: Metadata driven Multi-Agentic Language Agnostic Test Case Generator with Evolving prompt and Coverage Feedback [0.0]
テストケース生成に対する従来のアプローチは、しばしば手作業と計算オーバーヘッドの増大を伴う。
We propose FeedbackLLM, a novel language-agnostic test case generation framework based on tightly coupled two-stage approach。
提案アーキテクチャの性能は,CプログラムとPythonプログラムに関連する標準ベンチマークプログラムで評価される。
論文 参考訳(メタデータ) (2026-05-02T05:43:29Z) - TSLM: Tree-Structured Language Modeling for Divergent Thinking [32.89058911018328]
木構造言語モデリング(TSLM)を導入し,特殊なトークンを用いて分岐構造を符号化する。
TSLMは、共有プレフィックスの冗長な再計算なしに、体系的な探索を内部化することを学ぶ。
結果は、堅牢な推論のための推論時間スケーリングの新しいパラダイムを示唆している。
論文 参考訳(メタデータ) (2026-01-30T08:04:59Z) - Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models [5.6688028729584055]
大規模言語モデル(LLM)は、構造化関数呼び出しを通じて外部ツールを呼び出すエージェントとして、ますます多くデプロイされている。
診断ベンチマークであるMLCLを導入し,中国語,ヒンディー語,低リソース言語Igboを対象とした多言語ツールコールの体系的評価を行う。
論文 参考訳(メタデータ) (2026-01-08T20:44:28Z) - Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls [83.89771461061903]
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
意味論的に等価なコンテンツを持つ冗長な状態による$textitover-Exploration$と、検証器のスコアリングにおける高いばらつきに起因する$textitunder-Exploration$である。
各種木探索アルゴリズムに適合するフレキシブルなプラグアンドプレイシステムであるFETCHを提案する。
論文 参考訳(メタデータ) (2025-02-16T16:12:01Z) - Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling [63.98194996746229]
大型言語モデル(LLM)は幻覚を起こし、事実的に誤った情報を生み出す傾向にある。
我々はThink&Citeと呼ばれる新しいフレームワークを提案し、検索と統合された多段階推論問題として属性付きテキスト生成を定式化する。
論文 参考訳(メタデータ) (2024-12-19T13:55:48Z) - CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval [103.116634967815]
CodeXEmbedは400Mから7Bパラメータの大規模なコード埋め込みモデルのファミリーである。
我々の新しいトレーニングパイプラインは、複数のプログラミング言語を統合し、様々なコード関連タスクを共通の検索フレームワークに変換する。
私たちの7Bモデルは、コード検索において新しい最先端(SOTA)を設定し、以前の主要なモデルであるVoyage-CodeをCoIRベンチマークで20%以上上回っています。
論文 参考訳(メタデータ) (2024-11-19T16:54:45Z) - RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generation [71.88883580383039]
コード生成の推論プロセスを探求し、洗練するフレームワークであるRethinkMCTSを提案する。
具体的には、コード生成前の思考の検索にMCTSを使用し、再考と呼ばれる改善メカニズムをMCTSに統合する。
RethinkMCTSは、従来の検索ベースおよびフィードバック強化コード生成ベースラインよりも優れていることを実証する。
論文 参考訳(メタデータ) (2024-09-15T02:07:28Z) - VerMCTS: Synthesizing Multi-Step Programs using a Verifier, a Large Language Model, and Tree Search [5.389248707675898]
大型言語モデル(LLM)は有用なコードを生成することができるが、しばしばそれらが生成するコードは信頼できない。
本稿では,Dafny と Coq で検証プログラムを生成することで,この問題を解決するための VerMCTS を提案する。
論文 参考訳(メタデータ) (2024-02-13T00:55:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。