論文の概要: SynConfRoute: Syntax-Aware Routing for Efficient Code Completion with Small CodeLLMs
- arxiv url: http://arxiv.org/abs/2605.04894v1
- Date: Wed, 06 May 2026 13:25:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.835187
- Title: SynConfRoute: Syntax-Aware Routing for Efficient Code Completion with Small CodeLLMs
- Title(参考訳): SynConfRoute:小さなコードLLMによる効率的なコード補完のための構文対応ルーティング
- Abstract要約: SynConfRouteは、ローカルの完了を維持するか、より大きな自己ホスト型モデルにエスカレートするかを自動的に決定する、トレーニング不要のメソッドである。
Python、Java、C++にまたがって一般化されており、正しいローカル補完を拒絶することなく、3つの言語でのみルーティングされる信頼性を改善している。
このパイプラインは、カスタムトレーニングなしで市販のモデルを使用するため、実際に即座にデプロイできる。
- 参考スコア(独自算出の注目度): 5.867152615003303
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprises want AI code completion that is both high-quality and private, but they face a tension: proprietary models yield better results yet risk exposing proprietary code, while self-hosting large models is expensive and hard to maintain. As a lighter alternative, small CodeLLMs (1B-3B) can run on a developer's workstation accelerator with code never leaving the machine, but they fail on harder tasks. A practical solution is to use the small model for most requests and selectively route difficult ones to a larger self-hosted model. In this study, we evaluate 29 code specialized LLMs (0.5B-480B) from 12 families on execution-based fill-in-the-middle (FIM) code completion benchmarks across Python, Java, and C++, and find that model family and code specialized training matter more than size: a 3B model matches a 32B model despite being 10x smaller. Analyzing the 3B model's failures, we discover that 46% of its incorrect completions are not valid code. To enable efficient code completion, we propose SynConfRoute, a training-free method that combines token confidence with syntax validation to automatically decide per-request whether to keep the local completion or escalate to a larger self-hosted model. SynConfRoute improves pass@1 by 6.4% over confidence only routing on routine completions and by up to 31% on harder multi-language tasks, and the resulting pipeline achieves 78.9% on routine completions, 7.4% higher than always using the 480B model alone, while reducing accelerator usage by 58%. SynConfRoute generalizes across Python, Java, and C++, improving over confidence only routing on all three languages without ever rejecting a correct local completion. The pipeline uses off-the-shelf models with no custom training, making it immediately deployable in practice.
- Abstract(参考訳): プロプライエタリなモデルはより優れた結果をもたらすが、プロプライエタリなコードを公開するリスクは伴う。
より軽量な代替手段として、小さなCodeLLM (1B-3B) は開発者のワークステーションアクセラレータ上で実行でき、コードはマシンを離れることはないが、より難しいタスクで失敗する。
現実的な解決策は、ほとんどのリクエストに小さなモデルを使用し、難しいモデルをより大きな自己ホストモデルに選択的にルーティングすることです。
本研究では,Python,Java,C++にまたがる実行ベースファイリング・イン・ザ・ミドル(FIM)コード補完ベンチマークにおいて,12のファミリから29のコード専用LSM(0.5B-480B)を評価し,モデルファミリとコード専用トレーニングが,10倍小さいにもかかわらず32Bモデルと一致することを発見した。
3Bモデルの失敗を分析すると、その誤完了の46%が有効なコードではないことが分かる。
効率的なコード補完を実現するために,トークンの信頼性と構文検証を組み合わせたトレーニング不要のSynConfRouteを提案し,局所的な補完を維持するか,より大規模な自己ホスト型モデルにエスカレートするかを自動的に判断する。
SynConfRouteはパス@1を6.4%改善し、ルーチン補完のみをルーティングし、より難しいマルチ言語タスクを最大31%削減した。
SynConfRouteはPython、Java、C++にまたがって一般化されており、正しいローカル補完を拒絶することなく、3つの言語でのみルーティングされる信頼性を改善している。
このパイプラインは、カスタムトレーニングなしで市販のモデルを使用するため、実際に即座にデプロイできる。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools [2.0320563270126493]
我々は,クエリ毎の細粒度,多次元能力要件を予測するフレームワークHyDRAを提案する。
ショートフォールマッチングアルゴリズムは、予測された要求を満たす機能を持つ最も安価なモデルを選択する。
このフレームワークは、GitHub CopilotのVS Code Chat自動モードのすべてのユーザにデプロイされる。
論文 参考訳(メタデータ) (2026-05-16T18:19:30Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python [2.7324157162184157]
本稿では,大規模な言語モデルでRustの目的をPythonに翻訳するLLM支援型連続コード翻訳手法を提案する。
我々は、Pythonポートが59/80 SWE-bench検証タスク(73.8%)をRustの56/80(70.0%)に対して解決し、現実世界のエージェントタスクでほぼ同等であることを実証した。
評価の結果,APIレイテンシが支配的な LLM ベースのエージェントでは,Python の表現性が 15.9 倍のコード削減を実現している。
論文 参考訳(メタデータ) (2026-04-13T14:21:44Z) - Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework [0.26508608365976566]
GitHubの25のプロジェクトに関する実証調査では、プログレッシブプロンプトが平均96.9%のタスク完了を達成した。
自己批判はコードレビュー可能なロジックエラーで成功するが、外部サービス統合では完全に失敗する。
RAGは、より優れた効率で、すべての障害タイプで最高の完成を達成する。
論文 参考訳(メタデータ) (2026-02-02T23:08:03Z) - Anka: A Domain-Specific Language for Reliable LLM Code Generation [0.0]
大規模言語モデル(LLM)は、複雑な多段階プログラミングタスクの体系的なエラーを示す。
明示的で制約のある構文で設計されたデータ変換パイプライン用のドメイン固有言語()であるAnkaを紹介します。
Ankaは100のベンチマーク問題に対して99.9%のパース成功と95.8%のタスク精度を達成した。
論文 参考訳(メタデータ) (2025-12-29T05:28:17Z) - Workflows vs Agents for Code Translation [2.102846336724103]
大規模言語モデル(LLM)は自動化への道を提供するが、HDLコードの限られたトレーニングによって、エンドツーエンドのトランスパイルが不安定になり、構文エラーが発生しやすい。
LLM-to-HDLパイプラインにおける構文修復のための2つの手法の比較を行った。これは、一定の操作列に従う構造化された専門家設計フローと、モデルコンテキストプロトコル(MCP)を用いたより自律的なエージェントアプローチである。
3つのモデルスケールにまたがって、エージェント的アプローチは、初期構文エラーを解決し、パイプラインを通過する候補の数を増やすのに効果的である。
論文 参考訳(メタデータ) (2025-12-15T20:35:11Z) - OverFill: Two-Stage Models for Efficient Language Model Decoding [68.68408155020568]
大規模言語モデル(LLM)は多様なタスクにまたがって優れていますが、高い推論コストのため、デプロイメント上の大きな課題に直面しています。
プリフィルとデコードステージを分離し,精度と効率のトレードオフを最適化するOverFillを提案する。
我々の3B-to-1B OverFill構成は1Bプルーニングモデルを83.2%上回り、8B-to-3B構成は3Bプルーニングモデルを79.2%上回った。
論文 参考訳(メタデータ) (2025-08-11T20:07:34Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z) - Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning [48.66688117533318]
本稿では,専用の報酬設計を備えた新しい強化学習フレームワークCUREを提案する。
CUREは、その相互作用の結果に基づいて、コーディングと単体テスト生成機能を共進化させる。
我々のモデルは,ベースモデルに基づく強化学習に有効な報奨モデルとして機能することを発見した。
論文 参考訳(メタデータ) (2025-06-03T17:58:42Z) - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning [23.795932850992816]
R1-Code-Interpreterは,マルチターン制御微調整(SFT)と強化学習(RL)によって訓練されたテキストのみの大規模言語モデル(LLM)の拡張である。
144種類の多種多様な推論・計画タスクにまたがる汎用コードインタープリタのトレーニングは,タスクの不均一性や有効サンプルの不足による重大な課題を呈している。
最終モデルであるR1-CI-14Bは、37のテストタスクの平均精度を44.1%から72.4%に改善し、テキストのみのGPT-4o (58.6%) と GPT-4o with Code Interpreter (70.9%) を上回りました。
論文 参考訳(メタデータ) (2025-05-27T18:47:33Z) - S*: Test Time Scaling for Code Generation [55.11863577956177]
コード生成のための最初のハイブリッドテストタイムスケーリングフレームワークであるS*を提案する。
S*は生成されたコードのカバレッジと選択精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-02-20T09:18:53Z) - SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models [88.29990536278167]
SPaRは、木探索の自己精製を統合して、有効かつ同等な選好ペアを得るセルフプレイフレームワークである。
実験により,SPaRで誘導された3回の反復で訓練されたLLaMA3-8Bモデルが,一般機能を失うことなくIFEvalベンチマークでGPT-4-Turboを上回った。
論文 参考訳(メタデータ) (2024-12-16T09:47:43Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。