論文の概要: CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
- arxiv url: http://arxiv.org/abs/2603.17829v1
- Date: Wed, 18 Mar 2026 15:25:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.787171
- Title: CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
- Title(参考訳): CodeScout: コード検索エージェントの強化学習のための効果的なレシピ
- Abstract要約: 標準Unix端末にしか搭載されていない符号化エージェントをトレーニングして,強靭な結果が得られることを示す。
本研究は,コード検索,報酬設計,RL最適化のための既存のコーディングエージェント環境を再利用する技術に重点を置いている。
得られたモデルファミリであるCodeScoutと、コミュニティが構築するすべてのコードとデータをリリースします。
- 参考スコア(独自算出の注目度): 43.426809750160665
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A prerequisite for coding agents to perform tasks on large repositories is code localization - the identification of relevant files, classes, and functions to work on. While repository-level code localization has been performed using embedding-based retrieval approaches such as vector search, recent work has focused on developing agents to localize relevant code either as a standalone precursor to or interleaved with performing actual work. Most prior methods on agentic code search equip the agent with complex, specialized tools, such as repository graphs derived from static analysis. In this paper, we demonstrate that, with an effective reinforcement learning recipe, a coding agent equipped with nothing more than a standard Unix terminal can be trained to achieve strong results. Our experiments on three benchmarks (SWE-Bench Verified, Pro, and Lite) reveal that our models consistently achieve superior or competitive performance over 2-18x larger base and post-trained LLMs and sometimes approach performance provided by closed models like Claude Sonnet, even when using specialized scaffolds. Our work particularly focuses on techniques for re-purposing existing coding agent environments for code search, reward design, and RL optimization. We release the resulting model family, CodeScout, along with all our code and data for the community to build upon.
- Abstract(参考訳): 大きなリポジトリでタスクを実行するためのコーディングエージェントの前提条件は、コードローカライゼーションである。
リポジトリレベルのコードローカライゼーションは,ベクトル探索などの埋め込みベースの検索手法を用いて行われているが,最近の研究は,実際の作業を行うためのスタンドアロン前駆体として,あるいはインターリーブとして,関連するコードをローカライズするエージェントの開発に重点を置いている。
エージェントコード検索におけるほとんどの先行手法は、静的解析から派生したリポジトリグラフのような複雑な特殊なツールをエージェントに装備する。
本稿では, 効果的な強化学習法により, 標準Unix端末のみを備えた符号化エージェントを訓練し, 強力な結果が得られることを示す。
SWE-Bench Verified、Pro、Liteの3つのベンチマーク実験により、我々のモデルは2-18倍のベースとポストトレーニングされたLLMよりも優れた、あるいは競争的な性能を保ち、特別な足場を用いてもクロード・ソネットのようなクローズドモデルが提供するパフォーマンスにアプローチすることが判明した。
本研究は,コード検索,報酬設計,RL最適化のための既存のコーディングエージェント環境を再利用する技術に重点を置いている。
得られたモデルファミリであるCodeScoutと、コミュニティが構築するすべてのコードとデータをリリースします。
関連論文リスト
- PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation [61.752289169878566]
ドメイン固有のビジネスルール、インターフェース契約、開発者が実践を通じて内部化するが文書化しない運用規約を含む、エージェントの暗黙の知識の欠如の根本原因を特定します。
この知識は、ドメイン・コードの下に深く埋もれており、コード・エンティティとその依存関係にまたがっており、それを持たないエージェントには見えません。
本稿では,ドメインコード生成のための暗黙的知識の抽出,表現,再利用を可能にするフレームワークであるPRAXISを提案する。
論文 参考訳(メタデータ) (2026-08-20T08:28:28Z) - ToFu: A White-Box, Token-Efficient Agent Harness for Researchers [73.72929185946842]
ToFuは、ファイルを読み、ファイルを編集し、コマンドを実行し、開発ツールと統合する研究者のためのエージェントハーネスだ。
研究助手として、より優れたトークン効率、低コスト、多言語能力で実践的な研究を支援する。
研究対象として、ToFuはホワイトボックスのエージェントハーネスを提供しており、研究者はオーケストレーションロジック、ツール使用の振る舞い、デザインを検査、修正、評価することができる。
論文 参考訳(メタデータ) (2026-07-13T11:26:06Z) - From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence [150.3696990310269]
大規模言語モデル(LLM)は、自然言語記述を直接関数コードに変換することによって、自動ソフトウェア開発を変革した。
コードLLMに関する総合的な合成と実践的ガイド(一連の解析および探索実験)を提供する。
一般LLM(GPT-4, Claude, LLaMA)とコード特殊化LLM(StarCoder, Code LLaMA, DeepSeek-Coder, QwenCoder)のコード機能の解析を行う。
論文 参考訳(メタデータ) (2025-11-23T17:09:34Z) - Towards A Generalist Code Embedding Model Based On Massive Data Synthesis [35.04242699869519]
汎用コード検索のための最先端の埋め込みモデルである textbfCodeR (underlineCode underlineRetrieval) を導入する。
CodeRの優れたパフォーマンスは、DRU原則に基づいて構築された大規模な合成データセットであるCodeR-Pile上に構築されている。
論文 参考訳(メタデータ) (2025-05-19T04:37:53Z) - Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning [70.04746094652653]
機械学習論文を機能コードリポジトリに変換するフレームワークであるPaperCoderを紹介した。
PaperCoderは3つの段階で動作する。計画、図によるシステムアーキテクチャの設計、ファイル依存の特定、構成ファイルの生成である。
次に、モデルベースおよび人的評価の両方に基づいて、機械学習論文からコード実装を生成するPaperCoderを評価する。
論文 参考訳(メタデータ) (2025-04-24T01:57:01Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z) - On the Impacts of Contexts on Repository-Level Code Generation [5.641402231731082]
本稿ではレポジトリレベルのコード生成を評価するために設計された新しいベンチマークであるRepoExecを紹介する。
実行可能性、包括的なテストケース生成による機能的正当性、ファイル間のコンテキストの正確な利用という3つの重要な側面に注目します。
論文 参考訳(メタデータ) (2024-06-17T10:45:22Z) - CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges [41.038584732889895]
大規模言語モデル(LLM)は自動コード生成において有望であるが、通常は単純なタスクでのみ優れている。
私たちの研究は、実世界のリポジトリレベルのコード生成という、より現実的な設定でLLMを評価することに向かっています。
我々は,効率的なリポジトリレベルのコード生成に外部ツールを利用する,新しいLLMベースのエージェントフレームワークであるCodeAgentを紹介する。
論文 参考訳(メタデータ) (2024-01-14T18:12:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。