論文の概要: Small Agents with Semantic Search: Efficient Multilingual Code Localization
- arxiv url: http://arxiv.org/abs/2610.05099v1
- Date: Sun, 04 Oct 2026 10:13:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 23:26:44.031513
- Title: Small Agents with Semantic Search: Efficient Multilingual Code Localization
- Title(参考訳): 意味探索を伴う小型エージェント:効率的な多言語コード位置決め
- Abstract要約: セマンティック検索によってファイルのローカライゼーションが向上し,精度,言語間移動,推論効率が向上することを示す。
ローカルなセマンティック検索ツールであるColGREPを中心に構築されたファイルローカライゼーションエージェントのためのトレーニングフレームワークを提案する。
検索クエリを定式化し、検索されたコンテンツを検査し、関連するファイルを識別するために、20億未満のパラメータを持つ3つのモデルファミリを訓練する。
- 参考スコア(独自算出の注目度): 2.855228082831898
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Locating relevant files from natural-language requests is a core subtask for agents operating over code repositories. We investigate whether this task can be delegated to compact, specialized models to enable on-device search while reducing the token usage, latency, and inference cost of larger agents. We show that semantic search improves file localization, with gains in accuracy, cross-language transfer, and inference efficiency. To study this setting, we introduce a training framework for file-localization agents built around ColGREP, a local semantic search tool based on late-interaction retrieval models. Our recipe combines weighted supervised fine-tuning on teacher trajectories, assigning turn-level credit based on retrieval outcomes, with reinforcement learning on localization quality. We train three model families with fewer than two billion parameters to formulate search queries, inspect retrieved content, and identify relevant files. On localization tasks derived from SWE-bench Lite and Multi-SWE-bench Flash, ColGREP-equipped agents substantially improve over their base models and outperform corresponding GREP-based agents. In addition to improving localization accuracy, ColGREP reduces mean end-to-end trajectory latency by 44.1\% on CPU while using 29.1\% fewer tokens, and enables better generalization to programming languages unseen during fine-tuning. These results suggest that compact, tool-specialized localization agents can provide an efficient interface between natural-language requests and large codebases.
- Abstract(参考訳): 自然言語リクエストから関連するファイルを配置することは、コードリポジトリ上で操作するエージェントのコアサブタスクである。
トークンの使用量,レイテンシ,推論コストを削減しつつ,デバイス上での検索を可能にするために,このタスクをコンパクトで特殊なモデルに委譲できるかどうかを検討する。
セマンティック検索によってファイルのローカライゼーションが向上し,精度,言語間移動,推論効率が向上することを示す。
そこで本研究では,後期対話検索モデルに基づくローカルセマンティック検索ツールであるColGREPを中心に構築されたファイルローカライゼーションエージェントのトレーニングフレームワークを提案する。
本手法は,教師軌跡の微調整を重み付けし,検索結果に基づくターンレベル信用と,ローカライゼーション品質に基づく強化学習を組み合わせたものである。
検索クエリを定式化し、検索されたコンテンツを検査し、関連するファイルを識別するために、20億未満のパラメータを持つ3つのモデルファミリを訓練する。
SWE-bench LiteとMulti-SWE-bench Flashから派生したローカライゼーションタスクにおいて、ColGREPを組み込んだエージェントはベースモデルを大幅に改善し、対応するGREPベースのエージェントより優れている。
ColGREPは、ローカライズ精度の改善に加えて、平均的なエンドツーエンドの遅延時間を、29.1\%のトークンを使用してCPU上で44.1\%削減し、微調整中に見つからないプログラミング言語へのより良い一般化を可能にする。
これらの結果から,コンパクトなツール特化ローカライズエージェントが,自然言語要求と大規模コードベース間の効率的なインターフェースを提供する可能性が示唆された。
関連論文リスト
- GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search [53.40810298627443]
ReGUIDEは、MLLMが自己生成的推論と空間認識的批判を通じてデータを効率的に学習することを可能にするWebグラウンドのためのフレームワークである。
実験により、ReGUIDEは複数のベンチマークでWebグラウンド性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-05-21T08:36:18Z) - A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios [43.8734658237949]
クロスビューなジオローカライゼーションは大規模ローカライゼーション問題に対する有望な解決策である。
本稿では,新しい階層的ジオローカライゼーションフレームワークUnifyGeoを提案する。
タスク分離設定とタスク関連設定の両方において、UnifyGeoは最先端の処理性能を大きく上回ることを示す。
論文 参考訳(メタデータ) (2025-05-12T14:44:31Z) - LocAgent: Graph-Guided LLM Agents for Code Localization [25.395102705800916]
LocAgentは、グラフベースの表現を通じてコードのローカライゼーションに対処するフレームワークである。
細調整したQwen-2.5-Coder-Instruct-32Bモデルを用いて,SOTAプロプライエタリモデルと比較して,コストを大幅に削減した。
論文 参考訳(メタデータ) (2025-03-12T05:55:01Z) - AgentRE: An Agent-Based Framework for Navigating Complex Information Landscapes in Relation Extraction [10.65417796726349]
複雑なシナリオにおける関係抽出(RE)は、多種多様な関係型や単一の文内のエンティティ間のあいまいな関係のような課題に直面します。
本稿では,複雑なシナリオにおいてREを実現するために,大規模言語モデルの可能性を完全に活用するエージェントベースのREフレームワークであるAgentREを提案する。
論文 参考訳(メタデータ) (2024-09-03T12:53:05Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。