論文の概要: FrogNano: Training a 4B Coding Agent via Online Task Synthesis
- arxiv url: http://arxiv.org/abs/2609.07925v2
- Date: Wed, 09 Sep 2026 15:35:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.505958
- Title: FrogNano: Training a 4B Coding Agent via Online Task Synthesis
- Title(参考訳): FrogNano:オンラインタスク合成による4Bコーディングエージェントのトレーニング
- Authors: Minseon Kim, Zhengyan Shi, Emiliano Penaloza, Christopher Cui, Roger Creus Castanyer, Maryam Hashemzadeh, Isadora White, Jonathan Light, Jeonghye Kim, Matheus Pereira, Darya Moldavskaya, Chinmay Singh, Fabio Vera, Baolin Peng, Xingdi Yuan, Marc-Alexandre Côté, Alessandro Sordoni,
- Abstract要約: FrogNanoは、ソフトウェアエンジニアリング(SWE)タスクに効率的かつ効果的に取り組むように設計された4Bコーディングエージェントである。
合成作業を伴う約1,500のSWE環境において、RLを介してのみ訓練される。
- 参考スコア(独自算出の注目度): 61.25325155871018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present FrogNano, a 4B coding agent designed to tackle software engineering (SWE) tasks efficiently and effectively, even under resource-constrained environments. It is post-trained exclusively via RL on around 1,500 SWE environments with synthetic tasks. A key ingredient for improving performance is an online task synthesis pipeline that creates tasks calibrated to the frontier of learnability for the current checkpoint. This report provides evidence that competitive small coding agents can be trained with synthetic tasks alone, without traditional distillation from larger models, and that generating tasks at the learnability frontier of the current agent is important. We report details on the training methodology, evaluations across diverse environments, and in-depth analyses, serving as a foundation for our ongoing exploration of lightweight yet capable coding agents that can run on minimal hardware.
- Abstract(参考訳): 資源制約のある環境下であっても,ソフトウェア工学(SWE)タスクに効果的かつ効率的に取り組むように設計された4BコーディングエージェントであるFrogNanoを提示する。
合成作業を伴う約1,500のSWE環境において、RLを介してのみ訓練される。
パフォーマンス向上の鍵となる要素は、現在のチェックポイントの学習可能性の最前線に調整されたタスクを生成するオンラインタスク合成パイプラインである。
本報告は,より大規模なモデルからの伝統的な蒸留を行なわずに,競争力のある小型符号化エージェントを単独で訓練できることを示すとともに,現行エージェントの学習性最前線でのタスク生成が重要であることを示す。
トレーニング方法論,多様な環境に対する評価,詳細な分析などの詳細を報告し,最小限のハードウェア上で動作可能な軽量かつ有能なコーディングエージェントの探索の基盤として役立てる。
関連論文リスト
- AI Scientist via Synthetic Task Scaling [2.056976961583532]
機械学習エージェントを対象とした新しい合成環境生成パイプラインを提供する。
我々のパイプラインは、SWE-agentフレームワークと互換性のある機械学習の課題を自動的に合成する。
機械学習タスクのベンチマークであるMLGymに取り組む。
論文 参考訳(メタデータ) (2026-03-17T23:43:16Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - Hybrid-Gym: Training Coding Agents to Generalize Across Tasks [59.95803522351185]
本稿では,多種多様なタスク間で共有される伝達可能なスキルについて述べる。
本稿では,スケーラブルな合成タスクからなる学習環境であるHybrid-Gymを提案する。
実験により、我々の合成タスクで訓練されたエージェントが、様々な現実世界のタスクを効果的に一般化できることが示されている。
論文 参考訳(メタデータ) (2026-02-18T19:30:55Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling [71.37579508777843]
大規模言語モデル(LLM)は、複雑な推論機能を実現することによって、人工知能に革命をもたらした。
このギャップに対処するため、1000以上のドメイン分散タスク環境からなるオープンソースのフレームワークであるInternBootcampを紹介します。
論文 参考訳(メタデータ) (2025-08-12T05:00:00Z) - Logical Specifications-guided Dynamic Task Sampling for Reinforcement Learning Agents [9.529492371336286]
強化学習(Reinforcement Learning、RL)は、人工エージェントが多様な振る舞いを学習できるようにするために大きな進歩を遂げてきた。
論理仕様誘導動的タスクサンプリング(LSTS)と呼ばれる新しい手法を提案する。
LSTSは、エージェントを初期状態から目標状態へ誘導するRLポリシーのセットを、ハイレベルなタスク仕様に基づいて学習する。
論文 参考訳(メタデータ) (2024-02-06T04:00:21Z) - Environment Generation for Zero-Shot Compositional Reinforcement
Learning [105.35258025210862]
環境構成設計(CoDE)は、ジェネレータエージェントを訓練し、エージェントの現在のスキルレベルに合わせて一連の構成タスクを自動的に構築する。
我々は,複数のページや部屋からなる環境を生成することを学び,それらの環境において複雑なタスクを広範囲にこなせるRLエージェントを訓練する。
CoDEは最強のベースラインよりも4倍高い成功率を示し、3500のプリミティブタスクで学んだ実際のWebサイトのパフォーマンスを示している。
論文 参考訳(メタデータ) (2022-01-21T21:35:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。