論文の概要: Pomona: Continuous Code Quality Improvement via Small, Automated Changes at Bloomberg
- arxiv url: http://arxiv.org/abs/2606.06752v1
- Date: Thu, 04 Jun 2026 22:31:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-08 14:33:29.468267
- Title: Pomona: Continuous Code Quality Improvement via Small, Automated Changes at Bloomberg
- Title(参考訳): Pomona: Bloombergの小さな自動変更による継続的コード品質改善
- Abstract要約: Pomonaは軽量なエージェントツールで、発見とインクリメンタルな修復のサイクルを自動化する。
チームでの1ヶ月の展開と10人のシニアエンジニアに配布されたアンケートにより, Pomonaを評価した。
調査対象となったエンジニアの8/10は、Pomonaの採用を望んでおり、小さな差分サイズを賞賛し、コード品質の改善に重点を置いている。
- 参考スコア(独自算出の注目度): 3.9992305963821244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this short experience paper, we present Pomona, a lightweight agentic tool that utilises agent skills for continuous automated code quality improvement. Inspired by the philosophy of Kaizen(TM), Pomona automates a cycle of discovery and incremental repair: a Scanning skill identifies improvement tasks (e.g., linting violations, technical debt markers, and test gaps) and prioritises them in a structured backlog, while a Repair skill generates tiny pull requests (PRs) targeting ~10 lines of diff. This human-in-the-loop design enables frequent, low-risk improvements while maintaining engineer trust and productivity and reducing technical debt. We evaluated Pomona through a one-month deployment in a team and a questionnaire distributed to 10 senior engineers. Our preliminary results are promising: 15 of 17 generated PRs were successfully merged with a median time-to-close of under 2 hours. Furthermore, 8/10 of surveyed engineers expressed a desire to adopt Pomona, praising small diff sizes and Pomona's focus on improving code quality. We conclude by discussing actionable insights for researchers and practitioners on strategies for effective agentic deployment in industry.
- Abstract(参考訳): 本稿では、エージェントスキルを活用して、継続的自動コード品質改善を実現する軽量なエージェントツールであるPomonaを紹介する。
スキャンスキルは、改善タスク(例えば、リンティング違反、技術的負債マーカー、テストギャップ)を特定し、それらを構造化されたバックログに優先順位付けし、修復スキルは、約10行の差分をターゲットとした小さなプルリクエスト(PR)を生成する。
このHuman-in-the-loop設計は、エンジニアの信頼と生産性を維持しながら、頻繁でリスクの低い改善を可能にし、技術的負債を軽減します。
チームでの1ヶ月の展開と10人のシニアエンジニアに配布されたアンケートにより, Pomonaを評価した。
17件のPRのうち15件を中央値の2時間以内の時間にマージした。
さらに、調査対象となったエンジニアの8/10は、Pomonaの採用を望んでおり、小さな差分サイズと、コード品質の改善に重点を置いているPomonaを賞賛している。
我々は,産業における効果的なエージェント展開戦略について,研究者や実践者にとって実行可能な洞察を議論することで結論付けた。
関連論文リスト
- CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents [66.9575676266637]
大規模言語モデル(LLM)エージェントは、長期的、インタラクティブでステートフルな環境にますますデプロイされている。
これらの設定では、間違った購入を返金するなどの1つの間違ったアクションは、不可逆なタスクの失敗を引き起こし、実行前にインターセプトされなければならない。
CASTは、スパースタスクの結果を批判学習と政策最適化のためのアクションレベル監視に変換する、批判に意識したトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-08-31T01:59:51Z) - Self-evolving Agentic Customer Support System at LinkedIn [6.687642783904948]
本稿では,LinkedInの自己進化型エージェント支援システムについて紹介する。
検索強化ジェネレーションと進化的オートプロンプティングを統合している。
システムはプロンプト、検索、評価をクローズドループ、バージョン付きワークフローとして扱う。
論文 参考訳(メタデータ) (2026-08-10T20:51:18Z) - TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization [57.14479960309637]
コーディングエージェントは、多くの下流タスクでコード生成を加速するためにますます使われています。
その価値にもかかわらず、エージェント生成コードは、対応する人間による実装よりも大きく、冗長である傾向がある。
原因はエージェント自身の検索プロセスにあることを示す。
論文 参考訳(メタデータ) (2026-07-20T17:06:19Z) - Latent Programming Horizons in Coding Agents [6.8463578914435645]
ソフトウェアエンジニアリングタスクを解決するコーディングエージェントは、コードの推論、編集、テストの実行に数十ステップを費やしている。
符号化エージェントによる言語モデルの残余ストリームは、進化するプログラムの特性を線形にエンコードすることを示す。
将来の編集結果を予測するために訓練されたプローブは、パフォーマンスを最大25ステップまで向上させる。
論文 参考訳(メタデータ) (2026-07-06T15:08:26Z) - RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents [0.0]
RigorBenchは、AIコーディングエージェントのプロセス規律を測定する最初のベンチマークである。
プランニングフィデリティ、検証カバレッジ、回復効率、吸収品質、原子遷移積分の5つの柱にまたがるハーネスを評価している。
その結果,構造化プロセスの規律はプロセス品質のスコアを平均41%向上させ,下流結果の正しさを17%向上させることがわかった。
論文 参考訳(メタデータ) (2026-06-21T21:41:34Z) - Playful Agentic Robot Learning [108.08954330298549]
本研究では,実演型プログラミングエージェントが,下流のタスクが到着する前に,連続的なスキル学習段階として自己指導型プレイを使用する,遊び型エージェントロボット学習について検討する。
RATは、新しい学習可能な探索タスク、ロボットコードポリシーの計画と実行、中間的な進捗の検証、失敗の診断、密集したステップレベルのフィードバックによる検索、そして成功した実行を永続的なコードスキルライブラリに蒸留することを提案する。
論文 参考訳(メタデータ) (2026-06-17T17:55:23Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - El Agente Forjador: Task-Driven Agent Generation for Quantum Simulation [7.535793342235731]
El Agente Forjadorは、ユニバーサルコーディングエージェントが自律的にフォークし、検証し、再利用するマルチエージェントフレームワークである。
ツール生成と再利用のフレームワークがベースラインの精度を継続的に向上することを示す。
論文 参考訳(メタデータ) (2026-04-16T04:28:56Z) - AI-Assisted Unit Test Writing and Test-Driven Code Refactoring: A Case Study [0.0]
本稿では、自動単体テスト生成とその後の安全な反復に符号化モデルを用いるケーススタディを提案する。
数週間ではなく数時間で16,000行近い信頼性の高い単体テストを生成し、クリティカルモジュールで最大78%のブランチカバレッジを実現し、大規模なイテレーションでリグレッションリスクを著しく低減しました。
論文 参考訳(メタデータ) (2026-04-03T15:54:43Z) - The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase [0.0]
統合信頼モデル上に構築された自律的自己進化型ソフトウェアのためのフレームワークであるKitchen Loopを紹介します。
285以上のイテレーションで2つのプロダクションシステムにまたがって検証を行い、レグレッションオラクルによって検出されたゼロレグレッションで1,094以上のマージプルリクエストを生成しました。
論文 参考訳(メタデータ) (2026-03-26T17:45:00Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework [4.782965804438204]
大規模言語モデル(LLM)は、科学的コード生成を自動化する可能性を示しているが、信頼性、エラーの伝播、評価において課題に直面している。
我々は,AI for Science(AI4S)タスクを低符号プラットフォーム(LCP)の形で特別に設計したベイズ対向型マルチエージェントフレームワークを提案する。
ユーザ入力を実行可能な計画と適応テストケースに構造化するタスクマネージャ、候補ソリューションを生成するコードジェネレータ、包括的なフィードバックを提供する評価器である。
論文 参考訳(メタデータ) (2026-03-03T18:25:00Z) - Test-time Recursive Thinking: Self-Improvement without External Feedback [120.80790108733942]
TRT(Test-time Recursive Thinking)は、反復的な自己改善フレームワークである。
オープンソースモデルはAIME-25/24で100%精度に達し、LiveCodeBenchの最も難しい問題では、クローズドソースモデルは外部からのフィードバックなしで10.4-14.8ポイント改善されている。
論文 参考訳(メタデータ) (2026-02-03T04:37:37Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z) - Agentic Program Repair from Test Failures at Scale: A Neuro-symbolic approach with static analysis and test execution feedback [11.070932612938154]
我々は、さまざまなソフトウェア製品にまたがる大規模なテスト失敗に基づいて、ソースコードを修正するエンジニアリングエージェントを開発した。
静的解析とテストの失敗を通じてエージェントにフィードバックを提供し、ソリューションを洗練できるようにします。
3ヶ月の間に、生成された修正の80%がレビューされ、そのうち31.5%が着陸した。
論文 参考訳(メタデータ) (2025-07-24T19:12:32Z) - CLUTR: Curriculum Learning via Unsupervised Task Representation Learning [130.79246770546413]
CLUTRは、タスク表現とカリキュラム学習を2段階最適化に分離する、新しいカリキュラム学習アルゴリズムである。
CLUTRは、CarRacingとナビゲーション環境における一般化とサンプル効率の観点から、原則的かつ一般的なUED手法であるPAIREDよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-10-19T01:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。