論文の概要: SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis
- arxiv url: http://arxiv.org/abs/2607.27360v1
- Date: Wed, 29 Jul 2026 18:13:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.30424
- Title: SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis
- Title(参考訳): SkillMentor:学習ブラインドスポット診断によるLLMエージェントの自己進化
- Abstract要約: エージェントの自己進化は、主に行動の仕方を学ぶことに焦点を当て、能力を見渡す:エージェントが知らないものを見つけることを学ぶ。
SkillMentorは、強化学習を通じてメンターポリシーを訓練し、診断タスクを生成し、繰り返し発生する障害モードを特定し、それらを再利用可能な修正スキルにキュレートする。
AppWorldとBFCLv3全体で、SkillMentorはエグゼキュータのパフォーマンスを平均44.2%改善している。
- 参考スコア(独自算出の注目度): 27.289794818046527
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent self-evolution has primarily focused on learning how to act, while overlooking an equally important capability: learning to discover what an agent does not know. Existing approaches typically assume that failure discovery is given, focusing on how to repair failures once they are identified. We ask whether blind-spot diagnosis itself can be learned. We thus study diagnosis as an agent capability separate from execution, and exclude two alternative sources of progress: executor adaptation and human supervision. Under these constraints, performance cannot improve through executor updates or annotated examples, forcing all improvements to originate from the learned diagnostic capability. We propose SkillMentor, which trains a Mentor policy via reinforcement learning to generate diagnostic tasks, identify recurrent failure modes, and curate them into reusable corrective skills. Across AppWorld and BFCLv3, SkillMentor improves executor performance by an average of 44.2%. These results suggest that blind-spot diagnosis is a learnable capability, enabling self-evolution without updating executor weights or relying on human-curated data.
- Abstract(参考訳): エージェントの自己進化は、主に行動の仕方を学ぶことに焦点を当て、同様に重要な能力を見渡す:エージェントが知らないものを見つけることを学ぶ。
既存のアプローチは通常、障害発見が与えられると仮定し、特定されると障害の修復方法に焦点を当てる。
盲点診断自体が学べるかどうかを問う。
そこで我々は,実行から分離したエージェント能力としての診断を研究し,実行者適応と人的監督という2つの新たな進展源を除外した。
これらの制約の下では、エグゼクティブ更新やアノテーション付きの例を通じてパフォーマンスを改善することはできない。
SkillMentorは、強化学習を通じてメンターポリシーを訓練し、診断タスクを生成し、繰り返し発生する障害モードを特定し、それらを再利用可能な修正スキルにキュレートする。
AppWorldとBFCLv3全体で、SkillMentorはエグゼキュータのパフォーマンスを平均44.2%改善している。
これらの結果は、盲点診断は学習可能な能力であり、実行時の重みを更新したり、人間が計算したデータに頼ることなく自己進化を可能にすることを示唆している。
関連論文リスト
- The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents [0.12891210250935145]
LLMエージェントに手続き的スキルを加えることは、通常、タスク成功の平均的な改善によって評価される。
この指標は重要なコストを隠蔽します。
約6,000回のランでエージェントとスキルと非スキルを比較して、双方を計測する。
論文 参考訳(メタデータ) (2026-07-24T17:50:03Z) - Knowledge-Centric Self-Improvement [28.85741798328687]
自己改善型AIシステムはエージェントを、プロンプト、ハーネス、さらにはエージェント自身のコードを最適化することによって改善するオブジェクトとして扱う。
このエージェント中心のビューは、メンテナンスにコストがかかり、転送が困難になる。
我々は,エージェントが汎用的で使い捨てであるような,知識中心の自己改善という補完的パラダイムについて研究する。
論文 参考訳(メタデータ) (2026-07-21T21:38:39Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - Capability Self-Assessment: Teaching LLMs to Know Their Limits [54.08927435222828]
現代の大規模言語モデルは、体系的に自己評価能力が欠如していることが示される。
モデル本来の能力を維持しつつ自己評価を改善することを目的として,政策学習問題として定式化する。
その結果,強化学習はCSAを効果的に指導し,教師付き微調整よりも優れていた。
論文 参考訳(メタデータ) (2026-05-29T18:32:14Z) - DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations [12.048713464721665]
DemoEvolveは、進化を活用するためのデモブートストラップ付きのアプローチである。
我々はこのパラダイムを標本効率の速い適応の一形態として研究する。
DemoEvolveは、より効果的で監査可能なハーネス編集を生成する。
論文 参考訳(メタデータ) (2026-05-23T12:10:52Z) - Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents [24.279895675425077]
安全クリティカルなアプリケーションにおける身体的エージェントは、複数の相互依存能力に依存している。
障害検出と帰属を可能にする機能指向テスト手法を提案する。
論文 参考訳(メタデータ) (2026-04-28T03:08:48Z) - EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning [72.70291772077738]
エージェントのマルチターン診断能力を評価するためのベンチマークであるMed-Inquireを提案する。
次に、テスト時に効率的な診断戦略を学ぶ自己進化エージェントであるEvoClinicianを紹介する。
実験の結果,EvoClinicianは連続学習ベースラインや,メモリエージェントなどの自己進化エージェントよりも優れていた。
論文 参考訳(メタデータ) (2026-01-30T13:26:18Z) - Can Large Reasoning Models Self-Train? [51.0277533541394]
多数決投票を簡単な自己フィードバック機構として利用し、強化学習において自己学習が持続できるかどうかを検討する。
この基本的なアプローチは、モデルの推論性能だけでなく、次のRLイテレーションでより良い品質フィードバックを生成する能力も改善します。
しかし、我々の分析では、このような自己学習パラダイムの限界も明らかにしています - 自己回帰の長いRLは、報酬のハッキングにつながるため、突然、そして完全なパフォーマンスが崩壊します。
論文 参考訳(メタデータ) (2025-05-27T17:16:00Z) - Adapter Learning in Pretrained Feature Extractor for Continual Learning
of Diseases [66.27889778566734]
現在、インテリジェント診断システムには、デプロイされたばかりの新しい病気を継続的に診断する能力がない。
特に、新しい疾患のトレーニングデータを用いたインテリジェント診断システムの更新は、古い疾患の知識を壊滅的に忘れてしまう可能性がある。
ACLと呼ばれるアダプタベースの連続学習フレームワークは、新しい病気の集合を効果的に学習するために提案されている。
論文 参考訳(メタデータ) (2023-04-18T15:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。