論文の概要: Knowledge-Centric Self-Improvement
- arxiv url: http://arxiv.org/abs/2607.19592v1
- Date: Tue, 21 Jul 2026 21:38:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.93183
- Title: Knowledge-Centric Self-Improvement
- Title(参考訳): 知識中心の自己改善
- Authors: Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu, Amanda Zichang Wang, Atharva Sehgal, Eric Mazumdar, Yisong Yue,
- Abstract要約: 自己改善型AIシステムはエージェントを、プロンプト、ハーネス、さらにはエージェント自身のコードを最適化することによって改善するオブジェクトとして扱う。
このエージェント中心のビューは、メンテナンスにコストがかかり、転送が困難になる。
我々は,エージェントが汎用的で使い捨てであるような,知識中心の自己改善という補完的パラダイムについて研究する。
- 参考スコア(独自算出の注目度): 28.85741798328687
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-improving AI systems typically treat the agent as the object that improves, by optimizing prompts, workflows, harnesses, or even the agent's own code. This agent-centric view can make improvements expensive to maintain and difficult to transfer, because gains become tied to a particular agent design, task distribution, or adaptation run. We study a complementary paradigm: knowledge-centric self-improvement, in which agents remain generic and disposable while the persistent object is a curated knowledge base that agents can leverage for future tasks. We conduct controlled case studies to operationalize this idea via a simple protocol. Agents attempt one task, then contribute evidence-grounded insights to a shared knowledge base via task-level and cross-task forums, followed by knowledge distillation. Because self-improvement is contained in the knowledge rather than the agent, improvement can be more inspectable, transferable, and portable. Across abstract reasoning, coding, and terminal benchmarks, this protocol improves solve rates while reducing dollar cost relative to agent-centric baselines. The resulting distilled knowledge also transfers to held-out tasks and across LLM families, indicating that the improvement is not merely an LLM- or run-specific behavior. These results support a new view of self-improving agentic systems: progress can be driven primarily by the curated persistent knowledge. Code is available at https://github.com/recursive-knowledge/KSI.
- Abstract(参考訳): 自己改善型AIシステムは典型的にエージェントを改善対象として扱い、プロンプト、ワークフロー、ハーネス、さらにはエージェント自身のコードまで最適化する。
このエージェント中心のビューは、特定のエージェント設計、タスク分散、あるいは適応実行に結びつくため、メンテナンスが高価で、転送が困難になる。
エージェントは汎用的で使い捨てでありながら、永続オブジェクトはエージェントが将来のタスクに活用できるキュレートされた知識ベースである。
我々は、このアイデアを単純なプロトコルで運用するために、制御されたケーススタディを実行する。
エージェントはひとつのタスクを試み、その後、タスクレベルとクロスタスクフォーラムを通じて、エビデンスに基づく洞察を共有知識ベースに提供し、続いて知識蒸留を行う。
自己改善はエージェントよりも知識に含まれているので、より検査可能で、転送可能で、ポータブルである。
このプロトコルは抽象的推論、コーディング、端末ベンチマーク全体にわたって、エージェント中心のベースラインに対するドルコストを削減しながら、解決率を改善する。
得られた蒸留された知識は、保持されたタスクやLLMファミリーにも伝達され、改善は単にLLMまたは実行固有の振る舞いであることを示している。
これらの結果は,自己改善型エージェントシステムの新たな視点を支えている。
コードはhttps://github.com/recursive-knowledge/KSIで入手できる。
関連論文リスト
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents [35.45207852488779]
本稿では,ツールメモリをベースとした自己進化型エージェントフレームワークSEARLを紹介する。
インタラクションエクスペリエンスを直接利用するアプローチとは異なり,本手法では,計画と実行を統合する構造化されたエクスペリエンスメモリを構築している。
我々は,知識推論と数学タスクの枠組みを評価し,より実践的で効率的な学習を実現する上での有効性を実証した。
論文 参考訳(メタデータ) (2026-04-09T04:38:47Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - LLM Agents Beyond Utility: An Open-Ended Perspective [50.809163251551894]
我々は、事前訓練されたLLMエージェントを、自身のタスクを生成し、知識を蓄積し、その環境と広範囲に相互作用する能力で強化する。
複雑なマルチステップ命令を確実に追跡し、実行中に情報を保存、再利用し、独自のタスクを提案し、解決することができる。
迅速な設計や反復的なタスク生成に敏感であり、自己表現を形成することができない。
論文 参考訳(メタデータ) (2025-10-16T10:46:54Z) - Agentic Knowledgeable Self-awareness [79.25908923383776]
KnowSelfはデータ中心のアプローチで、人間のような知識のある自己認識を持つエージェントを応用する。
我々の実験により、KnowSelfは、外部知識を最小限に使用して、様々なタスクやモデルにおいて、様々な強力なベースラインを達成できることが実証された。
論文 参考訳(メタデータ) (2025-04-04T16:03:38Z) - Memento No More: Coaching AI Agents to Master Multiple Tasks via Hints Internalization [56.674356045200696]
本稿では,複雑なメモシステムや事前の高品質な実演データを必要としない,複数のタスクに対する知識とスキルを取り入れたAIエージェントの訓練手法を提案する。
このアプローチでは,エージェントが新たな経験を収集し,ヒントの形で人間から補正フィードバックを受け取り,このフィードバックを重みに組み込む,反復的なプロセスを採用している。
Llama-3をベースとしたエージェントに実装することで,数ラウンドのフィードバックの後,高度なモデルGPT-4oとDeepSeek-V3をタスクセットで性能向上させる手法の有効性を実証する。
論文 参考訳(メタデータ) (2025-02-03T17:45:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。