論文の概要: BONSAI: Evolvability-Guided Tree Search over Skills
- arxiv url: http://arxiv.org/abs/2608.07056v1
- Date: Fri, 07 Aug 2026 10:04:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.459801
- Title: BONSAI: Evolvability-Guided Tree Search over Skills
- Title(参考訳): BONSAI: 進化可能性でガイドされた木をスキルで探す
- Authors: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi,
- Abstract要約: スキル(英: skill)とは、凍結されたエージェントを操縦する自然言語の文書で、重量を更新できないので、エージェントが欠くあらゆる能力は散文で提供されなければならない。
BONSAIは文書空間の領域のキャパシティを進化させることによって、さらなる変異の下で実行可能な変動を生み出す新しいスキル最適化フレームワークである。
- 参考スコア(独自算出の注目度): 0.05131152350448099
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: A skill is a naturallanguage document that steers a frozen agent whose weights cannot be updated so any capability the agent lacks must be supplied in prose Optimising a skill is therefore optimising text against a score and the standard recipe which keeps any edit that raises a heldout score is blind in a specific way a single score cannot tell a document perched on a narrow overfit spike from one resting on a broad plateau even though only the second can still be improved We introduce BONSAI a novel skilloptimisation framework that steers instead by evolvability the capacity of a region of documentspace to keep producing viable variation under further mutation a property biology treats as separate from present fitness BONSAI grows skills as a MonteCarlo search tree in which every child document is a mutation of its parent and descends it under an upperconfidence selection rule whose exploitation term blends a skills own fitness with the fitness of its mutational neighbourhood Because every child is a mutation the mean score recorded beneath a node estimates that neighbourhoods evolvability at no extra cost so the rule concentrates budget on regions that keep improving while its exploration term keeps a currently weak branch in contention BONSAI ships the single bestscoring document it finds at no cost beyond the acceptifbetter loop it replaces With a frozen 30B agent and averaged over three benchmarks BONSAI lifts heldout accuracy over the skillfree agent by 2313 points and improves on two budgetmatched baselines GEPA and SkillOpt by 387 and 397 points respectively
- Abstract(参考訳): スキルとは、凍結されたエージェントを操縦する自然言語の文書で、重量が更新できないので、エージェントが不足しているエージェントをプロスで供給する能力がなければならなくなるため、スキルの最適化はスコアに対してテキストを最適化する。そのため、ホールトアウトスコアを上昇させる編集を維持する標準的なレシピは、特定の方法では盲目である。単一のスコアは、広大な高原の狭い過剰なスパイクで固定された文書を識別できない。
関連論文リスト
- When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents [24.749287669929913]
自己進化剤は, 実行軌道から再利用可能なスキルを蒸留することによって蓄積するが, このプロセスは単調ではない。
この機能-汚染相転移を形式化し、構造的原因まで追跡する。
汚染が構造的に不可逆であることを示す: 子孫がすでに受け継いだ欠点を消すことができないという事実から、ソーススキルを除去することは、失われた性能のごく一部しか回復できない。
論文 参考訳(メタデータ) (2026-08-06T09:43:04Z) - SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation [13.350311645241225]
本稿では,仮説駆動型自己検証とエビデンス誘導木探索を併用したクローズドループフレームワークであるSkillHEXを紹介する。
SkillHEXは、フェール可能な失敗仮説を実行可能なテストに変換する。
論文 参考訳(メタデータ) (2026-08-06T05:51:02Z) - Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning [72.49938949082117]
MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MARメソッドは通常、クエリレベルのラベルやトラジェクトリレベルのリターンからルーティング決定を学習する。
効率的な適応MARのための共有操作型クレジット割り当てフレームワークであるTreeCreditを提案する。
論文 参考訳(メタデータ) (2026-08-03T14:22:23Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History [4.682850246574405]
SkillHoneは、永続的な意思決定履歴に基づく継続的エージェントスキル進化のためのハーネスである。
SkillHoneは、フィードバックを提供する評価側の証拠とスキルリビジョンをペアリングする。
我々は、エージェントが統合検索スタックを与えられない生のオープンウェブ環境で、SkillHoneをディープ検索ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-06-07T15:21:08Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Why do Random Forests Work? Understanding Tree Ensembles as
Self-Regularizing Adaptive Smoothers [68.76846801719095]
統計学で広く普及している偏りと分散還元に対する現在の高次二分法は、木のアンサンブルを理解するには不十分である、と我々は主張する。
森林は、通常暗黙的に絡み合っている3つの異なるメカニズムによって、樹木を改良できることを示す。
論文 参考訳(メタデータ) (2024-02-02T15:36:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。