Coalition-Aware Skill Reliability for Self-Evolving Agents
Abstractの概要
本論文では、自己進化型LLMエージェントのスキルバンクに保存されたスキルが、単に集約された成果指標を向上させるだけでなく、正のメカニズム的貢献を果たしているかを調査しています。著者らはスキル・メカニスティック信頼性監査(SMRA)を通じて、バンク全体での向上が個別スキルのゼロまたは負の連合レベル貢献を覆い隠す「連合汚染」と、ソースドメインで有用だったスキルが転移後に性能を低下させる「ドメイン横断的有用性逆転」の2つの失敗モードを特定しました。これらの問題に対処するため、スキル蓄積のための連合考慮型スキル選択(CASS)と、転移後のマスキングのための教師なしスキルマスク連合オプティマイザ(u-SMCO)を提案しています。本研究は、スキルの信頼性が個々のスキル、周囲のスキルバンク、および対象となる展開ドメインの複合的な特性であることを実証しています。
新規性
本論文は、エージェントのスキルの信頼性を個々のスキルの本質的な属性ではなく、連合およびドメインに依存する特性として再定義しています。進化過程においてモンテカルロ抽出したシャープレイ限界貢献度を用いてスキルの蓄積をゲーティングするCASSと、ラベル不要なターゲットドメインの検索品質ノックアウトを用いて転移後に有用性が逆転したスキルを貪欲にマスクするu-SMCOという2つの介入手法を導入しています。
成果
LoCoMo、LongMemEval、HotpotQA、ALFWorldにわたる評価において、CASSとu-SMCOはMemSkillなどの強力な自己進化型エージェントのベースラインを一貫して上回りました。CASSは標準的な結果ベースのゲートと比較して採択する候補スキル数を大幅に抑えつつ純負の追加を回避し、u-SMCOはターゲットドメインの教師データを必要とすることなく、テストされたすべての学習済みバンクで転移性能を向上させました。
論文の注目点
- SMRAにより、結果のみに基づくゲートは、スキル進化時の連合汚染や転移時のドメイン横断的有用性逆転に対して構造的に盲目であることが明らかになりました。
- CASSは、サンプリングされた連合ノックアウトとシャープレイ限界貢献度をゲーティング機構に組み込み、連合を条件とした信頼性が検証されたスキルのみを採択します。
- u-SMCOは、ラベルなしターゲットドメインのクエリに対する検索品質ノックアウトを評価することで、存在自体がターゲットドメインの挙動を劣化させる転移スキルを特定しマスクします。