FuguReport

Coalition-Aware Skill Reliability for Self-Evolving Agents

著者 Qiyan Zhao, Xiaofeng Zhang, Bo Liu, Minda Chen, Wei Xiong, Jingyang Chen, Guanting Ye, Wenhao Yu, Xiaosong Yuan, Shijie Han, Da-Han Wang, Jianmin Ji, Fei Huang, Xu-Yao Zhang
所属 Chinese Academy of Sciences / LongShine AI Lab / University of Science and Technology of China / The Hong Kong University of Science and Technology / Shanghai Jiao Tong University
カテゴリ Method / Skill Reliability / Reliability interventions in skill selection, Task / Multi-Agent Coordination / Coalition impact on skill contribution, Evaluation / Skill Transfer Evaluation / Label-free skill masking effect
ライセンス CC BY 4.0

Abstractの概要

本論文では、自己進化型LLMエージェントのスキルバンクに保存されたスキルが、単に集約された成果指標を向上させるだけでなく、正のメカニズム的貢献を果たしているかを調査しています。著者らはスキル・メカニスティック信頼性監査(SMRA)を通じて、バンク全体での向上が個別スキルのゼロまたは負の連合レベル貢献を覆い隠す「連合汚染」と、ソースドメインで有用だったスキルが転移後に性能を低下させる「ドメイン横断的有用性逆転」の2つの失敗モードを特定しました。これらの問題に対処するため、スキル蓄積のための連合考慮型スキル選択(CASS)と、転移後のマスキングのための教師なしスキルマスク連合オプティマイザ(u-SMCO)を提案しています。本研究は、スキルの信頼性が個々のスキル、周囲のスキルバンク、および対象となる展開ドメインの複合的な特性であることを実証しています。

新規性

本論文は、エージェントのスキルの信頼性を個々のスキルの本質的な属性ではなく、連合およびドメインに依存する特性として再定義しています。進化過程においてモンテカルロ抽出したシャープレイ限界貢献度を用いてスキルの蓄積をゲーティングするCASSと、ラベル不要なターゲットドメインの検索品質ノックアウトを用いて転移後に有用性が逆転したスキルを貪欲にマスクするu-SMCOという2つの介入手法を導入しています。

成果

LoCoMo、LongMemEval、HotpotQA、ALFWorldにわたる評価において、CASSとu-SMCOはMemSkillなどの強力な自己進化型エージェントのベースラインを一貫して上回りました。CASSは標準的な結果ベースのゲートと比較して採択する候補スキル数を大幅に抑えつつ純負の追加を回避し、u-SMCOはターゲットドメインの教師データを必要とすることなく、テストされたすべての学習済みバンクで転移性能を向上させました。

論文の注目点

  1. SMRAにより、結果のみに基づくゲートは、スキル進化時の連合汚染や転移時のドメイン横断的有用性逆転に対して構造的に盲目であることが明らかになりました。
  2. CASSは、サンプリングされた連合ノックアウトとシャープレイ限界貢献度をゲーティング機構に組み込み、連合を条件とした信頼性が検証されたスキルのみを採択します。
  3. u-SMCOは、ラベルなしターゲットドメインのクエリに対する検索品質ノックアウトを評価することで、存在自体がターゲットドメインの挙動を劣化させる転移スキルを特定しマスクします。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。