論文の概要: GraphSkillAA: Attribution-Guided Skill-Graph Updating with Targeted Validation and Rollback
- arxiv url: http://arxiv.org/abs/2609.20455v2
- Date: Wed, 23 Sep 2026 18:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.27098
- Title: GraphSkillAA: Attribution-Guided Skill-Graph Updating with Targeted Validation and Rollback
- Title(参考訳): GraphSkillAA: ターゲットバリデーションとロールバックによる属性ガイド付きスキルグラフ更新
- Abstract要約: これは、スキル選択、実行、失敗帰属、ターゲット更新、バリデーション、ロールバックに1つのアドレス可能なグラフを使用する。
GPT-5.6-solでは、GraphSKILLAAは、検索QA、LiveMath、DocVQAでそれぞれ81.5%、66.7%、91.2%に達し、各メインセッティングで最高観測値に達した。
- 参考スコア(独自算出の注目度): 14.247836319968345
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: External skills provide domain knowledge and procedures without updating model parameters, but flat collections obscure skill applicability, dependencies, and composition. Graphs organize skills into addressable nodes and explicit relations, supporting selection and composition. Yet existing skill-graph methods use this structure mainly for retrieval, rather than to localize updates, scope retesting, or precisely roll back rejected changes. We introduce GRAPHSKILLAA (GraphSkill Abductive Attribution), which uses one addressable graph for skill selection, execution, failure attribution, targeted updating, validation, and rollback. Nodes separate applicability, execution, and exclusion conditions; typed edges encode prerequisite and enhancement relations. The frozen student records used nodes and edges, while the teacher contrasts related successes and failures to route each supported repair to the smallest relevant field or relation; execution lapses or insufficient evidence leave the graph unchanged. A Local Gate retests affected examples, while a Big Gate evaluates the merged graph on the complete update pool; rejected changes are rolled back. With GPT-5.6-sol, GRAPHSKILLAA reaches 81.5%, 66.7%, and 91.2% on SearchQA, LiveMath, and DocVQA, respectively, and attains the highest observed mean in every main setting. These results show that object-level attribution and graph-scoped validation make a skill graph a locally optimizable, testable, and reversible external state.
- Abstract(参考訳): 外部スキルはモデルパラメータを更新せずにドメインの知識とプロシージャを提供しますが、フラットコレクションは、スキルの適用性、依存関係、コンポジションを曖昧にします。
グラフは、アドレス可能なノードと明示的な関係にスキルを編成し、選択と構成をサポートする。
しかし、既存のスキルグラフ手法では、更新のローカライズやスコープの再テスト、拒否された変更の正確なロールバックではなく、主に検索にこの構造を使用している。
本稿では、GraphSKILLAA(GraphSkill Abductive Attribution)を紹介し、スキル選択、実行、障害属性、ターゲット更新、バリデーション、ロールバックに1つのアドレス可能なグラフを使用する。
ノードは適用性、実行、除外条件を分離する。
凍結した学生の記録はノードとエッジを使用し、教師は関連する成功と失敗を対比して、支援された各修復を最小の関連分野または関係にルートする。
Local Gateは影響した例を再テストし、Big Gateは完全な更新プールのマージグラフを評価し、拒否された変更はロールバックされる。
GPT-5.6-solでは、GraphSKILLAAは、検索QA、LiveMath、DocVQAでそれぞれ81.5%、66.7%、91.2%に達し、各メインセッティングで最高観測値に達した。
これらの結果は、オブジェクトレベルの属性とグラフスコープによる検証が、スキルグラフを局所的に最適化可能で、テスト可能で、可逆な外部状態にすることを示している。
関連論文リスト
- SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents [58.87681796862133]
我々は経済的なレンズを通してスキルの書き直しを勉強する。
我々のフレームワークは、情報保存戦略を用いて、スキル構造をプロファイルし、スキルを書き換える。
SkillsBenchの実験は、戦略間の異なる品質とコストのトレードオフを明らかにしている。
論文 参考訳(メタデータ) (2026-06-08T12:36:51Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - SkillsInjector: Dynamic Skill Context Construction for LLM Agents [16.631471381875816]
既存の方法では、静的なステップとしてスキルインジェクションを扱い、一定の基準でスキルを選択し、事前に予算を固定し、説明をそのまま残します。
本稿では,これらの決定に共同で対処する2段階適応手法であるSkillsInjectorを提案する。
Tau2-bench、SkillsBench、ALFWorldで、SkillsInjectorは最強のベースラインを3.9点、6.1点、7.3ポイント改善した。
論文 参考訳(メタデータ) (2026-05-28T11:44:32Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries [17.05120726889683]
グループ・オブ・スキルズ(Group of Skills)は、エージェントが対象とする検索対象をフラットなスキルリストからコンパクトなロールラベル付き実行コンテキストに変更する推論時グループ構造化検索手法である。
GoSkillsは、型付きスキルグラフからアンカー中心のスキルグループを構築し、グループグラフを通じてサポートグループを拡張し、スタート、サポート、チェック、回避フィールドとの固定実行契約をレンダリングする。
SkillsBenchとALFWorldの実験によると、GoSkillsは小さなスキル予算の下で可視的要求カバレッジを保ち、フラットなスキルアクセスベースラインよりも改善し、報酬とエージェントのみのランタイムを相対的に改善する。
論文 参考訳(メタデータ) (2026-05-07T21:51:59Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。