論文の概要: Relic: From Multi-Agent Collaboration to Persistent Organizational Capability
- arxiv url: http://arxiv.org/abs/2609.32965v2
- Date: Tue, 29 Sep 2026 02:47:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.631916
- Title: Relic: From Multi-Agent Collaboration to Persistent Organizational Capability
- Title(参考訳): Relic: マルチエージェントコラボレーションから永続的な組織能力へ
- Abstract要約: 繰り返し発生するコラボレーションの失敗を組織所有の実行可能なプロトコルに変えるRelicを紹介します。
メンバーは目に見える仕事を反映し、ルールを提案し、採用を管理します。
新たなメンバ転送では、動作の正確性は25.4%で、継承されたプロトコルが無く、34.6%が可読性テキストと同じルールで、41.2%が実行可能バインディングである。
- 参考スコア(独自算出の注目度): 37.80629799707573
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multiple agents may often conflict in an organization: for example, one coding agent changes an interface in a repository, but another continues to develop on the old version where existing tests become stale. A conversation can resolve the episode, but when the participants change, what makes the lesson continue to govern the team? We introduce Relic, which turns recurring collaboration failures into organization-owned, executable protocols. Members reflect on visible work, propose rules, and govern their adoption. Adopted protocols bind triggers, responsibilities, required evidence, and execution consequences to the runtime, while remaining open to revision and retirement. In one traced case, repeated integration friction produces an interface-review rule that governs later pull requests and is revised as work continues. Across 360 controlled runs over ten software workloads and three models, Relic raises complete-contract delivery from 14.06% to 19.76% (+5.71 percentage points) over a matched structured team without the protocol lifecycle, improving all four verified production endpoints in every model stratum. Under fresh-member transfer, behavioral correctness is 25.4% with no inherited protocol, 34.6% with the same rules provided as readable text, and 41.2% with executable bindings, a +6.5-point advantage over text alone. On the full CooperBench benchmark, after excluding 183 broken benchmark pairs, Relic achieves 371/469 (79.1%), establishing the best reported result among peer-structured systems. On the 47-pair same-model subset, Relic also exceeds Solo (28/47 vs. 26/47), reversing the coordination loss exhibited by the official peer baseline. Together, these results show how collaboration experience can become persistent organizational state that remains useful beyond the members who created it.
- Abstract(参考訳): 例えば、あるコーディングエージェントは、リポジトリ内のインターフェイスを変更しますが、別のエージェントは、既存のテストが不安定になった古いバージョン上で開発を続けます。
会話はエピソードを解決できるが、参加者が変わると、どのような教訓がチームを支配し続けるのか?
繰り返し発生するコラボレーションの失敗を組織所有の実行可能なプロトコルに変えるRelicを紹介します。
メンバーは目に見える仕事を反映し、ルールを提案し、採用を管理します。
採用されているプロトコルは、トリガ、責任、必要なエビデンス、実行結果をランタイムにバインドするが、リビジョンとリタイアにはオープンである。
あるトレースされたケースでは、繰り返し統合される摩擦は、後続のプルリクエストを管理し、作業が継続するにつれて修正されるインターフェイス-レビュールールを生成します。
360を超える制御された360は10のソフトウェアワークロードと3つのモデルを実行している。Relicは、プロトコルライフサイクルなしでマッチした構造化されたチームに対して、14.06%から19.76%(+5.71ポイント)の完全な契約デリバリを増加し、すべてのモデル層で検証された4つのエンドポイントを改善している。
新たなメンバの転送では、動作の正確性は25.4%で、継承されたプロトコルが無く、34.6%は可読性テキストと同じルールで、41.2%は実行可能なバインディングで、+6.5ポイントの利点がある。
完全な CooperBench ベンチマークでは、183個のベンチマークペアを除いた後、Relic は 371/469 (79.1%) を達成した。
47対の同モデルサブセットでは、Relic は Solo (28/47 vs. 26/47) を上回り、公式のピアベースラインによる調整損失を逆転させる。
これらの結果は、コラボレーションエクスペリエンスが永続的な組織状態になり、それを作成したメンバを超えて有用であることを示します。
関連論文リスト
- FunnelAudit: Responsibility Auditing in Multi-Route Recommender Systems [6.810073531792462]
マルチルートレコメンデータシステムは、検索、アロケーション、融合、ランキングを組み合わせることで、個別のインクルージョンと除外を監査しにくくする。
本稿では,インシデントレベルの責任監査を行うためのフレームワークであるFunnelAuditを紹介する。
我々は、固定ユニオン、重み付きクォータ割り当て、重み付き相互ランク融合を用いて、2段9ルートのファネルでフレームワークをインスタンス化し、次にSASRecランキングを付ける。
論文 参考訳(メタデータ) (2026-09-07T03:01:07Z) - SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows [5.5444120195759785]
textscReviseは構造化エージェントのきめ細かい回復に有効である。
無効な作業を止め、最初期の紛争を超えて有効に確立された進捗を保ち、影響を受けた地域のみを再計算する。
モデルコールをフルリスタートに対して40.6--56.0%、サフィックス再計算に対して31.3--43.6%削減する。
論文 参考訳(メタデータ) (2026-09-01T03:22:18Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks [0.0]
他のエージェントやエンジニアが残した部分的な状態からタスクを中断し、再割り当てし、レビューし、再開するからです。
前任者の作業が不透明あるいは不完全である場合に課される再検討コスト。
我々の乗っ取りプロトコルは、決定論的ハンドオフポイントで符号化エージェントを中断し、リポジトリを凍結し、4つのハンドオフビューで後継エージェントを評価する。
論文 参考訳(メタデータ) (2026-06-01T20:40:38Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - TraceFix: Repairing Agent Coordination Protocols with TLA+ Counterexamples [3.8706622179041745]
TraceFixは、LLM(Large Language Model)マルチエージェント調整のための検証ファーストパイプラインである。
エージェントは、タスク記述から構造化中間表現(IR)としてプロトコルトポロジを合成する。
さらに,TLA+モデルチェッカー(TLC)の逆例を用いて,検証が成功するまでプロトコルを反復的に修復する。
論文 参考訳(メタデータ) (2026-05-08T16:05:31Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。