論文の概要: Loop-Back Authority in LLM Agent Teams: A Paired Experiment on Flat and Hierarchical Coordination
- arxiv url: http://arxiv.org/abs/2609.14767v1
- Date: Sun, 13 Sep 2026 19:58:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.964701
- Title: Loop-Back Authority in LLM Agent Teams: A Paired Experiment on Flat and Hierarchical Coordination
- Title(参考訳): LLMエージェントチームのループバックオーソリティ:フラットおよび階層的コーディネーションに関するペア実験
- Abstract要約: 階層的なオーケストレーションでは、マネージャエージェントがワーカーの出力をレビューし、それをリビジョンのために送信することができる。
我々は,5つのLLMエージェント,その役割,プロンプト,ツール,モデル,およびデータを固定し,ひとつのリンクを変更可能なペア実験を提案する。
43のペア製品と86のランニングで、ビジネスインテリジェンスレポートタスク、5モデル審査パネル、決定論的仕様チェックがレポート毎にスコアされる。
フラットな組織は、実用性(d = 0.42, p = 0.009)と高いスコアを得る。
- 参考スコア(独自算出の注目度): 0.09999629695552194
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hierarchical orchestration, in which a Manager agent reviews worker output and can send it back for revision, is the default coordination pattern in production multi-agent LLM frameworks. Classical organizational theory predicts that the authority link speeds convergence on decisive output; work on sycophancy and Degeneration-of-Thought predicts that authoritative critique makes LLM output worse. Prior comparisons vary whole frameworks on tasks with checkable answers, leaving the authority link untested on open-ended work. We present a paired experiment that holds five LLM agents, their roles, prompts, tools, models, and data fixed and varies one link: whether the Manager may reject a worker's output and oblige a revision. Across 43 paired products and 86 runs of a business-intelligence reporting task, a five-model judge panel and a deterministic specification check score every report. The flat organization scores higher on Utility (d = 0.42, p = 0.009) and on Writing Clarity (d = 0.34, p = 0.030); the classical prediction fails. The reports are the same length, but hierarchical reports hedge 53% more, each revision loop is associated with a 0.14-point drop in Writing Clarity, and the hierarchical Writer's first draft is indistinguishable from the flat report: the gap opens inside the revision loop. Specification accuracy is at ceiling in both organizations, and the supervisory tier costs 51.5% more tokens for no quality gain. A supervisor pays for itself when it can verify and becomes a liability when it can only opine.
- Abstract(参考訳): 階層的なオーケストレーションでは、マネージャエージェントがワーカーの出力をレビューし、それをリビジョンのために送信することができる。
古典的な組織理論では、権威リンクは決定的なアウトプットの収束を早めると予測されている。
以前の比較では、チェック可能な回答を持つタスクのフレームワーク全体が異なり、オーソリティリンクは未検証のオープンエンドな作業に残されている。
我々は,5つのLLMエージェント,その役割,プロンプト,ツール,モデル,およびデータを固定し,ひとつのリンクを変更可能なペア実験を提案する。
43のペア製品と86のランニングで、ビジネスインテリジェンスレポートタスク、5モデル審査パネル、決定論的仕様チェックがレポート毎にスコアされる。
フラットな組織は、実用性 (d = 0.42, p = 0.009) と、文章の明確さ (d = 0.34, p = 0.030) でスコアを上げ、古典的な予測は失敗する。
レポートの長さは同じだが、階層的なレポートはさらに53%増加し、各リビジョンループは書き込みの明確さの0.14ポイントドロップと関連付けられ、階層的なWriterの最初のドラフトはフラットなレポートと区別できない。
仕様の正確さは両組織とも天井にあり、監督層は品質向上のためにトークンを51.5%増やしている。
監督官は、検証可能であれば自費で支払い、オペインのみを課すことができれば負債となる。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep [0.3384279376065155]
このパイロットは、逆電荷による境界境界VAT決定の選択について研究する。
アクティビティサーフェスを固定する(サブタスク、ツール、I/Oスキーマ、検証チェック、オーケストレータ、ベースモデル、マージポリシー)。
プログラムは40ケースのメインスイープ、マッチしたトケンアーム、エージェントカウント効果から即時予算を分離する3つの失敗インジェクションアームを含む4,400回に及ぶ。
論文 参考訳(メタデータ) (2026-08-24T15:40:15Z) - Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework [0.3867363075280543]
提案するクローズドループフレームワークでは,すべてのレビューコメントを永続的な行動規則として符号化する。
このフレームワークは、バージョン管理された命令ファイル、自己レビューチェックリスト、自動検証に設定された蓄積ルールを組み合わせる。
我々のフレームワークは、重み付けの更新なしに永続的なクロスセッション学習を実現し、既存のベンチマークが測定しない経験的な次元(時間とともに振る舞いの整合性)に対処する。
論文 参考訳(メタデータ) (2026-07-13T21:13:46Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents [0.9924185669370708]
CLQTはクローズドループ取引の評価をランキングではなく診断として再設定する。
CLQTは、完全にクローズドループで、コストを意識し、戦略に一貫性があり、時間的に制限された環境である。
論文 参考訳(メタデータ) (2026-06-29T04:26:30Z) - Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks [0.0]
確率的検証パターン(自己整合性投票、レビュアー LLM アンサンブル)は、人工物ではなく、判断を生成する。
Pramana は、ワイヤフォーマットの欠如を定義している。すべての連続エージェント出力は、タイプ付き ClaimAttestation でラップされ、4つの変種のうちの1つでラップされる。
プラマナは3つの対称性を再現したモデル(38,563個の到達可能な状態、0個の不変な違反)でTLCの下で徹底的に検証された。
論文 参考訳(メタデータ) (2026-05-19T17:00:33Z) - Same Signal, Different Semantics: A Cross-Framework Behavioral Analysis of Software Engineering Agents [28.650582699234402]
ソフトウェア工学エージェントの行動研究は、どの軌道形状がより高い分解率と相関するかという操作規則を抽出する。
それぞれのルールは典型的には単一のフレームワークから派生しており、それが構造的に異なるエージェント設計への署名と大きさの移行が直接テストされていない。
我々は、各層を順番に固定することでLCM効果からフレームワーク効果を分離し、構成毎に1つの振る舞い・アウトカム効果を測定する。
論文 参考訳(メタデータ) (2026-05-18T12:49:18Z) - Logic-Regularized Verifier Elicits Reasoning from LLMs [63.65875399266337]
論理規則で正規化された教師なしの検証器であるLOVERを提案する。
ローバーは、定理を二項潜在変数として扱い、内部の活性化を活用し、3つの論理的制約を課す。
ローバーは教師なしのベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-05-07T09:03:49Z) - Maestro: Joint Graph & Config Optimization for Reliable AI Agents [53.71882250666667]
Maestro は LLM エージェントのための全体論的に依存しないフレームワークであり、エージェントの品質を最大化するためにグラフや構成を共同で検索する。
IFBenchとHotpotQAのベンチマークでは、MIPROv2、GEPA、GEPA+といった主要なプロンプトを平均12%--4.9%、それぞれ4.86%上回っている。
論文 参考訳(メタデータ) (2025-09-04T20:00:37Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。