論文の概要: Copies or Sources? Measuring How LLM Aggregators Count Restated Evidence in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2610.06192v1
- Date: Mon, 05 Oct 2026 12:08:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 18:06:09.749422
- Title: Copies or Sources? Measuring How LLM Aggregators Count Restated Evidence in Multi-Agent Systems
- Title(参考訳): コーピー・ソース : マルチエージェントシステムにおけるLCMアグリゲータの検証
- Abstract要約: 大規模言語モデル上に構築されたマルチエージェントシステムは、もちろん観測を再開する。
このようなメッセージをプールするアグリゲータは、ステートメントではなく、ソースをカウントすべきである。
我々は、報告された確率を独立した読み取り単位に変換し、すべての再試行にコピーウェイトを割り当てる。
- 参考スコア(独自算出の注目度): 16.895933142289817
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-agent systems built on large language models (LLMs) restate observations as a matter of course: relays forward them, shared boards repeat them and discussion rounds echo them. An aggregator that pools such messages should count sources, not statements. We convert a reported probability into units of independent readings, which assigns every restatement a copy weight, 0 for an aggregator that counts sources and 1 for one that counts every statement, and yields the implied decision under any cost structure. Three testbeds hold the evidence fixed and vary how it is restated: message logs with an exact Bayesian oracle, web documents with appended copies, and logs written by LLM agent teams under four communication protocols. Across four models from three providers, a forwarded copy counts for 0.06 to 0.42 of a new reading, mostly because some replies count every statement. On 5% to 40% of logs that state one reading three times, the reported belief implies an early commitment that the oracle never makes. The models that count copies least and most on controlled logs do so on web copies and agent-written logs as well. A one-paragraph declaration of what a copy contributes brings the copy weight on controlled logs to 0.08 or less. A rule that has agents refer to readings instead of restating them cuts belief-implied early commitment from 11.2% to 1.1% and preserves genuine corroboration.
- Abstract(参考訳): 大規模言語モデル(LLM)上に構築されたマルチエージェントシステムは、もちろん観察を再開する。
このようなメッセージをプールするアグリゲータは、ステートメントではなく、ソースをカウントすべきである。
我々は、報告された確率を独立した読み取り単位に変換し、すべての再試行にコピーウェイトを割り当て、ソースをカウントするアグリゲータに0、全てのステートメントをカウントするアグリゲータに1を割り当て、あらゆるコスト構造の下で命令された決定を与える。
正確なベイズ神託のメッセージログ、追加コピーのWebドキュメント、LLMエージェントチームが4つの通信プロトコルで記述したログである。
3つのプロバイダの4つのモデルで、転送されたコピーは、新しい読み込みの0.06から0.42にカウントされる。
一つが3回読んでいるというログの5%から40%で、報告された信念は、神託が決して持たない早期のコミットメントを意味している。
最小かつ最も制御されたログのコピーをカウントするモデルは、Webコピーやエージェント記述のログにも当てはまる。
コピーが何に貢献するかの1パラグラフ宣言は、制御されたログのコピー重量を0.08以下にする。
エージェントをリコールする代わりに読書を参照する規則は、信仰に根ざした早期コミットメントを11.2%から1.1%に減らし、真の確執を保っている。
関連論文リスト
- To Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals [53.517661959543894]
投機的復号法 (SD) はLarge Language Model (LLM) の推論を著しく加速した。
既存のアプローチは、ニューラルドラフトとコンテキストベースのコピーという2つのドラフト戦略の根本的なトレードオフに直面している。
既存のコピーベース手法を解析し、それらが偶然に繰り返される傾向があることを確認する。
本稿では,LLMの遅延制御信号としてコピー処理を扱う適応型フレームワークであるSwitchSDを紹介する。
論文 参考訳(メタデータ) (2026-09-17T12:51:20Z) - Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research [7.426963307811556]
本稿では,保守型ポイントインタイム知識ライブラリをレポート作成から分離する2層エージェントシステムを提案する。
ポータブルなマルチエージェント"ライター"ランタイムは、任意の知識遮断Tにおいて矛盾のないエビデンス基底レポートを構成する。
我々は,555,926枚のエビデンスカードを出力する6,130個のソースの自己収集・公開コーパスを評価した。
論文 参考訳(メタデータ) (2026-08-13T09:09:28Z) - The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation [29.747532095696965]
LLMエージェントベンチマークは、タスクの完了、信頼性、推論コストを測定するが、エージェントがディスクに残す永続的なデータではない。
AgentFootprintは、実行後のエージェントストレージフットプリントのクロスフレームベンチマークである。
論文 参考訳(メタデータ) (2026-07-13T06:44:33Z) - One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions [0.0]
APIアグリゲータ、再販業者、推論プロバイダは、大きな言語モデル(LLM)を使用する。
既存の識別技術には、長いテキスト、トークンレベルのログ確率、反対に作られたプロンプト、またはモデル所有者の協力が必要である。
我々は,LLMの行動指紋を,自明なワンワードプロンプトに対する応答の実証的分布として定義する。
論文 参考訳(メタデータ) (2026-07-11T10:34:17Z) - TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory [22.85129722207174]
矛盾の解決は書き込み時の制御であり、欠落した契約を明確にすることを示しています。
TOKIは、二重行スキーマ上での2時間演算子の1つのファミリとして、四重項をタイプする。
8つのシステムにまたがる判定行列はギャップをローカライズする: 書き込みパス上の言語モデル判断を保持するすべてのベースラインは、3つの書き込み時異常のうちの少なくとも1つを許容する。
論文 参考訳(メタデータ) (2026-06-04T14:46:52Z) - CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation [132.00910067533982]
LM世代におけるリテラルコピーと非リテラルコピーの両方を測定するために設計されたベンチマークであるCopyBenchを紹介する。
リテラル複写は比較的稀であるが、イベント複写と文字複写という2種類の非リテラル複写は、7Bパラメータのモデルでも発生する。
論文 参考訳(メタデータ) (2024-07-09T17:58:18Z) - CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation [76.31621715032558]
グラウンデッドジェネレーションは、言語モデル(LM)に、より信頼性が高く説明可能な応答を生成する能力を持たせることを目的としている。
本稿では,新しい検証フレームワークであるCaLMを紹介する。
我々のフレームワークは、より少ないパラメトリックメモリに依存する小さなLMを有効活用し、より大きなLMの出力を検証する。
論文 参考訳(メタデータ) (2024-06-08T06:04:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。