論文の概要: Protocol Compression Changes Which Party Pays: Bilateral Cost in Cross-Organization LLM Agent Communication
- arxiv url: http://arxiv.org/abs/2609.06129v1
- Date: Sat, 05 Sep 2026 14:54:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:39:50.884989
- Title: Protocol Compression Changes Which Party Pays: Bilateral Cost in Cross-Organization LLM Agent Communication
- Title(参考訳): 当事者が支払うプロトコル圧縮の変化: クロスオーガナイゼーション LLM エージェント通信におけるバイラテラルコスト
- Abstract要約: 圧縮記法は、障害解析が余分なモデル呼び出しを強制する場合、全体のベースラインに対してトークンを8%から11%上昇させることができる。
当事者は135の対話のうち121のプロトコルに同意します。
20番から70番までの地平線は、条件付き会計の下でのみ低く、全てのイングランドのセッションの上に置かれる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agents that talk across organizations exchange long messages billed by the token. A shorter notation therefore looks like a saving that costs nothing but an agreement to use it. Recent work reports the saving is conditional. Compressed notation can instead raise total tokens by 8% to 11% over a JSON baseline, when parsing failures force extra model calls. That is measured for one payer. Between two organizations neither side can install a decoder at the other end, and each pays under its own tokenizer, price, and cache state. We measure both sides. A preregistered token-level study covered 198 content-matched item pairs across six vendors, for 2,376 native-usage cells. We then overlay an English baseline, runtime schema negotiation followed by compression, and injected-schema compression on a two-party procurement bargain with an exactly enumerated feasible set. The overlay covers 1,053 completed dialogues of a 1,215-cell grid across 3 model pairs, plus a 405-dialogue rerun of the negotiated condition. Compression amplifies cross-vendor cost dispersion by a factor of 1.078, with a 95% CI of [1.066, 1.091], and two vendor pairs reverse which endpoint is cheaper. Runtime negotiation succeeds as a protocol and fails as a bargain. The parties agree a schema in 121 of 135 headline dialogues, none of them the schema we would have supplied. They settle the task in only 9 of those dialogues, and they reach impasse in 106 of them. The negotiated sessions average 10.8 turns against 17.6, and cost 52% of the English total because sessions end sooner, not because the handshake is repaid. Break-even horizons run from 20 to 70 turns, the low end only under the conditional accounting, and all of them lie above every observed English session. On one cross-vendor pair both parties keep about half their cost. On the other the receiving party pays more at a high cache-hit rate.
- Abstract(参考訳): 組織全体で話すエージェントは、トークンによって請求された長いメッセージを交換します。
そのため、短い表記法は、それを使うための合意にしか費用がかからない貯蓄のように見える。
最近の報告では貯蓄が条件となっている。
圧縮記法は、フェール解析が余分なモデル呼び出しを強制する場合に、JSONベースラインに対して合計トークンを8%から11%高めることができる。
それは一人の給料で測られる。
2つの組織間では、どちらの側もデコーダを他の端にインストールすることができず、それぞれが独自のトークン、価格、キャッシュ状態の下で支払いを行う。
両面を測る。
事前登録されたトークンレベル調査では、6つのベンダーで198のコンテントマッチングアイテムペアをカバーし、2,376のネイティブ使用細胞をカバーした。
次に、英語のベースラインをオーバーレイし、実行時スキーマ交渉を行い、その後に圧縮を行い、正確に列挙可能な集合を持つ2当事者の調達バルゲインにスキーマ圧縮を注入する。
オーバーレイは3つのモデルペアにまたがる1,215セルグリッドの1,053の完成対話と、交渉された条件の405の対話再実行をカバーしている。
圧縮は、[1.066, 1.091]の95%CIと、2つのベンダーペアでエンドポイントが安くなるように、ベンダー間のコスト分散を1.078の係数で増幅する。
実行時交渉はプロトコルとして成功し、取引として失敗する。
当事者は135の見出し対話のうち121のスキーマに同意します。
彼らはこれらの対話のうち9つでタスクを決着させ、そのうち106つで失敗に終わる。
交渉されたセッションは平均で10.8回対17.6回であり、セッションが早く終わるのはハンドシェイクが返済されたからではなく、イングランド全体の52%の費用がかかる。
20番から70番までの地平線は、条件付き会計の下でのみ低く、全てのイングランドのセッションの上に置かれる。
1つのクロスベンダーペアでは、両者が約半分のコストを保っている。
一方、受信側は高いキャッシュヒットレートで支払う。
関連論文リスト
- Fixed-order postselected CHSH reference acquisition for parity-constrained spatial-mode qubits on a commercial cloud photonic processor [0.0]
我々は,Quandelaの商用クラウドアクセス可能なベレノスプロセッサ上で,2つの符号化されたフォトニックキュービットに対して,Clauser-Horne-Shimony-Holt (CHSH) の取得と報告を行う。
各論理キュービットは、8モードの単一光子レジスタの7次元ゼロサムセクターにおける2次元空間モード部分空間である。
論文 参考訳(メタデータ) (2026-08-13T01:08:02Z) - Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Token Reduction Is Not Cost Reduction [0.0]
再建した4成分の約87%に占めるコスト構成は,急激なキャッシュトラフィックが支配的であった。
ローカルペイロードの削減は、エンドツーエンドの請求コストの信頼できる予測器ではなかった。
本稿では,トークンの削減のみではなく,成功調整請求コストによる文脈還元システムの評価を提案する。
論文 参考訳(メタデータ) (2026-07-13T21:10:22Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation [0.0]
AIエージェントとの長い会話は、あるユーザにとって単純な問題を生み出します。
本研究では,個人化されたエージェントメモリについて検討する。あるユーザのエージェントとの会話履歴を,後続検索のためのコンパクトな検索層に抽出する。
6つのソフトウェアエンジニアリングプロジェクトから4,182件の会話(14,340件の交換)を適用すれば、平均交換長が371件から38件に短縮され、11倍の圧縮が得られる。
論文 参考訳(メタデータ) (2026-03-13T14:21:58Z) - OneLatent: Single-Token Compression for Visual Latent Reasoning [12.825780556445892]
我々は、レンダリングされたCoT画像とDeepSeek-OCR隠蔽状態の監督を通じて、中間推論を単一の潜在トークンに圧縮するフレームワークであるtextbfOneLatentを提案する。
ベンチマーク全体では、OneLatentはテキストCoTと比較して平均出力長を21時間で削減し、平均精度は2.21%しか低下しない。
長鎖論理推論では、OneLatentはProntoQAで99.80%、ProsQAで9.80%、遅延トークンで8.7.4times$に達する。
論文 参考訳(メタデータ) (2026-02-14T12:03:28Z) - AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents [0.0]
70ビリオンパラメータモデルを使用した1セッションは、クラウドコンピューティングの料金が約127ドルである。
本稿では,タスク認識型動的圧縮によってこの問題に対処するフレームワークであるAgentCompressを提案する。
計算コストは68.3%減少し、当初の成功率の96.2%を維持した。
論文 参考訳(メタデータ) (2026-01-08T18:13:46Z) - Language of Bargaining [60.218128617765046]
我々は、言語の使用が二国間交渉をどのように形成するかを研究するための新しいデータセットを構築した。
我々の研究は、交渉の結果を予測する言語信号も明らかにしている。
論文 参考訳(メタデータ) (2023-06-12T13:52:01Z) - Vcc: Scaling Transformers to 128K Tokens or More by Prioritizing
Important Tokens [65.4435926060951]
本稿では,超長周期の変換器の効率を,各層でより小さな表現に圧縮することで向上することを提案する。
我々のアルゴリズムは効率的であるだけでなく(4Kと16Kのベースラインに比べて3倍以上の効率向上を達成する)、多数のタスクで競合/ベターパフォーマンスを提供する。
論文 参考訳(メタデータ) (2023-05-07T10:32:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。