論文の概要: Retry Amplification in Distributed Systems: A Systematic Analysis of Retry Policies and Their Role in Cascading Failures
- arxiv url: http://arxiv.org/abs/2608.25403v1
- Date: Wed, 26 Aug 2026 06:04:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.611252
- Title: Retry Amplification in Distributed Systems: A Systematic Analysis of Retry Policies and Their Role in Cascading Failures
- Title(参考訳): 分散システムにおける再試行増幅:再試行政策の体系的解析とカスケード失敗における役割
- Abstract要約: 本稿では、部分的故障時にリトライポリシーが生成する追加要求量の定量化指標であるリトライ増幅係数(RAF)を紹介する。
200のオープンソースのPythonマイクロサービスプロジェクトに関する調査では、明示的な再試行ロジックが11.5%で検出されている。
予算制約による再試行は,過渡的な断層から回復しつつ,ノリトリーベースラインに近い成功率を維持していることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retry mechanisms are a standard component of resilient distributed systems, but their collective behavior, when every tier in a call path retries concurrently, is less well understood than the per-client guidance that produced them. This paper introduces the retry amplification factor (RAF), a metric quantifying the additional request volume that retry policies generate during partial failures. In a study of 200 open-source Python microservice projects, explicit retry logic is detected in 11.5%, and an audit of our own false negatives places true prevalence near 41%. Among the projects detected, 60.9% contain at least one configuration without backoff, and after manual verification exactly one of 113 production configurations randomizes its delay. We then evaluate these policies in simulation (n = 100 trials per strategy). Under correlated failures, a naive standard retry policy reduces the success rate from 55.4% to 41.5% relative to performing no retries at all. We catalog five recurring anti-patterns, propose Adaptive Retry Budgeting (ARB), and show that budget-constrained retries maintain success rates close to the no-retry baseline while still recovering from transient faults. These results indicate that retry behavior should be designed as a system-level property rather than configured locally at each call site.
- Abstract(参考訳): リトライメカニズムは、レジリエントな分散システムの標準コンポーネントであるが、コールパス内のすべての層が同時にリトライする場合、それらの集団的振る舞いは、それらを生成するクライアント毎のガイダンスよりもよく理解されていない。
本稿では、部分的故障時にリトライポリシーが生成する追加要求量の定量化指標であるリトライ増幅係数(RAF)を紹介する。
200のオープンソースのPythonマイクロサービスプロジェクトに関する調査では、明示的な再試行ロジックが11.5%で検出され、私たち自身の偽陰性の監査によって、真に41%近くが当てはまる。
検出されたプロジェクトのうち、60.9%はバックオフなしで少なくとも1つの構成を含んでおり、手作業による検証の後、113のプロダクション構成のうちの1つが遅延をランダムにしている。
次に、これらのポリシーをシミュレーションで評価する(n = 100 の試行)。
相関的な失敗の下では、単純な基準の再試行政策により、成功率は55.4%から41.5%に減少し、再試行は行われない。
我々は,繰り返し発生する5つのアンチパターンをカタログ化し,適応リトライ予算(ARB)を提案する。
これらの結果は、リトライ動作は各呼び出しサイトでローカルに設定されるのではなく、システムレベルのプロパティとして設計されるべきであることを示している。
関連論文リスト
- FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks [0.8699677835130409]
ランレベルのパスレートは、リトライフリーのカバレッジを最大17.8ポイント上回っている。
本稿では,実行レベルの精度,再試行自由度,確率ごとの変動率を指標とした繰り返し実行評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-05-30T23:03:05Z) - Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation [0.0]
自然言語からインフラストラクチャ・アズ・コード(IaC)を生成するには、プロバイダのスキーマ、依存関係の計画、組織的なポリシの制約を満たす必要がある。
Rego v1ポリシを備えた186タスクのAWS/TerraformベンチマークであるIaC-Eval v2で評価されたTerraform生成のための7つのエージェント戦略に関する検証初の実験的研究を示す。
論文 参考訳(メタデータ) (2026-05-29T12:43:27Z) - Stochastic Estimation of the Layer-wise Hessian Trace for Monitoring Neural-network Training [45.88028371034407]
本稿では,ニューラルネットワークの経験的リスクであるヘッセン行列の対角ブロックの軌跡のパラメータ推定器を提案する。
この手順はハッチンソントレース推定器とパラメータベクトル全体の上の1つのヘッセンベクトル積を組み合わせたものである。
重み分担の下での正しさは,第2次微分の前に階層的にヘッセンを組み立てる必要があることを示す。
論文 参考訳(メタデータ) (2026-05-25T10:24:32Z) - ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning [12.44509691077682]
本稿では,繰り返し発生する障害をプロセス知識グラフのシンボル編集に変換する神経シンボルエージェントであるANNEALを紹介する。
その中核となるメカニズムであるFDKA(Failure-Driven Knowledge Acquisition)は、責任のあるオペレータをローカライズし、制約付きLLM生成を通じて型付きパッチを合成し、提案を検証する。
4つのドメインと27のマルチシードランをまたいだANNEALは、永続的な構造修復を行う唯一の評価システムである。
論文 参考訳(メタデータ) (2026-05-04T05:24:03Z) - Solver-in-the-Loop: MDP-Based Benchmarks for Self-Correction and Behavioral Rationality in Operations Research [19.31559944205485]
運用 調査実践者は反復的なプロセスを通じて、不可能なモデルを日常的にデバッグする。
評価ループにtextbfsolver を配置するベンチマークを2つ導入する。
ドメイン固有のRLVRトレーニングによって、8BモデルがフロンティアAPIを越えられることが分かりました。
論文 参考訳(メタデータ) (2026-01-28T20:02:44Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。