論文の概要: Compound AI System Reliability: A Failure Taxonomy and Resilience Pattern Catalog from 150 Production Incidents
- arxiv url: http://arxiv.org/abs/2610.02503v1
- Date: Thu, 01 Oct 2026 21:25:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.090865
- Title: Compound AI System Reliability: A Failure Taxonomy and Resilience Pattern Catalog from 150 Production Incidents
- Title(参考訳): 複合AIシステムの信頼性:150件のプロダクションインシデントからの失敗分類とレジリエンスパターンカタログ
- Abstract要約: カスケーディングエラーはコンポーネントの境界を越えて伝播し、サイレント品質劣化は標準監視を回避し、調整失敗は間違った集団動作をもたらす。
我々は、オープンソースの複合AIプロジェクトと匿名の企業展開による150件のプロダクションインシデントレポートを分析し、23の障害モードの分類を構築する。
各カテゴリに対して, 制御された断層注入実験から実測値を用いたレジリエンスパターンを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying compound AI systems reliably and safely requires understanding failure modes that emerge at component boundaries, not within individual models. Cascading errors propagate across component boundaries, silent quality degradation evades standard monitoring, and coordination failures yield incorrect collective behavior from individually correct parts. We analyze 150 production incident reports from open-source compound AI projects and anonymized enterprise deployments to construct a taxonomy of 23 failure modes organized into five categories: retrieval failures, generation failures, tool failures, orchestration failures, and integration failures. For each category, we propose resilience patterns with measured effectiveness from controlled fault injection experiments. Circuit breakers reduce cascade propagation by 89%, output quality gates catch 73% of silent degradation before user impact, and component isolation reduces blast radius by 64%. Systems implementing three or more resilience patterns from our catalog reduce mean-time-to-recovery (MTTR) by 71% compared to unstructured monitoring baselines. We release the incident taxonomy and pattern catalog as a practitioner resource.
- Abstract(参考訳): 複合AIシステムを確実に安全にデプロイするには、個々のモデルではなく、コンポーネント境界に現れる障害モードを理解する必要がある。
カスケーディングエラーはコンポーネントの境界を越えて伝播し、サイレント品質劣化は標準監視を回避し、調整失敗は個々の正しい部分から間違った集団的振る舞いをもたらす。
我々は、オープンソースの複合AIプロジェクトから150件のプロダクションインシデントレポートを分析し、23の障害モードの分類を5つのカテゴリ(検索障害、生成障害、ツール障害、オーケストレーション障害、統合障害)に分類した。
各カテゴリに対して, 制御された断層注入実験から実測値を用いたレジリエンスパターンを提案する。
回路ブレーカーはカスケード伝搬を89%減少させ、出力品質ゲートはユーザーの衝突前に静音劣化の73%をキャッチし、部品分離により爆発半径を64%減少させる。
我々のカタログから3つ以上のレジリエンスパターンを実装するシステムは、非構造化モニタリングベースラインと比較して平均時間回復(MTTR)を71%削減する。
我々は、インシデント分類とパターンカタログを実践者資源としてリリースする。
関連論文リスト
- Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction [42.06723421277899]
ジェネレーティブAIは、ソーシャルエンジニアリングアタックをより流動的で適応的でスケーラブルにする。
我々は信頼連鎖のローカライゼーションを形式化し、アクターの権限、資産管理、検証効率、トランザクションパスで相互作用が失敗するかどうかを特定する。
我々は,20のシナリオファミリー,正当なケース,4つの構造的故障モード,および3つの表面状態にまたがる制御された300ケースのオンライン住宅コーパスを構築した。
論文 参考訳(メタデータ) (2026-08-10T21:17:03Z) - Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs [0.0]
小作農の絵ベースの農業保険では、被害検出の欠落は誤報よりもかなり高いコストがかかる。
本稿では,2段階のカスケードアーキテクチャであるCascadeCropNetを提案する。
軽量のセンチネルモデルでは2値の健康トリアージを行い、キャリブレーションされた損傷確率閾値タウを超えるサンプルを専門家モデルにエスカレーションして詳細な診断を行う。
論文 参考訳(メタデータ) (2026-07-28T09:01:27Z) - EntroRouter: Learning Efficient Model Routing via Entropy Regulation [45.88530258803968]
エントロピー制御を主目的とする単一ラウンドルーティングフレームワークを提案する。
我々はEntroが最強の専門家の精度の98.3%を維持し、計算コストを48.25%削減していることを示した。
論文 参考訳(メタデータ) (2026-06-28T14:39:06Z) - Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation [0.0]
マルチステップ推論パイプラインにおけるエラー伝搬の検出と中断を行うアーキテクチャフレームワークであるCHARMを紹介する。
CHARMは、ステージレベルの事実検証、クロスステージの一貫性トラッキング、信頼性の監視、カスケード解決トリガの4つのコンポーネントで構成されている。
我々は,HotpotQA,MuSiQue,2WikiMultiHopQA上のCHARMと,LangChainのエージェントパイプライン構成にまたがる独自の逆データセットを評価する。
論文 参考訳(メタデータ) (2026-06-03T04:33:47Z) - Error-Decomposed Class-Conditional Fusion for Statistically Guaranteed Hard-Category Robust Perception [3.4563147061792527]
本稿では,この普及する脆弱性をHCRP(Hard-Category Reliability Problem)として公式に定義する。
本稿では,エレガントな決定層推論フレームワークであるED-CCFを提案する。
論文 参考訳(メタデータ) (2026-05-17T18:39:05Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation [7.355373109826612]
本稿ではMAPDL自動化のための軽量エージェントハーネスであるCAX-Agentのアーキテクチャについて述べる。
我々は50の標準構造ベンチマークで3つのリカバリ戦略(no_recovery, rule_only, model_only)を評価した。
Model_onlyは、最大完了率(0.9267)、タスクスコア(3.59/4)、総得点(9.16/10)、ゼロ介入率(0.84)、0.7733, 3.17/4, 7.03/10, 0.00)、no_recovery(0.6933, 2.74/4, 5.60/10, 0.00)を大きな効果サイズで達成する。
論文 参考訳(メタデータ) (2026-05-12T14:46:34Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。