論文の概要: Service Health Engineering for Distributed Systems
- arxiv url: http://arxiv.org/abs/2609.08020v1
- Date: Mon, 07 Sep 2026 22:03:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:47:06.115089
- Title: Service Health Engineering for Distributed Systems
- Title(参考訳): 分散システムのためのサービスヘルスエンジニアリング
- Authors: Siva Rama Krishna Varma Bayyavarapu,
- Abstract要約: 本稿では,サービスヘルス工学を実践的信頼性の分野として紹介する。
サービスの約束、サービスレベルの指標と目的、監視、インシデント対策、レジリエンステスト、毎週のサービスヘルスレビューが、サイレントな失敗と立ち往生した作業を明らかにする方法について説明している。
また、AIを自律的な意思決定者にすることなく、サービスヘルスの証拠を組み立てるための、人間レビューされたAI支援の報告アーキテクチャも提示している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Distributed systems support many critical business workflows, but service health is often judged through component dashboards rather than through end-to-end user outcomes. This article presents service health engineering as a practical reliability discipline that connects telemetry, workflow completion, dependency behavior, operational readiness, and recovery validation. Using a document approval workflow as a running example, it describes how service promises, service-level indicators and objectives, watchdogs, incident measures, resiliency testing, and weekly service-health reviews can reveal silent failures and stranded asynchronous work. It also presents a human-reviewed, AI-assisted reporting architecture for assembling service-health evidence without making AI an autonomous decision-maker. The approach brings established reliability practices together around whether user journeys complete as promised.
- Abstract(参考訳): 分散システムは多くの重要なビジネスワークフローをサポートするが、サービスの健全性はエンドユーザの成果ではなく、コンポーネントダッシュボードを通じて判断されることが多い。
本稿では、テレメトリ、ワークフローの完了、依存性の振る舞い、運用の即応性、リカバリのバリデーションを接続する、実用的な信頼性の規律として、サービスヘルスエンジニアリングを紹介します。
ドキュメント承認ワークフローを実行中の例として、サービス約束、サービスレベルのインジケータと目標、監視犬、インシデント対策、レジリエンステスト、毎週のサービスヘルスレビューが、サイレントな障害と立ち往生した非同期処理を明らかにする方法について説明している。
また、AIを自律的な意思決定者にすることなく、サービスヘルスの証拠を組み立てるための、人間レビューされたAI支援の報告アーキテクチャも提示している。
このアプローチは、約束通りユーザジャーニーが完了するかどうかに関して、確立した信頼性のプラクティスをまとめます。
関連論文リスト
- Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety [0.0]
本稿では,Metaがこの緊張緩和に使用しているデプロイメント時間ヘルスチェックインフラストラクチャについて述べる。
この予防ベースの分散システムのサービスであるService Health Checkerのアーキテクチャを要約する。
ノイズや警告疲労,ドリフト,未発見の回帰といった,大規模に発生した運用上の問題について述べる。
論文 参考訳(メタデータ) (2026-08-20T19:19:36Z) - Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - Facial Affect Analysis for Service-Oriented Systems: Advances, Challenges, and Future Visions [5.786508486219879]
Facial Affect Analysis (FAA)は、スタンドアロンの認識タスクから、サービス指向ソフトウェアエコシステム(SoSE)の再利用可能な認識能力へと進化している。
本稿では, 構成可能で信頼性の高いサービスに対するシステム工学的要件を通じて, 近年の進歩を反映しつつ, FAAの方法論的コアを保存している。
FAAを明示的なインターフェース、測定可能な品質特性、説明可能なライフサイクル管理を備えた運用サービスコンポーネントとして扱うためのロードマップで締めくくります。
論文 参考訳(メタデータ) (2026-06-13T15:29:29Z) - Offloading Score: Measuring AI Reliance Through Counterfactual Workflows [70.84727355516559]
私たちは、AIツールにオフロードされた認知活動の分断を定量化する、信頼度尺度であるオフロードスコアを導入します。
本研究は,本質的な計量妥当性評価と制御されたユーザスタディにより,オフロードスコアの検証を行う。
オフロードスコアは、時間制約設定における依存度を著しく高めることを示す。
論文 参考訳(メタデータ) (2026-05-28T05:44:31Z) - Monitoring Deployed AI Systems in Health Care [8.240297189233528]
医療における人工知能(AI)システムのデプロイ後モニタリングは、その安全性、品質、持続的な利益を保証するために不可欠である。
このフレームワークは,3つの補完的原則 – システムの完全性,パフォーマンス,影響 – に基づいて構成されている。
それは、AIデプロイメントが時間とともに安全で効果的であることを保証するために、医療システムに実用的なテンプレートと出発点を提供する。
論文 参考訳(メタデータ) (2025-12-09T19:06:48Z) - Mining Service Behavior for Stateful Service Emulation [4.659827500657494]
サービス仮想化は、記録されたインタラクションからサービスモデルを導出するための広く使われているテクニックとして現れています。
これらの相互作用に基づいて実際のサービスの振舞いをエミュレートする様々な方法が提案されているが、ほとんどの場合、サービスの状態を説明できない。
本稿では,サービス状態を考慮した応答生成の精度を高めるサービス間相互作用からサービスモデルを導出する手法を提案する。
論文 参考訳(メタデータ) (2025-10-21T10:59:53Z) - Walk the Talk: Is Your Log-based Software Reliability Maintenance System Really Reliable? [18.587739647424716]
本稿では、サービス提供者の信頼を得るためのモデルに対する信頼性基準、診断忠実度を定義する。
本稿では,忠実なログに基づく異常検出システムであるFaithLogを提案する。
論文 参考訳(メタデータ) (2025-09-29T06:52:40Z) - Beyond One-Time Validation: A Framework for Adaptive Validation of Prognostic and Diagnostic AI-based Medical Devices [55.319842359034546]
既存のアプローチは、これらのデバイスを実際にデプロイする際の複雑さに対処するのに不足することが多い。
提示されたフレームワークは、デプロイメント中に検証と微調整を繰り返すことの重要性を強調している。
現在の米国とEUの規制分野に位置づけられている。
論文 参考訳(メタデータ) (2024-09-07T11:13:52Z) - WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks? [83.19032025950986]
本稿では,Webブラウザを介してソフトウェアと対話する大規模言語モデルベースエージェントについて検討する。
WorkArenaは、広く使用されているServiceNowプラットフォームに基づく33のタスクのベンチマークである。
BrowserGymは、そのようなエージェントの設計と評価のための環境である。
論文 参考訳(メタデータ) (2024-03-12T14:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。