操作ガイド
リスクと継続性に基づいたPHPの保守
保守とは、故障を待つことではありません。製品がユーザーにサービスを提供し続ける間、サポート体制、知識、そして変更対応能力を維持することです。
主な考え方
- 個別の事象、予防、そして進化。
- 影響力と露出度に基づいて優先順位をつける。
- 技術面および運用面の健全性を測定する。
- 回復と転移を練習する。
1. サービスを定義する
システム、時間、重要度、チャネル、責任分担を事前に合意しておくことで、あらゆる事態が緊急事態になるのを防ぐことができます。ユーザーサポート、技術的なインシデント、繰り返し発生する問題、計画的な機能拡張はそれぞれ個別に扱いましょう。
- 在庫と所有者。
- 深刻度と影響。
- 勤務時間とエスカレーション。
- 就業開始と採用。
2. 予防サイクルを構築する
バージョン管理、依存関係、バックアップ、証明書、容量、ドキュメントのために容量を確保してください。予防策は機能と競合するため、明確なポリシーが必要です。
- サポートカレンダー。
- 依存関係と脆弱性。
- バックアップからの復元。
- 生産能力とコストの見直し。
3.事件から学ぶ
まずはサービスの復旧を最優先し、その後、再発の原因究明と予防策の実施に努める。タイムライン、証拠、決定事項、フォローアップ状況を、責任追及をせずに記録する。
- 検出と申告。
- 封じ込めと復旧。
- 比例因果分析。
- 所有者と日付を含むアクション。
4. 行動のための対策を講じる
経験、エラー、遅延、飽和度、ビジネスシグナルを組み合わせましょう。すべてのアラートには受信者と対応が必要であり、すべてのダッシュボードは質問に答えるものでなければなりません。
- サービス目標。
- フローごとのエラー。
- キューとデータベースの容量。
- 事件発生件数と債務残高の推移。
5. 安全なお釣りを提供する
バッチサイズを削減し、チェックを自動化し、ロールバックの仕組みを理解する。保守部門と開発部門は、完了の定義とリリース規律を共有する。
- リスクに基づいたレビューとテスト。
- 小さな変化。
- 窓とコミュニケーション。
- 放流後の観察。
6. 知識を保存する
チームが作業する場所のアーキテクチャ、運用、および決定事項を文書化する。隠れた依存関係を明らかにするために、他の担当者とオンボーディングとランブックをテストする。
- システムマップ。
- 実行可能なランブック。
- 関連する決定事項。
- 異動と配置転換。
この決定に関連するコンテンツ
診断、処置、または関連する経験を継続してください。
ガイドをアプリケーションに適用してください
私たちは、評価を実施に結びつけることなく、状況、証拠、選択肢を検討します。