Plan de Reprise d'Activité (PRA)
Architecture Résiliente
Le PRA de Ziosting repose sur une infrastructure résiliente de 3 datacenters. Tous les plans d'actions décrits s'appliquent uniquement dans ce contexte multi-sites.
Vue d'ensemble
Notre Plan de Reprise d'Activité évalue et traite systématiquement les risques pour garantir la continuité de vos services. Cette documentation présente :
- L'analyse des risques - Évaluation de chaque scénario
- Les plans d'action - Procédures détaillées avec délais d'intervention
Analyse des Risques
Classification des Risques
Le tableau suivant évalue chaque risque selon quatre critères essentiels :
Erreur Humaine
| Événements | Probabilité | Impact | Plan Préventif | Plan d'action Curatif |
|---|---|---|---|---|
| Suppression de données fortuite | Probable | De nul à critique | Sauvegardes quotidiennes | Restauration dernière sauvegarde |
Pertes de Workers
| Événements | Probabilité | Impact | Plan Préventif | Plan d'action Curatif |
|---|---|---|---|---|
| Perte temporaire d'une ressource | Probable | De nul à modéré | Architecture multi-DC | Analyse incident + remise en service |
| Perte totale d'une ressource | Très rare | De nul à modéré | Multi-DC + infogérance proactive | Commande nouvelle ressource |
Pertes de Datacenters (Workers)
| Événements | Probabilité | Impact | Plan Préventif | Plan d'action Curatif |
|---|---|---|---|---|
| Perte d'1 datacenter | Très rare | De nul à modéré | Architecture multi-DC | Analyse + migration ressources |
| Perte de 2 datacenters | Improbable | De nul¹ à critique² | Sauvegardes quotidiennes | Nouvelles ressources + bootstrap³ |
| Perte de 3 datacenters | Improbable | Critique | Sauvegardes quotidiennes | Cluster mono-DC temporaire + restauration |
Pertes de Control-Planes
| Événements | Probabilité | Impact | Plan Préventif | Plan d'action Curatif |
|---|---|---|---|---|
| Perte d'1 control-plane | Probable | Nul | Architecture multi-DC | Analyse + remise en service |
| Perte de 2 control-planes | Très rare | Modéré à Fort⁴ | Sauvegardes quotidiennes | Nouvelles ressources + synchro |
| Perte de 3 control-planes | Très rare | Modéré à Fort⁴ | Sauvegardes quotidiennes | Nouveau cluster + redéploiement⁵ |
Légende des impacts
Notes importantes
- ZiElastic : Aucun impact en cas de perte de 2 datacenters
- ZiMySQL et ZiPostgres : Services arrêtés en cas de perte de 2 datacenters
- Bootstrap : Redémarrage forcé au dernier état intègre pour ZiMySQL
- Control-plane : Impact sur déploiements, cronjobs et élection du leader ZiPostgres
- Action client requise : Mise à jour des entrées DNS nécessaire
Plans d'Action Détaillés
Délais d'Intervention Garantis
Les actions curatives sont structurées avec des durées d'intervention précises :
Erreur Humaine - Suppression de Données
| Actions | Durée |
|---|---|
| 1. Téléchargement sauvegarde (espace client) | 1 min/Go |
| 2. Restauration des données | < 30 min (dump < 2Go) |
Perte de 2 Datacenters (services actifs)
| Actions | Durée |
|---|---|
| 1. Commande ressources temporaires | 15 min |
| 2. Identification nœud BDD le plus récent | 1 min |
| 3. Bootstrap services BDD | < 30 min (BDD < 2Go) |
Perte de 3 Datacenters ou Perte Totale
| Actions | Durée |
|---|---|
| 1. Création cluster mono-DC temporaire | 15 min |
| 2. Téléchargement sauvegarde | 1 min/Go |
| 3. Restauration complète | < 30 min (dump < 2Go) |
Perte de 2 Control-Planes
| Actions | Durée |
|---|---|
| 1. Commande nouvelles ressources | 15 min |
| 2. Synchronisation avec CP actif | 15 min |
Perte de 3 Control-Planes
| Actions | Durée |
|---|---|
| 1. Création nouveau cluster MultiKaaS | 30 min |
| 2. Mise à jour token déploiement | 5 min |
| 3. Redéploiement depuis Git | 5 min |
Ajustement des délais
Les durées indiquées sont basées sur des volumes standards. Elles seront ajustées lors de l'onboarding selon vos volumes réels de données.
Points Clés à Retenir
Architecture Haute Disponibilité
- 3 datacenters indépendants garantissent la résilience
- Sauvegardes quotidiennes systématiques
- Architecture multi-DC minimise l'impact des incidents
Temps de Récupération
- Incidents mineurs : < 30 minutes
- Incidents majeurs : < 1 heure
- Récupération complète : Dépend du volume de données
Votre Rôle
Dans certains scénarios critiques, votre intervention sera nécessaire :
- Mise à jour des entrées DNS
- Modification des tokens de déploiement
- Validation du retour à la normale