FAQ : Optimiser le RPO et le RTO pour la continuité d'activité
Le RPO et le RTO peuvent-ils être égaux à zéro ?
Oui. Atteindre un RPO nul signifie qu'aucune donnée n'est perdue, ce qui est possible grâce au miroitement synchrone des données. Un RTO quasi nul s'obtient via un logiciel de basculement automatique comme SafeKit, qui détecte les pannes et redémarre les applications sur un nœud secondaire en quelques secondes ou minutes.
Lequel est le plus important : le RPO ou le RTO ?
Aucun n'est intrinsèquement plus important que l'autre ; ils répondent à des objectifs différents. Le RPO (Recovery Point Objective) se concentre sur la perte de données (la quantité de données que vous pouvez vous permettre de perdre). Le RTO (Recovery Time Objective) se concentre sur la durée d'interruption (la rapidité avec laquelle vous devez être de nouveau en ligne). Pour les applications critiques, tous deux doivent être réduits au minimum.
Quelle est la différence de RPO et de RTO entre SafeKit au niveau application et au niveau VM ?
Bien que les deux approches garantissent un RPO de 0 grâce à la réplication synchrone, elles diffèrent en termes de temps de reprise :
- Niveau Application : RTO plus rapide (environ 1 min) car seuls les services applicatifs redémarrent sur un système d'exploitation déjà actif. Cela permet également de détecter les plantages spécifiques des logiciels ou des processus.
- Niveau VM : RTO plus élevé car la machine virtuelle tout entière doit redémarrer sur l'hôte secondaire. Bien qu'indépendante de l'application, cette approche ne propose pas de surveillance granulaire des processus applicatifs eux-mêmes.
Quelle est la différence entre les solutions de HA et de sauvegarde en termes de RTO ?
La haute disponibilité (HA) offre généralement un RTO beaucoup plus faible (de quelques secondes à quelques minutes) car elle gère automatiquement les pannes locales. La reprise d'activité avec des solutions de sauvegarde (DR) présente habituellement un RTO plus élevé (de quelques heures à quelques jours) car elle implique la restauration des données et des services sur un site distant après une catastrophe majeure.
Comment obtenir le meilleur RPO et RTO entre des sites distants ?
Obtenir un RPO nul et un RTO quasi nul entre des sites distants nécessite de combiner une réplication synchrone et un LAN étendu (VLAN étendu) :
- LAN étendu / VLAN étendu : En étendant le même sous-réseau (Couche 2) sur deux centres de données, vous pouvez déplacer une application du Site A vers le Site B sans modifier son adresse IP, évitant ainsi des mises à jour DNS complexes.
- La solution SafeKit : SafeKit en tire parti en fournissant une adresse IP virtuelle (VIP) logicielle qui bascule d'un site à l'autre. Elle réachemine instantanément le trafic vers le site secondaire grâce au Gratuitous ARP (GARP).
Cela permet d'obtenir un RPO = 0 (miroitement en temps réel) et un RTO minimal (basculement en environ 1 minute) sans intervention humaine.
Pourquoi la combinaison de la haute disponibilité et de la sauvegarde est-elle essentielle pour optimiser le RPO et le RTO ?
Associer la haute disponibilité (HA) à une solution de sauvegarde est le seul moyen d'obtenir une stratégie de reprise globale. Bien qu'elles soient souvent abordées ensemble, ces solutions répondent à des problématiques différentes de l'équation RPO/RTO :
- Haute Disponibilité (via SafeKit) : Optimise le RTO pour qu'il soit quasi nul et garantit un RPO nul lors de pannes matérielles ou logicielles. Grâce à la réplication synchrone en temps réel, le serveur secondaire est toujours à jour. En cas de défaillance du primaire, le service redémarre immédiatement sur le secondaire sans aucune perte de données.
- Solutions de Sauvegarde : Protègent contre les problèmes d'intégrité des données (comme les rançongiciels ou les suppressions accidentelles). Comme la HA réplique les modifications instantanément, elle répliquera également un virus ou la suppression d'une base de données sur le serveur de secours. Une sauvegarde permet de « remonter dans le temps » à un état antérieur à la corruption.
- L'Approche Hybride : Pour une résilience maximale, les entreprises utilisent une architecture hybride à 3 nœuds. Cela comprend un cluster local de 2 nœuds avec réplication synchrone pour la HA immédiate, et une troisième copie distante (asynchrone) pour le secours après sinistre (DR). Cette défense en profondeur garantit une copie « en direct » pour la reprise instantanée et une copie « historique » pour la sécurité des données.