Cluster Proxmox VE 3 nœuds avec réplication ZFS
Un cluster Proxmox VE à 3 nœuds avec stockage local ZFS et réplication asynchrone entre chaque nœud : haute disponibilité sans SAN ni cluster Ceph.
Objectifs du projet
Simplicité opérationnelle
Pas de cluster de stockage distribué à administrer : réplication ZFS native, simple à comprendre et à dépanner.
Haute disponibilité légère
Bascule HA Proxmox vers la réplique ZFS la plus récente en cas de panne d'un nœud.
Coût maîtrisé
Disques locaux NVMe/SSD par nœud, sans baie de stockage ni réseau SAN dédié.
RPO court
Réplication ZFS planifiée à intervalle court entre les 3 nœuds du cluster.
Architecture
Cluster de calcul
Proxmox VE en cluster à 3 nœuds, quorum Corosync, nombre minimal pour garantir la résilience.
Stockage local ZFS
Pool ZFS (mirror ou RAIDZ) par nœud, avec snapshots réguliers pour la protection des données.
Réplication storage
Réplication Proxmox (pvesr) basée sur ZFS send/receive, sur un réseau dédié à 80 Gbps : chaque VM est répliquée de façon asynchrone vers un ou plusieurs autres nœuds.
Haute disponibilité
En cas de panne, la VM redémarre sur le nœud répliqué avec le delta de données depuis la dernière synchronisation (RPO = intervalle de réplication).
Sauvegarde & PRA
Veeam Backup & Replication en complément, pour la rétention longue durée et la protection contre les erreurs humaines.
Stack technique
Défis & solutions
RPO non nul
Réplication asynchrone (contrairement à Ceph) : les données depuis la dernière synchro peuvent être perdues. Intervalle de réplication court + Veeam pour les données critiques.
Dimensionnement des pools ZFS
Arbitrage entre mirror (simplicité, overhead 50%) et RAIDZ (meilleur ratio capacité/redondance) selon la charge.
Charge réseau lors des réplications
Pics de bande passante au moment du ZFS send, isolés sur le réseau dédié à 80 Gbps pour ne pas impacter le trafic des VM.
Cohérence applicative
Snapshots ZFS crash-consistent (pas application-consistent) : coordination avec Veeam pour les bases de données critiques.
État actuel
- Cluster 3 nœuds opérationnel, réplication ZFS active entre chaque nœud.
- Bascule HA testée avec succès, RPO conforme à l'intervalle de réplication configuré.
- Sauvegardes Veeam intégrées en complément de la réplication.
- Piste d'évolution : intervalle de réplication plus court pour les VM critiques.
Une réplication ZFS Proxmox à mettre en place ?
Cluster Proxmox, réplication ZFS, haute disponibilité : on peut en discuter.