Aller au contenu principal

2 articles tagués avec « linux »

Voir tous les tags

Post-mortem : quand une sauvegarde de routine fige un serveur entier

· 11 minutes de lecture
BENE Maël
Administrateur Système

Un serveur de base de données métier (moteur SGBD propriétaire, sous Ubuntu 22.04) s'est figé un après-midi pendant une sauvegarde qui tournait depuis des mois sans le moindre incident. Huit minutes d'indisponibilité, aucune donnée perdue, mais j'ai fini par relier ce blocage à une saturation mémoire survenue la nuit précédente, sur un mécanisme en apparence totalement différent.

Schéma montrant le job de sauvegarde interne du moteur SGBD comme cause commune à trois symptômes : la RAM qui monte à 60 Go, l'accumulation d'archives locales, et la sauvegarde NAS qui sature

Le lock GPG qui n'aurait jamais dû exister

· 6 minutes de lecture
BENE Maël
Administrateur Système

Un parc d'une dizaine de VMs qui se déploient elles-mêmes via ansible-pull toutes les 30 minutes. De temps en temps, l'une d'elles arrête de converger, bloquée sur une erreur gpg: waiting for lock ou SQL library used incorrectly. La cause : une tâche qui importait une clé GPG dont plus rien ne se servait, quelque part dans un rôle partagé exécuté par toutes les VMs.

Schéma montrant deux chemins dans le pipeline : un chemin mort qui importe une clé GPG et finit en verrou orphelin, et le chemin réel qui vérifie une signature SSH et exécute le playbook