L'écart entre un serveur développant un problème et ce problème affectant les utilisateurs est la fenêtre dans laquelle la surveillance peut vous sauver. CPU fonctionnant à 100% pendant dix minutes avant qu'un service ne plante, espace disque se remplissant progressivement : tous ces problèmes ont des signes avant-coureurs que la surveillance détecte.
Surveillance externe de la disponibilité
Le niveau gratuit d'UptimeRobot surveille jusqu'à 50 URL toutes les cinq minutes depuis plusieurs emplacements et envoie des alertes par courriel ou SMS. Configurez-le pour vérifier l'URL réelle de la page d'accueil plutôt qu'un simple ping à l'IP du serveur.
Surveillance des ressources système sur le serveur
Netdata est un agent de surveillance open source qui s'installe en quelques secondes et fournit un tableau de bord en temps réel montrant l'utilisation du CPU, de la mémoire, des E/S disque et du débit réseau. Pour le stockage persistant des métriques, Prometheus avec Grafana est l'option de niveau production qui fournit des tableaux de bord et des règles d'alerte avec des intégrations à Slack et au courriel.
Seuils d'alerte qui fonctionnent en pratique
Ces valeurs fonctionnent pour la plupart des VPS canadiens : CPU au-dessus de 80% soutenu pendant plus de cinq minutes, mémoire au-dessus de 85% utilisée, espace disque au-dessus de 80% utilisé, attente d'E/S disque au-dessus de 20% soutenu et pool de processus PHP-FPM à capacité pendant plus de deux minutes.
Gotekky
Besoin d’aide pour choisir la prochaine étape?
Décrivez ce que vous observez et le résultat recherché. Nous identifierons si un service géré, un projet défini ou une évaluation technique payante est la bonne prochaine étape.