Servor. docs
en

Lire les métriques serveur — CPU, RAM, disque et charge

Apprenez à lire les métriques serveur — utilisation CPU, RAM, espace disque et charge moyenne — et à distinguer un serveur sain d'un serveur qui va poser problème.

Votre tableau de bord serveur déborde de chiffres, mais lesquels comptent et qu'est-ce qui est « normal » ? Ce guide explique comment lire les métriques serveur essentielles — CPU, RAM, disque et charge moyenne — pour distinguer un serveur sain d'un serveur qui s'apprête à vous causer des ennuis.

Dans Servor, ces chiffres proviennent de l'agent sous forme de métriques de ressources. Vous les voyez sur chaque serveur et pouvez définir des seuils qui vous alertent lorsqu'ils franchissent une limite.

Lisez des tendances, pas des instantanés

Une seule lecture élevée ne veut presque rien dire — les serveurs font des pics en permanence. Ce qui compte, c'est la tendance : un chiffre qui monte et reste haut, ou un pic qui ne redescend pas. Regardez toujours une métrique dans le temps avant d'agir.

Utilisation CPU

Le CPU indique la quantité de calcul effectuée par le serveur, généralement en pourcentage de la capacité totale.

  • Sain : faible à modéré la plupart du temps, avec de brefs pics en charge qui redescendent vite.
  • Signe d'alerte : un CPU collé à près de 100 % pendant des minutes, pas des secondes. Cela signifie que les requêtes s'accumulent et que la machine ne suit plus.

Un bref pic lorsqu'une sauvegarde tourne ou que le trafic explose est normal. C'est la saturation soutenue qui pose problème — d'où l'intérêt d'alerter sur la durée, pas sur une lecture isolée.

Un CPU élevé n'est pas toujours mauvais

Un traitement par lots ou un import doit utiliser le CPU dont il a besoin. Demandez-vous si la charge correspond à ce que le serveur est censé faire à cet instant. C'est le CPU soutenu et inexpliqué qui est le signal d'alarme.

RAM (mémoire)

La RAM est la mémoire de travail. Quand elle vient à manquer, le serveur se met à swapper sur le disque (lent) ou le noyau commence à tuer des processus (pire).

  • Sain : une marge confortable, un niveau stable ou variant lentement qui suit votre charge de travail.
  • Signe d'alerte : une montée régulière qui ne redescend jamais — la forme classique d'une fuite mémoire — ou une utilisation collée à la capacité, sans marge pour absorber un pic.

Sous Linux, ne paniquez pas devant une « mémoire libre faible »

Linux utilise délibérément la RAM disponible pour le cache disque : la mémoire « libre » paraît donc souvent faible sur une machine saine — ce cache est libéré instantanément dès que les applications en ont besoin. Surveillez la mémoire disponible et la tendance dans le temps, pas le chiffre brut de mémoire « libre ».

Espace disque

Le disque est la métrique la plus susceptible de provoquer une panne dure et moche — et la plus facile à prévenir.

  • Sain : une utilisation stable avec une marge nette, croissant de façon prévisible à mesure que vous ajoutez des données.
  • Signe d'alerte : une montée vers le plein, ou un saut brutal (logs qui s'emballent, upload bloqué, base de données qui a cessé de faire tourner ses fichiers).

Un disque plein fait tomber les services brutalement

Quand un disque atteint 100 %, les bases de données refusent les écritures, les logs s'arrêtent et les services plantent d'une manière lente et pénible à récupérer. Alertez bien avant le plein — gardez une vraie marge — pour corriger cela comme une corvée, jamais comme une panne.

Si le disque grimpe, les coupables habituels sont les fichiers de log, les caches de paquets, les vieilles sauvegardes ou les fichiers temporaires jamais nettoyés. Le terminal web ou une commande rapide comme du -sh /var/* vous montrera où est passé l'espace.

Charge moyenne (load average)

La charge moyenne est une métrique Unix/Linux indiquant combien de processus attendent de s'exécuter, généralement sur 1, 5 et 15 minutes. Elle est souvent mal interprétée, voici donc la clé :

Comparez la charge au nombre de cœurs CPU. Une charge de 4.0 correspond à une machine pleinement occupée sur 4 cœurs et surchargée sur 1 cœur.

  • Sain : une charge inférieure ou égale à votre nombre de cœurs — le travail est traité au fur et à mesure.
  • Signe d'alerte : une charge constamment supérieure à votre nombre de cœurs, signe que des processus s'accumulent en attente de temps CPU.

Les trois chiffres donnent la direction : si celui d'une minute est bien au-dessus de celui de quinze minutes, la charge monte en ce moment ; s'il est en dessous, un pic est en train de retomber.

CœursCharge ≈ nb de cœursCharge bien au-dessus des cœurs
1Pleinement utiliséSurchargé
4Pleinement utiliséSurchargé
8Pleinement utiliséSurchargé

À quoi ressemble un serveur « sain » en un coup d'œil

MétriqueSainÀ investiguer
CPUFaible/modéré, brefs pics qui redescendentCollé à ~100 % pendant des minutes
RAMStable avec de la margeMontée continue sans redescente, ou proche de la capacité
DisqueStable avec marge netteMontée vers le plein, ou saut brutal
ChargeInférieure ou égale au nombre de cœursConstamment au-dessus du nombre de cœurs

Transformer les métriques en alertes

Lire les métriques à l'œil convient pour une vérification rapide, mais vous ne voulez pas rester scotché à un tableau de bord. Définissez des seuils de ressources pour que Servor surveille à votre place et alerte via vos canaux de notification. Ouvrez vos serveurs dans Servor pour régler les seuils, et configurez les canaux dans les réglages d'alertes.

Alertez sur des conditions soutenues

Réglez les seuils pour qu'ils se déclenchent sur une condition qui persiste (par exemple, disque au-dessus d'une limite sur plusieurs vérifications) plutôt que sur une lecture isolée. Voyez les bonnes pratiques de surveillance pour choisir des seuils pertinents et éviter la fatigue d'alerte.

Étapes suivantes