Prérequis
- Un serveur Linux à superviser
- Prometheus installé (sur la même machine ou ailleurs)
01Lancer node_exporter
Téléchargé depuis le site de Prometheus puis décompressé, il se lance tel quel et écoute sur le port 9100. En production, faites-en un service systemd.
./node_exporter
curl http://localhost:9100/metrics # vérifier02Le déclarer dans Prometheus
global:
scrape_interval: 15s
scrape_configs:
- job_name: node
static_configs:
- targets: ['localhost:9100']03Interroger
Dans l’interface de Prometheus, la métrique up indique pour chaque cible si la dernière collecte a réussi (1) ou non (0).
La requête ci-dessous, tirée de la documentation, donne le temps CPU passé en mode système, par seconde, en moyenne sur une minute.
rate(node_cpu_seconds_total{mode="system"}[1m])04Et ensuite
Grafana pour les tableaux de bord, Alertmanager pour les alertes, et snmp_exporter pour les équipements réseau qui ne font pas tourner d’agent.
À retenir
- node_exporter : port 9100, métriques système.
- Une cible par job dans prometheus.yml.
- up == 0 : la première alerte à écrire.