-
Le canal d'alertes que personne ne lisait, et le catalogue qui l'a réparé
Chaque moniteur réveillait quelqu'un, donc aucun ne voulait plus rien dire. La staging sonnait la nuit, un tenant tranquille pouvait afficher 100 pour cent d'erreurs sur une seule requête, et l'équipe avait appris à balayer la notification. Voici le découpage P1 et P2 sur lequel on s'est arrêté pour une stack ECS, et les deux mécaniques qui ont arrêté le flapping.
-
Le CPU ment : autoscaler un service mono-thread
Un service ramait sous charge, mais l'autoscaling ne se déclenchait jamais parce que le CPU restait à 30 pour cent. Une app mono-thread sur une task multi-cœur sature un cœur et paraît à peine occupée. Pourquoi, et comment corriger.