Rubrique
Infra
Exploitation, incidents, observabilité et coût : tenir en production.
Articles
30 articles
Anatomie d'une facture cloud
L'ordre dans lequel lire une facture cloud, ce que cache chaque famille de lignes, et comment la ramener à un coût par tenant pour décider quoi optimiser, et quoi laisser tranquille.
7 minMembres
Sortir du cloud : le calcul honnête
Les quatre lignes d'un calcul de sortie du cloud (matériel, hébergement, personnel, risque) posées sur deux exemples chiffrés, et le seuil à partir duquel l'économie existe vraiment.
6 minMembres
Egress : la ligne qui décide de votre architecture
Comment la facturation des données sortantes fixe l'endroit où tourne votre calcul, ce que coûte chaque frontière traversée, et la grille pour inventorier vos flux avant qu'ils ne décident à votre place.
7 minMembres
Multi-région : ce que l'actif-actif coûte vraiment
Pourquoi l'actif-actif est un problème de données avant d'être un problème d'infrastructure, ce qu'il coûte en conflits, en capacité et en exploitation, et l'échelle des solutions moins chères à essayer d'abord.
7 minMembres
Un VPS, Docker Compose et Traefik : jusqu'où
Ce qu'une seule machine avec Docker Compose et Traefik tient réellement, les cinq endroits où elle casse, et l'ordre dans lequel en sortir quand un critère précis est atteint.
6 minMembres
Kubernetes : en avez-vous besoin ?
Le coût total de Kubernetes face à un PaaS ou à des VM pour une équipe de 5 à 30 ingénieurs, compté en temps de personnes, et les besoins précis qui justifient de le payer.
7 minLecture libre
Cloud souverain : ce qu'on perd, ce qu'on gagne
Les trois exigences que le mot « souverain » confond, les écarts de services à prévoir chez un fournisseur européen, et une grille par catégorie de données pour décider ce qui doit vraiment y aller.
7 minMembres
Alerter sur le burn rate : fenêtres multiples et réglage
D'où viennent les seuils d'une alerte sur la vitesse de consommation du budget d'erreur, comment les recalculer pour votre fenêtre, et pourquoi ils échouent à faible trafic.
7 minMembres
SLO : pourquoi les vôtres ne servent à rien
Comment reconnaître un SLO de vanité, en construire un sur un parcours utilisateur, et vérifier qu'il change réellement une décision.
8 minMembres
C'est toujours le DNS : cinq mécanismes
Les cinq façons dont le DNS transforme un changement banal en panne, comment reconnaître chacune en incident, et les réglages qui valent leur coût.
8 minMembres
Un changement de configuration est un déploiement
Pourquoi une poussée de configuration casse plus large et plus vite qu'une livraison de code, et quelles protections lui appliquer selon sa portée et sa réversibilité.
7 minLecture libre
La cause racine n'existe pas
Pourquoi chercher une cause unique produit des actions correctives qui ne corrigent rien, et comment mener une analyse par facteurs contributifs qui tient en une heure et demie.
7 minLecture libre
Stabilité statique : survivre à la panne du plan de contrôle
Comment vérifier que votre service continue de tourner, et que votre plan de reprise reste exécutable, quand l'API qui crée, configure et route ne répond plus.
7 minMembres
Déploiement progressif : ce que le canary ne voit pas
Un canary compare deux taux d'erreur sur du trafic sans état. Savoir calculer ce qu'il peut détecter, repérer ce qui lui échappe par construction, et choisir une autre protection quand le trafic est faible ou que la version écrit des données.
7 minMembres
Post-mortem sans blâme dans une culture du responsable
Ce qu'il faut réellement changer pour qu'un post-mortem produise de l'information dans une organisation hiérarchique qui demande un nom, et ce qu'il ne faut pas promettre.
8 minMembres
Cardinalité : la facture d'observabilité expliquée
Comment un label ajouté en une ligne multiplie le nombre de séries, ce qui fait réellement baisser la facture, et où ranger la dimension tenant quand elle ne tient pas dans les métriques.
7 minMembres
Échantillonner les traces sans perdre l'incident
Ce que l'échantillonnage en tête perd par construction, ce que le tail sampling coûte à opérer, et comment choisir entre les deux selon votre volume et votre nombre de services.
7 minMembres
Flame graphs : lire avant d'optimiser
Ce qu'un flame graph encode vraiment, les six contresens qui font optimiser la mauvaise fonction, et le calcul à faire avant d'écrire une ligne : quel gain maximal ce profil autorise-t-il sur la latence que vous voulez réduire ?
7 minMembres
L'équipe plateforme devenue goulot
Pourquoi une équipe plateforme se transforme en file d'attente deux ans après sa création, ce que coûte le passage au libre-service, et les mesures qui disent s'il faut la réorienter ou la dissoudre.
7 minMembres
Tests instables : traiter le problème comme une panne
Pourquoi un taux d'instabilité minuscule par test suffit à rendre un pipeline inutilisable, comment tenir une quarantaine qui ne devient pas un cimetière, et à partir de quand l'effort se rembourse.
7 minLecture libre
SRE à quarante : ce qu'une petite organisation peut prendre
À quarante ingénieurs, l'essentiel du SRE tient en un budget d'erreur minimal : deux ou trois SLO, une règle de décision écrite d'avance, un plafond de travail répétitif. Ce qu'il faut prendre, ce qu'il faut laisser, et comment savoir si le dispositif décide quelque chose.
6 minMembres
Sondes Kubernetes : provoquer sa propre panne
Pourquoi une liveness probe qui teste une dépendance transforme un ralentissement en panne totale, ce que chaque sonde doit vérifier, et la grille pour régler les vôtres.
7 minLecture libre
La méthode USE en dix minutes sur un serveur malade
Un tri en dix minutes : pour chaque ressource, utilisation, saturation, erreurs, avec les commandes et l'ordre. Ce que la méthode trouve vite, ce qu'elle ne trouvera jamais, et quand passer à autre chose.
7 minMembres
Astreinte soutenable : les chiffres
L'arithmétique d'une rotation : combien de personnes, combien de réveils par semaine avant que ça casse, ce que la compensation doit couvrir. De quoi calculer si votre astreinte tient un an, ou seulement jusqu'à la prochaine démission.
7 minMembres
Les nombres à connaître en 2026
Les ordres de grandeur de latence et de coût qui servent à juger une conception en 2026, donnés avec prudence, et surtout la méthode pour les remesurer sur votre propre infrastructure avant de décider.
7 minMembres
Limites CPU sous Kubernetes : le throttling
Pourquoi un conteneur à 16 % d'utilisation CPU moyenne peut voir sa latence de queue tripler, comment le mesurer, et quelle politique de requests et de limits choisir selon la charge.
8 minMembres
« You build it, you run it » avec des prestataires
Pourquoi le principe se contredit dès que ceux qui construisent sont sous contrat de prestation, et les trois montages qui rétablissent la boucle de retour : exploitation au contrat, propriétaire interne, ou transfert avec recette d'exploitation.
8 minMembres
Infrastructure as code à dix équipes
Où couper l'état, à qui appartient un module et comment traiter la dérive quand dix équipes écrivent la même infrastructure : les critères pour décider, et le coût de chaque découpage.
7 minLecture libre
Revue de mise en production : la grille
Une grille de vingt questions qui exigent chacune une preuve, les trois qui suffisent à repousser une mise en production, et le critère pour savoir quand la revue est du théâtre.
8 minMembres
Le portail développeur que personne n'ouvre
Les mécanismes qui vident un portail développeur de ses utilisateurs, ce qu'il coûte à maintenir, et les critères pour décider de le construire, de le réduire ou de s'en passer.
7 minMembres