Ce que je fais
Trois disciplines étroitement liées, prises en charge de bout en bout - et non renvoyées par-dessus la clôture entre les équipes.
Programmation
Du logiciel prêt pour la production, écrit en test-first - avec l'IA pour aller vite sans bâcler.
- Backends et API (Django, Scala / Akka-HTTP)
- Développement piloté par les tests et architecture claire
- Code assisté par IA avec revue senior
- Interfaces web, apps natives et PWA sur CloudFront
SRE & Fiabilité
Rendre les systèmes observables, résilients et capables de survivre - avant l'incident, pas pendant.
- SLO, error budgets et alertes qui ne crient pas au loup
- Préparation aux incidents, runbooks et postmortems
- Observabilité : métriques, logs, tracing
- Performance et coût sous charge réelle
Architecture Cloud & Automatisation
Infrastructure as code, golden paths et pipelines qui vous permettent d'avancer vite sans casser la production.
- Architecture AWS et revues well-architected
- Modules Terraform et fondations réutilisables
- CI/CD, GitOps et sécurité du déploiement
- Sécurité dès la conception et moindre privilège
Notes du terrain
Des écrits pratiques sur la fiabilité, l'architecture et l'exploitation de systèmes réels - sans esbroufe ni théâtre de gourou.
Git worktrees : un seul cerveau, plusieurs agents en parallèle
Quand plusieurs personnes - ou plusieurs agents IA - travaillent sur le même repo en même temps, chacun sur sa branch, vous n'avez pas besoin de N clones et vous ne pouvez pas partager un seul checkout. Les worktrees de Git vous donnent un historique unique et plusieurs répertoires de travail : une source de vérité unique sur laquelle un agent central peut raisonner, pendant que chaque exécutant compile, teste et committe en isolation.
Des SLO qui ne mentent pas : mesurer ce que les utilisateurs ressentent vraiment
La plupart des SLO sont au vert pendant que les utilisateurs souffrent - ils mesurent le système, pas la personne. Comment bâtir des SLI à partir de vrais parcours utilisateur, donner à chaque parcours l'objectif qu'il mérite, transformer la marge en un budget d'erreur dont une équipe est responsable, et câbler des alertes qui mènent droit à la cause.
Concevoir des alertes que personne n'ignore
Les alertes bruyantes apprennent à votre équipe à ignorer celle qui compte. Un guide approfondi et concret sur les alertes basées sur les symptômes et le multi-fenêtre / multi-burn-rate - les calculs du burn rate, du PromQL prêt à coller, et le processus d'astreinte qui rend les pages à nouveau crédibles.
Vous avez un système qui ne doit jamais tomber ?
Qu'il s'agisse d'une revue d'architecture, d'une mission SRE ou d'un incendie de fiabilité que vous devez éteindre - parlons-en.
Contactez-moi