Senior Site Reliability Engineer
De functie en het team
Als Senior Site Reliability Engineer neem je eigenaarschap over de betrouwbaarheid, veiligheid en voorspelbaarheid van de productieomgeving. Je werkt nauw samen met product engineers, product owners en engineering leadership om systemen meetbaar, schaalbaar en beter beheersbaar te maken. De rol combineert traditionele SRE, platform engineering, cloud infrastructure en AI platform operations. In het eerste jaar ligt de nadruk vooral op production reliability, observability, veilige releases en kostenbeheersing, terwijl de AI-component verder zal groeien. Je komt terecht in een compact technisch team met senior engineers en veel directe invloed op keuzes rondom architectuur, deployment, tooling en incidentprocessen. Dit is een hands-on rol voor iemand die graag verantwoordelijkheid draagt, nog steeds zelf in de terminal werkt en het leuk vindt om een SRE-practice verder op te bouwen.
Wat ga je doen
Je maakt reliability meetbaar door SLO’s, SLI’s en error budgets verder op te zetten en te vertalen naar technische keuzes. Je verbetert observability over de volledige keten, van applicaties en databases tot queues, containers, cloudservices en netwerkgrenzen. Wanneer er iets misgaat, leid je incident response. Je werkt aan veilige releaseprocessen met CI/CD, health checks, canary deployments en snelle rollbacks. Je beheert en verbetert de infrastructuur, waarbij infrastructuur via reviews, pipelines en reproduceerbare processen wordt uitgerold. Daarnaast bouw je automation en interne tooling om handmatig werk en terugkerende operationele taken te verminderen.
Je houdt actief grip op cloudkosten en maakt kosten zichtbaar per service of team, zonder reliability te verslechteren. Ook werk je AI-native: je gebruikt AI dagelijks voor incidentanalyse, loganalyse, infrastructure code, runbooks en automatisering, terwijl je de output kritisch controleert.
