Senior Site Reliability Engineer (m/f/d)

Senior Site Reliability Engineer (m/f/d)

Stuttgart Vollzeit 60000 - 80000 € / Jahr (geschätzt) Kein Homeoffice möglich
F

Auf einen Blick

  • Aufgaben: Leite die technische Richtung und verbessere die Zuverlässigkeit unserer Plattform.
  • Unternehmen: Flip, ein junges Tech-Unternehmen mit einer dynamischen Kultur.
  • Vorteile: Flexibles Arbeiten, E-Gym-Mitgliedschaft und Jobrad-Leasing für eine gute Work-Life-Balance.
  • Weitere Informationen: Remote-first Arbeitsweise mit gelegentlichen Team-Events in Berlin oder Stuttgart.
  • Warum dieser Job: Gestalte die Architektur und entwickle innovative Lösungen in einem wachsenden Team.
  • Qualifikationen: Mindestens 5 Jahre Erfahrung in SRE oder verwandten Bereichen und starke Kommunikationsfähigkeiten.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Als Senior Site Reliability Engineer in unserem Platform Squad sind Sie für kritische Zuverlässigkeitsbereiche von Anfang bis Ende verantwortlich und treiben die technische Richtung innerhalb des Squads – führen architektonische Entscheidungen auf unserer Plattform, betreuen Teamkollegen und heben kontinuierlich den Zuverlässigkeitsstandard im Team an. Diese Rolle ist für einen Ingenieur mit nachweislicher Erfahrung im Aufbau und Betrieb von hochdurchsatzfähigen, hochverfügbaren Systemen gedacht, der eine senior-level technische Verantwortung und echten Einfluss durch tiefgehende Ingenieurtätigkeiten in einem engen, gut strukturierten Team wünscht.

Was Sie bei uns erwartet:

  • Co-Ownership der Architektur: Helfen Sie, die Architektur und Evolution unserer Cloud-Infrastruktur auf Azure und unserer Kubernetes-Cluster zu gestalten – entworfen für hohen Durchsatz und höchste Verfügbarkeit – um das schnelle Wachstum von Flip weltweit zu unterstützen.
  • Strategie zur Resilienz vorantreiben: Definieren Sie, wie wir globales Scaling, Zero-Downtime-Deployments, Rollback-Mechanismen und Notfallwiederherstellung angehen, und stellen Sie sicher, dass die Plattform rund um die Uhr verfügbar bleibt.
  • Unsere Observability-Stack weiterentwickeln: Verbessern Sie unseren LGTM-Stack (Loki, Grafana, Tempo, Mimir) zu einer Grundlage, der unsere Ingenieure vertrauen können.
  • Unsere IaC-Plattform verbessern: Beseitigen Sie unnötige Arbeiten an der Quelle und machen Sie unsere Infrastruktur wirklich selbstbedienbar für Ingenieurteams.
  • Führung bei Vorfällen: Übernehmen Sie eine führende Rolle bei plattformbezogenen größeren Vorfällen, leiten Sie fehlerfreie Nachbesprechungen für das Squad und übersetzen Sie Erkenntnisse in systematische Verbesserungen.
  • Mentoring im Squad: Coachen Sie Teamkollegen, führen Sie RFCs und Design-Reviews im Team durch und helfen Sie Ingenieuren, sich zu stärkeren SREs zu entwickeln.
  • Unsere Roadmap gestalten: Arbeiten Sie mit Ihrem Squad zusammen, um die Richtung der Plattform zu definieren.

Was Sie mitbringen:

  • Mindestens 5 Jahre praktische Erfahrung als Site Reliability Engineer (SRE), Platform Engineer, DevOps Engineer, Infrastructure Engineer, Cloud Engineer oder Backend Engineer mit starkem Fokus auf Infrastruktur.
  • Nachweisliche Erfahrung im Aufbau und Betrieb von hochdurchsatzfähigen, hochverfügbaren Systemen in der Produktion.
  • Tiefe, produktionsrelevante Erfahrung mit Kubernetes auf jedem Hyperscaler.
  • Starke Erfahrung mit modernen Observability-Stacks (z.B. Prometheus, Mimir, VictoriaMetrics, Dash0, Loki, ELK) und eine klare Sichtweise auf SLIs, SLOs und Fehlerbudgets.
  • Solide Softwareentwicklungskompetenzen in Go (stark bevorzugt, da unsere IaC auf Pulumi in Go läuft) oder Python.
  • Praktische Erfahrung mit Infrastructure as Code (Pulumi, OpenTofu, Terraform) und GitOps (z.B. ArgoCD) + CI/CD-Pipeline-Design.
  • Nachgewiesene Fähigkeit, komplexe Infrastrukturinitiativen von der Planung bis zur Produktion zu leiten – einschließlich Schreiben von RFCs und Führen von Architekturentscheidungen innerhalb Ihres Teams.
  • Erfahrung im Mentoring von Ingenieuren und im Anheben des technischen Niveaus innerhalb eines Teams.
  • Komfortabel im Umgang mit größeren Vorfällen von Anfang bis Ende und in der Umsetzung von Erkenntnissen in systematische Veränderungen.
  • Starke Kommunikationsfähigkeiten und geschäftsfließendes Englisch.
  • Bereitschaft zur Teilnahme an Bereitschaftsdiensten, um die Zuverlässigkeit unserer Plattform sicherzustellen.

Nice-to-Have Qualifikationen:

  • Produktionstaugliche API-Gateways mit Gateway API (z.B. Envoy Gateway) implementiert.
  • Multi-Cluster-Service-Meshes (z.B. Cilium, Linkerd, Istio) betrieben.
  • Kubernetes-Operatoren (z.B. Strimzi, CNPG) bereitgestellt und gewartet.
  • Hochverfügbares PostgreSQL in der Produktion betrieben.

Was wir Ihnen bieten:

  • Arbeitsmodus: Wir sind remote-first und geben Ihnen die Flexibilität, von zu Hause aus zu arbeiten. Gleichzeitig schätzen wir die Kraft der persönlichen Zusammenarbeit. Je nach Rolle nehmen Sie an gelegentlichen Teamevents, Workshops oder Meetings in unseren Büros in Berlin oder Stuttgart teil – immer mit ausreichend Vorankündigung. Das genaue Gleichgewicht wird während Ihres Interviews besprochen.
  • Work-Life-Balance: Wir möchten nicht, dass Sie Wurzeln in Ihrem Schreibtischstuhl schlagen. Deshalb übernehmen wir die Kosten für Ihre E-Gym-Wellpass-Mitgliedschaft und bieten Jobrad-Leasing an.
  • Erfolge feiern: Erwarten Sie hochmotivierte und engagierte Menschen in einer entspannten Arbeitsatmosphäre.
  • Teil von etwas Größerem sein: Sie gestalten Flip aktiv in Ihrer Rolle. Auf dem Weg sind Sie ein Ermöglicher des schnellen Wachstums eines jungen Technologieunternehmens und wachsen in Richtung Ihrer Ziele, Spaß ist garantiert.
  • Happy to be a Flipster: Freuen Sie sich auf regelmäßige Teamevents und Kulturtage, die uns als Flipsters zusammenbringen.
  • Arbeiten im Ausland: Bei Flip können Sie auch im Ausland innerhalb der Europäischen Union arbeiten. Lassen Sie uns im Interview über Remote-Arbeit sprechen.

Bei Flip ist jeder willkommen – unabhängig davon, welches Geschlecht Sie identifizieren oder wie alt Sie sind. Sexuelle Identität, Herkunft, Religion, Weltanschauung und Behinderungen beeinflussen nicht Ihr potenzielles Arbeitsverhältnis bei Flip. Das Wichtigste ist, dass Sie ins Team passen!

Senior Site Reliability Engineer (m/f/d) Arbeitgeber: Flip

Flip ist ein hervorragender Arbeitgeber, der eine flexible Remote-Arbeitsumgebung bietet und gleichzeitig die Bedeutung persönlicher Zusammenarbeit schätzt. Mit einem starken Fokus auf Work-Life-Balance, regelmäßigen Teamevents und der Möglichkeit, aktiv an der Gestaltung eines schnell wachsenden Tech-Unternehmens teilzuhaben, fördert Flip eine positive und inklusive Unternehmenskultur, in der jeder Mitarbeiter die Chance hat, sich weiterzuentwickeln und seine Ziele zu erreichen.

F

Kontaktdaten:

Flip Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer (m/f/d) mit Bravour zu bestehen

Kubernetes
Cloud Infrastructure (Azure)
Hochverfügbare Systeme
Observability Stacks (z.B. Prometheus, Mimir, Loki)
Infrastructure as Code (Pulumi, Terraform)
CI/CD Pipeline Design
Softwareentwicklung in Go oder Python