Auf einen Blick
- Aufgaben: Leite die technische Richtung und verbessere die Zuverlässigkeit unserer Plattform.
- Unternehmen: Innovatives Unternehmen mit Fokus auf Cloud-Infrastruktur und Kubernetes.
- Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und Möglichkeiten zur beruflichen Weiterentwicklung.
- Weitere Informationen: Mentoring-Möglichkeiten und spannende Herausforderungen in einem wachsenden Umfeld.
- Warum dieser Job: Gestalte die Architektur und mache einen echten Unterschied in einem dynamischen Team.
- Qualifikationen: Mindestens 5 Jahre Erfahrung in SRE oder verwandten Bereichen.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Als Senior Site Reliability Engineer in unserem Platform Squad sind Sie für kritische Zuverlässigkeitsbereiche von Anfang bis Ende verantwortlich und treiben die technische Richtung innerhalb des Squads voran – führen architektonische Entscheidungen auf unserer Plattform, betreuen Teamkollegen und heben kontinuierlich den Zuverlässigkeitsstandard im Team an.
Diese Rolle ist für einen Ingenieur mit nachweislicher Erfahrung im Aufbau und Betrieb von hochdurchsatzfähigen, hochverfügbaren Systemen gedacht, der eine senior-level technische Verantwortung und echten Einfluss durch tiefgehende Ingenieurtätigkeiten in einem kompakten, gut strukturierten Team wünscht.
Was Sie bei uns erwartet:
- Co-own the architecture: Helfen Sie, die Architektur und Evolution unserer Cloud-Infrastruktur auf Azure und unsere Kubernetes-Cluster zu gestalten – entworfen für hohen Durchsatz und höchste Verfügbarkeit – um das schnelle Wachstum von Flip weltweit zu unterstützen.
- Drive the resilience strategy: Definieren Sie, wie wir globales Scaling, Zero-Downtime-Deployments, Rollback-Mechanismen und Notfallwiederherstellung angehen, und stellen Sie sicher, dass die Plattform rund um die Uhr verfügbar bleibt.
- Evolve our observability stack: Verbessern Sie unseren LGTM-Stack (Loki, Grafana, Tempo, Mimir) zu einer Grundlage, der unsere Ingenieure vertrauen können.
- Improve our IaC Platform: Beseitigen Sie unnötige Arbeiten an der Quelle und machen Sie unsere Infrastruktur wirklich selbstbedienbar für Ingenieurteams.
- Lead in incidents: Übernehmen Sie eine führende Rolle bei plattformbezogenen größeren Vorfällen, leiten Sie fehlerfreie Nachbesprechungen für das Squad und übersetzen Sie Erkenntnisse in systematische Verbesserungen.
- Mentor within the squad: Coachen Sie Teamkollegen, führen Sie RFCs und Design-Reviews im Team durch und helfen Sie Ingenieuren, stärkere SREs zu werden.
- Shape our roadmap: Arbeiten Sie mit Ihrem Squad zusammen, um die Richtung der Plattform zu definieren.
Was Sie mitbringen:
- Wir suchen einen praktischen, SaaS-orientierten Senior Site Reliability Engineer, der Skalierbarkeit und Zuverlässigkeit als erstklassige Produktanliegen behandelt.
- Must-Have Qualifications:
- 5+ Jahre praktische Erfahrung als Site Reliability Engineer (SRE), Platform Engineer, DevOps Engineer, Infrastructure Engineer, Cloud Engineer oder Backend Engineer mit starkem Infrastrukturfokus.
- Nachweisliche Erfahrung im Aufbau und Betrieb von hochdurchsatzfähigen, hochverfügbaren Systemen in der Produktion.
- Tiefe, produktionsrelevante Erfahrung mit Kubernetes auf jedem Hyperscaler.
- Starke Erfahrung mit modernen Observability-Stacks (z.B. Prometheus, Mimir, VictoriaMetrics, Dash0, Loki, ELK) und eine klare Sicht auf SLIs, SLOs und Fehlerbudgets.
- Solide Softwareentwicklungskompetenzen in Go (stark bevorzugt, da unser IaC auf Pulumi in Go läuft) oder Python.
- Praktische Erfahrung mit Infrastructure as Code (Pulumi, OpenTofu, Terraform) und GitOps (z.B. ArgoCD) + CI/CD-Pipeline-Design.
- Nachgewiesene Fähigkeit, komplexe Infrastrukturinitiativen vom Design bis zur Produktion zu leiten – einschließlich Schreiben von RFCs und Führen von Architekturentscheidungen innerhalb Ihres Teams.
- Erfahrung in der Betreuung von Ingenieuren und der Erhöhung des technischen Niveaus innerhalb eines Teams.
- Komfortabel im Umgang mit größeren Vorfällen von Anfang bis Ende und in der Umsetzung von Erkenntnissen in systematische Veränderungen.
- Starke Kommunikationsfähigkeiten und geschäftsfließendes Englisch.
- Bereitschaft zur Teilnahme an Bereitschaftsdiensten, um die Zuverlässigkeit unserer Plattform sicherzustellen.
- Nice-to-Have Qualifications:
- Produktionstaugliche API-Gateways mit Gateway API (z.B. Envoy Gateway) ausgerollt.
- Multi-Cluster-Service-Meshes (z.B. Cilium, Linkerd, Istio) betrieben.
- Kubernetes-Operatoren (z.B. Strimzi, CNPG) bereitgestellt und gewartet.
- Hochverfügbares PostgreSQL in der Produktion betrieben.
Senior Site Reliability Engineer (m/f/d) Arbeitgeber: Flip GmbH
Flip ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einem flexiblen Remote-First-Arbeitsmodell und einem starken Fokus auf Work-Life-Balance unterstützt Flip seine Mitarbeiter nicht nur bei ihrer beruflichen Entwicklung, sondern fördert auch eine positive Unternehmenskultur durch regelmäßige Team-Events und die Möglichkeit, im europäischen Ausland zu arbeiten. Hier haben Sie die Chance, aktiv an der Gestaltung eines schnell wachsenden Tech-Unternehmens mitzuwirken und Ihre Karriere in einem unterstützenden Team voranzutreiben.