Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Berlin Vollzeit 63000 - 77000 € / Jahr (geschätzt) Hybrid
F

Auf einen Blick

  • Aufgaben: Entwickle und betreibe Kubernetes-Cluster auf eigener Hardware für eine moderne Cloud-Plattform.
  • Unternehmen: Innovatives Unternehmen mit einem starken Fokus auf SRE und modernster Technologie.
  • Vorteile: Flexibles Arbeiten, modernes Tech-Stack, und die Möglichkeit, echten Einfluss zu nehmen.
  • Weitere Informationen: Wachstumsorientierte Umgebung mit kurzen Entscheidungswegen und einem starken Team.
  • Warum dieser Job: Gestalte die SRE-Praxis aktiv mit und beeinflusse den Erfolg führender eCommerce-Marken.
  • Qualifikationen: Erfahrung mit Kubernetes in Produktion und SRE-Praktiken erforderlich.

Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.

Einführung

Standort & Arbeitsmodell: Berlin, hybrid

Technologiestack: Kubernetes auf unseren eigenen Servern, Harvester (KubeVirt), Argo CD/Flux, Prometheus/Grafana, Longhorn/Ceph

Team: Ein wachsendes SRE-Team – Sie berichten vorerst an unseren CTPO und an den Teamleiter SRE, den wir als Nächstes einstellen; zwei Systemadministratoren in Pforzheim betreuen die physische Hardware.

Prozess: Einführungsgespräch · Hausaufgabe (~2h) · 90-minütiges technisches Interview mit unseren Entwicklern · Führungsgespräch · Team kennenlernen

Sprachen: Fließendes Englisch erforderlich; Deutsch ist ein Plus, aber kein Muss.

Warum diese Rolle besonders ist

Die meisten SRE-Jobs heute bedeuten, dass man in einer verwalteten Cloud-Konsole herumklickt. Dieser nicht. Wir betreiben unsere eigene Hardware in Frankfurt und bauen eine moderne private Cloud-Plattform auf Kubernetes und Harvester – standardmäßig vor Ort, mit elastischem Burst in die öffentliche Cloud und der Option, später nur cloudbasiert zu arbeiten. Sie werden keine fertige SRE-Praxis übernehmen: Sie helfen, sie zu definieren, Seite an Seite mit unseren Entwicklungsteams in Berlin – und Sie sind nicht allein, eine Einstellung eines Teamleiters SRE steht bevor. SRE hier ist eine unterstützende Disziplin: Sie bauen, was unsere Entwickler benötigen, um zuverlässig zu liefern, während zwei Systemadministratoren in Pforzheim die physische Hardware betreuen. Und der Einfluss ist direkt – unsere Produktentdeckungstechnologie unterstützt mehr als 2.000 europäische Online-Shops (Intersport, SPAR, Douglas und mehr) und verarbeitet jährlich Milliarden von Käuferanfragen. Wenn die Produktentdeckung langsam oder ausgefallen ist, verlieren unsere Kunden in Echtzeit Einnahmen.

Ihre ersten 90 Tage

Sie lernen beide Produkte kennen, nehmen an der Bereitschaftsrotation mit einem Buddy teil und übernehmen Ihr erstes Zuverlässigkeitsthema – SLOs für ein Produkt, Alarmierung, die tatsächlich um 3 Uhr morgens hilft, oder Automatisierung eines Teils der Arbeit. Bis zum Tag 90 haben Sie sichtbare Verbesserungen geliefert und wissen, wohin Sie die Plattform als Nächstes bringen möchten.

Ihre Mission

  • SLOs, SLIs und Fehlerbudgets definieren und besitzen; datengestützte Zuverlässigkeitsentscheidungen vorantreiben
  • Incident Response end-to-end leiten: schnelle Erkennung, klare Kommunikation, fehlerfreie Nachbesprechungen – und ganze Klassen von Vorfällen strukturell reduzieren, nicht fallweise
  • Arbeit durch Automatisierung und GitOps eliminieren; unsere Beobachtbarkeit (Metriken, Protokolle, Traces, Alarmierung, Runbooks) über zwei verschiedene Stacks weiterentwickeln
  • Unseren benutzerdefinierten Kubernetes-Operator (CRDs) entwickeln, der zustandsbehaftete Suchcluster deklarativ, selbstheilend und sicher aktualisierbar macht – und das Auto-Scaling (HPA/VPA, KEDA, Cluster-Auto-Scaler) ausrollen, das die heutige Architektur erschwert
  • Kapazität, Leistung und Kosten sowohl vor Ort als auch in der Cloud planen – einschließlich der großen Katalog- und Spitzenlasten, die unseren Händlern wichtig sind – und KI-Tools verwenden, wo sie messbar die Diagnose und den Betrieb beschleunigen

Ihr Profil

Must-haves:

  • Kubernetes in Produktion – aufgebaut, nicht nur verwendet: Sie haben Cluster auf Ihren eigenen Servern eingerichtet und gewartet (z.B. kubeadm, RKE2, k3s) und kennen den Lebenszyklus und Upgrades von Clustern – nur verwaltete Erfahrung reicht für diese Rolle nicht aus
  • Erlebte SRE-Praxis: SLOs, Fehlerbudgets, Incident Management, Bereitschaft
  • Praktische Erfahrung mit GitOps oder vergleichbarer Infrastruktur-/Bereitstellungsautomatisierung – Erfahrung mit Argo CD oder Flux ist ein starkes Plus
  • Solide Beobachtungsfähigkeiten – Metriken, Protokolle, Traces, Alarmierung, denen die Menschen vertrauen
  • Ein starkes Automatisierungsinstinkt – Sie würden lieber die Ursache eines Problems beheben, als dessen Umgehung zu wiederholen
  • Eine kollaborative, unterstützende Denkweise – Sie sehen SRE als Dienstleistung für unsere Entwickler: Sie fragen, was sie brauchen, diskutieren offen über Kompromisse und verlieben sich nicht in Ihre eigene Lösung

Nice-to-haves (genuin optional – wir bringen Ihnen den Rest bei):

  • Harvester, KubeVirt, vSphere/ESXi, OpenStack oder ähnliche Virtualisierungs-/HCI-Plattformen
  • Container-Speicher (Longhorn, Ceph) und Rechenzentrumsnetzwerke (Lastverteilung, Ingress, VLAN)
  • Auto-Scaling (HPA, VPA, KEDA, Cluster-Auto-Scaler) und Kapazitäts-/Kostenplanung
  • Erfahrung im Aufbau von Kubernetes-Operatoren/CRDs
  • Deutschkenntnisse
  • Zertifizierungen (CKA, CKS) sind willkommen, aber kein Ersatz für praktische Erfahrung – im technischen Interview werden wir nach dem fragen, was Sie tatsächlich gebaut und betrieben haben.

Sie müssen nicht jede Anforderung erfüllen – oder Ihr Titel war nie „SRE“? Bewerben Sie sich trotzdem. Wenn Sie Produktionssysteme besessen, Vorfälle bearbeitet und tief mit Kubernetes gearbeitet haben, möchten wir von Ihnen hören – Produktionserfahrung und Ingenieursdenken sind uns wichtiger als Titel oder Schlagworte.

Die Freude an der Zusammenarbeit mit uns

  • Einfluss von Tag eins: Ihre Arbeit beeinflusst direkt die Einnahmen führender E-Commerce-Marken in ganz Europa.
  • Moderner Technologiestack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg zur Cloud – mit Raum, Dinge richtig zu bauen.
  • KI-first-Denkweise: Wir nutzen KI als echten Teil unserer täglichen Arbeit, nicht als Schlagwort.
  • Eigenverantwortung & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, Ihre Rolle aktiv zu gestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit drei Bürotagen pro Woche und Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Ingenieure, eine offene Feedbackkultur und ein Umfeld, in dem Zuverlässigkeit als echte Ingenieurdiziplin behandelt wird.

Jobstandorte: Berlin, München, Pforzheim oder Stockholm (alle hybrid)

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) Arbeitgeber: FactFinder

FactFinder ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einem attraktiven Vergütungsmodell, klaren Entwicklungsperspektiven und der Chance, aktiv an der Gestaltung von Prozessen und Playbooks mitzuwirken, fördert das Unternehmen eine Kultur des Wachstums und der Verantwortung. Die hybride Arbeitsweise und moderne Technologien wie Salesforce und KI-gestützte Workflows sorgen dafür, dass Du Deine Kunden bestmöglich unterstützen kannst und gleichzeitig eine ausgewogene Work-Life-Balance genießt.

F

Kontaktdaten:

FactFinder Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) mit Bravour zu bestehen

Kubernetes
GitOps
Argo CD
Flux
SLOs
Error Budgets
Incident Management