Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Pforzheim Vollzeit 60750 - 74250 € / Jahr (geschätzt) Homeoffice (teilweise)
F

Auf einen Blick

  • Aufgaben: Definiere und besitze SLOs, SLIs und Fehlerbudgets; leite die Incident-Response.
  • Unternehmen: Führende Plattform für Produkterkennung im europäischen E-Commerce.
  • Vorteile: Flexibles hybrides Arbeitsmodell, modernes Tech-Stack und klare Verantwortlichkeiten.
  • Weitere Informationen: Wachstumschancen in einem starken Team mit offener Feedbackkultur.
  • Warum dieser Job: Beeinflusse direkt den Umsatz führender Marken und arbeite mit modernster Technologie.
  • Qualifikationen: Erfahrung mit Kubernetes in Produktion und SRE-Praktiken.

Das prognostizierte Gehalt liegt zwischen 60750 - 74250 € pro Jahr.

Einführung

Standort & Arbeitsmodell: Berlin, hybrid

Technologiestack: Kubernetes auf unseren eigenen Servern, Harvester (KubeVirt), Argo CD/Flux, Prometheus/Grafana, Longhorn/Ceph

Team: Ein wachsendes SRE-Team – Sie berichten vorerst an unseren CTPO und an den Teamleiter SRE, den wir als Nächstes einstellen; zwei Systemadministratoren in Pforzheim betreuen die physische Hardware.

Prozess: Einführungsgespräch · Hausaufgabe (~2h) · 90-minütiges technisches Interview mit unseren Entwicklern · Führungsgespräch · Team kennenlernen

Sprachen: Fließendes Englisch erforderlich; Deutsch ist ein Plus, aber kein Muss.

Warum diese Rolle besonders ist

Die meisten SRE-Jobs heute bedeuten, in einer verwalteten Cloud-Konsole zu klicken. Dieser nicht. Wir betreiben unsere eigene Hardware in Frankfurt und bauen eine moderne private Cloud-Plattform auf Kubernetes und Harvester – standardmäßig vor Ort, mit elastischem Burst in die öffentliche Cloud und der Option, später nur cloudbasiert zu arbeiten. Sie werden keine fertige SRE-Praxis übernehmen: Sie helfen, sie zu definieren, Seite an Seite mit unseren Entwicklungsteams in Berlin – und Sie werden es nicht alleine tun, ein Teamleiter SRE wird als Nächstes eingestellt. SRE hier ist eine unterstützende Disziplin: Sie bauen, was unsere Entwickler benötigen, um zuverlässig zu liefern, während zwei Systemadministratoren in Pforzheim die physische Hardware betreuen. Und der Einfluss ist direkt – unsere Produktentdeckungstechnologie unterstützt mehr als 2.000 europäische Online-Shops (Intersport, SPAR, Douglas und mehr) und verarbeitet jährlich Milliarden von Käuferanfragen. Wenn die Produktentdeckung langsam oder ausgefallen ist, verlieren unsere Kunden in Echtzeit Einnahmen.

Ihre ersten 90 Tage

Sie lernen beide Produkte kennen, nehmen an der Bereitschaftsrotation mit einem Buddy teil und übernehmen Ihr erstes Zuverlässigkeitsthema – SLOs für ein Produkt, Alarmierung, die tatsächlich um 3 Uhr morgens hilft, oder Automatisierung eines Teils der Arbeit. Bis Tag 90 haben Sie sichtbare Verbesserungen geliefert und wissen, wohin Sie die Plattform als Nächstes bringen möchten.

Ihre Mission

  • SLOs, SLIs und Fehlerbudgets definieren und verwalten; datengestützte Zuverlässigkeitsentscheidungen vorantreiben
  • Vorfallreaktion von Anfang bis Ende leiten: schnelle Erkennung, klare Kommunikation, fehlerfreie Nachbesprechungen – und ganze Klassen von Vorfällen strukturell beseitigen, nicht fallweise
  • Arbeit durch Automatisierung und GitOps eliminieren; unsere Beobachtbarkeit (Metriken, Protokolle, Traces, Alarmierung, Handbücher) über zwei verschiedene Stacks weiterentwickeln
  • Unseren benutzerdefinierten Kubernetes-Operator (CRDs) entwickeln, der zustandsbehaftete Suchcluster deklarativ, selbstheilend und sicher aktualisierbar macht – und das Auto-Scaling (HPA/VPA, KEDA, Cluster-Auto-Scaler) ausrollen, das die heutige Architektur erschwert
  • Kapazität, Leistung und Kosten sowohl vor Ort als auch in der Cloud planen – einschließlich der großen Katalog- und Spitzenlasten, die unseren Händlern wichtig sind – und KI-Tools überall dort einsetzen, wo sie messbar Diagnose und Betrieb beschleunigen

Ihr Profil

Must-haves:

  • Kubernetes in Produktion – aufgebaut, nicht nur verwendet: Sie haben Cluster auf Ihren eigenen Servern eingerichtet und gewartet (z.B. kubeadm, RKE2, k3s) und kennen den Lebenszyklus und Upgrades von Clustern – nur verwaltete Erfahrung reicht für diese Rolle nicht aus
  • Erlebte SRE-Praxis: SLOs, Fehlerbudgets, Vorfallmanagement, Bereitschaft
  • Praktische Erfahrung mit GitOps oder vergleichbarer Infrastruktur-/Bereitstellungsautomatisierung – Erfahrung mit Argo CD oder Flux ist ein starkes Plus
  • Solide Beobachtungsfähigkeiten – Metriken, Protokolle, Traces, Alarmierung, denen man vertraut
  • Ein starkes Automatisierungsinstinkt – Sie würden lieber die Ursache eines Problems beheben, als dessen Umgehung zu wiederholen
  • Eine kollaborative, unterstützende Denkweise – Sie sehen SRE als Dienstleistung für unsere Entwickler: Sie fragen, was sie brauchen, diskutieren offen über Kompromisse und verlieben sich nicht in Ihre eigene Lösung

Nice-to-haves (genuin optional – wir bringen Ihnen den Rest bei):

  • Harvester, KubeVirt, vSphere/ESXi, OpenStack oder ähnliche Virtualisierungs-/HCI-Plattformen
  • Container-Speicher (Longhorn, Ceph) und Rechenzentrumsnetzwerke (Lastverteilung, Ingress, VLAN)
  • Auto-Scaling (HPA, VPA, KEDA, Cluster-Auto-Scaler) und Kapazitäts-/Kostenplanung
  • Erfahrung im Aufbau von Kubernetes-Operatoren/CRDs
  • Deutschkenntnisse
  • Zertifizierungen (CKA, CKS) sind willkommen, aber kein Ersatz für praktische Erfahrung – im technischen Interview werden wir nach dem fragen, was Sie tatsächlich gebaut und betrieben haben. Sie müssen nicht jede Box abhaken – oder Ihr Titel war nie „SRE“? Bewerben Sie sich trotzdem. Wenn Sie Produktionssysteme besessen, Vorfälle bearbeitet und tief mit Kubernetes gearbeitet haben, möchten wir von Ihnen hören – Produktionserfahrung und Ingenieursdenken sind uns wichtiger als Titel oder Schlagworte.

Die Freude an der Zusammenarbeit mit uns

  • Einfluss ab dem ersten Tag: Ihre Arbeit beeinflusst direkt die Einnahmen führender eCommerce-Marken in ganz Europa.
  • Moderner Technologiestack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg zur Cloud – mit Raum, Dinge richtig zu gestalten.
  • KI-first-Denkweise: Wir nutzen KI als echten Teil unserer täglichen Arbeit, nicht als Schlagwort.
  • Eigenverantwortung & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, Ihre Rolle aktiv zu gestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit drei Bürotagen pro Woche mit Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Ingenieure, eine offene Feedbackkultur und ein Umfeld, in dem Zuverlässigkeit als echte Ingenieurdiziplin behandelt wird.

Jobstandorte: Berlin, München, Pforzheim oder Stockholm (alle hybrid)

Über uns

Wir sind eine der führenden Produktentdeckungsplattformen für den europäischen eCommerce. Unsere Suche, Navigation und Empfehlungen verarbeiten jährlich Milliarden von Käuferanfragen – und treiben einen kombinierten GMV von mehr als 160 Milliarden Euro bei unseren Kunden. Dazu gehören Intersport, Spar, Douglas und mehr als 2.000 weitere B2B- und B2C-eCommerce-Unternehmen in ganz Europa. Seit über 20 Jahren sind wir ein wesentlicher Bestandteil der komplexen eCommerce-Landschaft, und mit unserem KI-gestützten Produktentdeckungserlebnis (PDX) treten wir nun in die nächste Phase ein – als Private-Equity-geführtes Unternehmen (Genui), unter einem neuen, von McKinsey geprägten Managementteam, mit einem klaren Wachstums- und EBITDA-Plan. Büros in Pforzheim, Berlin, München und Stockholm.

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) Arbeitgeber: FactFinder

FactFinder ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einem attraktiven Vergütungsmodell, klaren Entwicklungsperspektiven und der Chance, aktiv an der Gestaltung von Prozessen und Playbooks mitzuwirken, fördert das Unternehmen eine Kultur des Wachstums und der Verantwortung. Die hybride Arbeitsweise und moderne Technologien wie Salesforce und KI-gestützte Workflows sorgen dafür, dass Du Deine Kunden bestmöglich unterstützen kannst und gleichzeitig eine ausgewogene Work-Life-Balance genießt.

F

Kontaktdaten:

FactFinder Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) erhalten könntest

Netzwerken in der IT-Community

In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.

Online-Foren und Gruppen nutzen

Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!

Direkt bei FactFinder bewerben

Viele Unternehmen, wie FactFinder, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.

Überzeugende Projekte zeigen

Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) mit Bravour zu bestehen

Kubernetes
GitOps
Argo CD
Flux
SLOs
Error Budgets
Incident Management

Einige Tipps für deine Bewerbung 🫡

Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!

Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!

Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!

Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf FactFinder und die ausgeschriebene Position Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.

Wie man sich auf ein Vorstellungsgespräch bei FactFinder vorbereitet

Technische Vorbereitung ist alles!

Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.

Praxisbeispiele parat haben

In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.

Soft Skills betonen

Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!

Fragen zum Unternehmen vorbereiten

Schau dir spezifisch die Projekte von FactFinder an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.