Auf einen Blick
- Aufgaben: Definiere und besitze SLOs, SLIs und Fehlerbudgets; leite die Incident-Response.
- Unternehmen: Führende Plattform für Produkterkennung im europäischen E-Commerce.
- Vorteile: Flexibles hybrides Arbeitsmodell, modernes Tech-Stack und klare Verantwortlichkeiten.
- Weitere Informationen: Wachstumschancen in einem starken Team mit offener Feedbackkultur.
- Warum dieser Job: Beeinflusse direkt den Umsatz führender Marken und arbeite mit modernster Technologie.
- Qualifikationen: Erfahrung mit Kubernetes in Produktion und SRE-Praktiken.
Das prognostizierte Gehalt liegt zwischen 60750 - 74250 € pro Jahr.
Einführung
Standort & Arbeitsmodell: Berlin, hybrid
Technologiestack: Kubernetes auf unseren eigenen Servern, Harvester (KubeVirt), Argo CD/Flux, Prometheus/Grafana, Longhorn/Ceph
Team: Ein wachsendes SRE-Team – Sie berichten vorerst an unseren CTPO und an den Teamleiter SRE, den wir als Nächstes einstellen; zwei Systemadministratoren in Pforzheim betreuen die physische Hardware.
Prozess: Einführungsgespräch · Hausaufgabe (~2h) · 90-minütiges technisches Interview mit unseren Entwicklern · Führungsgespräch · Team kennenlernen
Sprachen: Fließendes Englisch erforderlich; Deutsch ist ein Plus, aber kein Muss.
Warum diese Rolle besonders ist
Die meisten SRE-Jobs heute bedeuten, in einer verwalteten Cloud-Konsole zu klicken. Dieser nicht. Wir betreiben unsere eigene Hardware in Frankfurt und bauen eine moderne private Cloud-Plattform auf Kubernetes und Harvester – standardmäßig vor Ort, mit elastischem Burst in die öffentliche Cloud und der Option, später nur cloudbasiert zu arbeiten. Sie werden keine fertige SRE-Praxis übernehmen: Sie helfen, sie zu definieren, Seite an Seite mit unseren Entwicklungsteams in Berlin – und Sie werden es nicht alleine tun, ein Teamleiter SRE wird als Nächstes eingestellt. SRE hier ist eine unterstützende Disziplin: Sie bauen, was unsere Entwickler benötigen, um zuverlässig zu liefern, während zwei Systemadministratoren in Pforzheim die physische Hardware betreuen. Und der Einfluss ist direkt – unsere Produktentdeckungstechnologie unterstützt mehr als 2.000 europäische Online-Shops (Intersport, SPAR, Douglas und mehr) und verarbeitet jährlich Milliarden von Käuferanfragen. Wenn die Produktentdeckung langsam oder ausgefallen ist, verlieren unsere Kunden in Echtzeit Einnahmen.
Ihre ersten 90 Tage
Sie lernen beide Produkte kennen, nehmen an der Bereitschaftsrotation mit einem Buddy teil und übernehmen Ihr erstes Zuverlässigkeitsthema – SLOs für ein Produkt, Alarmierung, die tatsächlich um 3 Uhr morgens hilft, oder Automatisierung eines Teils der Arbeit. Bis Tag 90 haben Sie sichtbare Verbesserungen geliefert und wissen, wohin Sie die Plattform als Nächstes bringen möchten.
Ihre Mission
- SLOs, SLIs und Fehlerbudgets definieren und verwalten; datengestützte Zuverlässigkeitsentscheidungen vorantreiben
- Vorfallreaktion von Anfang bis Ende leiten: schnelle Erkennung, klare Kommunikation, fehlerfreie Nachbesprechungen – und ganze Klassen von Vorfällen strukturell beseitigen, nicht fallweise
- Arbeit durch Automatisierung und GitOps eliminieren; unsere Beobachtbarkeit (Metriken, Protokolle, Traces, Alarmierung, Handbücher) über zwei verschiedene Stacks weiterentwickeln
- Unseren benutzerdefinierten Kubernetes-Operator (CRDs) entwickeln, der zustandsbehaftete Suchcluster deklarativ, selbstheilend und sicher aktualisierbar macht – und das Auto-Scaling (HPA/VPA, KEDA, Cluster-Auto-Scaler) ausrollen, das die heutige Architektur erschwert
- Kapazität, Leistung und Kosten sowohl vor Ort als auch in der Cloud planen – einschließlich der großen Katalog- und Spitzenlasten, die unseren Händlern wichtig sind – und KI-Tools überall dort einsetzen, wo sie messbar Diagnose und Betrieb beschleunigen
Ihr Profil
Must-haves:
- Kubernetes in Produktion – aufgebaut, nicht nur verwendet: Sie haben Cluster auf Ihren eigenen Servern eingerichtet und gewartet (z.B. kubeadm, RKE2, k3s) und kennen den Lebenszyklus und Upgrades von Clustern – nur verwaltete Erfahrung reicht für diese Rolle nicht aus
- Erlebte SRE-Praxis: SLOs, Fehlerbudgets, Vorfallmanagement, Bereitschaft
- Praktische Erfahrung mit GitOps oder vergleichbarer Infrastruktur-/Bereitstellungsautomatisierung – Erfahrung mit Argo CD oder Flux ist ein starkes Plus
- Solide Beobachtungsfähigkeiten – Metriken, Protokolle, Traces, Alarmierung, denen man vertraut
- Ein starkes Automatisierungsinstinkt – Sie würden lieber die Ursache eines Problems beheben, als dessen Umgehung zu wiederholen
- Eine kollaborative, unterstützende Denkweise – Sie sehen SRE als Dienstleistung für unsere Entwickler: Sie fragen, was sie brauchen, diskutieren offen über Kompromisse und verlieben sich nicht in Ihre eigene Lösung
Nice-to-haves (genuin optional – wir bringen Ihnen den Rest bei):
- Harvester, KubeVirt, vSphere/ESXi, OpenStack oder ähnliche Virtualisierungs-/HCI-Plattformen
- Container-Speicher (Longhorn, Ceph) und Rechenzentrumsnetzwerke (Lastverteilung, Ingress, VLAN)
- Auto-Scaling (HPA, VPA, KEDA, Cluster-Auto-Scaler) und Kapazitäts-/Kostenplanung
- Erfahrung im Aufbau von Kubernetes-Operatoren/CRDs
- Deutschkenntnisse
- Zertifizierungen (CKA, CKS) sind willkommen, aber kein Ersatz für praktische Erfahrung – im technischen Interview werden wir nach dem fragen, was Sie tatsächlich gebaut und betrieben haben. Sie müssen nicht jede Box abhaken – oder Ihr Titel war nie „SRE“? Bewerben Sie sich trotzdem. Wenn Sie Produktionssysteme besessen, Vorfälle bearbeitet und tief mit Kubernetes gearbeitet haben, möchten wir von Ihnen hören – Produktionserfahrung und Ingenieursdenken sind uns wichtiger als Titel oder Schlagworte.
Die Freude an der Zusammenarbeit mit uns
- Einfluss ab dem ersten Tag: Ihre Arbeit beeinflusst direkt die Einnahmen führender eCommerce-Marken in ganz Europa.
- Moderner Technologiestack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg zur Cloud – mit Raum, Dinge richtig zu gestalten.
- KI-first-Denkweise: Wir nutzen KI als echten Teil unserer täglichen Arbeit, nicht als Schlagwort.
- Eigenverantwortung & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, Ihre Rolle aktiv zu gestalten.
- Flexibles Arbeiten: Hybrides Arbeitsmodell mit drei Bürotagen pro Woche mit Fokus auf Ergebnisse.
- Starkes Team: Erfahrene Ingenieure, eine offene Feedbackkultur und ein Umfeld, in dem Zuverlässigkeit als echte Ingenieurdiziplin behandelt wird.
Jobstandorte: Berlin, München, Pforzheim oder Stockholm (alle hybrid)
Über uns
Wir sind eine der führenden Produktentdeckungsplattformen für den europäischen eCommerce. Unsere Suche, Navigation und Empfehlungen verarbeiten jährlich Milliarden von Käuferanfragen – und treiben einen kombinierten GMV von mehr als 160 Milliarden Euro bei unseren Kunden. Dazu gehören Intersport, Spar, Douglas und mehr als 2.000 weitere B2B- und B2C-eCommerce-Unternehmen in ganz Europa. Seit über 20 Jahren sind wir ein wesentlicher Bestandteil der komplexen eCommerce-Landschaft, und mit unserem KI-gestützten Produktentdeckungserlebnis (PDX) treten wir nun in die nächste Phase ein – als Private-Equity-geführtes Unternehmen (Genui), unter einem neuen, von McKinsey geprägten Managementteam, mit einem klaren Wachstums- und EBITDA-Plan. Büros in Pforzheim, Berlin, München und Stockholm.
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) Arbeitgeber: FactFinder
FactFinder ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einem attraktiven Vergütungsmodell, klaren Entwicklungsperspektiven und der Chance, aktiv an der Gestaltung von Prozessen und Playbooks mitzuwirken, fördert das Unternehmen eine Kultur des Wachstums und der Verantwortung. Die hybride Arbeitsweise und moderne Technologien wie Salesforce und KI-gestützte Workflows sorgen dafür, dass Du Deine Kunden bestmöglich unterstützen kannst und gleichzeitig eine ausgewogene Work-Life-Balance genießt.