Auf einen Blick
- Aufgaben: Entwickle und betreibe Kubernetes-Cluster auf eigener Hardware für innovative Cloud-Lösungen.
- Unternehmen: Wachsendes Unternehmen mit modernem Tech-Stack und flexibler Arbeitskultur.
- Vorteile: Einfluss auf große eCommerce-Marken, modernes Arbeitsumfeld und Raum für persönliche Entwicklung.
- Weitere Informationen: Flexible Arbeitsmodelle und ein unterstützendes Team warten auf dich.
- Warum dieser Job: Gestalte die SRE-Praxis aktiv mit und erlebe direkten Einfluss auf den Geschäftserfolg.
- Qualifikationen: Erfahrung mit Kubernetes in Produktion und SRE-Praktiken erforderlich.
Das prognostizierte Gehalt liegt zwischen 56700 - 69300 € pro Jahr.
Einführung
Standort & Arbeitsmodell: Berlin, hybrid
Technologiestack: Kubernetes auf unseren eigenen Servern, Harvester (KubeVirt), Argo CD/Flux, Prometheus/Grafana, Longhorn/Ceph
Team: Ein wachsendes SRE-Team - Sie berichten vorerst an unseren CTPO und an den Teamleiter SRE, den wir als nächstes einstellen; zwei Systemadministratoren in Pforzheim betreuen die physische Hardware.
Prozess: Einführungsgespräch - Hausaufgabe (~2h) - 90-minütiges technisches Interview mit unseren Entwicklern - Führungsgespräch - Team kennenlernen
Sprachen: Fließendes Englisch erforderlich; Deutsch ist ein Plus, aber kein Muss.
Warum diese Rolle besonders ist
Die meisten SRE-Jobs heute bedeuten, dass man in einer verwalteten Cloud-Konsole herumklickt. Dieser nicht. Wir betreiben unsere eigene Hardware in Frankfurt und bauen eine moderne private Cloud-Plattform auf Kubernetes und Harvester - standardmäßig vor Ort, mit elastischem Burst in die öffentliche Cloud und der Option, später nur cloudbasiert zu arbeiten. Sie werden keine fertige SRE-Praxis übernehmen: Sie helfen, sie zusammen mit unseren Entwicklungsteams in Berlin zu definieren - und Sie werden es nicht alleine tun, ein Teamleiter SRE wird als nächstes eingestellt. SRE hier ist eine unterstützende Disziplin: Sie bauen, was unsere Entwickler benötigen, um zuverlässig zu liefern, während zwei Systemadministratoren in Pforzheim die physische Hardware betreuen. Und der Einfluss ist direkt - unsere Produktentdeckungstechnologie unterstützt mehr als 2.000 europäische Online-Shops (Intersport, SPAR, Douglas und mehr) und verarbeitet jährlich Milliarden von Käuferanfragen. Wenn die Produktentdeckung langsam oder ausgefallen ist, verlieren unsere Kunden in Echtzeit Einnahmen.
Ihre ersten 90 Tage
Sie lernen beide Produkte kennen, nehmen an der Bereitschaftsrotation mit einem Buddy teil und übernehmen Ihr erstes Zuverlässigkeitsthema - SLOs für ein Produkt, Alarmierung, die tatsächlich um 3 Uhr morgens hilft, oder Automatisierung eines Teils der Arbeit. Bis Tag 90 haben Sie sichtbare Verbesserungen geliefert und wissen, wohin Sie die Plattform als Nächstes bringen möchten.
Ihre Mission
- SLOs, SLIs und Fehlerbudgets definieren und besitzen; datengestützte Zuverlässigkeitsentscheidungen vorantreiben
- Vorfallreaktion von Anfang bis Ende leiten: schnelle Erkennung, klare Kommunikation, fehlerfreie Nachbesprechungen - und ganze Klassen von Vorfällen strukturell reduzieren, nicht fallweise
- Arbeit durch Automatisierung und GitOps eliminieren; unsere Beobachtbarkeit (Metriken, Protokolle, Traces, Alarmierung, Handbücher) über zwei verschiedene Stacks weiterentwickeln
- Unseren benutzerdefinierten Kubernetes-Operator (CRDs) entwickeln, der zustandsbehaftete Suchcluster deklarativ, selbstheilend und sicher aktualisierbar macht - und das Auto-Scaling (HPA/VPA, KEDA, Cluster-Auto-Scaler) ausrollen, das die heutige Architektur erschwert
- Kapazität, Leistung und Kosten sowohl vor Ort als auch in der Cloud planen - einschließlich der großen Katalog- und Spitzenlasten, die unseren Händlern wichtig sind - und KI-Tools verwenden, wo immer sie die Diagnose und den Betrieb messbar beschleunigen
Ihr Profil
Must-haves
- Kubernetes in der Produktion - aufgebaut, nicht nur verwendet: Sie haben Cluster auf Ihren eigenen Servern eingerichtet und gewartet (z.B. kubeadm, RKE2, k3s) und kennen den Lebenszyklus und Upgrades von Clustern - ausschließlich verwaltete Erfahrung reicht für diese Rolle nicht aus
- Erlebte SRE-Praxis: SLOs, Fehlerbudgets, Vorfallmanagement, Bereitschaft
- Praktische Erfahrung mit GitOps oder vergleichbarer Infrastruktur-/Bereitstellungsautomatisierung - Erfahrung mit Argo CD oder Flux ist ein starkes Plus
- Solide Beobachtungsfähigkeiten - Metriken, Protokolle, Traces, Alarmierung, denen die Menschen vertrauen
- Ein starkes Automatisierungsinstinkt - Sie würden lieber die Ursache eines Problems beheben, als dessen Umgehung zu wiederholen
- Eine kollaborative, unterstützende Denkweise - Sie sehen SRE als Dienstleistung für unsere Entwickler: Sie fragen, was sie brauchen, diskutieren offen über Kompromisse und verlieben sich nicht in Ihre eigene Lösung
Nice-to-haves (genuin optional - wir bringen Ihnen den Rest bei)
- Harvester, KubeVirt, vSphere/ESXi, OpenStack oder ähnliche Virtualisierungs-/HCI-Plattformen
- Container-Speicher (Longhorn, Ceph) und Rechenzentrumsnetzwerke (Lastverteilung, Ingress, VLAN)
- Auto-Scaling (HPA, VPA, KEDA, Cluster-Auto-Scaler) und Kapazitäts-/Kostenplanung
- Erfahrung im Aufbau von Kubernetes-Operatoren/CRDs
- Deutschkenntnisse
- Zertifizierungen (CKA, CKS) sind willkommen, aber kein Ersatz für praktische Erfahrung - im technischen Interview werden wir nach dem fragen, was Sie tatsächlich gebaut und betrieben haben.
Sie erfüllen nicht jedes Kriterium - oder Ihr Titel war nie "SRE"? Bewerben Sie sich trotzdem. Wenn Sie Produktionssysteme besessen, Vorfälle bearbeitet und tief mit Kubernetes gearbeitet haben, möchten wir von Ihnen hören - Produktionserfahrung und Ingenieursdenken sind uns wichtiger als Titel oder Schlagworte.
Die Freude an der Zusammenarbeit mit uns
- Einfluss ab dem ersten Tag: Ihre Arbeit beeinflusst direkt die Einnahmen führender E-Commerce-Marken in ganz Europa.
- Moderner Technologiestack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg zur Cloud - mit Raum, Dinge richtig zu gestalten.
- AI-first-Denkweise: Wir nutzen KI als echten Teil unserer täglichen Arbeit, nicht als Schlagwort.
- Eigenverantwortung & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, Ihre Rolle aktiv zu gestalten.
- Flexibles Arbeiten: Hybrid
Senior Site Reliability Engineer / SRE - Kubernetes & Hybrid Cloud (m/f/d) in Berlin Arbeitgeber: FACT-Finder
Als Account Executive für den italienischen Markt bei FactFinder haben Sie die Möglichkeit, in einem dynamischen und innovativen Umfeld zu arbeiten, das auf Wachstum und Zusammenarbeit setzt. Wir bieten Ihnen nicht nur ein attraktives Vergütungspaket mit transparenten Provisionsstrukturen, sondern auch die Chance, Ihre Karriere schnell voranzutreiben und Verantwortung in strategischen Rollen zu übernehmen. Unsere moderne Unternehmenskultur fördert Autonomie und Vertrauen, während Sie mit einem erstklassigen Team zusammenarbeiten und an der Spitze der eCommerce- und KI-Revolution stehen.