Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

Pforzheim Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
FACT-Finder

Auf einen Blick

  • Aufgaben: Definiere und besitze SLOs, SLIs und Fehlerbudgets; leite die Incident-Reaktion.
  • Unternehmen: Innovatives Unternehmen mit modernem Tech-Stack und starkem Teamgeist.
  • Vorteile: Flexibles hybrides Arbeitsmodell, klare Verantwortlichkeiten und Raum für persönliches Wachstum.
  • Weitere Informationen: Starkes Team mit offener Feedbackkultur und Fokus auf Zuverlässigkeit.
  • Warum dieser Job: Beeinflusse direkt den Umsatz führender eCommerce-Marken in Europa.
  • Qualifikationen: Erfahrung mit Kubernetes in Produktion und SRE-Praktiken.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

Einführung

Standort & Arbeitsmodell: Berlin, hybrid

Technologiestack: Kubernetes auf unseren eigenen Servern, Harvester (KubeVirt), Argo CD/Flux, Prometheus/Grafana, Longhorn/Ceph

Team: Ein wachsendes SRE-Team – Sie berichten vorerst an unseren CTPO und an den Teamleiter SRE, den wir als Nächstes einstellen; zwei Systemadministratoren in Pforzheim betreuen die physische Hardware.

Prozess: Einführungsgespräch · Hausaufgabe (~2h) · 90-minütiges technisches Interview mit unseren Entwicklern · Führungsgespräch · Team kennenlernen

Sprachen: Fließendes Englisch erforderlich; Deutsch ist ein Plus, aber kein Muss.

Warum diese Rolle besonders ist

Die meisten SRE-Jobs heute bedeuten, in einer verwalteten Cloud-Konsole zu klicken. Dieser nicht. Wir betreiben unsere eigene Hardware in Frankfurt und bauen eine moderne private Cloud-Plattform auf Kubernetes und Harvester – standardmäßig vor Ort, mit elastischem Burst in die öffentliche Cloud und der Option, später nur cloudbasiert zu arbeiten. Sie werden keine fertige SRE-Praxis übernehmen: Sie helfen, sie zu definieren, Seite an Seite mit unseren Berliner Entwicklungsteams – und Sie sind nicht allein, eine Einstellung eines Teamleiters SRE steht bevor. SRE hier ist eine unterstützende Disziplin: Sie bauen, was unsere Entwickler benötigen, um zuverlässig zu liefern, während zwei Systemadministratoren in Pforzheim die physische Hardware betreuen. Und der Einfluss ist direkt – unsere Produktentdeckungstechnologie unterstützt mehr als 2.000 europäische Online-Shops (Intersport, SPAR, Douglas und mehr) und verarbeitet jährlich Milliarden von Käuferanfragen. Wenn die Produktentdeckung langsam oder ausgefallen ist, verlieren unsere Kunden in Echtzeit Einnahmen.

Ihre ersten 90 Tage

Sie lernen beide Produkte kennen, nehmen an der Bereitschaftsrotation mit einem Buddy teil und übernehmen Ihr erstes Zuverlässigkeitsthema – SLOs für ein Produkt, Alarmierung, die tatsächlich um 3 Uhr morgens hilft, oder Automatisierung eines Teils der Arbeit. Bis Tag 90 haben Sie sichtbare Verbesserungen geliefert und wissen, wohin Sie die Plattform als Nächstes bringen möchten.

Ihre Mission

  • Definieren und Besitzen von SLOs, SLIs und Fehlerbudgets; dateninformierte Entscheidungen zur Zuverlässigkeit vorantreiben
  • Leiten der Vorfallreaktion von Anfang bis Ende: schnelle Erkennung, klare Kommunikation, fehlerfreie Nachbesprechungen – und strukturell ganze Klassen von Vorfällen reduzieren, nicht fallweise
  • Arbeit durch Automatisierung und GitOps eliminieren; unsere Beobachtbarkeit (Metriken, Protokolle, Traces, Alarmierung, Handbücher) über zwei verschiedene Stacks hinweg weiterentwickeln
  • Helfen, unseren benutzerdefinierten Kubernetes-Operator (CRDs) zu erstellen, der zustandsbehaftete Suchcluster deklarativ, selbstheilend und sicher aktualisierbar macht – und die Auto-Skalierung (HPA/VPA, KEDA, Cluster-Auto-Scaler) auszurollen, die die heutige Architektur erschwert
  • Kapazität, Leistung und Kosten sowohl vor Ort als auch in der Cloud planen – einschließlich der großen Katalog- und Spitzenlasten, die unseren Händlern wichtig sind – und KI-Tools verwenden, wo immer sie die Diagnose und den Betrieb messbar beschleunigen.

Ihr Profil

Must-haves:

  • Kubernetes in Produktion – aufgebaut, nicht nur verwendet: Sie haben Cluster auf Ihren eigenen Servern eingerichtet und gewartet (z.B. kubeadm, RKE2, k3s) und kennen den Lebenszyklus und Upgrades von Clustern – nur verwaltete Erfahrung reicht für diese Rolle nicht aus.
  • Erlebte SRE-Praxis: SLOs, Fehlerbudgets, Vorfallmanagement, Bereitschaftsdienst.
  • Praktische Erfahrung mit GitOps oder vergleichbarer Infrastruktur-/Bereitstellungsautomatisierung – Erfahrung mit Argo CD oder Flux ist ein starkes Plus.
  • Solide Beobachtungsfähigkeiten – Metriken, Protokolle, Traces, Alarmierung, denen die Menschen vertrauen.
  • Ein starkes Automatisierungsinstinkt – Sie würden lieber die Ursache eines Problems beheben, als dessen Umgehung zu wiederholen.
  • Eine kollaborative, unterstützende Denkweise – Sie sehen SRE als Dienstleistung für unsere Entwickler: Sie fragen, was sie brauchen, diskutieren offen über Kompromisse und verlieben sich nicht in Ihre eigene Lösung.

Nice-to-haves (genuin optional – wir bringen Ihnen den Rest bei):

  • Harvester, KubeVirt, vSphere/ESXi, OpenStack oder ähnliche Virtualisierungs-/HCI-Plattformen.
  • Container-Speicher (Longhorn, Ceph) und Rechenzentrumsnetzwerke (Lastenausgleich, Ingress, VLAN).
  • Auto-Skalierung (HPA, VPA, KEDA, Cluster-Auto-Scaler) und Kapazitäts-/Kostenplanung.
  • Erfahrung im Aufbau von Kubernetes-Operatoren/CRDs.
  • Deutschkenntnisse.

Zertifizierungen (CKA, CKS) sind willkommen, aber kein Ersatz für praktische Erfahrung – im technischen Interview werden wir nach dem fragen, was Sie tatsächlich gebaut und betrieben haben. Sie müssen nicht jede Anforderung erfüllen – oder Ihr Titel war nie „SRE“? Wenn Sie Produktionssysteme besessen, Vorfälle bearbeitet und tief mit Kubernetes gearbeitet haben, möchten wir von Ihnen hören – Produktionserfahrung und Ingenieursdenken sind uns wichtiger als Titel oder Schlagworte.

Die Freude an der Zusammenarbeit mit uns

  • Einfluss ab dem ersten Tag: Ihre Arbeit beeinflusst direkt die Einnahmen führender E-Commerce-Marken in ganz Europa.
  • Moderner Technologiestack: Kubernetes, Harvester, GitOps, Auto-Skalierung und ein spannender Weg zur Cloud – mit Raum, um Dinge richtig zu bauen.
  • KI-first-Denkweise: Wir nutzen KI als echten Teil unserer täglichen Arbeit, nicht als Schlagwort.
  • Eigenverantwortung & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, Ihre Rolle aktiv zu gestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit drei Bürotagen pro Woche mit Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Ingenieure, eine offene Feedbackkultur und ein Umfeld, in dem Zuverlässigkeit als echte Ingenieurdiziplin behandelt wird.

Jobstandorte: Berlin, München, Pforzheim oder Stockholm (alle hybrid)

Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) Arbeitgeber: FACT-Finder

Als Account Executive für den italienischen Markt bei FactFinder haben Sie die Möglichkeit, in einem dynamischen und innovativen Umfeld zu arbeiten, das auf Wachstum und Zusammenarbeit setzt. Wir bieten Ihnen nicht nur ein attraktives Vergütungspaket mit transparenten Provisionsstrukturen, sondern auch die Chance, Ihre Karriere schnell voranzutreiben und Verantwortung in strategischen Rollen zu übernehmen. Unsere moderne Unternehmenskultur fördert Autonomie und Vertrauen, während Sie mit einem erstklassigen Team zusammenarbeiten und an der Spitze der eCommerce- und KI-Revolution stehen.

FACT-Finder

Kontaktdaten:

FACT-Finder Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) erhalten könntest

Netzwerken in der IT-Community

In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.

Online-Foren und Gruppen nutzen

Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!

Direkt bei FACT-Finder bewerben

Viele Unternehmen, wie FACT-Finder, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.

Überzeugende Projekte zeigen

Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) mit Bravour zu bestehen

Kubernetes
GitOps
Argo CD
Flux
SLOs
Error Budgets
Incident Management

Einige Tipps für deine Bewerbung 🫡

Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!

Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!

Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!

Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf FACT-Finder und die ausgeschriebene Position Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d) zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.

Wie man sich auf ein Vorstellungsgespräch bei FACT-Finder vorbereitet

Technische Vorbereitung ist alles!

Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.

Praxisbeispiele parat haben

In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.

Soft Skills betonen

Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!

Fragen zum Unternehmen vorbereiten

Schau dir spezifisch die Projekte von FACT-Finder an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.