Site Reliability Engineer - Cloud Operations

Site Reliability Engineer - Cloud Operations

Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
S

Auf einen Blick

  • Aufgaben: Modernisiere und migriere Anwendungen auf Kubernetes für eine zuverlässige Cloud-Plattform.
  • Unternehmen: Führende digitale Bank in der Schweiz mit innovativer Unternehmenskultur.
  • Vorteile: Attraktives Gehalt, Gesundheitsleistungen, flexible Arbeitszeiten und Entwicklungsmöglichkeiten.
  • Weitere Informationen: Dynamisches Umfeld mit großartigen Wachstumschancen und Raum für Kreativität.
  • Warum dieser Job: Gestalte die Zukunft des Bankings mit modernster Technologie und echten Lösungen.
  • Qualifikationen: Mindestens 3 Jahre Erfahrung in SRE oder DevOps und Kenntnisse in Kubernetes.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

At Swissquote, we’re all in. All in to shake things up. All in to build the bank people actually want to use. All in to make finance less boring — und eine Menge mächtiger.

Wir sind die führende digitale Bank der Schweiz — über 1.400 Menschen in Europa, dem Nahen Osten und Asien, die echte Finanzlösungen für über eine Million Kunden weltweit entwickeln. Vom Handel und Investieren bis hin zum alltäglichen Banking decken wir das gesamte Spektrum ab. Wir bewegen uns schnell, aber wir bauen Dinge, auf die wir wirklich stolz sind.

Wachstum schafft Raum. Raum, um Dinge auszuprobieren, Verantwortung zu übernehmen und in einem Tempo zu wachsen, das die meisten Orte nicht bieten können. Ob Sie gerne im Rampenlicht stehen oder es vorziehen, einfach gute Arbeit zu leisten, hier gibt es Platz für beides.

Wir haben den Dresscode abgeschafft — aber nie die Möglichkeit zu feiern. Großer Gewinn oder kleiner, wir machen es wichtig. Ein Ort, an dem die Atmosphäre für sich selbst sorgt.

Als Arbeitgeber, der Chancengleichheit bietet, heißen wir Kandidaten aus allen Hintergründen, Erfahrungen und Perspektiven willkommen, um unserem Team beizutreten und zu unserem gemeinsamen Erfolg beizutragen.

Fühlen Sie es? Es ist ein guter Anfang.

Team Mission und Stakeholder

Sind Sie leidenschaftlich an Kubernetes, verteilten Systemen und der Aufrechterhaltung zuverlässiger Produktionsplattformen in großem Maßstab interessiert?

Schließen Sie sich unserem Cloud Operations-Team an und helfen Sie uns, Anwendungen zu migrieren und zu modernisieren, die im Kern von Swissquote laufen.

Wir suchen einen Site Reliability Engineer, der gerne nah an der Produktion arbeitet, Zuverlässigkeitsprobleme löst und verbessert, wie Anwendungen bereitgestellt und betrieben werden.

In dieser Rolle werden Sie:

  • Produktionsanwendungen auf Kubernetes migrieren und modernisieren,
  • Drittanbieter-Software in unsere Produktionsplattformen integrieren und an unsere Betriebsstandards anpassen,
  • Zusammen mit Software- und IT-Ingenieuren an der Verbesserung von Zuverlässigkeit, Leistung und betrieblicher Bereitschaft arbeiten,
  • Anwendungen auf unserer Service-Mesh-Plattform entwerfen und betreiben,
  • Sichere Bereitstellungsmuster wie Canary-Releases und progressive Rollouts integrieren,
  • SLOs, SLIs und nützliche betriebliche KPIs definieren und diese zur Förderung von Verbesserungen nutzen,
  • Die Beobachtbarkeit über Metriken, Protokolle und Traces verbessern, damit Probleme leichter erkannt und verstanden werden,
  • AI-Tools erkunden und integrieren, die bei der Fehlersuche, Vorfallanalyse und Behebung helfen können,
  • Testen, wie Systeme unter Last, während Ausfällen und wenn Abhängigkeiten verschwinden, reagieren,
  • Wiederholbare betriebliche Arbeiten automatisieren, wann immer es sinnvoll ist,
  • Level-3-Support bereitstellen und an der Rufbereitschaft teilnehmen.
  • Mindestens 3 Jahre Erfahrung in SRE, DevOps, Plattformengineering oder einer ähnlichen produktionsorientierten Rolle,
  • Solide praktische Erfahrung im Betrieb von Produktionslasten auf Kubernetes, OpenShift, EKS oder einer ähnlichen Kubernetes-Plattform,
  • Gute Kenntnisse von Helm und wie man Anwendungen damit paketiert, konfiguriert und pflegt,
  • Erfahrung mit Service-Mesh-Technologien wie Istio oder Linkerd oder starke Kubernetes-Netzwerkkenntnisse,
  • Ein gutes Verständnis von Service-zu-Service-Netzwerken, Verkehrslenkung, mTLS und TLS,
  • Erfahrung mit GitOps und modernen Bereitstellungsstrategien wie Canary oder progressiver Lieferung,
  • Praktisches Verständnis von SRE-Konzepten wie SLIs, SLOs und Fehlerbudgets,
  • Erfahrung mit Beobachtungs- und Tracing-Tools wie Prometheus, Grafana, Elastic Stack oder OpenTelemetry,
  • Starke Linux- und Netzwerkgrundlagen, einschließlich TCP/IP, DNS und Lastverteilung,
  • Komfortabel bei der Fehlersuche von JVM-basierten Anwendungen in der Produktion und in der Lage, Probleme im Zusammenhang mit Heap-Nutzung, Garbage Collection oder JVM-Konfiguration zu untersuchen,
  • Komfortabel beim Automatisieren von Aufgaben mit Python, Go, Bash oder einer anderen Programmiersprache,
  • Erfahrung oder starkes Interesse an der Anwendung von AI zur Beobachtbarkeit, Vorfallreaktion oder operativer Automatisierung,
  • Erfahrung oder starkes Interesse am Betrieb von Anwendungen, die von GPU-Ressourcen oder anderer AI-Infrastruktur abhängen,
  • Vertrautheit mit Infrastructure as Code-Tools wie Terraform, Ansible oder Puppet.

Nice-to-Haves

  • Erfahrung mit Argo CD, Argo Rollouts oder Argo Workflows,
  • Tiefere Erfahrung mit Istio, Linkerd oder Envoy-basierten Service-Mesh-Plattformen,
  • Erfahrung im Entwerfen oder Betreiben von Kubernetes-Plattformen in großem Maßstab,
  • Erfahrung im Betrieb von Java- oder Spring-Boot-Anwendungen in der Produktion,
  • Praktische Erfahrung in der Feinabstimmung von JVM-Anwendungen für Leistung oder latenzarme Arbeitslasten,
  • Erfahrung mit der Integration von Anwendungen in selbst gehostete AI-Plattformen wie vLLM,
  • Erfahrung in der Fehlersuche bei AI-Infrastrukturintegrationen, einschließlich Modellzugriff, GPU-Verfügbarkeit und NVIDIA MIG-Konfigurationen,
  • Kenntnisse in Cilium, eBPF oder anderen modernen Kubernetes-Netzwerktechnologien,
  • Erfahrung mit öffentlichen Cloud- oder großen privaten Cloud-Umgebungen,
  • Ein Homelab, selbst gehostete Dienste oder Nebenprojekte, bei denen Sie experimentieren, Dinge kaputt machen und sie wieder aufbauen können.

Wer Sie sind

  • Sie möchten verstehen, warum Systeme sich so verhalten, wie sie es tun, insbesondere wenn etwas schiefgeht,
  • Sie automatisieren wiederholbare Arbeiten, anstatt sie als Teil des Jobs zu akzeptieren,
  • Sie fühlen sich wohl dabei, über Entwicklungs-, Infrastruktur- und Betriebsteams hinweg zu arbeiten,
  • Es macht Ihnen nichts aus, sich tief in Software einzuarbeiten, die Sie nicht selbst erstellt haben,
  • Sie sind neugierig auf AI und wo sie den Alltag wirklich verbessern kann,
  • Sie sprechen fließend Englisch und haben gute Konversationskenntnisse in Französisch,
  • Sie halten sich über cloud-native Technologien auf dem Laufenden und probieren neue Ansätze aus, wenn sie ein echtes Problem lösen.

Bitte beachten Sie, dass Swissquote niemals sensible persönliche Informationen oder Zahlungen während des Rekrutierungsprozesses anfordert. Jede solche Anfrage ist betrügerisch.

Site Reliability Engineer - Cloud Operations Arbeitgeber: Swissquote Bank

Swissquote ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern in einem dynamischen und internationalen Umfeld zahlreiche Entwicklungsmöglichkeiten bietet. Mit einer offenen Unternehmenskultur, die Teamarbeit und Innovation fördert, können Sie Ihre Fähigkeiten im Bereich Compliance und Datenmanagement weiterentwickeln, während Sie gleichzeitig von flexiblen Arbeitsmodellen und einem unterstützenden Team profitieren. Die Lage in der Schweiz ermöglicht zudem eine hohe Lebensqualität und Zugang zu einem vielfältigen beruflichen Netzwerk.

S

Kontaktdaten:

Swissquote Bank Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Site Reliability Engineer - Cloud Operations mit Bravour zu bestehen

Kubernetes
OpenShift
EKS
Helm
Istio
Linkerd
GitOps