Site Reliability Engineer

Site Reliability Engineer

Vollzeit 60000 - 66000 € / Jahr (geschätzt) Kein Homeoffice möglich
K

Auf einen Blick

  • Aufgaben: Sichere die Plattform, reagiere auf Alerts und verbessere kontinuierlich die Zuverlässigkeit.
  • Unternehmen: Innovatives Unternehmen im Gesundheitswesen mit internationalem Team.
  • Vorteile: Attraktives Gehalt, 25 Urlaubstage, Weiterbildung und flexible Arbeitszeiten.
  • Weitere Informationen: Dynamisches Umfeld mit Raum für persönliche Entwicklung und Team-Events.
  • Warum dieser Job: Gestalte die Zukunft der klinischen KI und arbeite an bedeutenden Projekten.
  • Qualifikationen: Erfahrung mit Kubernetes, Linux und Programmierung.

Das prognostizierte Gehalt liegt zwischen 60000 - 66000 € pro Jahr.

Kaiko entwickelt einen Agenten für klinische KI, der Kliniker dabei unterstützt, über Patientendaten, Richtlinien und Diagnosen nachzudenken. Entscheidungen im Gesundheitswesen werden selten von einer einzelnen Person oder aus einer einzigen Datenquelle getroffen. Der Assistent von Kaiko erhält den longitudinalen Patienten-Kontext über Begegnungen, Kliniker und Institutionen hinweg, was Zusammenarbeit, Zweitmeinungen und komplexe diagnostische Arbeitsabläufe ermöglicht. Das System ist so konzipiert, dass es sicher in realen klinischen Umgebungen arbeitet, mit menschlicher Aufsicht, Nachvollziehbarkeit und regulatorischer Übereinstimmung im Kern.

Unser Assistent unterstützt allgemein anwendbare klinische Aufgaben wie die Navigation durch Patientendaten, Interaktion mit Richtlinien, multimodale Interaktion (Chat und Sprache) und Koordination der Versorgung. Darüber hinaus entwickeln wir spezialisierte diagnostische Agenten in Bereichen wie Onkologie, Radiologie und Pathologie.

Wir arbeiten eng mit führenden Krankenhäusern und Forschungszentren zusammen, darunter das Netherlands Cancer Institute (NKI). Kaiko ist ein gut finanziertes Unternehmen mit einem wachsenden internationalen Team, das von Zürich und Amsterdam aus operiert.

Über die Rolle

Dies ist eine frontline Reliability-Rolle, und wir möchten ehrlich sein: Sie werden den Großteil Ihrer Zeit damit verbringen, die Plattform gesund zu halten – auf Alarme zu reagieren, Vorfälle zu triagieren und zu lösen sowie als respektierter Teil der Arbeit Bereitschaftsdienst zu leisten. Der Rest Ihrer Zeit fließt in die Verbesserung dieser Arbeit über die Zeit: Alarme schärfen, Mühe beseitigen und das SRE-Programm stärken, damit dieselben Probleme uns nicht ständig alarmieren.

Wenn Sie motiviert sind, zu verstehen, warum etwas kaputt gegangen ist, und das Problem dauerhaft zu lösen, werden Sie hier gut abschneiden. Wenn Bereitschaftsdienst sich wie eine Steuer anfühlt, die Sie lieber vermeiden würden, ist dies nicht die richtige Position für Sie.

Dies ist eine neu geschaffene Stelle in unserem Observability SRE-Team, sodass Sie die Möglichkeit haben, zu gestalten, wie Zuverlässigkeit bei Kaiko funktioniert, anstatt einen starren Prozess zu übernehmen.

Einige Verantwortungsbereiche

  • Besitzen Sie die reaktive Frontlinie. Übernehmen Sie den Bereitschaftsdienst, triagieren Sie Alarme schnell und methodisch und treiben Sie Vorfälle mit klarer Kommunikation und sauberen Übergaben zur Lösung.
  • Gestalten Sie unsere Alarme vertrauenswürdig. Behandeln Sie laute oder wenig wertvolle Alarme als Mängel, die behoben werden müssen, nicht als Hintergrundgeräusch. Helfen Sie uns, in Richtung strukturierter, abfragbarer Signale und präziser, umsetzbarer Alarmierung zu gelangen.
  • Verwandeln Sie Vorfälle in dauerhafte Lösungen. Führen Sie blameless Postmortems durch und tragen Sie dazu bei, dass Aktionspunkte in unseren Diensten umgesetzt werden.
  • Stärken Sie das SRE-Programm. Schreiben Sie Automatisierungen und Tools, die Mühe beseitigen, Runbooks und Dashboards verbessern und die Bereitschaftsdienstrotation besser dokumentiert hinterlassen, als Sie sie vorgefunden haben.

Über Sie

Diese Dinge halten wir für unerlässlich, damit Sie in dieser Rolle gedeihen können:

  • Tiefgehende Kubernetes-Erfahrung. Sie können echte Fehlermodi unter Druck analysieren und debuggen – Planung, Netzwerk, Ressourcenbelastung, Steuerungsebene vs. Arbeitslastprobleme – und nicht nur einen Cluster über ein Dashboard betreiben.
  • Starke Linux-Grundlagen. Sie sind damit vertraut, auf Betriebssystemebene zu debuggen: Prozesse, Netzwerke, Dateisysteme, Ressourcenlimits.
  • Solide Programmierfähigkeiten. Sie greifen auf Code zurück, um Mühe zu beseitigen, und schreiben wartbare Automatisierungen und Tools. Nachweisbare Erfahrung im Aufbau von Produkten zeigt gute Problemlösungsfähigkeiten und eine komfortable Mentalität zur Wartung komplexer Software.
  • Flüssigkeit in Beobachtbarkeit und Incident-Response. Sie leben bequem in Metriken, Protokollen und Traces, können die Abfrage schreiben, die ein Problem isoliert, und bleiben ruhig, während Sie einen Vorfall leiten.
  • Internalisierte SRE-Prinzipien. SLO/SLI- und Fehlerbudgetdenken, eine Neigung zur Prävention und ein Instinkt zur Reduzierung von Mühe – damit Ihre Verbesserungen das System wirklich zuverlässiger machen.

Wir denken an jemanden mit etwa 3-6 Jahren Erfahrung in der Produktion von SRE, Plattform oder Infrastruktur, aber uns ist nachgewiesene Kompetenz wichtiger als die Anzahl der Jahre.

Soziale Fähigkeiten

  • Lösungsorientiert und pragmatisch; scheuen Sie sich nicht, Lösungen von Grund auf zu entwickeln, wann immer das Problem es erfordert.
  • Kollaborativer Kommunikator, der Teams coacht und klare, umsetzbare Anleitungen schreibt.
  • Neigung zur Automatisierung und Beseitigung von Mühe.

Schön zu haben

  • Erfahrung mit strukturiertem Logging und modernen Alarmierungspraktiken.
  • Flüssigkeit in Infrastructure-as-Code und CI/CD (Terraform, Helm, GitOps und ähnliches).
  • Vertrautheit mit Incident-Management-Tools (Rootly, PagerDuty, incident.io) und der Disziplin rund um Postmortems.
  • Exposition gegenüber regulierten oder risikobehafteten Bereichen (Gesundheit, Fintech, kritische Infrastruktur).

Bei Kaiko glauben wir, dass die besten Ideen aus Zusammenarbeit, Eigenverantwortung und Ambition entstehen. Wir haben ein Team internationaler Experten aufgebaut, in dem Ihre Arbeit direkte Auswirkungen hat. Hier sind einige Werte, die wir schätzen:

  • Eigenverantwortung: Sie haben die Autonomie, Ihre eigenen Ziele zu setzen, kritische Entscheidungen zu treffen und die direkten Auswirkungen Ihrer Arbeit zu sehen.
  • Zusammenarbeit: Sie gehen mit Neugier an Meinungsverschiedenheiten heran, bauen auf gemeinsamen Grundlagen auf und schaffen gemeinsam Lösungen.
  • Ambition: Sie sind von Menschen umgeben, die hohe Standards setzen, Hindernisse als Chancen sehen und unermüdlich daran arbeiten, bessere Ergebnisse für Patienten zu erzielen.

Zusätzlich bieten wir

  • Ein attraktives und wettbewerbsfähiges Gehalt, einen guten Rentenplan und 25 Urlaubstage pro Jahr.
  • Tolle Offsites und Teamevents, um das Team zu stärken und Erfolge gemeinsam zu feiern.
  • Ein Budget von 1000 EUR für Lernen und Entwicklung, um Ihnen beim Wachsen zu helfen.
  • Autonomie, um Ihre Arbeit auf die Weise zu erledigen, die für Sie am besten funktioniert, egal ob Sie ein Kind haben oder frühe Morgenstunden bevorzugen.
  • Eine jährliche Pendlerpauschale.

Kaiko setzt sich dafür ein, ein diverses Team aufzubauen und einen inklusiven, gerechten Einstellungsprozess zu fördern. Wir begrüßen Bewerber aller Hintergründe.

Site Reliability Engineer Arbeitgeber: kaiko.ai

Kaiko.ai in Zürich ist ein hervorragender Arbeitgeber, der eine dynamische und innovative Arbeitsumgebung bietet, in der Mitarbeiter die Möglichkeit haben, an bedeutenden Projekten im Bereich der Gesundheitsdaten und KI zu arbeiten. Mit einem wettbewerbsfähigen Gehalt, einem Lernbudget und 25 Urlaubstagen jährlich fördert das Unternehmen die persönliche und berufliche Weiterentwicklung seiner Mitarbeiter und schafft eine Kultur des kontinuierlichen Lernens und der Zusammenarbeit.

K

Kontaktdaten:

kaiko.ai Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Site Reliability Engineer mit Bravour zu bestehen

Kubernetes
Linux Fundamentals
Programmierung
Automatisierung
Observability
Incident-Response
SRE-Prinzipien