Principal Site Reliability Engineer

Principal Site Reliability Engineer

Geneva Vollzeit 63000 - 77000 € / Jahr (geschätzt) Homeoffice (teilweise)

Auf einen Blick

  • Aufgaben: Leite die Zuverlässigkeitsstrategie für unsere Cloud-Plattform und Produktionsdienste.
  • Unternehmen: ID Quantique, ein führendes Unternehmen in der Quantenkommunikation.
  • Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitsmodelle und kontinuierliche Weiterbildung.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrierechancen und einer leistungsorientierten Kultur.
  • Warum dieser Job: Gestalte die Zukunft der Quantenkommunikation und arbeite mit einem globalen Expertenteam.
  • Qualifikationen: Über 15 Jahre Erfahrung in der Produktionstechnik und Führungskompetenz.

Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.

ID Quantique (IDQ) ist ein globaler Marktführer in quantensicheren Kommunikations- und Quantenmesssystemen. Wir bieten Lösungen zum Schutz von Regierungen, Telekommunikationsinfrastrukturen und Finanzinstituten vor der Bedrohung "ernten jetzt, später entschlüsseln" und liefern sowohl terrestrische als auch weltraumbasierte quantensichere Netzwerke im weltweiten Live-Betrieb.

Unsere Quantenmesssysteme erweitern die Grenzen der Einzelphotonenmessung und ermöglichen Durchbrüche in der Quantenkommunikation, Sensorik, Computertechnik und ultrasensitiven Bildgebung in Zusammenarbeit mit führenden Forschern und Technologieinnovatoren weltweit.

Was Sie erwarten können

Das Platform Engineering-Team baut, sichert und betreibt skalierbare Infrastrukturen, die cloudverwaltete SaaS-Produkte mit vor Ort eingesetzten Komponenten an Kundenstandorten unterstützen. Als Principal Site Reliability Engineer werden Sie die technische Führung für die Zuverlässigkeit unserer globalen Plattform übernehmen. Sie definieren die Strategie, Standards und das Betriebsmodell, um hochverfügbare, resiliente und sichere Dienste zu gewährleisten, während Sie aktiv an der Gestaltung und dem Betrieb der Technologien beteiligt sind, die unsere Produktionsumgebungen untermauern.

Sie arbeiten eng mit Architektur, DevSecOps, Cloud Operations und Produktentwicklung zusammen, um eine Kultur der Beobachtbarkeit, Automatisierung und kontinuierlichen Verbesserung zu fördern, wobei Sie sicherstellen, dass Probleme identifiziert und gelöst werden, bevor sie die Kunden beeinträchtigen.

  • Definieren und leiten Sie die Zuverlässigkeitsstrategie für Tier 1 und Tier 2 Produktionsdienste, einschließlich Service-Level-Ziele, Fehlerbudgets, Beobachtbarkeit, Resilienz, Notfallwiederherstellung und Cloud-Sicherheit.
  • Gestalten und betreiben Sie Beobachtungsplattformen, leiten Sie Chaos-Engineering- und Notfallwiederherstellungsinitiativen, verbessern Sie die Zuverlässigkeit von PostgreSQL, Redis/Valkey, Kafka und OpenSearch und liefern Sie AI Ops-Funktionen, einschließlich prädiktiver Überwachung, automatisierter Behebung und Selbstheilung.
  • Leiten Sie die Reaktion auf schwerwiegende Vorfälle, den Bereitschaftsdienst und die globale Eskalation, während Sie Ingenieure betreuen und Ingenieurstandards etablieren, die in der gesamten Organisation übernommen werden.

Was Sie tun werden

Sie sind verantwortlich für die Zuverlässigkeit, Resilienz und betriebliche Exzellenz unserer Cloud-Plattform und Produktionsdienste und integrieren Zuverlässigkeitsprinzipien in architektonische Entscheidungen und Plattformdesigns. Sie etablieren Beobachtungsstandards, die Metriken, Protokolle, verteilte Nachverfolgung und Profiling abdecken, während Sie die Service-Level-Ziele und Fehlerbudgets über die Ingenieurteams hinweg steuern.

Sie leiten die Resilienztechnik durch Chaos-Tests, Notfallwiederherstellungsplanung und validierte Failover-Übungen, teilen sich die Verantwortung für die Cloud-Sicherheitslage mit DevSecOps und stellen die Zuverlässigkeit unserer kritischen Daten- und Streaming-Plattformen sicher. Sie optimieren die Plattformeffizienz durch Automatisierung, KI-gesteuerte Operationen und kontinuierliche betriebliche Verbesserung.

  • Verantwortung für Produktionszuverlässigkeit, Beobachtbarkeit, Service-Level-Ziele, Fehlerbudgets, Resilienz, Backup und Notfallwiederherstellung, Cloud-Sicherheit und Plattformgovernance über alle kritischen Dienste hinweg.
  • Leiten Sie das Incident Command, die Kommunikation mit Führungskräften, Nachbesprechungen nach Vorfällen, den Bereitschaftsdienst und die globale Eskalation, während Sie prädiktive Überwachung, automatisierte Behebung und Selbstheilungsfähigkeiten bereitstellen.
  • Arbeiten Sie mit Architektur, DevSecOps, Cloud Operations und Produktentwicklung zusammen, um Ingenieurstandards zu etablieren, Ingenieure zu betreuen und eine gemeinsame Zuverlässigkeits-Roadmap zu liefern.

Was Sie mitbringen

Sie sind ein erfahrener Leiter im Bereich Site Reliability Engineering mit mehr als 15 Jahren Erfahrung in der Produktionsingenieurtechnik und haben kürzlich praktische Verantwortung für großangelegte, fehlertolerante Produktionssysteme auf AWS oder GCP übernommen. Sie haben erfolgreich Beobachtungsplattformen entworfen und betrieben, Programme für Service-Level-Ziele implementiert und messbare Verbesserungen in Verfügbarkeit, Zuverlässigkeit und mittlerer Wiederherstellungszeit erzielt.

Sie haben hochgradige Produktionsvorfälle geleitet, Resilienztests und Notfallwiederherstellungsübungen geplant und durchgeführt sowie Ingenieurpraktiken über mehrere Teams hinweg durch technische Führung und Mentoring beeinflusst.

  • 15+ Jahre Erfahrung in der Produktionsingenieurtechnik mit aktueller praktischer Verantwortung für großangelegte, fehlertolerante Produktionssysteme auf AWS oder GCP, einschließlich Verantwortung für Beobachtbarkeit, Service-Level-Ziele und Fehlerbudgets.
  • Nachgewiesene Erfahrung in der Leitung von Resilienzinitiativen, validierten Notfallwiederherstellungen und Failover-Tests sowie im Umgang mit hochgradigen Produktionsvorfällen und messbaren Zuverlässigkeitsverbesserungen.
  • Nachgewiesene technische Führung durch Architekturüberprüfungen, Governance, Mentoring, Coaching und Ingenieurstandards, die in mehreren Teams und Diensten übernommen wurden.

Sie passen gut zu uns, wenn

Sie verfügen über umfassende Kenntnisse in der Cloud-Infrastruktur, Plattformtechnik und Cloud-Sicherheit, mit praktischer Erfahrung in der Sicherung verteilter Produktionsumgebungen durch Cloud-Sicherheitsmanagement, Erkennung von Laufzeitanfälligkeiten und automatisierte Durchsetzung von Richtlinien. Sie verstehen, wie man Zuverlässigkeit, Sicherheit, Netzwerk und betriebliche Effizienz im großen Maßstab ausbalanciert.

Sie haben Erfahrung in der Implementierung von KI-gesteuerten Betriebsfähigkeiten, der Anwendung von FinOps-Prinzipien zur Optimierung der Infrastruktur und der Gestaltung hochverfügbarer verteilter Systeme, die außergewöhnliche Resilienz und Leistung bieten.

  • Nachgewiesene Erfahrung im Cloud-Sicherheitsmanagement, im Schutz von Arbeitslasten, in der Richtlinie-als-Code, in der standardmäßig sicheren Infrastruktur und in der automatisierten Sicherheitsdurchsetzung über cloudnative Plattformen und CI/CD-Pipelines.
  • Praktische Erfahrung mit KI-Verkehrsmanagement durch LLM-Gateways, Kapazitätsplanung, Ressourcenoptimierung, FinOps-basierte Optimierung, autonome Operationen, prädiktive Alarmierung und selbstheilende Plattformen.
  • Tiefes Wissen über Netzwerke, Routing, Lastenausgleich, Verbindungsresilienz und verteilte Systeme, mit der Fähigkeit, Netzwerk, Sicherheit und Zuverlässigkeit in skalierbare Plattformarchitekturen zu integrieren.

Was wir bieten

Eine Rolle bei einem der am schnellsten wachsenden und aufregendsten Quantenunternehmen der Welt. Ein wettbewerbsfähiges Vergütungssystem, ein Leistungspaket und einen Aktienplan, die darauf ausgelegt sind, Exzellenz zu belohnen. Flexible Arbeitsmodelle, die es Ihnen ermöglichen, Ihr Leben, Ihre Familie und Ihre Karriere in Einklang zu bringen. Laufende Schulungen und Weiterbildungen, um Ihre Fähigkeiten scharf zu halten und Ihr Wachstum auf Kurs zu halten. Einen Karriereentwicklungsplan innerhalb der Unternehmen der IonQ-Gruppe. Eine dynamische, eng verbundene Umgebung, in der Sie mit einem globalen Team von Experten zusammenarbeiten. Eine leistungsorientierte Kultur, die auf Vertrauen, Teamarbeit und gemeinsamen Ambitionen basiert.

ID Quantique/IonQ ist ein Arbeitgeber, der Chancengleichheit bietet und qualifizierte Bewerber ohne Rücksicht auf Rasse, Hautfarbe, Glauben, Religion, nationale Herkunft, Geschlecht, sexuelle Orientierung, Geschlechtsidentität, Alter, Behinderung, Veteranenstatus oder einen anderen gesetzlich geschützten Status berücksichtigt.

Principal Site Reliability Engineer Arbeitgeber: 아이디퀀티크

ID Quantique (IDQ) bietet als Teil von IONQ eine herausragende Arbeitsumgebung für Senior Mechanical Engineers in Genf, wo innovative Lösungen im Bereich der quantensicheren Kommunikation entwickelt werden. Mit einem starken Fokus auf Mitarbeiterentwicklung, flexiblen Arbeitsmodellen und einer dynamischen Teamkultur fördert das Unternehmen eine Atmosphäre des Vertrauens und der Zusammenarbeit, die es den Mitarbeitern ermöglicht, ihre Fähigkeiten kontinuierlich zu erweitern und an spannenden Projekten mit globaler Reichweite zu arbeiten.

Kontaktdaten:

아이디퀀티크 Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Principal Site Reliability Engineer mit Bravour zu bestehen

Cloud Infrastructure
Site Reliability Engineering
Observability Platforms
Service-Level Objectives
Disaster Recovery Planning
Chaos Engineering
Production Incident Management