Senior Site Reliability Engineer, DGX Cloud

Senior Site Reliability Engineer, DGX Cloud

Vollzeit 63000 - 77000 € / Jahr (geschätzt) Homeoffice (teilweise)
Nvidia

Auf einen Blick

  • Aufgaben: Bau und Unterstützung von Kubernetes-Clustern für KI-Forschung und Unternehmensanwendungen.
  • Unternehmen: NVIDIA, ein führendes Unternehmen in Grafik- und KI-Technologie.
  • Vorteile: Wettbewerbsfähiges Gehalt, Gesundheitsleistungen und ein unterstützendes Arbeitsumfeld.
  • Weitere Informationen: Dynamisches Umfeld mit Möglichkeiten zur beruflichen Weiterentwicklung.
  • Warum dieser Job: Gestalte die Zukunft der KI mit innovativen Technologien und einem talentierten Team.
  • Qualifikationen: 10+ Jahre Erfahrung in der Betriebsführung und Expertenwissen in Kubernetes.

Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.

NVIDIA hat die Computergraphik, das PC-Gaming und das beschleunigte Rechnen seit mehr als 25 Jahren transformiert. Es ist ein einzigartiges Erbe der Innovation, das durch großartige Technologie und erstaunliche Menschen angetrieben wird. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Rechnens zu definieren. Eine Ära, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert, die die Welt verstehen können. Als NVIDIAN sind Sie in einer vielfältigen, unterstützenden Umgebung eingebettet, in der jeder inspiriert wird, sein Bestes zu geben. NVIDIA treibt KI und Hochleistungsrechnen voran. DGX Cloud zielt darauf ab, eine vollständig verwaltete KI-Plattform bei großen Cloud-Anbietern bereitzustellen und KI-Workloads mit hochleistungsfähiger NVIDIA-Infrastruktur zu optimieren.

Arbeiten Sie mit dem DGX Cloud-Team von NVIDIA als Senior Site Reliability Engineer, um leistungsstarke DGX Cloud-Cluster für KI-Forscher und Unternehmenskunden weltweit aufrechtzuerhalten.

Was Sie tun werden:

  • Aufbau, Implementierung und Unterstützung der betrieblichen und zuverlässigkeitsbezogenen Aspekte von großangelegten Kubernetes-Clustern mit Fokus auf Leistung im großen Maßstab, Echtzeitüberwachung, Protokollierung und Alarmierung
  • Definition von SLOs/SLIs, Überwachung von Fehlerbudgets und Optimierung von Berichten
  • Unterstützung von Diensten, bevor sie gestartet werden, durch Systemerstellung, Beratung, Entwicklung von Softwaretools, Plattformen und Frameworks, Kapazitätsmanagement und Startüberprüfungen
  • Wartung von Diensten, sobald sie live sind, durch Messung und Überwachung von Verfügbarkeit, Latenz und allgemeiner Systemgesundheit
  • Betrieb und Optimierung von GPU-Workloads über AWS, GCP, Azure, OCI und private Clouds
  • Nachhaltige Skalierung von Systemen durch Mechanismen wie Automatisierung und Weiterentwicklung von Systemen durch Vorantreiben von Änderungen, die Zuverlässigkeit und Geschwindigkeit verbessern
  • Leitung von Triage und Ursachenanalyse bei schwerwiegenden Vorfällen
  • Praktizieren einer ausgewogenen Vorfallreaktion und schuldloser Nachbesprechungen
  • Teilnahme an der Rufbereitschaft zur Unterstützung von Produktionsdiensten

Was wir sehen müssen:

  • BS in Informatik oder einem verwandten technischen Bereich oder gleichwertige Erfahrung
  • 10+ Jahre Erfahrung im Betrieb von Produktionsdiensten
  • Expertenwissen in der Kubernetes-Administration, Containerisierung und Mikroservices-Architektur
  • Erfahrung mit Infrastrukturautomatisierungstools (z.B. Terraform, Ansible, Chef, Puppet)
  • Kenntnisse in mindestens einer Programmiersprache auf hoher Ebene (z.B. Python, Go)
  • Tiefgehendes Wissen über Linux-Betriebssysteme, Netzwerkgrundlagen (TCP/IP) und Standards für Cloud-Sicherheit
  • Fundierte Kenntnisse der SRE-Prinzipien, einschließlich SLOs, SLIs, Fehlerbudgets und Vorfallbearbeitung
  • Erfahrung im Aufbau und Betrieb umfassender Observability-Stacks (Überwachung, Protokollierung, Nachverfolgung) mit Tools wie OpenTelemetry, Prometheus, Grafana, ELK Stack, Lightstep, Splunk usw.

Wege, sich von der Masse abzuheben:

  • Betrieb von GPU-beschleunigten Clustern mit KubeVirt in der Produktion
  • Anwendung generativer KI-Techniken zur Reduzierung des operativen Aufwands
  • Erfahrung mit Workflow-Orchestrierungsplattformen wie Temporal, Cadence, Airflow, Argo Workflows oder Step Functions

Senior Site Reliability Engineer, DGX Cloud Arbeitgeber: Nvidia

NVIDIA ist ein herausragender Arbeitgeber, der innovative Technologien im Bereich Künstliche Intelligenz vorantreibt. Mit einem dynamischen Arbeitsumfeld in einer der fortschrittlichsten Technologiestädte bietet NVIDIA nicht nur wettbewerbsfähige Vergütungen, sondern auch umfangreiche Möglichkeiten zur beruflichen Weiterentwicklung und Zusammenarbeit mit führenden Experten der Branche. Hier haben Sie die Chance, an bahnbrechenden Projekten zu arbeiten und Ihre Fähigkeiten in einem unterstützenden Team weiterzuentwickeln, während Sie an der Spitze der technologischen Entwicklung stehen.

Nvidia

Kontaktdaten:

Nvidia Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer, DGX Cloud mit Bravour zu bestehen

Kubernetes-Administration
Containerisierung
Mikroservices-Architektur
Infrastruktur-Automatisierungstools (z.B. Terraform, Ansible, Chef, Puppet)
Programmierkenntnisse in mindestens einer Hochsprache (z.B. Python, Go)
Linux-Betriebssysteme
Netzwerkgrundlagen (TCP/IP)