Auf einen Blick
- Aufgaben: Bau und Unterstützung von Kubernetes-Clustern für KI-Forschung und Unternehmensanwendungen.
- Unternehmen: NVIDIA, ein führendes Unternehmen in Grafik- und KI-Technologie.
- Vorteile: Wettbewerbsfähiges Gehalt, Gesundheitsleistungen und ein unterstützendes Arbeitsumfeld.
- Weitere Informationen: Dynamisches Umfeld mit Möglichkeiten zur beruflichen Weiterentwicklung.
- Warum dieser Job: Gestalte die Zukunft der KI mit innovativen Technologien und einem talentierten Team.
- Qualifikationen: 10+ Jahre Erfahrung in der Betriebsführung und Expertenwissen in Kubernetes.
Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.
NVIDIA hat die Computergraphik, das PC-Gaming und das beschleunigte Rechnen seit mehr als 25 Jahren transformiert. Es ist ein einzigartiges Erbe der Innovation, das durch großartige Technologie und erstaunliche Menschen angetrieben wird. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Rechnens zu definieren. Eine Ära, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert, die die Welt verstehen können. Als NVIDIAN werden Sie in einer vielfältigen, unterstützenden Umgebung arbeiten, in der jeder inspiriert ist, sein Bestes zu geben.
NVIDIA treibt KI und Hochleistungsrechnen voran. DGX Cloud zielt darauf ab, eine vollständig verwaltete KI-Plattform bei großen Cloud-Anbietern bereitzustellen und KI-Workloads mit hochleistungsfähiger NVIDIA-Infrastruktur zu optimieren.
Arbeiten Sie mit dem DGX Cloud-Team von NVIDIA als Senior Site Reliability Engineer, um leistungsstarke DGX Cloud-Cluster für KI-Forscher und Unternehmenskunden weltweit aufrechtzuerhalten.
Was Sie tun werden:
- Aufbau, Implementierung und Unterstützung der betrieblichen und zuverlässigkeitsbezogenen Aspekte von großangelegten Kubernetes-Clustern mit Fokus auf Leistung im großen Maßstab, Echtzeitüberwachung, Protokollierung und Alarmierung
- Definition von SLOs/SLIs, Überwachung von Fehlerbudgets und Optimierung von Berichten
- Unterstützung von Diensten, bevor sie gestartet werden, durch Systemerstellung, Entwicklung von Softwaretools, Plattformen und Frameworks, Kapazitätsmanagement und Startüberprüfungen
- Wartung von Diensten, sobald sie live sind, durch Messung und Überwachung der Verfügbarkeit, Latenz und der allgemeinen Systemgesundheit
- Betrieb und Optimierung von GPU-Workloads über AWS, GCP, Azure, OCI und private Clouds
- Nachhaltige Skalierung von Systemen durch Mechanismen wie Automatisierung und Weiterentwicklung von Systemen durch Vorantreiben von Änderungen, die Zuverlässigkeit und Geschwindigkeit verbessern
- Leitung von Triage und Ursachenanalyse bei schwerwiegenden Vorfällen
- Praktizieren einer ausgewogenen Vorfallreaktion und schuldloser Nachbesprechungen
- Teilnahme an der Rufbereitschaft zur Unterstützung von Produktionsdiensten
Was wir sehen möchten:
- BS in Informatik oder verwandtem technischen Bereich oder gleichwertige Erfahrung
- Über 10 Jahre Erfahrung im Betrieb von Produktionsdiensten
- Expertenwissen in der Kubernetes-Administration, Containerisierung und Mikroservices-Architektur
- Erfahrung mit Infrastrukturautomatisierungstools (z.B. Terraform, Ansible, Chef, Puppet)
- Kenntnisse in mindestens einer Hochsprache (z.B. Python, Go)
- Tiefgehendes Wissen über Linux-Betriebssysteme, Netzwerkgrundlagen (TCP/IP) und Standards für Cloud-Sicherheit
- Fundierte Kenntnisse der SRE-Prinzipien, einschließlich SLOs, SLIs, Fehlerbudgets und Vorfallbearbeitung
- Erfahrung im Aufbau und Betrieb umfassender Observability-Stacks (Überwachung, Protokollierung, Nachverfolgung) mit Tools wie OpenTelemetry, Prometheus, Grafana, ELK Stack, Lightstep, Splunk usw.
Wege, sich von der Masse abzuheben:
- Betrieb von GPU-beschleunigten Clustern mit KubeVirt in der Produktion
- Anwendung generativer KI-Techniken zur Reduzierung des operativen Aufwands
- Erfahrung mit Workflow-Orchestrierungsplattformen wie Temporal, Cadence, Airflow, Argo Workflows oder Step Functions
Senior Site Reliability Engineer, DGX Cloud Arbeitgeber: Nvidia
NVIDIA ist ein herausragender Arbeitgeber, der innovative Technologien im Bereich Künstliche Intelligenz vorantreibt. Mit einem dynamischen Arbeitsumfeld in einer der fortschrittlichsten Technologiestädte bietet NVIDIA nicht nur wettbewerbsfähige Vergütungen, sondern auch umfangreiche Möglichkeiten zur beruflichen Weiterentwicklung und Zusammenarbeit mit führenden Experten der Branche. Hier haben Sie die Chance, an bahnbrechenden Projekten zu arbeiten und Ihre Fähigkeiten in einem unterstützenden Team weiterzuentwickeln, während Sie an der Spitze der technologischen Entwicklung stehen.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior Site Reliability Engineer, DGX Cloud erhalten könntest
✨Engagier dich in Entwickler-Communities!
Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.
✨Zeig deine Fähigkeiten!
Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Nvidia anzuklopfen, wenn du dich auf die Stelle als Senior Site Reliability Engineer, DGX Cloud bewirbst – so wissen sie gleich, was sie von dir erwarten können!
✨Nutze Jobplattformen speziell für Tech-Jobs!
Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.
✨Such dir Mentoren und Feedback!
Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Nvidia vorzubereiten!
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer, DGX Cloud mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.
Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.
Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.
Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Nvidia klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.
Wie man sich auf ein Vorstellungsgespräch bei Nvidia vorbereitet
✨Technische Vorbereitung auf die Coding-Challenges
In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!
✨Das eigene Portfolio im besten Licht präsentieren
Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.
✨Teamfähigkeit und Kommunikation betonen
In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.
✨Vorbereitung auf Fragen zur Software-Architektur
Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.