Auf einen Blick
- Aufgaben: Leite technische Strategien für DGX Cloud Cluster und verbessere Produktionsabläufe.
- Unternehmen: NVIDIA, ein führendes Unternehmen in der KI- und GPU-Technologie.
- Vorteile: Attraktives Gehalt, Aktienoptionen und umfassende Sozialleistungen.
- Weitere Informationen: Dynamisches Arbeitsumfeld mit Möglichkeiten zur beruflichen Weiterentwicklung.
- Warum dieser Job: Gestalte die Zukunft der Cloud-Technologie und arbeite an innovativen Projekten.
- Qualifikationen: 18+ Jahre Erfahrung in großen verteilten Systemen und starke Softwarekenntnisse.
NVIDIA sucht einen Distinguished Engineer, der als technischer Leiter in der Produktionsingenieurorganisation fungiert. Die Person wird leidenschaftlich Clusteraktivitäten innerhalb der DGX Cloud GPU-Kapazität leiten. Die Produktionsingenieurabteilung bei NVIDIA hat die Aufgabe, sicherzustellen, dass großangelegte Produktionssysteme zuverlässig, verwaltbar und zunehmend automatisiert über die DGX Cloud-Ressourcen bleiben. Unsere Methode kombiniert Softwareengineering, Systemengineering und Produktionsexpertise. Dies ermöglicht es uns, Plattformen, Workflows und Betriebsmodelle zu entwickeln, die die Gesundheit, Skalierbarkeit und Verfügbarkeit der GPU-Infrastruktur für Forscher und Kunden erhalten.
Diese Position konzentriert sich auf die betriebliche Struktur für DGX Cloud-Cluster in On-Premise-, Hyperscaler- und NVIDIA Cloud-Partnerumgebungen. Der Umfang umfasst die ingenieurtechnischen Verbindungen, die erforderlich sind, um sicherzustellen, dass die DGX Cloud-Kapazität in der Produktion voll funktionsfähig ist: Kubernetes-Serviceverwaltung, Bereitstellung und Hardwarebereitschaft, Handhabung der On-Premise-Infrastruktur, Bereitstellung und betriebliche Vorbereitung, Zusammenarbeit zur Servicezuverlässigkeit und die Prozesse, die diese Bereiche in ein einheitliches Produktionssystem integrieren.
Dies ist eine praktische Rolle für einen tief technisch versierten Distinguished Engineer, der die architektonische Richtung für Clusteroperationen in der gesamten DGX Cloud definieren wird. Die richtige Person wird Softwareengineering-Rigor, Systemtiefe und Produktionsurteil kombinieren. Sie werden die technische Strategie festlegen und Betriebsstandards etablieren. Sie werden die Evolution des Rahmens für Produktionsoperationen leiten und den Fortschritt bei bereichsübergreifenden Fähigkeiten vorantreiben, um die DGX Cloud-Kapazität nutzbar, unterstützbar und skalierbar zu halten.
Was Sie tun werden:
- Definieren Sie die langfristige technische Strategie für den Betrieb von DGX Cloud-Clustern konsistent über lokale Rechenzentren, Hyperscaler und NeoCloud-Umgebungen.
- Definieren Sie die architektonische Richtung und grundlegende Betriebsstandards für den Lebenszyklus von Clustern, die Bereitstellung zur Laufzeit, Wiederherstellung, Release-Bereitschaft und Betriebsfähigkeit im stabilen Zustand in Bezug auf die DGX Cloud-Kapazität.
- Leiten Sie die Roadmap und Ausführung kritischer bereichsübergreifender Investitionen, die die Produktionsbereitschaft, Betriebssicherheit, Leistung und die Koordination zwischen Teams verbessern.
- Treffen und beeinflussen Sie hochwirksame technische Entscheidungen, die bestimmen, wie Plattform-, Hardware-, Anbieter- und Serviceteams zusammenarbeiten, um DGX Cloud-Ressourcen in der Produktion zu betreiben.
- Erstellen Sie langlebige Workflows, Schnittstellen und Ingenieureingriffe über den Kubernetes-Produktionsdienst, die Vorbereitung von Anbietern und Hardware sowie On-Premise- und Bare-Metal-Umgebungen.
- Restrukturieren Sie die Betriebs- und Serviceebenenzuverlässigkeitsdomänen.
- Entwickeln und verbessern Sie die Automatisierung, APIs, Betriebsabläufe und Bereitschaftstore, die erforderlich sind, um neue Kapazitäten in die stabile Produktion zu überführen und bestehende Kapazitäten im Gleichgewicht zu halten.
- Implementieren Sie Betriebsansätze, die manuelle Eingaben reduzieren, klare Verantwortlichkeiten festlegen und Konsistenz, Nachverfolgbarkeit und Release-Sicherheit innerhalb der DGX Cloud-Umgebungen erhöhen.
- Arbeiten Sie eng mit Plattformteams, Hardware- und Anbieterengineering, Servicebesitzern und anderen Führungskräften im Bereich Produktionsengineering zusammen, um wiederkehrende Reibungen zu identifizieren und in dauerhafte Verbesserungen in Software, Prozessen und betrieblichen Schnittstellen umzuwandeln.
- Erhöhen Sie den Ingenieurniveau für Betriebsfähigkeit, Resilienz, Skalierbarkeit und Leistung über Clusteroperationen hinweg durch Führungsstärke, Architekturüberprüfung und technische Standards.
Was wir sehen müssen:
- BS, MS oder PhD in Informatik, Elektrotechnik oder einem verwandten technischen Bereich oder gleichwertige Erfahrung.
- 18+ Jahre Erfahrung im Aufbau und Betrieb großangelegter verteilter Systeme, Infrastrukturplattformen oder Produktionsumgebungen.
- Bestätigte technische Führung auf Unternehmensniveau in Produktionsengineering, SRE, Infrastruktursoftware oder Cloud-Plattformen.
- Konsequente Erfolgsbilanz bei der Definition von Betriebsmodellen, architektonischer Richtung und Ingenieurstandards über mehrere technische Bereiche und Organisationen hinweg.
- Erfahrung in der Leitung großer, bereichsübergreifender technischer Bemühungen vom Konzept bis zur Produktion, einschließlich der Abstimmung von Mitarbeitern, Klärung von Fragen und Erzielung messbarer Ergebnisse.
- Tiefe Erfahrung in einem oder mehreren dieser Bereiche: Kubernetes-basierte Produktionssysteme, Infrastrukturautomatisierung oder Betrieb verteilter Systeme.
- Starke Softwareengineering-Fähigkeiten in Sprachen wie Python, Go oder ähnlichen Programmiersprachen.
- Tiefes Verständnis von verteilten Systemen, Linux, Netzwerken, Containern und Produktionszuverlässigkeitsfragen.
- Erfahrung in der Erstellung betrieblicher Workflows, APIs, Dienstschnittstellen oder Automatisierungsrahmen, die zum Standard werden, wie Teams Produktionssysteme betreiben.
- Starkes architektonisches Urteilsvermögen und eine nachgewiesene Geschichte der Vereinfachung komplexer betrieblicher Probleme durch wiederverwendbare Software, klare technische Strategien und dauerhafte Ingenierrichtlinien.
Wege, sich von der Masse abzuheben:
- Definierte die strukturelle Grundlage für eine große, heterogene Infrastrukturumgebung, die sich über mehrere Plattformen oder Anbieter erstreckt.
- Etablierte weit verbreitete Betriebsstandards, Architekturen, APIs oder Workflows, die die Zuverlässigkeit, Betriebsfähigkeit oder Leistung im Unternehmensmaßstab verbesserten.
- Erstellte Automatisierungs- und Ingenieurschnittstellen, die Plattformteams, Infrastrukturteams und Servicebesitzer in ein konsistentes Produktionssystem integrieren.
- Erfahrung in der Verbesserung der Produktionsbereitschaft, Wiederherstellung, Laufzeitsicherheit oder Release-Qualität für großangelegte Infrastruktur.
- Genauso wohlfühlend beim Festlegen technischer Strategien, Überprüfen von Architekturen im großen Maßstab, Schreiben von Code und Fördern der Akzeptanz über organisatorische Grenzen hinweg.
Diese Rolle ist absichtlich dem bereichsübergreifenden Produktionsbetriebsmodell für die DGX Cloud-Kapazität zugewiesen. Sie umfasst keine gemeinsame Plattform-Softwarefunktion für typische Automatisierungsdienste. Der Erfolg wird erreicht, indem sichergestellt wird, dass das größere DGX Cloud-Cluster optimal in einer Live-Umgebung funktioniert. Die Position erfordert starke technische Führung, konsistente Workflows, klare Grenzen und produktive bereichsübergreifende Ingenieurkoordination.
Distinguished Engineer, Production Engineering, Cluster Management Arbeitgeber: NVIDIA
NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von einem Umfeld profitieren, das persönliche und berufliche Weiterentwicklung unterstützt. Werden Sie Teil eines Unternehmens, das die Zukunft intelligenter Maschinen gestaltet und dabei auf eine positive Work-Life-Balance Wert legt.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Distinguished Engineer, Production Engineering, Cluster Management erhalten könntest
✨Engagier dich in Entwickler-Communities!
Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.
✨Zeig deine Fähigkeiten!
Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei NVIDIA anzuklopfen, wenn du dich auf die Stelle als Distinguished Engineer, Production Engineering, Cluster Management bewirbst – so wissen sie gleich, was sie von dir erwarten können!
✨Nutze Jobplattformen speziell für Tech-Jobs!
Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.
✨Such dir Mentoren und Feedback!
Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei NVIDIA vorzubereiten!
Wir glauben, dass du diese Fähigkeiten brauchst, um Distinguished Engineer, Production Engineering, Cluster Management mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.
Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.
Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.
Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei NVIDIA klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.
Wie man sich auf ein Vorstellungsgespräch bei NVIDIA vorbereitet
✨Technische Vorbereitung auf die Coding-Challenges
In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!
✨Das eigene Portfolio im besten Licht präsentieren
Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.
✨Teamfähigkeit und Kommunikation betonen
In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.
✨Vorbereitung auf Fragen zur Software-Architektur
Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.