Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure

Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure

Vollzeit 54000 - 66000 € / Jahr (geschätzt) Homeoffice (teilweise)
N

Auf einen Blick

  • Aufgaben: Leite das Design und die Bereitstellung von GPU-Compute-Clustern für Deep Learning.
  • Unternehmen: NVIDIA, ein führendes Unternehmen im Bereich KI und Hochleistungsrechnen.
  • Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und ein inklusives Teamumfeld.
  • Weitere Informationen: Wachstumschancen in einem dynamischen und unterstützenden Team.
  • Warum dieser Job: Gestalte die Zukunft der KI mit modernster Technologie und innovativen Projekten.
  • Qualifikationen: Erfahrung in HPC-Clusterverwaltung und starke Linux-Kenntnisse erforderlich.

Das prognostizierte Gehalt liegt zwischen 54000 - 66000 € pro Jahr.

NVIDIA's Deep Learning Frameworks (DLFW) Infrastructure team sucht einen technisch versierten Senior HPC Cluster Administrator, um das Design, die Bereitstellung und die Zuverlässigkeit unserer großangelegten GPU-Compute-Cluster zu leiten. Diese Systeme führen die anspruchsvollsten Deep-Learning-Trainings-, Inferenz- und Hochleistungsrechenlasten in der Branche aus - von DGX/HGX-Plattformen bis hin zu bahnbrechenden Grace Blackwell-Systemen. Sie werden architektonische Entscheidungen in den Bereichen Compute, Netzwerk und Speicher vorantreiben und eng mit Software-, Forschungs- und Produktteams zusammenarbeiten, um unsere Infrastruktur den unterstützten Arbeitslasten voraus zu halten.

Was Sie tun werden:

  • Den gesamten Lebenszyklus von GPU-Compute-Clustern besitzen - Beschaffung, Bereitstellung, Konfigurationsmanagement, Überwachung und Stilllegung - in heterogenen Linux-Umgebungen (DGX, HGX, eingebettete Systeme)
  • Speicherlösungen (NFS, Lustre, WekaFS oder gleichwertig) entwerfen und skalieren mit einem klaren Fahrplan für Kapazitäts- und Leistungswachstum
  • Automatisierung der Infrastruktur mit modernen IaC-Tools (Ansible, Terraform) und CI/CD-Pipelines (GitLab) leiten
  • Job-Scheduling über Slurm verwalten und optimieren, einschließlich Fair-Share-Richtlinien, Reservierungsmanagement und MIG/GPU-Partitionierungsstrategien
  • Beobachtungsstacks (Prometheus, Grafana, DCGM) pflegen und verbessern sowie proaktive Lösungen für Hardware- und Softwarevorfälle vorantreiben
  • Mit ML-Ingenieuren und Softwareteams zusammenarbeiten, um die Clusterkonfiguration für großangelegte verteilte Trainingsarbeitslasten zu optimieren
  • Neue Technologien bewerten und einführen - Netzwerkfabric (InfiniBand, NVLink, EFA/RDMA), Speicherebenen, Container-Runtimes - um Leistung und Zuverlässigkeit zu verbessern
  • Junior Engineers betreuen und zu teamweiten Ingenieurstandards beitragen

Was wir sehen müssen:

  • BS/MS in CS, EE, CE oder gleichwertige praktische Erfahrung
  • 5+ Jahre Erfahrung in der Bereitstellung und Verwaltung von großangelegten HPC- oder ML-Trainingsclustern
  • Tiefgehende Expertise in der Linux-Systemadministration im großen Maßstab
  • Starke Skript- und Automatisierungsfähigkeiten in Python und/oder Bash
  • Praktische Erfahrung mit Slurm (Scheduling, Accounting, cgroup-Konfiguration)
  • Beherrschung des Konfigurationsmanagements und IaC (Ansible erforderlich; Terraform von Vorteil)
  • Erfahrung mit Containertechnologien (Docker, Apptainer/Singularity, Kubernetes)
  • Solides Verständnis von Hochgeschwindigkeitsnetzwerken (InfiniBand, RoCE, RDMA, EFA)
  • Erfahrung mit verteilten/parallelisierten Dateisystemen und Speicherarchitektur
  • Fähigkeit, Probleme von Anfang bis Ende zu lösen und klar mit Ingenieuren und Management-Stakeholdern zu kommunizieren

Wie Sie sich von der Masse abheben können:

  • Erfahrung mit NVIDIA GPU-Infrastrukturtools (DCGM, nvidia-smi, MIG, NVSwitch-Diagnose)
  • Vertrautheit mit Clusterverwaltungsplattformen (Colossus, Bright Cluster Manager, xCAT oder ähnlich)
  • Erfahrung in der Unterstützung großangelegter verteilter Deep-Learning-Arbeitslasten (PyTorch, JAX, Megatron)
  • Kenntnisse in BMC/IPMI/Redfish für das Out-of-Band-Management und den Hardware-Lebenszyklus
  • Hintergrund in MLOps-Tools oder ML-Plattformengineering

Schließen Sie sich unserem Team von erstklassigen Ingenieuren an und werden Sie Teil der bahnbrechenden Arbeit, die wir bei NVIDIA leisten. Wir setzen uns dafür ein, ein kollaboratives und integratives Umfeld zu fördern, in dem jedes Teammitglied die Möglichkeit hat, zu gedeihen und einen bedeutenden Einfluss zu haben!

Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und dem Gehalt von Mitarbeitern in ähnlichen Positionen festgelegt. Für Polen: Die Grundgehaltsspanne liegt bei 221.250 PLN - 383.500 PLN für Level 3 und 292.500 PLN - 507.000 PLN für Level 4.

Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure Arbeitgeber: NVIDIA

NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von einem Umfeld profitieren, das persönliche und berufliche Weiterentwicklung unterstützt. Werden Sie Teil eines Unternehmens, das die Zukunft intelligenter Maschinen gestaltet und dabei auf eine positive Work-Life-Balance Wert legt.

N

Kontaktdaten:

NVIDIA Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei NVIDIA anzuklopfen, wenn du dich auf die Stelle als Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei NVIDIA vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure mit Bravour zu bestehen

HPC Cluster Administration
Deep Learning Frameworks
Linux Systems Administration
Scripting in Python
Bash Scripting
Slurm Job Scheduling
Configuration Management (Ansible)

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei NVIDIA klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei NVIDIA vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.