Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure

Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure

Berlin Vollzeit 60000 - 80000 € / Jahr (geschätzt) Homeoffice (teilweise)
Nvidia

Auf einen Blick

  • Aufgaben: Leite das Design und die Bereitstellung von GPU-Compute-Clustern für Deep Learning.
  • Unternehmen: NVIDIA, ein führendes Unternehmen im Bereich KI und Hochleistungsrechnen.
  • Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und ein unterstützendes Team.
  • Weitere Informationen: Wachstumsorientierte Umgebung mit Möglichkeiten zur beruflichen Weiterentwicklung.
  • Warum dieser Job: Gestalte die Zukunft der KI mit modernster Technologie und innovativen Projekten.
  • Qualifikationen: Erfahrung in HPC-Clusterverwaltung und tiefes Wissen in Linux-Systemen.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

NVIDIA's Deep Learning Frameworks (DLFW) Infrastructure team sucht einen technisch versierten Senior HPC Cluster Administrator, um das Design, die Bereitstellung und die Zuverlässigkeit unserer großangelegten GPU-Compute-Cluster zu leiten. Diese Systeme führen die anspruchsvollsten Deep-Learning-Trainings-, Inferenz- und Hochleistungsrechenlasten in der Branche aus - von DGX/HGX-Plattformen bis hin zu bahnbrechenden Grace Blackwell-Systemen. Sie werden architektonische Entscheidungen in den Bereichen Compute, Netzwerk und Speicher vorantreiben und eng mit Software-, Forschungs- und Produktteams zusammenarbeiten, um unsere Infrastruktur an die unterstützten Workloads anzupassen.

Was Sie tun werden:

  • Den gesamten Lebenszyklus von GPU-Compute-Clustern besitzen - Beschaffung, Bereitstellung, Konfigurationsmanagement, Überwachung und Stilllegung - in heterogenen Linux-Umgebungen (DGX, HGX, eingebettete Systeme).
  • Speicherlösungen (NFS, Lustre, WekaFS oder gleichwertig) entwerfen und skalieren mit einem klaren Fahrplan für Kapazitäts- und Leistungswachstum.
  • Automatisierung der Infrastruktur mit modernen IaC-Tools (Ansible, Terraform) und CI/CD-Pipelines (GitLab) leiten.
  • Job-Scheduling über Slurm verwalten und optimieren, einschließlich Fair-Share-Richtlinien, Reservierungsmanagement und MIG/GPU-Partitionierungsstrategien.
  • Beobachtungsstacks (Prometheus, Grafana, DCGM) pflegen und verbessern sowie proaktive Lösungen für Hardware- und Softwarevorfälle vorantreiben.
  • Mit ML-Ingenieuren und Softwareteams zusammenarbeiten, um die Clusterkonfiguration für großangelegte verteilte Trainings-Workloads zu optimieren.
  • Neue Technologien bewerten und einführen - Netzwerkfabric (InfiniBand, NVLink, EFA/RDMA), Speicherebenen, Container-Runtimes - um Leistung und Zuverlässigkeit zu verbessern.
  • Junior Engineers betreuen und zu teamweiten Ingenieurstandards beitragen.

Was wir sehen müssen:

  • BS/MS in CS, EE, CE oder gleichwertige praktische Erfahrung.
  • 5+ Jahre Erfahrung in der Bereitstellung und Verwaltung von großangelegten HPC- oder ML-Trainingsclustern.
  • Tiefe Expertise in der Linux-Systemadministration im großen Maßstab.
  • Starke Skript- und Automatisierungsfähigkeiten in Python und/oder Bash.
  • Praktische Erfahrung mit Slurm (Scheduling, Accounting, cgroup-Konfiguration).
  • Beherrschung des Konfigurationsmanagements und IaC (Ansible erforderlich; Terraform von Vorteil).
  • Erfahrung mit Containertechnologien (Docker, Apptainer/Singularity, Kubernetes).
  • Solides Verständnis von Hochgeschwindigkeitsnetzwerken (InfiniBand, RoCE, RDMA, EFA).
  • Erfahrung mit verteilten/parallelisierten Dateisystemen und Speicherarchitekturen.
  • Fähigkeit, Probleme von Anfang bis Ende zu lösen und klar mit Ingenieuren und Management-Stakeholdern zu kommunizieren.

Wie Sie sich von der Masse abheben können:

  • Erfahrung mit NVIDIA GPU-Infrastrukturtools (DCGM, nvidia-smi, MIG, NVSwitch-Diagnose).
  • Vertrautheit mit Clusterverwaltungsplattformen (Colossus, Bright Cluster Manager, xCAT oder ähnlich).
  • Erfahrung in der Unterstützung großangelegter verteilter Deep-Learning-Workloads (PyTorch, JAX, Megatron).
  • Kenntnisse über BMC/IPMI/Redfish für das Out-of-Band-Management und den Hardware-Lebenszyklus.
  • Hintergrund in MLOps-Tools oder ML-Plattformengineering.

Schließen Sie sich unserem Team von erstklassigen Ingenieuren an und werden Sie Teil der bahnbrechenden Arbeit, die wir bei NVIDIA leisten. Wir setzen uns dafür ein, ein kollaboratives und integratives Umfeld zu fördern, in dem jedes Teammitglied die Möglichkeit hat, zu gedeihen und einen bedeutenden Einfluss zu haben!

Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure Arbeitgeber: Nvidia

NVIDIA ist ein herausragender Arbeitgeber, der innovative Technologien im Bereich Künstliche Intelligenz vorantreibt. Mit einem dynamischen Arbeitsumfeld in einer der fortschrittlichsten Technologiestädte bietet NVIDIA nicht nur wettbewerbsfähige Vergütungen, sondern auch umfangreiche Möglichkeiten zur beruflichen Weiterentwicklung und Zusammenarbeit mit führenden Experten der Branche. Hier haben Sie die Chance, an bahnbrechenden Projekten zu arbeiten und Ihre Fähigkeiten in einem unterstützenden Team weiterzuentwickeln, während Sie an der Spitze der technologischen Entwicklung stehen.

Nvidia

Kontaktdaten:

Nvidia Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Nvidia anzuklopfen, wenn du dich auf die Stelle als Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Nvidia vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure mit Bravour zu bestehen

HPC Cluster Administration
Deep Learning Frameworks
Linux Systems Administration
Scripting in Python and/or Bash
Job Scheduling mit Slurm
Infrastructure as Code (IaC) mit Ansible und Terraform
Container Technologien (Docker, Apptainer/Singularity, Kubernetes)

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Nvidia klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei Nvidia vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.