Auf einen Blick
- Aufgaben: Entwickle und optimiere KI-Workloads auf großen GPU-Clustern.
- Unternehmen: Innovatives Unternehmen, das an der Spitze der KI-Technologie steht.
- Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und Weiterbildungsmöglichkeiten.
- Weitere Informationen: Dynamisches Umfeld mit großartigen Karrieremöglichkeiten in einem wachsenden Bereich.
- Warum dieser Job: Gestalte die Zukunft der KI mit modernster Technologie und echten Herausforderungen.
- Qualifikationen: Erfahrung in beschleunigter Computertechnologie und Programmierkenntnisse in C, C++ oder Python.
Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.
Wir suchen einen Senior Solutions Architect mit umfangreicher praktischer Erfahrung in der Bereitstellung, Fehlersuche und Optimierung von Trainings- und Inferenz-Workloads auf großflächigen GPU-Clustern. Da wir Kunden und Partner in ganz Europa bei der Schulung von Modellen auf bahnbrechender GPU-Infrastruktur unterstützen, suchen wir jemanden, der gerne komplexe Herausforderungen an der Schnittstelle von Hochleistungsrechnen und KI löst. Ebenso nimmt die Komplexität der Inferenz mit der Explosion von MOE-Modellen und der disaggregierten Ausführung zu, was die Inferenz zu einer echten HPC-Arbeitslast macht. Sie müssen nicht in jedem genannten Bereich Expertise haben, aber wir sind besonders an Kandidaten interessiert, die tiefes Wissen in mindestens einigen Schlüsselbereichen mitbringen, um groß angelegte KI-Workloads zu ermöglichen. Wenn Sie praktische Erfahrung nachweisen können, würden wir uns freuen, von Ihnen zu hören.
Was Sie tun werden:
- Zusammenarbeit mit den Entwicklern des Trainingsrahmens von NVIDIA und den Produktteams, um über die neuesten Funktionen informiert zu bleiben und Partner bei deren effektiver Annahme zu unterstützen.
- Unterstützung bei der Bereitstellung, Fehlersuche und Verbesserung der Effizienz von KI-Workloads auf umfangreichen NVIDIA-Plattformen.
- Benchmarking neuer Rahmenfunktionen, Analyse der Leistung und Weitergabe umsetzbarer Erkenntnisse an Kunden und interne Teams.
- Direkte Zusammenarbeit mit externen Kunden zur Lösung von Leistungs- und Stabilitätsproblemen von Clustern, Identifizierung von Engpässen und Implementierung effektiver Lösungen.
- Aufbau von Fachwissen und Anleitung von Kunden beim effizienten und zuverlässigen Skalieren von Workloads auf der neuesten Generation von NVIDIA-GPUs.
- Beitrag zur europäischen Sovereign AI-Initiative, indem Kunden bei der Implementierung fortschrittlicher Resilienzfunktionen innerhalb von KI-Trainingspipelines unterstützt werden.
Was wir sehen müssen:
- BS, MS, PhD oder gleichwertige Erfahrung in Informatik, Elektrotechnik/Informatik, Physik, Mathematik oder einem verwandten Ingenieurfeld – oder gleichwertige praktische Erfahrung.
- Über 8 Jahre Erfahrung in beschleunigten Rechentechnologien auf Clustergröße, idealerweise einschließlich der Arbeit mit NVIDIA-Plattformen.
- Starke Programmierkenntnisse in mindestens einer der folgenden Sprachen: C, C++ oder Python.
- Praktische Erfahrung in der Identifizierung und Behebung von Engpässen in großflächigen Trainings-Workloads oder parallelen Anwendungen.
- Praktische Erfahrung in der Profilerstellung und Fehlersuche großer paralleler Anwendungen.
- Solides Verständnis von CPU- und GPU-Architekturen, CUDA, parallelen Dateisystemen und Hochgeschwindigkeitsverbindungen.
- Erfahrung in der Arbeit mit großen Rechenclustern mit Verständnis ihrer internen Planungs- und Ressourcenmanagementmechanismen (z.B. SLURM oder cloudbasierte Cluster).
- Fundierte Kenntnisse von Trainingspipelines und -rahmen, einschließlich ihrer internen Abläufe und Leistungsmerkmale.
Wie Sie sich von der Masse abheben können:
- Erfahrung in der Fehlersuche von Trainingspipelines, die in Produktionsumgebungen auf Tausenden von GPUs laufen.
- Praktische Erfahrung mit Leistungsprofilierung und Optimierungen unter Verwendung von Tools wie Nsight Systems, Nsight Compute und gutes Verständnis von NCCL, MPI und Low-Level-Kommunikationsbibliotheken.
- Fähigkeit, Stabilitätsprobleme über den gesamten Stack hinweg zu debuggen: parallele Anwendung, Trainingsrahmen, Laufzeitbibliotheken, Scheduler und Hardware.
- Solides Verständnis der internen Funktionsweise von LLM-Rahmen wie PyTorch, Megatron-LM oder NeMo und wie sie die Compute-Schichten wie CPUs, GPUs, Netzwerk und Speicher beeinflussen oder Verständnis von Inferenztools wie vLLM, Dynamo, TensorRT-LLM, RedHat Inference Server oder SGLang.
NVIDIA hat das beschleunigte Rechnen revolutioniert. Heute treibt unsere KI-Infrastruktur globale Intelligenz an und transformiert jede Branche.
Senior Solutions Architect, HPC and AI Arbeitgeber: NVIDIA Corporation
NVIDIA ist ein herausragender Arbeitgeber, der eine dynamische und unterstützende Arbeitsumgebung bietet, in der Innovation und Teamarbeit im Mittelpunkt stehen. Als Senior Manager im Bereich IT Engineering - End User Support haben Sie die Möglichkeit, an der Spitze der technologischen Entwicklung zu stehen und Ihre Karriere durch kontinuierliche Weiterbildung und Mentoring voranzutreiben. In München profitieren Sie von einer lebendigen Stadt mit einem starken Fokus auf Technologie und Kreativität, was Ihnen nicht nur berufliche, sondern auch persönliche Wachstumschancen eröffnet.