Auf einen Blick
- Aufgaben: Entwickle skalierbare Softwarearchitekturen für verteiltes AI-Training und -Inference.
- Unternehmen: NVIDIA, ein führendes Unternehmen in Grafik- und KI-Technologie.
- Vorteile: Wettbewerbsfähiges Gehalt, umfassende Sozialleistungen und kontinuierliche Weiterbildung.
- Weitere Informationen: Dynamisches Umfeld mit Möglichkeiten zur beruflichen Weiterentwicklung.
- Warum dieser Job: Gestalte die Zukunft der KI und mache einen echten Unterschied in der Technologie.
- Qualifikationen: Ph.D. oder gleichwertige Erfahrung in Informatik und 5+ Jahre relevante Berufserfahrung.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
NVIDIA hat die Computergraphik, das PC-Gaming und das beschleunigte Rechnen seit über 25 Jahren transformiert. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Rechnens zu definieren, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert. Als NVIDIAN sind Sie in einer vielfältigen, unterstützenden Umgebung eingebettet, in der jeder inspiriert ist, sein Bestes zu geben. Kommen Sie ins Team und sehen Sie, wie Sie einen bleibenden Einfluss auf die Welt ausüben können.
Rollenübersicht: Senior HPC und AI Network Software Architect, mit Fokus auf verteiltes Training, Echtzeitinferenz und Kommunikationseffizienz über große Systeme. Sie werden neue Software- und Hardwareansätze entwickeln, die Plattformentwicklung durch praktische Innovationen gestalten und zur Gestaltung von Systemen beitragen, die die schnellsten KI-Workloads weltweit antreiben.
Verantwortlichkeiten:
- Entwickeln und weiterentwickeln der Architektur skalierbarer Softwaresysteme für verteiltes KI-Training und Inferenz, mit Fokus auf Durchsatz, Latenz, Resilienz und Speichereffizienz über Cluster-Scale-Deployments.
- Entwickeln und bewerten von Next-Generation-Kommunikations- und Laufzeitfähigkeiten in Bibliotheken wie NCCL, UCX und UCC, die auf die sich entwickelnden Anforderungen von KI-Workloads zugeschnitten sind.
- Zusammenarbeiten mit KI-Framework-Teams (z.B. TensorFlow, PyTorch, JAX) und internen Plattformteams, um Integrationen zu erstellen, neue Ansätze zu erkunden und die End-to-End-Leistung und Zuverlässigkeit zu verbessern.
- Zusammenarbeiten an Hardware- und systemlevel Funktionen über GPUs, DPUs und Interconnects, um die Datenbewegung zu beschleunigen und neue Fähigkeiten für Training, Inferenz und Modellbereitstellung im großen Maßstab zu ermöglichen.
- Innovation in Laufzeitsystemen, Kommunikationsbibliotheken und KI-spezifischen Protokollschichten vorantreiben, um neue Ideen in praktische Fähigkeiten und robuste Implementierungen umzusetzen.
Qualifikationen:
- Ph.D. oder gleichwertige Berufserfahrung in Informatik, Computertechnik oder einem eng verwandten Bereich.
- 5+ Jahre Erfahrung in der Systemprogrammierung, paralleler oder verteilter Verarbeitung, Hochleistungsnetzwerken oder großangelegter Datenbewegung, einschließlich Entwurf und Aufbau komplexer Systeme.
- Starker Programmierhintergrund in C++, Python und idealerweise CUDA oder anderen GPU-Programmiermodellen, mit nachweislicher Erfahrung im Aufbau leistungsstarker, produktionsrelevanter Software.
- Umfassende praktische Erfahrung mit KI-Frameworks (z.B. PyTorch, TensorFlow, JAX) und ein solides Verständnis dafür, wie Kommunikationsbibliotheken und Laufzeitsysteme großangelegtes Training und Inferenz erleichtern.
- Nachgewiesener Erfolg bei der Entwicklung und Verfeinerung von Hochdurchsatz-, Niedriglatenzsystemen, einschließlich der Fähigkeit, über Software-Stacks, Hardwarefähigkeiten und Systemengpässe hinweg zu denken.
- Starke Zusammenarbeit in einem multinationalen, interdisziplinären Umfeld, mit der Fähigkeit, Ideen beizutragen, Schwung aufzubauen und effektiv mit leitenden Ingenieuren, Forschern und Partnerteams zu arbeiten.
Herausragend:
- Tiefe Expertise mit NCCL, UCX, UCC oder ähnlichen Kommunikationsbibliotheken, die in großangelegten KI- und HPC-Workloads verwendet werden.
- Starker Hintergrund in Netzwerken und Kommunikationsprotokollen, RDMA, kollektiven Kommunikationen, congestion-aware Transport oder accelerator-aware Networking.
- Umfassendes Wissen über das Training und die Bereitstellung großer Modelle im großen Maßstab, einschließlich Kommunikationsengpässen, Planungsherausforderungen und systemlevel Trade-offs zwischen Rechenleistung, Speicher und Fabric.
- Erfahrung in der Erstellung von Hardware-Software-Co-Design für verteilte KI-Systeme, einschließlich Beiträgen, die GPU-, DPU-, Interconnect- oder Laufzeitfähigkeiten vorangetrieben haben.
- Vertrautheit mit der Infrastruktur für die Bereitstellung von LLMs oder transformerbasierten Modellen, einschließlich Sharding, Pipelining, Expertenparallelismus oder hybriden Parallelismus.
Vorteile:
NVIDIA bietet hoch wettbewerbsfähige Gehälter und ein umfassendes Leistungspaket. Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und dem Gehalt von Mitarbeitern in ähnlichen Positionen festgelegt.
Wenn Sie leidenschaftlich daran interessiert sind, verteilte Systeme zu entwerfen, die KI-Infrastruktur voranzutreiben und Probleme im großen Maßstab zu lösen, möchten wir von Ihnen hören!
Senior HPC and AI Network Software Architect Arbeitgeber: NVIDIA Corporation
NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von den vielfältigen Möglichkeiten zur beruflichen Weiterentwicklung profitieren, die NVIDIA seinen Mitarbeitern bietet.