Senior Solutions Architect – Large Scale Neural Networks Inference in Schaffhausen

Senior Solutions Architect – Large Scale Neural Networks Inference in Schaffhausen

Schaffhausen Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
N

Auf einen Blick

  • Aufgaben: Leite die KI-Inferenzstrategie für EMEA-Kunden und optimiere Hochleistungs-Pipelines.
  • Unternehmen: Innovatives Unternehmen im Bereich KI mit einem Fokus auf Zusammenarbeit.
  • Vorteile: Umfassendes Leistungspaket, wettbewerbsfähiges Gehalt und remote-freundliche Rollen.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrieremöglichkeiten.
  • Warum dieser Job: Gestalte die Zukunft der KI und arbeite an bahnbrechenden Projekten.
  • Qualifikationen: Mindestens 8 Jahre Erfahrung in AI/ML-Infrastruktur und tiefes Wissen über Inferenzoptimierung.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

In dieser Rolle definieren Sie die KI-Inferenzrichtung für ein Portfolio von EMEA-Kunden und leiten Engagements von der Konzeptphase bis zu Produktionsbereitstellungen. Sie arbeiten mit NVIDIA-Teams und Kunden zusammen, um hochwirksame, skalierbare Inferenzlösungen voranzutreiben und Feedback zu sammeln, um die Roadmap des NVIDIA-Stacks zu gestalten. Sie werden Engpässe in Bezug auf Latenz, Effizienz und Kosten angehen und Erkenntnisse in strategische Technologieentscheidungen umsetzen. Dies ist eine kundenorientierte Rolle mit großem Einfluss, die sich auf fortschrittliche KI- und Unternehmensbereitstellungen stützt.

Leistungen / Benefits

  • Umfassendes Leistungspaket
  • Wettbewerbsfähiges Gehalt
  • Remote-freundliche Rollen
  • Chancengleichheit als Arbeitgeber

Verantwortungsbereiche

  • Leitung der Inferenzstrategie für EMEA-Kunden und Anleitung von Engagements von PoC bis hin zu Produktionsbereitstellungen
  • Identifizierung und Behebung von Inferenzengpässen in Kundenbereitstellungen (Latenz, Effizienz, Kosten pro Token, Speicher, Low-Latency Networking)
  • Architektur und Optimierung von Hochleistungs-Inferenzpipelines unter Verwendung von Dynamo, TensorRT-LLM, vLLM, SGLang und anderen Backends
  • Übersetzung von Kundenbereitstellungsmustern in umsetzbares Produktfeedback zur Beeinflussung der Roadmap des NVIDIA-Stacks (Dynamo, TensorRT-LLM, NIM)
  • Koordination mit NVIDIA- und Kunden-Teams, um die technische Richtung abzustimmen und die Bereitstellung im großen Maßstab voranzutreiben

Zentrale Anforderungen

  • Über 8 Jahre Erfahrung in der AI/ML-Infrastruktur mit tiefgreifender Expertise in der Optimierung von LLM/VLM-Inferenz und Produktionsbereitstellungen im großen Maßstab
  • Tiefes Verständnis der Beschleunigung von Transformer-Inferenz (Quantisierung INT4/FP8, spekulative Dekodierung, disaggregierte Inferenz, kontinuierliches Batching, KV-Cache-Optimierung, WideEP für MoE)
  • Verständnis der GPU-Speicherhierarchien und des Low-Latency Networking sowie deren Auswirkungen auf die Inferenzleistung
  • Nachweisliche Erfolge bei der Leitung technischer Initiativen
  • Ausgezeichnete Kommunikationsfähigkeiten für Forscher, Ingenieure und Führungskräfte
  • Starke Kommunikations-, Führungs- und Zusammenarbeitskompetenzen
  • Interdisziplinäre Zusammenarbeit mit Forschungsscientists und Ingenieuren

Senior Solutions Architect – Large Scale Neural Networks Inference in Schaffhausen Arbeitgeber: NVIDIA

NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von einem Umfeld profitieren, das persönliche und berufliche Weiterentwicklung unterstützt. Werden Sie Teil eines Unternehmens, das die Zukunft intelligenter Maschinen gestaltet und dabei auf eine positive Work-Life-Balance Wert legt.

N

Kontaktdaten:

NVIDIA Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Solutions Architect – Large Scale Neural Networks Inference in Schaffhausen mit Bravour zu bestehen

AI/ML Infrastruktur
LLM/VLM Inferenzoptimierung
Produktionsbereitstellung in großem Maßstab
Transformer Inferenzbeschleunigung
Quantisierung (INT4/FP8)
Spekulatives Decoding
Disaggregierte Inferenz