Senior Solutions Architect – Large Scale Neural Networks Inference in Biel

Senior Solutions Architect – Large Scale Neural Networks Inference in Biel

Biel Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
N

Auf einen Blick

  • Aufgaben: Leite die KI-Inferenzstrategie für EMEA-Kunden und optimiere Hochleistungs-Pipelines.
  • Unternehmen: Innovatives Unternehmen im Bereich KI mit einem Fokus auf Zusammenarbeit.
  • Vorteile: Umfassendes Leistungspaket, wettbewerbsfähiges Gehalt und remote-freundliche Rollen.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrieremöglichkeiten.
  • Warum dieser Job: Gestalte die Zukunft der KI und arbeite an bahnbrechenden Projekten.
  • Qualifikationen: Mindestens 8 Jahre Erfahrung in AI/ML-Infrastruktur und tiefes Wissen über Inferenzoptimierung.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

In dieser Rolle definieren Sie die KI-Inferenzrichtung für ein Portfolio von EMEA-Kunden und leiten Engagements von der Konzeptphase bis zu Produktionsbereitstellungen. Sie arbeiten mit NVIDIA-Teams und Kunden zusammen, um hochwirksame, skalierbare Inferenzlösungen voranzutreiben und Feedback zu sammeln, um die Roadmap des NVIDIA-Stacks zu gestalten. Sie werden Engpässe in Bezug auf Latenz, Effizienz und Kosten angehen und Erkenntnisse in strategische Technologieentscheidungen umsetzen. Dies ist eine kundenorientierte Rolle mit hohem Einfluss, die auf fortschrittlicher KI und Unternehmensbereitstellungen basiert.

Leistungen / Benefits

  • Umfassendes Leistungspaket
  • Wettbewerbsfähiges Gehalt
  • Remote-freundliche Rollen
  • Chancengleichheit als Arbeitgeber

Verantwortungsbereiche

  • Leitung der Inferenzstrategie für EMEA-Kunden und Anleitung von Engagements von PoC bis hin zu Produktionsbereitstellungen
  • Identifizierung und Behebung von Inferenzengpässen in Kundenbereitstellungen (Latenz, Effizienz, Kosten pro Token, Speicher, Low-Latency-Netzwerke)
  • Architektur und Optimierung von Hochleistungs-Inferenzpipelines unter Verwendung von Dynamo, TensorRT-LLM, vLLM, SGLang und anderen Backends
  • Übersetzung von Kundenbereitstellungsmustern in umsetzbares Produktfeedback zur Beeinflussung der Roadmap des NVIDIA-Stacks (Dynamo, TensorRT-LLM, NIM)
  • Koordination mit NVIDIA- und Kunden-Teams, um die technische Richtung abzustimmen und die Bereitstellung im großen Maßstab voranzutreiben

Zentrale Anforderungen

  • Über 8 Jahre Erfahrung in der AI/ML-Infrastruktur mit tiefgreifender Expertise in der Optimierung von LLM/VLM-Inferenz und Produktionsbereitstellungen im großen Maßstab
  • Tiefes Verständnis der Beschleunigung von Transformer-Inferenz (Quantisierung INT4/FP8, spekulative Dekodierung, disaggregierte Inferenz, kontinuierliches Batching, KV-Cache-Optimierung, WideEP für MoE)
  • Verständnis der GPU-Speicherhierarchien und der Low-Latency-Netzwerke sowie deren Auswirkungen auf die Inferenzleistung
  • Nachweisliche Erfolge bei der Leitung technischer Initiativen
  • Ausgezeichnete Kommunikationsfähigkeiten für Forscher, Ingenieure und Führungskräfte
  • Starke Kommunikations-, Führungs- und Zusammenarbeitskompetenzen
  • Interdisziplinäre Zusammenarbeit mit Forschungsscientists und Ingenieuren
  • Optimierung der LLM/VLM-Inferenz
  • Beschleunigung der Transformer-Inferenz
  • Quantisierung (INT4/FP8)

Senior Solutions Architect – Large Scale Neural Networks Inference in Biel Arbeitgeber: NVIDIA

NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von einem Umfeld profitieren, das persönliche und berufliche Weiterentwicklung unterstützt. Werden Sie Teil eines Unternehmens, das die Zukunft intelligenter Maschinen gestaltet und dabei auf eine positive Work-Life-Balance Wert legt.

N

Kontaktdaten:

NVIDIA Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Solutions Architect – Large Scale Neural Networks Inference in Biel mit Bravour zu bestehen

AI/ML Infrastruktur
LLM/VLM Inferenzoptimierung
Produktionsbereitstellung in großem Maßstab
Transformer Inferenzbeschleunigung
Quantisierung (INT4/FP8)
Spekulatives Decoding
Disaggregierte Inferenz