Senior Solutions Architect – Large Scale Neural Networks Inference in Bern

Senior Solutions Architect – Large Scale Neural Networks Inference in Bern

Bern Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
N

Auf einen Blick

  • Aufgaben: Leite die KI-Inferenzstrategie für EMEA-Kunden und optimiere Hochleistungsinferenz-Pipelines.
  • Unternehmen: NVIDIA, ein führendes Unternehmen im Bereich KI und maschinelles Lernen.
  • Vorteile: Umfassendes Leistungspaket, wettbewerbsfähiges Gehalt und remote-freundliche Rollen.
  • Weitere Informationen: Führe technische Initiativen und arbeite eng mit Forschungsteams zusammen.
  • Warum dieser Job: Gestalte die Zukunft der KI mit innovativen Lösungen und beeinflusse die NVIDIA-Produkt-Roadmap.
  • Qualifikationen: Mindestens 8 Jahre Erfahrung in AI/ML-Infrastruktur und tiefes Wissen über LLM/VLM-Inferenzoptimierung.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

In dieser Rolle definieren Sie die KI-Inferenzrichtung für ein Portfolio von EMEA-Kunden und leiten Engagements von der Konzeptphase bis zu Produktionsbereitstellungen. Sie arbeiten mit NVIDIA-Teams und Kunden zusammen, um hochwirksame, skalierbare Inferenzlösungen voranzutreiben und Feedback zu sammeln, um die Roadmap des NVIDIA-Stacks zu gestalten. Sie werden Engpässe in Bezug auf Latenz, Effizienz und Kosten angehen und Erkenntnisse in strategische Technologieentscheidungen umsetzen. Dies ist eine kundenorientierte Rolle mit hohem Einfluss, die auf fortschrittlicher KI und Unternehmensbereitstellungen basiert.

  • Leistungen / Benefits: umfassendes Leistungspaket, wettbewerbsfähiges Gehalt, remote-freundliche Rollen, Arbeitgeber mit Chancengleichheit

Verantwortungsbereiche:

  • Leitung der Inferenzstrategie für EMEA-Kunden und Anleitung von Engagements von PoC bis hin zu Produktionsbereitstellungen
  • Identifizierung und Behebung von Inferenzengpässen in Kundenbereitstellungen (Latenz, Effizienz, Kosten pro Token, Speicher, Low-Latency-Netzwerke)
  • Architektur und Optimierung von Hochleistungs-Inferenzpipelines unter Verwendung von Dynamo, TensorRT-LLM, vLLM, SGLang und anderen Backends
  • Übersetzung von Kundenbereitstellungsmustern in umsetzbares Produktfeedback zur Beeinflussung der Roadmap des NVIDIA-Stacks (Dynamo, TensorRT-LLM, NIM)
  • Koordination mit NVIDIA- und Kunden-Teams, um die technische Richtung abzustimmen und die Bereitstellung in großem Maßstab voranzutreiben

Zentrale Anforderungen:

  • Über 8 Jahre Erfahrung in der AI/ML-Infrastruktur mit tiefgreifender Expertise in der Optimierung von LLM/VLM-Inferenz und Produktionsbereitstellungen in großem Maßstab
  • Tiefes Verständnis der Beschleunigung von Transformer-Inferenz (Quantisierung INT4/FP8, spekulative Dekodierung, disaggregierte Inferenz, kontinuierliches Batching, KV-Cache-Optimierung, WideEP für MoE)
  • Verständnis der GPU-Speicherhierarchien und der Low-Latency-Netzwerke sowie deren Auswirkungen auf die Inferenzleistung
  • Nachweisliche Erfolge bei der Leitung technischer Initiativen
  • Ausgezeichnete Kommunikationsfähigkeiten für Forscher, Ingenieure und Führungskräfte
  • Starke Kommunikations-, Führungs- und Zusammenarbeitskompetenzen
  • Interdisziplinäre Zusammenarbeit mit Forschungsscientists und Ingenieuren
  • Optimierung der LLM/VLM-Inferenz, Beschleunigung der Transformer-Inferenz, Quantisierung (INT4/FP8)

Senior Solutions Architect – Large Scale Neural Networks Inference in Bern Arbeitgeber: NVIDIA

NVIDIA ist ein herausragender Arbeitgeber, der nicht nur wettbewerbsfähige Gehälter und umfassende Sozialleistungen bietet, sondern auch eine dynamische Arbeitskultur fördert, die Innovation und Zusammenarbeit in der Robotikbranche anregt. In dieser Schlüsselposition in der EMEA-Region haben Sie die Möglichkeit, ein leistungsstarkes Team zu leiten, strategische Beziehungen aufzubauen und bedeutende Wachstumschancen zu entwickeln, während Sie gleichzeitig von einem Umfeld profitieren, das persönliche und berufliche Weiterentwicklung unterstützt. Werden Sie Teil eines Unternehmens, das die Zukunft intelligenter Maschinen gestaltet und dabei auf eine positive Work-Life-Balance Wert legt.

N

Kontaktdaten:

NVIDIA Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Solutions Architect – Large Scale Neural Networks Inference in Bern mit Bravour zu bestehen

AI/ML Infrastruktur
LLM/VLM Inferenzoptimierung
Produktionsbereitstellung in großem Maßstab
Transformer Inferenzbeschleunigung
Quantisierung (INT4/FP8)
Spekulatives Decoding
Disaggregierte Inferenz