Senior Staff LLM Inference Engineer

Senior Staff LLM Inference Engineer

Vollzeit 72000 - 88000 € / Jahr (geschätzt) Kein Homeoffice möglich
S

Auf einen Blick

  • Aufgaben: Entwickle innovative KI-Lösungen und optimiere Inferenzsysteme auf neuartiger Hardware.
  • Unternehmen: D-Matrix, ein Vorreiter in der generativen KI-Technologie.
  • Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen und umfassende Sozialleistungen.
  • Weitere Informationen: Kollaborative Kultur mit hohem Maß an Eigenverantwortung und Entwicklungsmöglichkeiten.
  • Warum dieser Job: Gestalte die Zukunft der KI mit und arbeite an bahnbrechenden Projekten.
  • Qualifikationen: Erfahrung in Softwareentwicklung und tiefes Verständnis für KI-Architekturen.

Das prognostizierte Gehalt liegt zwischen 72000 - 88000 € pro Jahr.

Bei d-Matrix konzentrieren wir uns darauf, das Potenzial von generativer KI zu entfalten, um die Transformation der Technologie voranzutreiben. Wir stehen an der Spitze der Software- und Hardware-Innovation und erweitern die Grenzen des Möglichen. Unsere Kultur basiert auf Respekt und Zusammenarbeit. Wir schätzen Demut und glauben an direkte Kommunikation. Unser Team ist inklusiv, und unsere unterschiedlichen Perspektiven ermöglichen bessere Lösungen. Wir suchen Personen, die leidenschaftlich daran interessiert sind, Herausforderungen anzugehen und von der Ausführung getrieben werden.

Die D-Matrix Frontier Group befindet sich an der Spitze dessen, was mit LLM-Inferenz auf heterogener Hardware möglich ist. Unser Auftrag umfasst den gesamten Stack: von der Erschließung neuer Anwendungsfälle und neuartiger Bereitstellungsmuster bis hin zur tiefen Optimierung von Inferenzkernen und dem Aufbau von Prototyp-Systemen, die das einzigartige Rechenmodell von D-Matrix demonstrieren. Wir sind ein angewandtes Forschungs- und Ingenieurteam, das schnell arbeitet, reale Systeme bereitstellt und direkt mit Produkt- und Hardwareteams zusammenarbeitet, um die Roadmap zu gestalten. Wir entwickeln die Werkzeuge, Laufzeiten und Frameworks, die es ermöglichen, dass moderne KI-Modelle effizient und kostengünstig über heterogene Bereitstellungen hinweg laufen.

Diese Rolle

Wir stellen End-to-End-Inferenzingenieure ein, die sich wohlfühlen, von einer neuartigen Forschungsidee zu einem bereitgestellten, optimierten System zu gelangen. Sie werden auf jeder Ebene des Inferenzstacks arbeiten, von der Optimierung auf Kernel-Ebene bis hin zur verteilten Orchestrierung und hochrangigen Serving-APIs. Diese Rolle könnte gut zu Ihnen passen, wenn Sie:

  • Ein tiefes Verständnis für moderne Architekturen der generativen KI haben und wissen, wie man die Leistung zur Inferenzzeit maximiert.
  • Mit den internen Abläufen von Open-Source-Inferenz-Frameworks (vLLM, SGLang, TensorRT-LLM usw.) vertraut sind und diese bei Bedarf erweitern oder ersetzen können.
  • Neue Anwendungsfälle erkunden und frühe POCs entwickeln möchten, die neue Ideen beweisen.
  • Ergebnisorientiert sind und eine starke Handlungsorientierung haben; Sie übernehmen Probleme von der Prototypenentwicklung bis zur Optimierung und Übergabe.
  • Begeistert sind, an der Schnittstelle zwischen neuartiger Hardware und modernen Modellen zu arbeiten und möchten, dass Ihre Arbeit direkten Einfluss darauf hat, wie die nächste Generation von KI-Silizium genutzt wird.
  • Klare Kommunikation schätzen und in einem kleinen, hochverantwortlichen Teamumfeld gedeihen.

Verantwortlichkeiten

  • Identifizieren und Prototypisieren neuer LLM-Inferenzanwendungsfälle, die für heterogene Hardware-Bereitstellungen geeignet sind.
  • Überzeugende Prototyp-Systeme entwickeln, die die Fähigkeiten von D-Matrix gegenüber Kunden, Partnern und internen Stakeholdern demonstrieren.
  • Benutzerdefinierte Kerne und Optimierungen auf Operator-Ebene entwickeln und abstimmen, um den Durchsatz zu maximieren und die Latenz zu minimieren.
  • Strategien zur Quantisierung, Sparsamkeit und Batch-Verarbeitung entwickeln, die auf das D-Matrix-Rechenmodell zugeschnitten sind.
  • Inferenzlaufzeiten, Serving-Frameworks und Evaluierungswerkzeuge aufbauen und pflegen.
  • Zu verteilten Inferenzsystemen beitragen: Tensor-/Pipeline-Parallelismus, disaggregierte Vorbefüllung/Dekodierung, KV-Cache-Management.
  • Eng mit Hardwarearchitekten zusammenarbeiten, um Firmware- und Compiler-Teams umsetzbare Einblicke in Inferenzarbeitslasten zu geben.
  • Mit Produkt- und Geschäftsentwicklung zusammenarbeiten, um POCs in kundenorientierte Demonstrationen zu übersetzen.
  • Zu technischen Veröffentlichungen, Whitepapers und Open-Source-Projekten beitragen, die die Sichtbarkeit von D-Matrix fördern.

Erforderliche Qualifikationen

  • Abschluss in Informatik, Elektrotechnik oder einem verwandten Bereich und mehr als 10 Jahre relevante Ingenieurerfahrung oder gleichwertige nachgewiesene Erfahrung.
  • Master- oder Doktortitel in Informatik, Elektrotechnik oder einem verwandten Bereich bevorzugt, mit mehr als 6 Jahren relevanter Branchenerfahrung.
  • Starke Kenntnisse in Python und C/C++.
  • Praktische Erfahrung in der Optimierung von LLM-Inferenz – Aufmerksamkeitskerne, KV-Cache, Batch-Strategien, Quantisierung (INT8/FP8/INT4).
  • Erfahrung mit mindestens einem großen Inferenz-Framework (vLLM, SGLang, TensorRT-LLM, ONNX Runtime oder ähnlich) auf Beitragsniveau.
  • Vertrautheit mit GPU-Kernel-Programmierung (CUDA/Triton) und Performance-Profiling-Tools.

Bevorzugte Qualifikationen

  • Erfahrung mit heterogenen Compute-Bereitstellungen – Planung von Inferenzarbeitslasten über unterschiedliche Hardware (Beschleuniger, CPUs, GPUs).
  • Vertrautheit mit benutzerdefiniertem Silizium oder ASIC-basierter Inferenz (über GPU-only Umgebungen hinaus).
  • Erfahrung mit verteilter Inferenz: Tensor-Parallelismus, Pipeline-Parallelismus, disaggregiertes Serving.
  • Beiträge zu Open-Source-Inferenz- oder ML-Systemprojekten.
  • Erfahrung mit der Bereitstellung von Produktionsinferenz in großem Maßstab (Latenz-SLOs, kontinuierliches Batching, Multi-Modell-Serving).
  • Vertrautheit mit spekulativer Dekodierung, Mixture-of-Experts-Routing oder Techniken zum Long-Context-Serving.
  • Arbeitserfahrung mit dem Material im JAX Scaling Book oder gleichwertigem systemtechnischen Verständnis des modernen LLM-Trainings und der Inferenz.

Warum D-Matrix Frontier Group

  • Arbeiten Sie an wirklich neuartiger Hardware: Die D-Matrix-In-Memory-Compute-Architektur eröffnet Inferenzoptimierungsprobleme, die es sonst nirgendwo gibt.
  • End-to-End-Verantwortung von der Idee bis zum bereitgestellten System, mit einem kurzen Feedback-Zyklus zwischen Ihrer Arbeit und der realen Hardware.
  • Kleines, erfahrenes Team mit hoher Autonomie und direktem Einfluss auf die Produktentwicklung.
  • Wettbewerbsfähige Vergütung, Aktien und Sozialleistungen in Santa Clara, CA.

Gleichstellung der Chancen

d-Matrix ist stolz darauf, ein Arbeitsplatz mit gleichen Chancen und ein Arbeitgeber für positive Maßnahmen zu sein. Wir setzen uns dafür ein, ein integratives Umfeld zu fördern, in dem sich jeder willkommen und befähigt fühlt, seine beste Arbeit zu leisten. Wir stellen die besten Talente für unsere Teams ein, unabhängig von Rasse, Religion, Hautfarbe, Alter, Behinderung, Geschlecht, Geschlechtsidentität, sexueller Orientierung, Abstammung, genetischen Informationen, Familienstand, nationaler Herkunft, politischer Zugehörigkeit oder Veteranenstatus. Unser Fokus liegt darauf, Teamkollegen mit bescheidener Expertise, Freundlichkeit, Engagement und der Bereitschaft einzustellen, Herausforderungen anzunehmen und jeden Tag gemeinsam zu lernen.

Senior Staff LLM Inference Engineer Arbeitgeber: Showcify

Als Arbeitgeber bei Deliveroo in Dubai bieten wir Ihnen die Möglichkeit, in einem dynamischen und innovativen Umfeld zu arbeiten, wo Ihre Ideen und Ihr Engagement einen direkten Einfluss auf das Kundenerlebnis haben. Unsere Unternehmenskultur fördert Zusammenarbeit und Vielfalt, während wir Ihnen gleichzeitig die Chance geben, Ihre Fähigkeiten weiterzuentwickeln und eine bedeutende Karriere aufzubauen. Genießen Sie die Vorteile eines hybriden Arbeitsmodells und die Unterstützung eines globalen Teams, das sich für Inklusion und Chancengleichheit einsetzt.

S

Kontaktdaten:

Showcify Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior Staff LLM Inference Engineer erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Showcify anzuklopfen, wenn du dich auf die Stelle als Senior Staff LLM Inference Engineer bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Showcify vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Staff LLM Inference Engineer mit Bravour zu bestehen

Generative AI Architekturen
Optimierung von LLM-Inferenz
Python
C/C++
Open-Source Inferenz-Frameworks (vLLM, SGLang, TensorRT-LLM)
GPU-Kernel-Programmierung (CUDA/Triton)
Leistungsprofiling-Tools

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Showcify klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei Showcify vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.