LLM Inference Frameworks and Optimization Engineer

LLM Inference Frameworks and Optimization Engineer

Vollzeit 60000 - 80000 € / Jahr (geschätzt) Homeoffice (teilweise)
Together AI

Auf einen Blick

  • Aufgaben: Entwickle und optimiere hochleistungsfähige Inferenz-Frameworks für KI-Modelle.
  • Unternehmen: Together.ai, ein innovatives Unternehmen im Bereich künstliche Intelligenz.
  • Vorteile: Wettbewerbsfähiges Gehalt, Startup-Equity, Gesundheitsversorgung und weitere Vorteile.
  • Weitere Informationen: Wachstumsorientierte Umgebung mit spannenden Karrierechancen.
  • Warum dieser Job: Gestalte die Zukunft der KI-Infrastruktur und arbeite an bahnbrechenden Projekten.
  • Qualifikationen: 3+ Jahre Erfahrung in Deep Learning und verteilten Systemen erforderlich.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Über uns

Bei Together.ai entwickeln wir eine hochmoderne Infrastruktur, um effiziente und skalierbare Inferenz für große Sprachmodelle (LLMs) zu ermöglichen. Unsere Mission ist es, Inferenz-Frameworks, Algorithmen und Infrastruktur zu optimieren und die Grenzen von Leistung, Skalierbarkeit und Kosteneffizienz zu erweitern. Wir suchen einen Ingenieur für Inferenz-Frameworks und Optimierung, der verteilte Inferenz-Engines entwirft, entwickelt und optimiert, die multimodale und Sprachmodelle in großem Maßstab unterstützen. Diese Rolle konzentriert sich auf latenzarme, hochdurchsatzfähige Inferenz, GPU-/Beschleunigeroptimierungen und Software-Hardware-Co-Design, um eine effiziente großflächige Bereitstellung von LLMs und Vision-Modellen sicherzustellen.

Verantwortlichkeiten

  • Entwicklung und Optimierung von Inferenz-Frameworks: Entwerfen und Entwickeln eines fehlertoleranten, hochkonkurrierenden verteilten Inferenz-Engines für Text-, Bild- und multimodale Generierungsmodelle. Implementieren und Optimieren von verteilten Inferenzstrategien, einschließlich Mixture of Experts (MoE) Parallelismus, Tensor-Parallelismus, Pipeline-Parallelismus für leistungsstarkes Serving. Anwenden von CUDA-Grafoptimierungen, TensorRT/TRT-LLM-Grafoptimierungen und PyTorch-basierter Kompilierung (torch.compile) sowie spekulativer Dekodierung zur Verbesserung der Effizienz und Skalierbarkeit.
  • Software-Hardware-Co-Design und KI-Infrastruktur: Zusammenarbeit mit Hardware-Teams zur Analyse von Leistungsengpässen, Co-Optimierung der Inferenzleistung für GPUs, TPUs oder benutzerdefinierte Beschleuniger. Enge Zusammenarbeit mit KI-Forschern und Infrastruktur-Ingenieuren zur Entwicklung effizienter Modellausführungspläne und Optimierung von E2E-Modellserving-Pipelines.

Qualifikationen

  • Must-Have:
    • Erfahrung: 3+ Jahre Erfahrung in tiefen Lerninferenz-Frameworks, verteilten Systemen oder Hochleistungsrechnen.
    • Technische Fähigkeiten: Vertraut mit mindestens einem LLM-Inferenz-Framework (z.B. TensorRT-LLM, vLLM, SGLang, TGI (Text Generation Inference)). Hintergrundwissen und Erfahrung in mindestens einem der folgenden Bereiche: GPU-Programmierung (CUDA/Triton/TensorRT), Compiler, Modellquantisierung und GPU-Cluster-Planung. Tiefes Verständnis von KV-Cache-Systemen wie Mooncake, PagedAttention oder benutzerdefinierten Inhouse-Varianten.
    • Programmierung: Versiert in Python und C++/CUDA für hochleistungsfähige tiefen Lerninferenz.
    • Optimierungstechniken: Tiefes Verständnis von Transformer-Architekturen und LLM/VLM/Diffusionsmodell-Optimierung. Kenntnisse über Inferenzoptimierung, wie Arbeitslastplanung, CUDA-Grafik, kompilierte, effiziente Kerne.
    • Soziale Fähigkeiten: Starke analytische Problemlösungsfähigkeiten mit einer leistungsorientierten Denkweise. Ausgezeichnete Zusammenarbeit und Kommunikationsfähigkeiten über Teams hinweg.
  • Nice-to-Have:
    • Erfahrung in der Entwicklung von Softwaresystemen für große Rechenzentrumsnetzwerke mit RDMA/RoCE.
    • Vertraut mit verteilten Dateisystemen (z.B. 3FS, HDFS, Ceph).
    • Vertraut mit Open-Source-verteilten Planungs-/Orchestrierungs-Frameworks wie Kubernetes (K8S).
    • Beiträge zu Open-Source-Projekten für tiefe Lerninferenz.

Warum Sie sich uns anschließen sollten?

Diese Rolle bietet eine einzigartige Gelegenheit, die Zukunft der LLM-Inferenzinfrastruktur zu gestalten und eine skalierbare, leistungsstarke KI-Bereitstellung über eine Vielzahl von Anwendungen hinweg sicherzustellen. Wenn Sie leidenschaftlich daran interessiert sind, die Grenzen der KI-Inferenz zu erweitern, würden wir uns freuen, von Ihnen zu hören!

Über Together AI

Together AI ist ein forschungsgetriebenes Unternehmen für künstliche Intelligenz. Wir glauben, dass offene und transparente KI-Systeme Innovationen vorantreiben und die besten Ergebnisse für die Gesellschaft schaffen werden. Gemeinsam haben wir die Mission, die Kosten moderner KI-Systeme erheblich zu senken, indem wir Software, Hardware, Algorithmen und Modelle gemeinsam entwerfen. Wir haben zu führenden Open-Source-Forschungen, Modellen und Datensätzen beigetragen, um die Grenzen der KI voranzutreiben, und unser Team war hinter technologischen Fortschritten wie FlashAttention, Hyena, FlexGen und RedPajama. Wir laden Sie ein, einer leidenschaftlichen Gruppe von Forschern auf unserer Reise beizutreten, die nächste Generation von KI-Infrastruktur aufzubauen.

Vergütung

Wir bieten wettbewerbsfähige Vergütung, Startup-Eigenkapital, Krankenversicherung und andere wettbewerbsfähige Vorteile. Die US-Grundgehaltsspanne für diese Vollzeitstelle liegt zwischen 160.000 und 230.000 USD + Eigenkapital + Leistungen. Unsere Gehaltsspannen werden durch Standort, Niveau und Rolle bestimmt. Die individuelle Vergütung wird durch Erfahrung, Fähigkeiten und berufsbezogenes Wissen festgelegt.

Gleichberechtigung

Together AI ist ein Arbeitgeber, der Chancengleichheit bietet, und ist stolz darauf, allen unabhängig von Rasse, Hautfarbe, Abstammung, Religion, Geschlecht, nationaler Herkunft, sexueller Orientierung, Alter, Staatsbürgerschaft, Familienstand, Behinderung, Geschlechtsidentität, Veteranenstatus und mehr gleiche Beschäftigungsmöglichkeiten zu bieten.

LLM Inference Frameworks and Optimization Engineer Arbeitgeber: Together AI

Together AI ist ein hervorragender Arbeitgeber, der eine dynamische und innovative Arbeitsumgebung bietet, in der Mitarbeiter die Möglichkeit haben, an der Spitze der KI-Technologie zu arbeiten. Mit einem starken Fokus auf persönliche und berufliche Entwicklung, wettbewerbsfähigen Vergütungen und einem unterstützenden Teamgeist fördert Together AI eine Kultur der Zusammenarbeit und des Wachstums. Die Position des Head of Hyperscaler Partnerships ermöglicht es Ihnen, bedeutende Partnerschaften mit führenden Cloud-Anbietern zu gestalten und dabei einen direkten Einfluss auf die Zukunft der KI-Infrastruktur zu nehmen.

Together AI

Kontaktdaten:

Together AI Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so LLM Inference Frameworks and Optimization Engineer erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Together AI anzuklopfen, wenn du dich auf die Stelle als LLM Inference Frameworks and Optimization Engineer bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Together AI vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um LLM Inference Frameworks and Optimization Engineer mit Bravour zu bestehen

Deep Learning Inference Frameworks
Distributed Systems
High-Performance Computing
CUDA Programming
TensorRT
Model Quantization
GPU Cluster Scheduling

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Together AI klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei Together AI vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.