ML Engineer, Infrastructure

ML Engineer, Infrastructure

Berlin Vollzeit 72000 - 88000 € / Jahr (geschätzt) Homeoffice (teilweise)
P

Auf einen Blick

  • Aufgaben: Verwalte und entwickle unsere GPU-Infrastruktur für bahnbrechende tabellarische Modelle.
  • Unternehmen: Innovatives KI-Labor, das von SAP unterstützt wird und an der Spitze der Technologie steht.
  • Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und die Möglichkeit, an spannenden Projekten zu arbeiten.
  • Weitere Informationen: Dynamisches Arbeitsumfeld mit hervorragenden Entwicklungsmöglichkeiten und regelmäßigen Team-Events.
  • Warum dieser Job: Sei Teil eines kleinen, talentierten Teams und arbeite an echten Herausforderungen in der KI.
  • Qualifikationen: Mindestens 3 Jahre Erfahrung in der Verwaltung von GPU-Infrastrukturen und tiefes Verständnis von Slurm.

Das prognostizierte Gehalt liegt zwischen 72000 - 88000 € pro Jahr.

Wer wir sind

Foundation-Modelle haben Text und Bilder transformiert. Strukturierte Daten - das größte und folgenschwerste Datenformat der Welt - blieben bis jetzt unberührt. Was LLMs für Sprache getan haben, tun wir für Tabellen. Wir haben tabellarische Foundation-Modelle pioniert: TabPFN v2 war eine Titelgeschichte in Nature, hat über 3,5 Millionen Downloads und mehr als 7.500 GitHub-Sterne erreicht und läuft in der Produktion, von der Erkennung von Lungenkrankheiten mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme - Millionen von Zeilen, Echtzeitinferenz, völlig neue Modalitäten - sind noch offen, und niemand sonst arbeitet auf diesem Niveau daran.

Wir sind ein kleines, hochselektives Team von über 40 Personen mit Hintergründen von Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, geleitet von Frank Hutter, Noah Hollmann und Sauraj Gambhir, und beraten von Bernhard Schölkopf und dem Turing-Preisträger Yann LeCun. Im Juli 2026, weniger als 18 Monate nach unserer Vorfinanzierung von 9 Millionen Euro, traten wir SAP als unabhängiges Frontier-AI-Labor bei - dasselbe Team, dieselbe Mission und offene Gewichtsmodelle, jetzt unterstützt von mehr als 1 Milliarde Euro über vier Jahre.

Über die Rolle

Wir geben jährlich mehrere Millionen Euro für GPU-Compute aus, um tabellarische Foundation-Modelle zu trainieren. Das ist kein Ziel, sondern das, was wir heute betreiben, und es wächst. Die Person, die diese Infrastruktur besitzt, trifft Entscheidungen im Wert von Millionen von Euro: Clusterarchitektur, Planungseffizienz, Anbieterstrategie, Hardwareauswahl. Ein falscher Anruf kostet sechsstellige Beträge.

Heute betreiben wir Slurm auf GCP über mehrere Cluster. Wir skalieren auf eine Multi-Cluster-, Multi-Provider-Infrastruktur und bewerten neue Hardwaregenerationen, sobald sie verfügbar sind. Sie besitzen den gesamten Stack, von Clusterbetrieb und Kostenoptimierung bis hin zur Leistung des verteilten Trainings und der Tool-Schicht, die es den Forschern ermöglicht, schnell voranzukommen. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen, was sie gut machen, um Infrastrukturentscheidungen zu treffen, die ihnen tatsächlich helfen. Und dies ist keine reine Unterstützungsrolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste SOTA-tabellarische Architektur in petto haben, legen Sie los und trainieren Sie sie.

Woran Sie arbeiten werden:

  • Besitzen und weiterentwickeln der Multi-Cluster-GPU-Infrastruktur. Slurm auf GCP heute, Multi-Provider und neue Hardware morgen. Architektur, Planung, Zuverlässigkeit, Kostenoptimierung.
  • GPU-Nutzung und Training-Durchsatz steigern: Profilierung, Speicheroptimierung, Kommunikationsengpässe, systemweite Fehlersuche beim verteilten Training über große Läufe.
  • Die nächste Generation unserer Infrastruktur entwerfen: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Anbieter-Diversifizierung, Kapazitätsplanung gegen wachsende Compute-Anforderungen.
  • Die Entwicklerproduktivitätsschicht aufbauen: CI-Pipelines, Experimentverfolgung, Modellregistrierung, Datenverarbeitung und interne Tools, die die Geschwindigkeit der Forschungsiteration hoch halten.
  • Das Compute-Budget besitzen. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware und hassen verschwendete Rechenleistung.

Technologiestack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton.

Sie könnten gut passen, wenn Sie:

  • Über 3 Jahre Erfahrung im Aufbau und Betrieb von Produktions-GPU-Infrastrukturen oder verteilten Trainingssystemen im großen Maßstab haben. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung.
  • Tiefgehende praktische Erfahrung mit Slurm und Clusterverwaltung haben. Sie haben Planungsfehler behoben, die Nutzung über Multi-Tenant-GPU-Workloads optimiert und Infrastruktur betrieben, bei der Ausfallzeiten echte Kosten verursachen.
  • Expertenniveau im Systemdenken haben: Speicherbandbreite, GPU-Profilierung. Sie denken über Hardware nach, nicht über Konfigurationen.
  • Starke Python-Kenntnisse und echte Vertrautheit mit den internen Abläufen von PyTorch haben. Genug, um einen Trainingslauf zu profilieren und zu sagen, ob der Engpass beim Laden von Daten, der Kommunikation oder der Berechnung liegt.
  • Eine Erfolgsbilanz bei der Entscheidungsfindung in der Infrastruktur haben, die messbar den Training-Durchsatz oder die Kosteneffizienz verbessert hat.
  • Starke Fähigkeiten im Bereich KI-Tools haben. Sie verwenden Claude Code, Cursor oder ähnliche Werkzeuge fließend, um schnell voranzukommen, ohne die Qualität zu opfern.

Bonus:

  • Erfahrung im Betrieb mit GPU-Ausgaben im Bereich von mehreren Millionen.
  • Erfahrung mit Multi-Cloud- oder hybrider HPC-/Cloud-Infrastruktur.
  • Erfahrung mit Triton, CUDA oder benutzerdefinierten Kernen.
  • Erfahrung mit der Skalierung von einem einzelnen Cluster auf eine Multi-Cluster-Orchestrierung.
  • Hintergrund im Aufbau von Experimentverfolgung, Modellregistrierung oder ML-Pipeline-Tools.

Das Leben bei Prior Labs

Sie arbeiten neben Forschern und Entwicklern, die sich selbst hohe Maßstäbe setzen - sowohl in der Qualität ihrer Arbeit als auch in der Art und Weise, wie sie miteinander arbeiten. Wir bewegen uns schnell und nehmen uns dennoch die Zeit, die Dinge richtig zu machen.

Unsere Teams sind in Berlin, Freiburg und New York ansässig - wenn Sie an etwas so Schwierigen wie TabPFN arbeiten, ist es wichtig, im selben Raum zu sein. Aber großartige Menschen kommen von überall her, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was normalerweise häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, kommt das gesamte Unternehmen regelmäßig zu Offsites zusammen, um gemeinsam zu bauen und zu feiern.

Unsere Verpflichtungen

Die besten Produkte und Teams werden von Menschen mit einer breiten Palette von Perspektiven und Hintergründen aufgebaut. Wir begrüßen Bewerbungen aus allen Identitäten und Lebensbereichen - insbesondere wenn Sie sich jemals durch "nicht alle Anforderungen zu erfüllen" entmutigt gefühlt haben - und bieten gleiche Chancen unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder einem anderen Merkmal, das Sie ausmacht, wer Sie sind.

Wir kümmern uns darum, wie Ihre Daten behandelt werden - siehe unsere Datenschutzrichtlinie für die Rekrutierung.

ML Engineer, Infrastructure Arbeitgeber: Prior Labs

Bei Prior Labs sind wir ein kleines, ehrgeiziges Team, das eine der schwierigsten Herausforderungen in der KI löst. Wir bieten eine dynamische Arbeitsumgebung in Berlin, Freiburg und New York, wo Sie eng mit erstklassigen Forschern und Entwicklern zusammenarbeiten können, die sich leidenschaftlich für die Qualität ihrer Arbeit und den Einfluss auf die reale Welt einsetzen. Unsere Unternehmenskultur fördert schnelles Handeln, rigoroses Denken und die Möglichkeit, bedeutende Beiträge zu leisten, während wir gleichzeitig ein sicheres und inklusives Umfeld schaffen, in dem Vielfalt geschätzt wird.

P

Kontaktdaten:

Prior Labs Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so ML Engineer, Infrastructure erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Prior Labs anzuklopfen, wenn du dich auf die Stelle als ML Engineer, Infrastructure bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Prior Labs vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um ML Engineer, Infrastructure mit Bravour zu bestehen

GPU-Infrastrukturmanagement
Slurm
GCP
Docker
PyTorch
Triton
CUDA

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Prior Labs klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei Prior Labs vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.