Auf einen Blick
- Aufgaben: Verwalte und entwickle unsere GPU-Infrastruktur für bahnbrechende tabellarische Modelle.
- Unternehmen: Innovatives KI-Labor, das von SAP unterstützt wird und an der Spitze der Technologie steht.
- Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und die Möglichkeit, an spannenden Projekten zu arbeiten.
- Weitere Informationen: Dynamisches Arbeitsumfeld mit hervorragenden Entwicklungsmöglichkeiten und regelmäßigen Team-Events.
- Warum dieser Job: Sei Teil eines kleinen, talentierten Teams und arbeite an echten Herausforderungen in der KI.
- Qualifikationen: Mindestens 3 Jahre Erfahrung in der Verwaltung von GPU-Infrastrukturen und tiefes Verständnis von Slurm.
Das prognostizierte Gehalt liegt zwischen 72000 - 88000 € pro Jahr.
Wer wir sind
Foundation-Modelle haben Text und Bilder transformiert. Strukturierte Daten - das größte und folgenschwerste Datenformat der Welt - blieben bis jetzt unberührt. Was LLMs für Sprache getan haben, tun wir für Tabellen. Wir haben tabellarische Foundation-Modelle pioniert: TabPFN v2 war eine Titelgeschichte in Nature, hat über 3,5 Millionen Downloads und mehr als 7.500 GitHub-Sterne erreicht und läuft in der Produktion, von der Erkennung von Lungenkrankheiten mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme - Millionen von Zeilen, Echtzeitinferenz, völlig neue Modalitäten - sind noch offen, und niemand sonst arbeitet auf diesem Niveau daran.
Wir sind ein kleines, hochselektives Team von über 40 Personen mit Hintergründen von Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, geleitet von Frank Hutter, Noah Hollmann und Sauraj Gambhir, und beraten von Bernhard Schölkopf und dem Turing-Preisträger Yann LeCun. Im Juli 2026, weniger als 18 Monate nach unserer Vorfinanzierung von 9 Millionen Euro, traten wir SAP als unabhängiges Frontier-AI-Labor bei - dasselbe Team, dieselbe Mission und offene Gewichtsmodelle, jetzt unterstützt von mehr als 1 Milliarde Euro über vier Jahre.
Über die Rolle
Wir geben jährlich mehrere Millionen Euro für GPU-Compute aus, um tabellarische Foundation-Modelle zu trainieren. Das ist kein Ziel, sondern das, was wir heute betreiben, und es wächst. Die Person, die diese Infrastruktur besitzt, trifft Entscheidungen im Wert von Millionen von Euro: Clusterarchitektur, Planungseffizienz, Anbieterstrategie, Hardwareauswahl. Ein falscher Anruf kostet sechsstellige Beträge.
Heute betreiben wir Slurm auf GCP über mehrere Cluster. Wir skalieren auf eine Multi-Cluster-, Multi-Provider-Infrastruktur und bewerten neue Hardwaregenerationen, sobald sie verfügbar sind. Sie besitzen den gesamten Stack, von Clusterbetrieb und Kostenoptimierung bis hin zur Leistung des verteilten Trainings und der Tool-Schicht, die es den Forschern ermöglicht, schnell voranzukommen. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen, was sie gut machen, um Infrastrukturentscheidungen zu treffen, die ihnen tatsächlich helfen. Und dies ist keine reine Unterstützungsrolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste SOTA-tabellarische Architektur in petto haben, legen Sie los und trainieren Sie sie.
Woran Sie arbeiten werden:
- Besitzen und weiterentwickeln der Multi-Cluster-GPU-Infrastruktur. Slurm auf GCP heute, Multi-Provider und neue Hardware morgen. Architektur, Planung, Zuverlässigkeit, Kostenoptimierung.
- GPU-Nutzung und Training-Durchsatz steigern: Profilierung, Speicheroptimierung, Kommunikationsengpässe, systemweite Fehlersuche beim verteilten Training über große Läufe.
- Die nächste Generation unserer Infrastruktur entwerfen: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Anbieter-Diversifizierung, Kapazitätsplanung gegen wachsende Compute-Anforderungen.
- Die Entwicklerproduktivitätsschicht aufbauen: CI-Pipelines, Experimentverfolgung, Modellregistrierung, Datenverarbeitung und interne Tools, die die Geschwindigkeit der Forschungsiteration hoch halten.
- Das Compute-Budget besitzen. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware und hassen verschwendete Rechenleistung.
Technologiestack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton.
Sie könnten gut passen, wenn Sie:
- Über 3 Jahre Erfahrung im Aufbau und Betrieb von Produktions-GPU-Infrastrukturen oder verteilten Trainingssystemen im großen Maßstab haben. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung.
- Tiefgehende praktische Erfahrung mit Slurm und Clusterverwaltung haben. Sie haben Planungsfehler behoben, die Nutzung über Multi-Tenant-GPU-Workloads optimiert und Infrastruktur betrieben, bei der Ausfallzeiten echte Kosten verursachen.
- Expertenniveau im Systemdenken haben: Speicherbandbreite, GPU-Profilierung. Sie denken über Hardware nach, nicht über Konfigurationen.
- Starke Python-Kenntnisse und echte Vertrautheit mit den internen Abläufen von PyTorch haben. Genug, um einen Trainingslauf zu profilieren und zu sagen, ob der Engpass beim Laden von Daten, der Kommunikation oder der Berechnung liegt.
- Eine Erfolgsbilanz bei der Entscheidungsfindung in der Infrastruktur haben, die messbar den Training-Durchsatz oder die Kosteneffizienz verbessert hat.
- Starke Fähigkeiten im Bereich KI-Tools haben. Sie verwenden Claude Code, Cursor oder ähnliche Werkzeuge fließend, um schnell voranzukommen, ohne die Qualität zu opfern.
Bonus:
- Erfahrung im Betrieb mit GPU-Ausgaben im Bereich von mehreren Millionen.
- Erfahrung mit Multi-Cloud- oder hybrider HPC-/Cloud-Infrastruktur.
- Erfahrung mit Triton, CUDA oder benutzerdefinierten Kernen.
- Erfahrung mit der Skalierung von einem einzelnen Cluster auf eine Multi-Cluster-Orchestrierung.
- Hintergrund im Aufbau von Experimentverfolgung, Modellregistrierung oder ML-Pipeline-Tools.
Das Leben bei Prior Labs
Sie arbeiten neben Forschern und Entwicklern, die sich selbst hohe Maßstäbe setzen - sowohl in der Qualität ihrer Arbeit als auch in der Art und Weise, wie sie miteinander arbeiten. Wir bewegen uns schnell und nehmen uns dennoch die Zeit, die Dinge richtig zu machen.
Unsere Teams sind in Berlin, Freiburg und New York ansässig - wenn Sie an etwas so Schwierigen wie TabPFN arbeiten, ist es wichtig, im selben Raum zu sein. Aber großartige Menschen kommen von überall her, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was normalerweise häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, kommt das gesamte Unternehmen regelmäßig zu Offsites zusammen, um gemeinsam zu bauen und zu feiern.
Unsere Verpflichtungen
Die besten Produkte und Teams werden von Menschen mit einer breiten Palette von Perspektiven und Hintergründen aufgebaut. Wir begrüßen Bewerbungen aus allen Identitäten und Lebensbereichen - insbesondere wenn Sie sich jemals durch "nicht alle Anforderungen zu erfüllen" entmutigt gefühlt haben - und bieten gleiche Chancen unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder einem anderen Merkmal, das Sie ausmacht, wer Sie sind.
Wir kümmern uns darum, wie Ihre Daten behandelt werden - siehe unsere Datenschutzrichtlinie für die Rekrutierung.
ML Engineer, Infrastructure Arbeitgeber: Prior Labs
Bei Prior Labs sind wir ein kleines, ehrgeiziges Team, das eine der schwierigsten Herausforderungen in der KI löst. Wir bieten eine dynamische Arbeitsumgebung in Berlin, Freiburg und New York, wo Sie eng mit erstklassigen Forschern und Entwicklern zusammenarbeiten können, die sich leidenschaftlich für die Qualität ihrer Arbeit und den Einfluss auf die reale Welt einsetzen. Unsere Unternehmenskultur fördert schnelles Handeln, rigoroses Denken und die Möglichkeit, bedeutende Beiträge zu leisten, während wir gleichzeitig ein sicheres und inklusives Umfeld schaffen, in dem Vielfalt geschätzt wird.