D
Vollzeit · Berlin

ML Engineer, Infrastructure

DUDE CHEM · Berlin

Berlin Vollzeit Homeoffice (teilweise) Schnelle Bewerbung
72000 - 88000 € / Jahr (geschätzt)
Direkt-Bewerbung · ohne Weiterleitung
Ohne Anschreiben ca. 2 Min kostenlos

Auf einen Blick

  • Aufgaben
    Entwickle und optimiere unsere GPU-Infrastruktur für bahnbrechende tabellarische Modelle.
  • Unternehmen
    Innovatives KI-Labor, das von SAP unterstützt wird und an der Spitze der Technologie steht.
  • Warum dieser Job
    Arbeite an spannenden Herausforderungen und beeinflusse die Zukunft der KI mit deinem Wissen.
  • Qualifikationen
    Mindestens 3 Jahre Erfahrung in der GPU-Infrastruktur und starke Python-Kenntnisse.

Das solltest du mitbringen

GPU-InfrastrukturmanagementSlurmGCPDockerPyTorchTritonCUDACluster-OrchestrierungKostenoptimierungSystemdenkenPythonExperimentverfolgungModellregistrierungCI-PipelinesDatenverarbeitung

Fehlt dir etwas davon? Bewirb dich trotzdem – das meiste kannst du im Job lernen.

Über die Rolle

Wer wir sind

Foundation-Modelle haben Text und Bilder transformiert. Strukturierte Daten - das größte und folgenschwerste Datenformat der Welt - blieben bis jetzt unberührt. Was LLMs für Sprache getan haben, tun wir für Tabellen. Wir haben tabellarische Foundation-Modelle pioniert: TabPFN v2 war eine Titelgeschichte in Nature, hat über 3,5 Millionen Downloads und über 7.500 GitHub-Sterne erreicht und läuft in der Produktion, von der Erkennung von Lungenkrankheiten mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme - Millionen von Zeilen, Echtzeitinferenz, völlig neue Modalitäten - sind noch offen, und niemand sonst arbeitet auf diesem Niveau daran.

Wir sind ein kleines, hochselektives Team von über 40 Personen mit Hintergründen von Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, geleitet von Frank Hutter, Noah Hollmann und Sauraj Gambhir, und beraten von Bernhard Schölkopf und dem Turing-Preisträger Yann LeCun. Im Juli 2026, weniger als 18 Monate nach unserer Vorfinanzierung von 9 Millionen Euro, traten wir SAP als unabhängiges Frontier-AI-Labor bei - dasselbe Team, dieselbe Mission und offene Gewichtsmodelle, jetzt unterstützt von mehr als 1 Milliarde Euro über vier Jahre.

Über die Rolle

Wir geben jährlich mehrere Millionen Euro für GPU-Compute aus, um tabellarische Foundation-Modelle zu trainieren. Das ist kein Ziel, sondern das, was wir heute betreiben, und es wächst. Die Person, die diese Infrastruktur besitzt, trifft Entscheidungen im Wert von Millionen von Euro: Clusterarchitektur, Planungseffizienz, Anbieterstrategie, Hardwareauswahl. Ein falscher Anruf kostet sechsstellige Beträge.

Heute betreiben wir Slurm auf GCP über mehrere Cluster. Wir skalieren auf eine Multi-Cluster-, Multi-Provider-Infrastruktur und bewerten neue Hardwaregenerationen, sobald sie verfügbar sind. Sie besitzen den gesamten Stack, von Clusterbetrieb und Kostenoptimierung bis hin zur Leistung des verteilten Trainings und der Tool-Schicht, die es den Forschern ermöglicht, schnell voranzukommen. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen, was sie gut machen, um Infrastrukturentscheidungen zu treffen, die ihnen tatsächlich helfen. Und dies ist keine reine Unterstützungsrolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste SOTA-tabellarische Architektur in petto haben, legen Sie los und trainieren Sie sie.

Woran Sie arbeiten werden:

  • Besitzen und weiterentwickeln der Multi-Cluster-GPU-Infrastruktur. Slurm auf GCP heute, Multi-Provider und neue Hardware morgen. Architektur, Planung, Zuverlässigkeit, Kostenoptimierung.
  • GPU-Nutzung und Training-Durchsatz steigern: Profilierung, Speicheroptimierung, Kommunikationsengpässe, systemweite Fehlersuche beim verteilten Training über große Läufe.
  • Die nächste Generation unserer Infrastruktur entwerfen: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Anbieter-Diversifizierung, Kapazitätsplanung gegen wachsende Compute-Anforderungen.
  • Die Entwicklerproduktivitätsschicht aufbauen: CI-Pipelines, Experimentverfolgung, Modellregistrierung, Datenverarbeitung und interne Tools, die die Geschwindigkeit der Forschungsiteration hoch halten.
  • Das Compute-Budget besitzen. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware und hassen verschwendete Rechenleistung.

Technologiestack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton.

Sie könnten gut passen, wenn Sie:

  • Über 3 Jahre Erfahrung im Aufbau und Betrieb von Produktions-GPU-Infrastrukturen oder verteilten Trainingssystemen in großem Maßstab haben. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung.
  • Tiefgehende praktische Erfahrung mit Slurm und Clusterverwaltung haben. Sie haben Planungsfehler behoben, die Nutzung über Multi-Tenant-GPU-Workloads optimiert und Infrastruktur betrieben, bei der Ausfallzeiten echte Kosten verursachen.
  • Expertenniveau im Systemdenken haben: Speicherbandbreite, GPU-Profilierung. Sie denken über Hardware nach, nicht über Konfigurationen.
  • Starke Python-Kenntnisse und echte Vertrautheit mit den internen Abläufen von PyTorch haben. Genug, um einen Trainingslauf zu profilieren und zu sagen, ob der Engpass beim Laden von Daten, der Kommunikation oder der Berechnung liegt.
  • Eine Erfolgsbilanz bei der Entscheidungsfindung in der Infrastruktur haben, die messbar den Training-Durchsatz oder die Kosteneffizienz verbessert hat.
  • Starke Fähigkeiten im Bereich KI-Tools haben. Sie verwenden Claude Code, Cursor oder ähnliche Werkzeuge fließend, um schnell zu arbeiten, ohne die Qualität zu opfern.

Bonus:

  • Erfahrung im Betrieb mit GPU-Ausgaben im zweistelligen Millionenbereich.
  • Erfahrung mit Multi-Cloud- oder hybrider HPC-/Cloud-Infrastruktur.
  • Erfahrung mit Triton, CUDA oder benutzerdefinierten Kernen.
  • Erfahrung im Skalieren von einem einzelnen Cluster auf eine Multi-Cluster-Orchestrierung.
  • Hintergrund im Aufbau von Experimentverfolgung, Modellregistrierung oder ML-Pipeline-Tools.

Das Leben bei Prior Labs

Sie arbeiten neben Forschern und Entwicklern, die sich selbst hohe Maßstäbe setzen - sowohl in der Qualität ihrer Arbeit als auch in der Art und Weise, wie sie miteinander arbeiten. Wir bewegen uns schnell und nehmen uns dennoch die Zeit, die Dinge richtig zu machen.

Unsere Teams sind in Berlin, Freiburg und New York ansässig - wenn Sie an etwas so Schwierigen wie TabPFN arbeiten, ist es wichtig, im selben Raum zu sein. Aber großartige Menschen kommen von überall her, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was normalerweise häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, kommt das gesamte Unternehmen regelmäßig zu Offsites zusammen, um gemeinsam zu bauen und zu feiern.

Unsere Verpflichtungen

Die besten Produkte und Teams werden von Menschen mit einer breiten Palette von Perspektiven und Hintergründen aufgebaut. Wir begrüßen Bewerbungen aus allen Identitäten und Lebensbereichen - insbesondere wenn Sie sich jemals durch "nicht jede Box abzuhaken" entmutigt gefühlt haben - und bieten gleiche Chancen unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder einem anderen Merkmal, das Sie ausmacht, wer Sie sind.

Wir kümmern uns darum, wie Ihre Daten behandelt werden - siehe unsere Datenschutzrichtlinie für die Rekrutierung.

Details zum Job

Anstellung
Vollzeit
Remote
Homeoffice (teilweise)
Gehalt
72000 - 88000 € / Jahr (geschätzt)

Das bietet dir DUDE CHEM

Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und die Möglichkeit, remote zu arbeiten.

StudySmarter Expertenrat

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei DUDE CHEM anzuklopfen, wenn du dich auf die Stelle als ML Engineer, Infrastructure bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei DUDE CHEM vorzubereiten!

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills

In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge

Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen

Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen

In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei DUDE CHEM klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei DUDE CHEM vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.

Über den Arbeitgeber

Doctolib ist ein herausragender Arbeitgeber, der Ihnen die Möglichkeit bietet, die Infrastruktur eines führenden Healthtech-Unternehmens in Europa zu gestalten. Mit einem starken Fokus auf Mitarbeiterentwicklung und einer Kultur der proaktiven Zuverlässigkeit profitieren Sie von flexiblen Arbeitsmodellen, umfangreichen Sozialleistungen und einem unterstützenden Umfeld, das Innovation und Teamarbeit fördert. Hier haben Sie die Chance, nicht nur technische Exzellenz zu erreichen, sondern auch einen direkten Einfluss auf die Gesundheitsversorgung in Europa zu nehmen.

Kontaktdaten:
DUDE CHEM Recruiting-Team

Standorte

  • Berlin

Bereit für den ersten Schritt?

Ohne Anschreiben · dauert ca. 2 Minuten