Auf einen Blick
- Aufgaben: Entwickle und pflege Container-Images für ML-Systeme in einem HPC-Umfeld.
- Unternehmen: ETH Zürich, eine der weltweit führenden technischen Universitäten.
- Vorteile: Flexible Arbeitszeiten, Zugang zu einem der größten AI-Supercomputer Europas und umfassende Weiterbildungsmöglichkeiten.
- Weitere Informationen: Dynamisches Team mit exzellenten Karrierechancen und einem Fokus auf Vielfalt und Nachhaltigkeit.
- Warum dieser Job: Arbeite an innovativen Projekten mit führenden Forschern und gestalte die Zukunft der KI mit.
- Qualifikationen: Erfahrung in HPC-Umgebungen und starke Linux- sowie Container-Kenntnisse erforderlich.
Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.
Wir suchen einen erfahrenen Infrastruktur-Ingenieur, der dem Apertus-Team beitritt. Der ideale Kandidat wird den Container-Image-Stack hinter unseren Vortrainings-, Nachtrainings- und Bereitstellungs-Workloads verwalten und mit CSCS-Ingenieuren zusammenarbeiten, um das großangelegte Training auf Alps stabil und schnell zu halten.
Diese Rolle erfordert starke Linux- und Containerfähigkeiten, Erfahrung mit HPC-Umgebungen und die Fähigkeit, kollaborativ über Forschungs-, Ingenieur- und Betriebsteams hinweg zu arbeiten.
Projekt Hintergrund
Das Apertus-Projekt, eine gemeinsame Initiative zwischen EPFL, ETH Zürich und CSCS, sucht einen praktischen und motivierten Infrastruktur-Ingenieur, um die nächste Version von Apertus zu entwickeln. Der erfolgreiche Kandidat wird den Container-Image-Stack verwalten und eng mit CSCS zusammenarbeiten, um das großangelegte Training stabil und schnell zu halten.
Wir trainieren offene Grundmodelle mit Hunderten von Milliarden von Parametern auf Tausenden von GPUs auf einem der größten AI-fähigen Supercomputer in Europa. Das Team besteht aus mehr als einem Dutzend Vollzeit-Ingenieuren, die Seite an Seite mit führenden Forschern von EPFL und ETH Zürich arbeiten, hat die Modelle Apertus 1 und Apertus 1.5 veröffentlicht und arbeitet mit über dreißig akademischen Partnern zusammen, um vollständig offene (Open Source), verantwortungsvoll trainierte, mehrsprachige, multimodale KI-Modelle für Forschung und Industrie bereitzustellen.
Apertus wird auf Alps, der Supercomputing-Infrastruktur des Schweizer Nationalen Supercomputing-Zentrums (CSCS), trainiert und entwickelt. Die Rolle erfordert jemanden, der sich in einer HPC-Umgebung wohlfühlt und mit Forschern und Infrastruktur-Ingenieuren zusammenarbeitet.
Jobbeschreibung
Der Ingenieur wird Stabilität und Durchsatz für die Apertus-Vortrainings- und Nachtrainings-Pipelines ermöglichen, indem er die ML-Systembilder pflegt und mit CSCS an der zugrunde liegenden Infrastruktur zusammenarbeitet.
- ML-Systembildpflege: Erstellen, Pflegen und Aktualisieren von Containerbildern für alle Kern-ML-Entwicklungsphasen: Vortraining, Nachtraining/Ausrichtung und Modellbereitstellung/-einsatz.
- Compute-Partnerschaft und Effizienz: Als primärer technischer Ansprechpartner für CSCS-Ingenieure und Forscher in Bezug auf Berechnung, Zuverlässigkeit und Effizienz fungieren.
- Infrastruktur-Stresstest: Die Infrastruktur mit repräsentativen Vortrainings- und Nachtrainings-Workloads auf Stresstests prüfen.
Profil
- Master oder Doktorat in Informatik, Datenwissenschaft, Künstlicher Intelligenz, Maschinellem Lernen oder einem verwandten Bereich.
- Hervorragende BSc-Kandidaten mit starker Ingenieurerfahrung werden ebenfalls berücksichtigt.
- Praktische Erfahrung mit HPC-Umgebungen: Job-Scheduler wie Slurm, Shared Filesystems und Multi-Node-GPU-Systeme.
- Starke Linux-System- und Containerfähigkeiten (Docker/Podman und HPC-Laufzeiten wie enroot oder Apptainer).
- Starke Zusammenarbeit und Kommunikationsfähigkeiten sowie die Fähigkeit, über Forschungs-, Ingenieur- und Betriebsteams hinweg zu arbeiten.
Arbeitsplatz
Wir bieten eine stimulierende akademische Umgebung an einer der weltweit führenden technischen Universitäten, Zugang zu Alps, einem der größten AI-fähigen Supercomputer in Europa, und die Möglichkeit, mit führenden Forschern auf diesem Gebiet zusammenzuarbeiten.
Die Rolle kann entweder in Lausanne bei der EPFL oder in Zürich bei der ETH Zürich angesiedelt sein.
Apertus Engineer: Infrastructure Arbeitgeber: Master in Integrated Building Systems ETH Zürich
ETH Zürich ist ein hervorragender Arbeitgeber, der eine inspirierende und interdisziplinäre Arbeitsumgebung bietet, in der Mitarbeiter die Möglichkeit haben, mit führenden Forschern zusammenzuarbeiten und die Zukunft der Quantenwissenschaft aktiv mitzugestalten. Die Förderung von Vielfalt und Chancengleichheit sowie nachhaltige Praktiken sind zentrale Werte des Unternehmens, die ein respektvolles und unterstützendes Arbeitsklima schaffen. Zudem bietet ETH Zürich zahlreiche Möglichkeiten zur beruflichen Weiterentwicklung und Networking mit Partnern aus Industrie und Wissenschaft auf nationaler und internationaler Ebene.
Kontaktdaten:
Master in Integrated Building Systems ETH Zürich Recruiting-Team