Apertus Engineer: Infrastructure

Apertus Engineer: Infrastructure

Vollzeit 45000 - 65000 € / Jahr (geschätzt) Kein Homeoffice möglich
Eidgenössische Technische Hochschule Zürich

Auf einen Blick

  • Aufgaben: Entwickle und pflege Container-Images für ML-Entwicklungsphasen und arbeite an Hochleistungsrechnern.
  • Unternehmen: Führende technische Universität mit Zugang zu einem der größten KI-fähigen Supercomputer in Europa.
  • Vorteile: Attraktive Anstellungsbedingungen, flexible Arbeitszeiten und umfassende Weiterbildungsmöglichkeiten.
  • Weitere Informationen: Werde Teil eines dynamischen Teams mit exzellenten Karrierechancen und einem inklusiven Arbeitsumfeld.
  • Warum dieser Job: Arbeite an innovativen Projekten und trage zur Entwicklung von KI-Technologien mit nationaler Bedeutung bei.
  • Qualifikationen: Erfahrung in HPC-Umgebungen und starke Linux- sowie Container-Kenntnisse erforderlich.

Das prognostizierte Gehalt liegt zwischen 45000 - 65000 € pro Jahr.

Wir suchen einen erfahrenen Infrastruktur-Ingenieur, der dem Apertus-Team beitritt. Der ideale Kandidat wird den Container-Image-Stack hinter unseren Vortraining-, Nachtraining- und Bereitstellungs-Workloads verantworten und mit CSCS-Ingenieuren zusammenarbeiten, um das großangelegte Training auf Alps stabil und schnell zu halten. Diese Rolle erfordert starke Linux- und Containerfähigkeiten, Erfahrung mit HPC-Umgebungen und die Fähigkeit, kollaborativ über Forschungs-, Ingenieur- und Betriebsteams hinweg zu arbeiten.

Projekt Hintergrund: Das Apertus-Projekt, eine gemeinsame Initiative zwischen EPFL, ETH Zürich und CSCS, sucht einen praktischen und motivierten Infrastruktur-Ingenieur, um die nächste Version von Apertus zu entwickeln. Der erfolgreiche Kandidat wird den Container-Image-Stack besitzen und eng mit CSCS zusammenarbeiten, um das großangelegte Training stabil und schnell zu halten. Wir trainieren offene Grundmodelle mit Hunderten von Milliarden von Parametern auf Tausenden von GPUs auf einem der größten AI-fähigen Supercomputer in Europa.

Die Rolle erfordert jemanden, der sich in einer HPC-Umgebung wohlfühlt und mit Forschern und Infrastruktur-Ingenieuren zusammenarbeitet. Der Ingenieur wird Stabilität und Durchsatz für die Apertus-Vortraining- und Nachtraining-Pipelines ermöglichen, indem er die ML-Systembilder pflegt und mit CSCS an der zugrunde liegenden Infrastruktur zusammenarbeitet.

  • ML-Systembildpflege: Erstellen, Pflegen und Aktualisieren von Containerbildern für alle Kern-ML-Entwicklungsphasen: Vortraining, Nachtraining/Ausrichtung und Modellbereitstellung/-einsatz.
  • Compute-Partnerschaft und Effizienz: Dienen Sie als primärer technischer Ansprechpartner für CSCS-Ingenieure und Forscher in Bezug auf Compute, Zuverlässigkeit und Effizienz.
  • Infrastruktur-Stresstest: Stresstest der Infrastruktur mit repräsentativen Vortraining- und Nachtraining-Workloads, um Stabilität und Durchsatz nach Bildaktualisierungen, Systemwartung und Konfigurationsänderungen zu validieren.

Profil:

  • Master oder Doktorat in Informatik, Datenwissenschaft, künstlicher Intelligenz, maschinellem Lernen oder einem verwandten Bereich.
  • Hervorragende BSc-Kandidaten mit starker Ingenieurerfahrung werden ebenfalls berücksichtigt.
  • Praktische Erfahrung mit HPC-Umgebungen: Job-Scheduler wie Slurm, Shared Filesystems und Multi-Node-GPU-Systeme.
  • Starke Linux-System- und Containerfähigkeiten (Docker/Podman und HPC-Laufzeiten wie enroot oder Apptainer).
  • Starke Zusammenarbeit und Kommunikationsfähigkeiten sowie die Fähigkeit, über Forschungs-, Ingenieur- und Betriebsteams hinweg zu arbeiten.

Wir bieten:

  • Ein anregendes akademisches Umfeld an einer der weltweit führenden technischen Universitäten.
  • Zugang zu Alps, einem der größten AI-fähigen Supercomputer in Europa.
  • Die Möglichkeit, mit führenden Forschern auf diesem Gebiet zusammenzuarbeiten.
  • Attraktive Beschäftigungsbedingungen und umfassende Vorteile, einschließlich der Pensionspläne von ETH Zürich/EPFL.
  • Flexible Arbeitsbedingungen, einschließlich Optionen für Remote-Arbeit.
  • Berufliche Entwicklungsmöglichkeiten, einschließlich Konferenzteilnahmen und spezialisierter Schulungen.

ETH Zürich fördert eine inklusive Kultur. Wir setzen uns für Chancengleichheit ein, schätzen Vielfalt und pflegen ein Arbeits- und Lernumfeld, in dem die Rechte und die Würde aller Mitarbeiter und Studierenden respektiert werden.

Apertus Engineer: Infrastructure Arbeitgeber: Eidgenössische Technische Hochschule Zürich

Als Software Research & Development Engineer bei ETH Zürich profitieren Sie von einer inspirierenden und kollaborativen Arbeitsumgebung in einer weltweit anerkannten Forschungseinrichtung. Wir bieten spannende Herausforderungen, vielfältige Projekte und die Möglichkeit, Ihre Fähigkeiten weiterzuentwickeln, während Sie an der Schnittstelle zwischen Forschung, Technik und Betrieb arbeiten. Unsere Kultur fördert Vielfalt und Inklusion, und wir setzen uns aktiv für eine nachhaltige Zukunft ein.

Eidgenössische Technische Hochschule Zürich

Kontaktdaten:

Eidgenössische Technische Hochschule Zürich Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Apertus Engineer: Infrastructure mit Bravour zu bestehen

Linux-Systeme
Container-Technologien (Docker/Podman)
HPC-Umgebungen
Job-Scheduler (z.B. Slurm)
Multi-Node-GPU-Systeme
CI/CD-Pipelines für Container-Image-Bauten
ARM64/aarch64 Plattformen