AIML - Senior ML/RL Training Infrastructure Engineer, AFM

AIML - Senior ML/RL Training Infrastructure Engineer, AFM

Zürich Vollzeit 75000 - 95000 € / Jahr (geschätzt) Kein Homeoffice möglich
Apple Inc.

Auf einen Blick

  • Aufgaben: Entwickle und skaliere Systeme für großangelegte Reinforcement Learning-Projekte bei Apple.
  • Unternehmen: Apple, ein innovatives Unternehmen, das Technologie für Milliarden von Menschen gestaltet.
  • Vorteile: Wettbewerbsfähiges Gehalt, Gesundheitsleistungen und flexible Arbeitsmöglichkeiten.
  • Weitere Informationen: Dynamisches Team mit exzellenten Wachstums- und Entwicklungsmöglichkeiten.
  • Warum dieser Job: Gestalte die Zukunft der KI und arbeite an bahnbrechenden Projekten mit modernster Technologie.
  • Qualifikationen: PhD oder MSc in Informatik, Erfahrung mit PyTorch oder JAX und verteilten Systemen.

Das prognostizierte Gehalt liegt zwischen 75000 - 95000 € pro Jahr.

Bereit, die Art und Weise zu transformieren, wie Milliarden von Menschen mit Technologie interagieren? Das Core Foundation Models-Team von Apple treibt die Intelligenz voran, die Erfahrungen auf Milliarden von Geräten weltweit ermöglicht – und wir suchen außergewöhnliche Talente, die sich uns anschließen! Schließen Sie sich unserem in Europa ansässigen angewandten ML-Team an, das die nächste Generation der großangelegten ML- und RL-Trainingsinfrastruktur für Apples Foundation-Modelle aufbaut. Wir entwickeln leistungsstarke, verteilte Systeme, die bahnbrechende Forschung zu Foundation-Modellen in großem Maßstab unterstützen.

Wir suchen einen Ingenieur, der leidenschaftlich daran interessiert ist, die Infrastruktur zu entwerfen, zu optimieren und zu skalieren, die modernste Machine Learning- und Reinforcement Learning-Workloads ermöglicht. Als erfahrenes Mitglied des Teams arbeiten Sie eng mit Forschern und Systemingenieuren zusammen, um robuste Trainingsframeworks zu erstellen, Experimente zu beschleunigen und die Grenzen von Leistung und Effizienz zu erweitern. Sie werden mit Teams in den Engineering-Hubs von Apple – einschließlich New York, Seattle und Cupertino – zusammenarbeiten, um die Werkzeuge und Systeme voranzutreiben, die großangelegtes Modelltraining ermöglichen.

Als Kernmitglied unseres ML-Infrastrukturteams entwerfen, bauen und skalieren Sie die Systeme, die großangelegtes Reinforcement Learning für Apples Foundation-Modelle ermöglichen. Sie konzentrieren sich auf TPU-basiertes Training mit JAX und entwickeln robuste, leistungsstarke RL-Pipelines, die verteilte Actor/Learner-Architekturen, effizientes Experience Replay und großangelegte Umgebungsdurchführungen unterstützen. In dieser Rolle arbeiten Sie über den gesamten Stack der RL-Trainingssysteme hinweg – von der Leistungsoptimierung auf niedriger Ebene und Compiler-Optimierung bis hin zur Cluster-Orchestrierung und Ressourcenverwaltung.

Sie stellen sicher, dass die Trainingspipelines effizient, zuverlässig, reproduzierbar und beobachtbar sind, sodass Forschungsteams schnell iterieren und komplexere RL-Umgebungen und -Modelle erkunden können. Ihre Arbeit wird sich direkt auf die Skalierbarkeit, den Durchsatz und die Stabilität von RL-Experimenten auswirken und dazu beitragen, neue Fähigkeiten im agentischen Denken, in der Entscheidungsfindung und im Policy-Learning für Apples Foundation-Modelle freizuschalten.

Diese Position ist ideal für Ingenieure, die Freude an verteilten Systemen, hochleistungsfähigen ML-Frameworks und dem Aufbau der Infrastruktur haben, die großangelegtes RL-Forschung möglich macht.

Mindestens erforderliche Qualifikationen:
  • PhD oder MSc in Informatik, Computertechnik oder einem verwandten Bereich.
  • Starke Kenntnisse in PyTorch oder JAX und Erfahrung mit dem Ausführen von Trainings-Workloads auf GPUs/TPUs.
  • Solides Verständnis der Konzepte verteilter Systeme (Parallelitätsstrategien, Fehlertoleranz, Synchronisation).
Bevorzugte Qualifikationen:
  • Praktische Erfahrung in der Entwicklung oder Optimierung von Trainingsschleifen, RL-Pipelines oder großangelegten Modelltrainings-Frameworks.
  • Starke Software-Engineering-Fähigkeiten in Python, mit Schwerpunkt auf Zuverlässigkeit, Debugging und hochleistungsfähiger Ausführung.
  • Tiefe Erfahrung mit PyTorch/JAX-Interna, XLA, Debugging und Leistungsprofilierung auf GPU/TPU-Architekturen.
  • Expertise in Mustern des verteilten RL-Trainings, einschließlich Actor/Learner-Architekturen, Experience Replay und paralleler Umgebungsdurchführung.
  • Erfahrung im Aufbau von Trainingsdiensten, Orchestrierungswerkzeugen oder automatisierten Pipelines für großangelegte Experimente.
  • Nachweislicher Erfolg bei der Diagnose von Engpässen in großangelegten ML-Jobs (I/O, Eingabepipelines, Kernel-Leistung, Speicher, Kompilierung).
  • Vertrautheit mit den spezifischen Infrastrukturanforderungen von RL (z.B. Actor/Learner-Architekturen, Experience Replay-Systeme, großangelegte Umgebungsdurchführung).
  • Erfahrung mit Cloud-Skalierungs-Clustern oder spezialisierten Beschleunigern (TPU v5/v6, GPU, benutzerdefinierte Hardware).
  • Beiträge zu ML-Frameworks, Bibliotheken für verteiltes Training oder Systeme für hochleistungsfähiges Computing.
  • Ausgezeichnete Kommunikations- und Zusammenarbeitfähigkeiten für die Zusammenarbeit mit Forschungs- und Engineering-Partnern.

Bei Apple sind wir nicht alle gleich. Und das ist unsere größte Stärke. Wir ziehen die Unterschiede in dem, wer wir sind, was wir erlebt haben und wie wir denken, in Betracht. Denn um Produkte zu schaffen, die allen dienen, glauben wir daran, alle einzubeziehen. Daher verpflichten wir uns, alle Bewerber fair und gleich zu behandeln. Wir werden mit Bewerbern zusammenarbeiten, um angemessene Anpassungen vorzunehmen.

Bei Apple glauben wir, dass Zugänglichkeit ein fundamentales Menschenrecht ist. Sie werden diese Idee in allem hier finden – in unserer Kultur, unseren Vorteilen und unseren digitalen Werkzeugen. Indem wir so viele Perspektiven wie möglich willkommen heißen, helfen wir Ihnen, eine Karriere aufzubauen, in der Sie sich zugehörig fühlen.

AIML - Senior ML/RL Training Infrastructure Engineer, AFM Arbeitgeber: Apple Inc.

Apple ist ein hervorragender Arbeitgeber, der nicht nur innovative Produkte schafft, sondern auch eine inklusive und vielfältige Arbeitskultur fördert. In Mainz haben Mitarbeiter die Möglichkeit, in einem dynamischen Umfeld zu arbeiten, das kontinuierliches Lernen und persönliche Entwicklung unterstützt. Mit einem starken Fokus auf Teamarbeit und Kundenservice bietet Apple seinen Mitarbeitern die Chance, ihre Leidenschaft für Technologie auszuleben und gleichzeitig einen positiven Einfluss auf die Gemeinschaft zu haben.

Apple Inc.

Kontaktdaten:

Apple Inc. Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um AIML - Senior ML/RL Training Infrastructure Engineer, AFM mit Bravour zu bestehen

PyTorch
JAX
GPU/TPU Training Workloads
Distributed Systems
Parallelism Strategies
Fault Tolerance
Synchronization