Auf einen Blick
- Aufgaben: Entwickle ML-Infrastruktur für humanoide Roboter und optimiere Trainingspipelines.
- Unternehmen: Innovatives Robotik-Startup mit einem dynamischen Team von Experten.
- Vorteile: Wettbewerbsfähiges Gehalt und die Möglichkeit, an vorderster Front der Robotik zu arbeiten.
- Weitere Informationen: Energiegeladenes Team mit Fokus auf Zusammenarbeit und Innovation.
- Warum dieser Job: Sei Teil einer revolutionären Technologie und gestalte die Zukunft der Robotik mit.
- Qualifikationen: Erfahrung in ML-Infrastruktur und starke Python-Kenntnisse erforderlich.
Das prognostizierte Gehalt liegt zwischen 75000 - 100000 € pro Jahr.
Über Flexion
Bei Flexion entwickeln wir die Intelligenzschicht, die die nächste Generation humanoider Roboter antreibt. Unsere Mission ist es, den Übergang von fragilen Prototypen zur realen Bereitstellung humanoider Roboter zu beschleunigen. Wir wurden von führenden Wissenschaftlern im Bereich Robotik und Reinforcement Learning (ehemals Nvidia, ehemals ETH Zürich) gegründet und von führenden internationalen VC-Firmen unterstützt. In nur wenigen Monaten haben wir von unserem ersten Code bis zur Bereitstellung echter humanoider Fähigkeiten Fortschritte gemacht.
Die Rolle
Dies ist eine Senior-ML-Engineering-Position, in der wir unsere Kern-Compute- und Datenplattformen aufbauen. Wir entwickeln das Gehirn für humanoide Roboter, was das Training großangelegter Grundmodelle mit riesigen Datenmengen umfasst. Sie werden die Pipelines entwerfen, die Daten von Simulatoren und Robotern in das Modelltraining überführen, Trainingslasten optimieren und die Plattformen erstellen, die unseren KI-Ingenieuren helfen, schnell zu trainieren, zu bewerten und zu iterieren.
Sie werden Teil des erfahrenen Infrastrukturteams von Flexion (ehemals Google, Meta, Amazon) und übernehmen erhebliche Verantwortung für die Systeme hinter unserer Datensammlung, dem Training und den Experimentierabläufen: von strategischen Infrastrukturentscheidungen, Cluster-Orchestrierung und Optimierung des verteilten Trainings bis hin zu Datenplattformen, CI und Experimentierwerkzeugen. Dies ist eine Senior-Position vor Ort in unserem Büro in Zürich.
Hauptverantwortlichkeiten
- Architektur von Trainingsdatenplattformen und -pipelines: Aufbau der Speicher-, Verarbeitungs- und Bereitstellungsschichten, die den gesamten Datenlebenszyklus abdecken: von Simulatorausgaben und Robotertelemetrie bis hin zu Trainingsdatensätzen. Dazu gehört der Aufbau von Infrastrukturen mit Objektspeicher (S3), parallelen Dateisystemen (Lustre) und gängigen Datenformaten (Parquet, WebDataset, LeRobot).
- Verteilen des Trainings optimieren: Zusammenarbeit mit unseren KI-Ingenieuren, um Arbeitslasten über Multi-Node-GPU-Cluster zu skalieren, Profilierung und Verbesserung des Durchsatzes, der Geräteauslastung und der Kommunikationseffizienz. Dazu gehört die Optimierung unseres verteilten IsaacLab-basierten Sim-to-Real-Trainings.
- Bewertung und Annahme neuer Plattformen und Technologien: Vergleich von Cloud-Anbietern, GPUaaS-Plattformen und aufkommenden Werkzeugen, wobei Sie die Entscheidungen darüber treffen, was wir annehmen, während wir unseren Compute-Fußabdruck erweitern.
Anforderungen
- Berufserfahrung im Aufbau von Infrastrukturen, Werkzeugen oder Plattformen für großangelegte ML-Trainingslasten.
- Starke Erfahrung mit ML-Dateninfrastruktur: verteilte Verarbeitung, Objektspeicher, Metadaten-/Katalogsysteme, Versionierung von Datensätzen, Streaming, Shuffling, Caching und Hochdurchsatz-Datenladung.
- Praktische Erfahrung im Training, der Skalierung oder Unterstützung verteilter ML-Arbeitslasten, mit Verständnis für DDP, FSDP, NCCL, Checkpointing, Fehlertoleranz und Engpässen bei der Trainingsleistung.
- Erfahrung mit Cloud-Infrastruktur wie AWS, GCP oder ähnlichem, einschließlich Compute-, Netzwerk-, Speicher- und Kosten-/Leistungsabgleich.
- Erfahrung mit Job-Scheduling- oder Orchestrierungssystemen wie Slurm, Kubernetes, Ray oder ähnlichem.
- Kenntnisse in Python und praktische Kenntnisse in PyTorch.
- Ownership-Mindset: Komfortabel bei der Entscheidungsfindung über Architektur, Setzen von Richtungen und eigenständiger Lieferung in einem sich schnell bewegenden Umfeld.
Schön zu haben
- Erfahrung mit Job-Scheduling- und Orchestrierungstools: Slurm, Kubernetes oder beides.
- Vertrautheit mit gängigen Datenformaten (Parquet, WebDataset, LeRobot).
- Vertrautheit mit Robotersimulationsumgebungen (IsaacLab, IsaacGym, MuJoCo).
- Erfahrung mit Infrastructure-as-Code und Konfigurationsmanagement (Terraform, Ansible).
- Vertrautheit mit Experiment-Tracking-Plattformen (Weights & Biases, MLflow).
Vorteile
- Wettbewerbsfähiges Vergütungspaket
- Ein Platz in der ersten Reihe bei einem der ehrgeizigsten Robotikunternehmen Europas
- Ein energiegeladenes, kollaboratives Team mit einer Neigung zum Handeln
Machine Learning Engineer Arbeitgeber: Flexion Robotics
pFlexion Robotics in Zürich bietet eine dynamische Arbeitsumgebung, in der Innovation und Teamarbeit großgeschrieben werden. Als IT & Security Engineer haben Sie die Möglichkeit, Ihre Fähigkeiten in einem der führenden Unternehmen der Robotikbranche einzubringen und weiterzuentwickeln. Flexible Arbeitszeiten und ein engagiertes Team fördern nicht nur Ihre berufliche Entwicklung, sondern auch eine ausgewogene Work-Life-Balance./p