Auf einen Blick
- Aufgaben: Entwickle und betreibe die Infrastruktur für maschinelles Lernen in einem dynamischen Team.
- Unternehmen: Agile Robots, ein internationales High-Tech-Unternehmen mit über 3500 Mitarbeitern.
- Vorteile: Attraktives Gehalt, Gesundheitsleistungen, Weiterbildung und ein modernes Arbeitsumfeld.
- Weitere Informationen: Vielfältiges Team mit über 60 Nationalitäten und hervorragenden Entwicklungsmöglichkeiten.
- Warum dieser Job: Gestalte die Zukunft der Robotik und arbeite an innovativen Projekten mit Experten.
- Qualifikationen: Erfahrung in Softwareentwicklung und Betrieb von ML-Infrastrukturen erforderlich.
Das prognostizierte Gehalt liegt zwischen 50515 - 61741 € pro Jahr.
Die AI-Teams bei Agile Robots suchen einen ML Platform Engineer (m/w/d), der die verteilte Trainings-, Bereitstellungs- und Experimentier-Infrastruktur aufbaut und betreibt, auf die Forschungs-, Daten- und Robotik-Teams angewiesen sind, um Modelle von Prototypen in die Produktion zu überführen.
Ihre Verantwortlichkeiten
- Training Infrastructure: Entwerfen und Skalieren verteilter Trainings-Workflows für große Modelle mit Tools wie PyTorch Distributed, DeepSpeed und Cluster-Schedulern wie SLURM oder Kubernetes.
- ML Platform: Aufbau und Wartung containerisierter ML-Umgebungen, die reproduzierbare Experimente und Benchmarking unterstützen.
- CI/CD Pipelines: Entwicklung und Wartung von CI/CD-Pipelines für maschinelles Lernen, um zuverlässiges Testen, Training und Bereitstellung von Modellen zu ermöglichen.
- Lifecycle Management: Implementierung von Experimentverfolgung, Modellversionierung und Reproduzierbarkeits-Workflows mit Tools wie ClearML oder Weights & Biases.
- Observability: Einrichtung von Überwachungssystemen wie Prometheus und Grafana zur Verfolgung der Modellleistung und Systemgesundheit sowie zur Erkennung von Drift in der Produktion.
- Cross-Team Collaboration: Zusammenarbeit mit Forschungs-, Daten- und Robotik-Teams, um neue Modelle mit robusten Produktionssystemen zu verbinden.
Wesentliche Fähigkeiten
- Hintergrund und Erfahrung: Abschluss in Informatik, Softwaretechnik oder einem verwandten Bereich, mit Berufserfahrung im Aufbau und Betrieb von ML- oder Softwareinfrastrukturen in der Produktion.
- Distributed Training: Erfahrung im Entwerfen und Betreiben verteilter Trainingssysteme auf Kubernetes und Docker, unter Verwendung von PyTorch Distributed, DeepSpeed und Planern wie SLURM.
- CI/CD für ML: Erfahrung im Aufbau von CI/CD-Pipelines, die zuverlässiges Testen, Training und Bereitstellung von Modellen unterstützen.
- Cloud Infrastructure: Erfahrung im Betrieb von ML-Workloads auf Cloud-Infrastrukturen, vorzugsweise AWS.
- Experiment Tracking: Praktische Erfahrung mit Experimentverfolgung und Modellversionierung unter Verwendung von Tools wie MLflow oder Weights & Biases.
- Observability: Erfahrung mit Überwachung und Drift-Erkennung unter Verwendung von Tools wie Prometheus und Grafana.
- Software Engineering: Python- und Systemdesignfähigkeiten, mit Erfahrung im Aufbau und Betrieb von ML-Systemen über die Prototypenphase hinaus.
Wünschenswerte Fähigkeiten
- Multimodal Systems: Erfahrung mit großangelegten oder multimodalen ML-Systemen wie Vision-Language-Action-Modellen.
- Infrastructure As Code: Vertrautheit mit Infrastructure-as-Code-Tools wie Terraform.
- ML Orchestration: Erfahrung mit ML-Pipeline- und Orchestrierungstools.
- Distributed Compute: Kenntnisse in Hochleistungs- oder verteilten Rechenumgebungen.
Was wir bieten
- Ein dynamisches High-Tech-Unternehmen, kombiniert mit finanzieller Solidität und erstklassigen Investoren.
- Ein interdisziplinäres, internationales Team mit über 60 verschiedenen Nationalitäten in einer kollaborativen Arbeitsumgebung.
- Viele Entwicklungsmöglichkeiten, während wir weiter wachsen.
- Herausfordernde Aufgaben und wirkungsvolle Projekte neben Experten, die professionelles und persönliches Wachstum ermöglichen.
- Corporate Benefits-Programm, das Gesundheit, Mobilität und Lernen für 100 € netto pro Monat abdeckt.
- Moderne Bürofazilitäten mit einer Dachterrasse mit Blick auf München, kostenlose Getränke und Obst sowie regelmäßige Unternehmensveranstaltungen tragen zu einem guten Arbeitsumfeld bei.
Über uns
Agile Robots SE ist ein internationales High-Tech-Unternehmen mit Sitz in München, Deutschland, mit einem Produktionsstandort in Kaufbeuren und mehr als 3500 Mitarbeitern weltweit. Unsere Mission ist es, die Lücke zwischen künstlicher Intelligenz und Robotik zu schließen, indem wir Systeme entwickeln, die modernste Kraft-Moment-Sensorik und führende Bildverarbeitungstechnologie kombinieren. Diese einzigartige Kombination von Technologien ermöglicht es uns, benutzerfreundliche und erschwingliche Roboterlösungen anzubieten, die intelligente Präzisionsmontage ermöglichen. Dies wird durch unsere Mitarbeiter möglich, die jeden Tag ihr Bestes mit Kreativität und Begeisterung geben. Werden Sie Teil dieses Teams und gestalten Sie die Zukunft der Robotik mit uns! Wir sind stolz auf unsere Vielfalt und freuen uns auf Ihre Bewerbung, unabhängig von Geschlecht und sexueller Identität, Nationalität, Ethnie, Religion, Alter oder Behinderung.
ML Platform Engineer (m/f/d) in München Arbeitgeber: Agilerobotsse
Agile Robots SE ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, in einem dynamischen High-Tech-Unternehmen in München zu arbeiten. Mit einem interdisziplinären, internationalen Team und zahlreichen Entwicklungsmöglichkeiten fördern wir sowohl Ihre berufliche als auch persönliche Entfaltung. Unsere modernen Büros, ein attraktives Corporate Benefits Programm und regelmäßige Firmenevents schaffen eine positive Arbeitsatmosphäre, in der Sie an herausfordernden Projekten mitwirken können.