Auf einen Blick
- Aufgaben: Skaliere unsere Forschungs-Compute-Cluster und sorge für höchste Verfügbarkeit und Zuverlässigkeit.
- Unternehmen: Voleon, ein führendes Technologieunternehmen im Bereich maschinelles Lernen und Finanzwesen.
- Vorteile: Attraktives Gehalt, Gesundheitsleistungen, 20 Tage Urlaub und 401(k) mit Unternehmensbeitrag.
- Weitere Informationen: Dynamisches Team mit hervorragenden Entwicklungsmöglichkeiten und einem integrativen Arbeitsumfeld.
- Warum dieser Job: Arbeite an der Spitze der Technologie und beeinflusse die Zukunft des maschinellen Lernens.
- Qualifikationen: Mindestens 5 Jahre Erfahrung in SRE oder DevOps, Kenntnisse in HPC und Cloud-Infrastruktur.
Voleon ist ein Technologieunternehmen, das modernste Techniken des maschinellen Lernens auf reale Probleme im Finanzwesen anwendet. Seit fast zwei Jahrzehnten führen wir unsere Branche an und arbeiten an der Spitze der Anwendung von maschinellem Lernen im Investmentmanagement. Wir sind zu einem milliardenschweren Vermögensverwalter geworden und haben ehrgeizige Ziele für die Zukunft.
Als Senior Cluster Site Reliability Engineer (SRE) werden Sie helfen, unseren Forschungs-Compute-Cluster zu skalieren, um unseren wachsenden Bedürfnissen gerecht zu werden. Sie werden Ingenieursfähigkeiten nutzen, um hohe Verfügbarkeiten, Zuverlässigkeit und Robustheit sicherzustellen. Unsere Forschungscluster sind das Herzstück unserer F&E, und Sie sind direkt verantwortlich dafür, diese wichtige Ressource verfügbar und leistungsfähig zu halten. Ihre Arbeit wird eine erstklassige HPC-Plattform für Forscher bieten, die sich auf moderne Probleme des maschinellen Lernens in großem Maßstab konzentrieren. Sie unterstützen sowohl On-Premise- als auch Cloud-Infrastrukturen und arbeiten daran, die beste Erfahrung für unser technisches Personal zu bieten. Sie werden IaC, Automatisierung und SRE-Prinzipien nutzen, um ein Produkt zu verfeinern und zu optimieren, das 24/7 funktioniert, um Voleon zu unterstützen.
Das Cluster Operations-Team arbeitet an vorderster Front, um Echtzeit-Betriebsprobleme zu triagieren und zu mildern. Sie werden ein integrales Mitglied dieses Teams sein, das alltägliche Probleme mit hoher Dringlichkeit löst und gleichzeitig systematische Verbesserungen und architektonische Lösungen entwickelt, um wiederkehrende Probleme zu verhindern. Sie werden mit Ingenieurteams zusammenarbeiten, um Verbesserungen bei Monitoring und Telemetrie zu entwickeln. Sie helfen, betriebliche Rahmenbedingungen zu entwerfen und zu überwachen, um sicherzustellen, dass der Cluster innerhalb eines strengen SLA-Bereichs arbeitet.
Verantwortlichkeiten- Erster Ansprechpartner im Falle von Cluster-Ausfällen oder Problemen.
- Dringende Probleme triagieren und lösen, sobald sie auftreten.
- Eine hohe Verfügbarkeit des Clusters sicherstellen (gemessen in mehreren Nullen) und SLAs definieren und verfolgen, um die Zuverlässigkeit zu quantifizieren.
- Systematische/wiederkehrende Problemmuster diagnostizieren und präzise Lösungen in Zusammenarbeit mit Ingenieurteams entwickeln.
- Robuste Metriken und Beobachtbarkeit für die Cluster-Gesundheit entwickeln und diese Metriken zur Information Ihrer Arbeit nutzen.
- Benutzerdefinierte Beobachtungsmechanismen erstellen, wenn Standardlösungen nicht ausreichen.
- Software- und Forschungsteams bei der Gestaltung von Richtlinien für die faire Nutzung des Clusters unterstützen und Durchsetzungsmechanismen für diese Richtlinien entwickeln.
- Bei der Prognose des Clusterwachstums helfen und geeignete Skalierungsstrategien auswählen.
- Die Betriebsabläufe in Bezug auf Kosten und Benutzerfreundlichkeit optimieren.
- 5+ Jahre Erfahrung in SRE- oder DevOps-Rollen, vorzugsweise als Senior Engineer oder technischer Leiter.
- Kenntnisse über HPC-/Batch-Compute-Frameworks (Slurm, Kueue, AWS/GCP Batch) und/oder Systeme zum Training von maschinellem Lernen (Kubeflow, MLflow, Horovod).
- Fähigkeit, Skripte und Dienstprogramme mittlerer Komplexität in einer gängigen Skriptsprache (Python, Ruby usw.) zu entwickeln.
- Vertrautheit mit Infrastructure-as-Code und Konfigurationsmanagement-Tools (Terraform, Ansible).
- Erfahrung mit Cloud-Infrastruktur (AWS oder GCP).
- Vertrautheit mit dem Entwurf und der Implementierung moderner Beobachtungsstacks (Prometheus, Grafana, Loki, ELK, OpenTelemetry).
- Erfahrung mit verteilten Speichertechnologien (Lustre, Ceph, S3).
- Denken wie ein „Systemingenieur“ anstelle eines „Systemadministrators“, systematisch denken und Automatisierung nutzen.
- Abschluss in Informatik.
- Praktische Erfahrung mit HPC-Frameworks (Slurm, Grid Engine) und Kubernetes-basierten Job-Orchestratoren (Airflow, Kueue, Kubeflow Pipelines) sowie anderen verteilten Computing-Frameworks (Ray, Modin, Dask, Spark).
- Vertrautheit mit ML-Frameworks (PyTorch/Tensorflow, JAX, Horovod, DeepSpeed).
- Vertrautheit mit hybriden/on-prem Umgebungen.
- Erfahrung mit Containerisierung (Docker, Podman, Singularity), insbesondere für HPC-/Batch-Compute-Umgebungen.
- Erfahrung mit HPC-Netzwerken (InfiniBand, RDMA).
- Solide Grundlagen in Sicherheit/IAM (Identitätsmanagementsysteme, AWS/GCP IAM, Zero Trust).
Voleon ist ein Arbeitgeber, der Chancengleichheit bietet. Bewerber werden ohne Rücksicht auf Rasse, Hautfarbe, Religion, Glauben, nationale Herkunft, Alter, Geschlecht, Geschlechtsidentität, Familienstand, sexuelle Orientierung und Identität, genetische Informationen, Veteranenstatus, Staatsbürgerschaft oder andere Faktoren, die durch lokale, staatliche oder bundesstaatliche Gesetze verboten sind, berücksichtigt.
Die angegebene Grundgehaltsspanne für diese Position basiert auf den Standorten dieser Ausschreibung. Die individuellen Gehälter werden durch eine Vielzahl von Faktoren bestimmt, einschließlich, aber nicht beschränkt auf Bildung, Erfahrung, Wissen, Fähigkeiten und Geografie. Das Grundgehalt umfasst keine anderen Formen der Gesamtvergütung wie Bonusvergütung und andere Leistungen. Unser Leistungspaket umfasst medizinische, zahnärztliche und visuelle Abdeckung, Lebens- und AD&D-Versicherung, 20 Tage bezahlten Urlaub, 9 Krankheitstage und einen 401(k)-Plan mit Unternehmensbeitrag.
Senior Cluster Site Reliability Engineer Arbeitgeber: The Voleon Group
Voleon ist ein hervorragender Arbeitgeber, der eine innovative und kollaborative Arbeitsumgebung bietet, in der Kreativität und Experimentierfreude geschätzt werden. Mit einem starken Fokus auf Mitarbeiterentwicklung und Mentorship ermöglicht das Unternehmen seinen Ingenieuren, an bedeutenden Projekten zu arbeiten und ihre Fähigkeiten kontinuierlich auszubauen. Die umfassenden Sozialleistungen, einschließlich einer wettbewerbsfähigen Vergütung und großzügigen Urlaubstagen, machen Voleon zu einem attraktiven Arbeitsplatz für talentierte Fachkräfte im Bereich Software Engineering.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior Cluster Site Reliability Engineer erhalten könntest
✨Netzwerken in der IT-Community
In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.
✨Online-Foren und Gruppen nutzen
Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!
✨Direkt bei The Voleon Group bewerben
Viele Unternehmen, wie The Voleon Group, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.
✨Überzeugende Projekte zeigen
Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Cluster Site Reliability Engineer mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!
Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!
Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!
Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf The Voleon Group und die ausgeschriebene Position Senior Cluster Site Reliability Engineer zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.
Wie man sich auf ein Vorstellungsgespräch bei The Voleon Group vorbereitet
✨Technische Vorbereitung ist alles!
Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.
✨Praxisbeispiele parat haben
In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.
✨Soft Skills betonen
Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!
✨Fragen zum Unternehmen vorbereiten
Schau dir spezifisch die Projekte von The Voleon Group an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.