Auf einen Blick
- Aufgaben: Setze innovative GPU-Cloud-Infrastrukturen um und löse technische Herausforderungen.
- Unternehmen: Dynamisches Unternehmen im Bereich KI und Cloud-Technologien.
- Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und internationale Teamkultur.
- Weitere Informationen: Wachstumsorientierte Umgebung mit vielen Entwicklungsmöglichkeiten.
- Warum dieser Job: Gestalte die Zukunft der Technologie mit modernsten GPU-Systemen.
- Qualifikationen: Erfahrung in der Bereitstellung von Rechenzentrumsinfrastruktur und Linux-Kenntnisse.
Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.
Diese Position wird im Auftrag eines Partnerunternehmens ausgeschrieben, das alle Anwendungen und nächsten Schritte verwaltet. Unser Partner sucht einen Senior Technical Operations & Deployment Engineer (GPU Cloud Infrastructure) mit Sitz in Deutschland. Dies ist eine stark praktische Infrastrukturrolle, die sich auf die Bereitstellung, Inbetriebnahme und den Betrieb von GPU-Cloud-Umgebungen in regionalen und zentralen Rechenzentren konzentriert.
Sie werden validierte Architekturen und Stücklisten in produktionsbereite Infrastruktur umsetzen, die Hardware, Netzwerke, Speicher, Linux und Plattformsoftware umfasst. Die Rolle befindet sich an der Schnittstelle zwischen Rechenzentrumsbetrieb, GPU-Infrastruktur, Netzwerkengineering und Cloud-Plattformbetrieb. Sie werden mit hochdichten NVIDIA-GPU-Systemen, fortschrittlichen Netzwerken, Speicherplattformen, Kubernetes, Virtualisierung und Observability-Tools arbeiten.
Als praktischer technischer Eskalationspunkt werden Sie komplexe Probleme über physische und Softwareebenen hinweg beheben und Vorfälle bis zur Lösung vorantreiben. Sie werden auch helfen, Bereitstandards, Validierungsverfahren, Dokumentation und betriebliche Praktiken für eine sich schnell entwickelnde AI-Infrastrukturumgebung zu etablieren. Die Rolle bietet umfassende technische Verantwortung in einem internationalen, schnelllebigen Umfeld, in dem praktische Ausführung und betriebliche Exzellenz entscheidend sind.
Verantwortlichkeiten
- Rechenzentrumsbereitstellung: Koordination der Bereitstellungen mit Rechenzentrumsanbietern, Integratoren, Logistikteams, Anbietern und internen Ingenieuren; Validierung von Rack-Layouts, Stromversorgung, Kühlung, Luftstrom, Verkabelung, Beschriftung und physischer Bereitschaft.
- Rack- und Infrastrukturinbetriebnahme: Unterstützung bei Rack-and-Stack-Aktivitäten für GPU- und CPU-Server, Speicher, Switches, Router, Firewalls, PDUs, serielle/OOB-Systeme und unterstützende Infrastruktur.
- Verkabelung und Konnektivität: Validierung von Glasfaser- und Kupferverkabelung, Optiken, Transceivern, Breakout-Kabeln, Portzuordnungen, Linkgeschwindigkeiten, Redundanz und Management, Speicher-, Nord-Süd- und Ost-West-Konnektivität.
- Hardware-Inbetriebnahme: Inbetriebnahme von GPU-Servern, Speicherknoten und Plattforminfrastruktur unter Validierung von BIOS, BMC, Firmware, NICs, DPUs, GPUs, NVMe, RAID/HBA, PCIe-Topologie, NUMA, Thermik, Stromversorgung und Hardwaregesundheit.
- Hardwarevalidierung: Durchführung von Burn-in-, Stress-, Netzwerk-, Speicher- und Abnahmetests vor der Produktionsübergabe; Behebung von Problemen mit GPUs, DPUs, NICs, Optiken, Speicher, Firmware und BIOS.
- Netzwerkbereitstellungsunterstützung: Zusammenarbeit mit Netzwerkengineering zur Validierung von Switch-Konfigurationen, Routing, VLAN/VRF-Segmentierung, BGP, ECMP, EVPN/VXLAN, OVS/OVN, VyOS, Firewalls, WAF-Infrastruktur und Kundenkonnektivität.
- AI-Netzwerk: Unterstützung bei der Validierung von RoCE/RDMA-Fabriken für verteilte AI-Workloads und Behebung von Problemen wie Link-Flaps, MTU-Mismatches, Routenfehlern, Paketverlust, PFC/ECN-Problemen und Stau.
- Plattforminstallation: Installation und Validierung von Ubuntu/Linux-Umgebungen, NVIDIA-Treibern, CUDA, OFED oder Inbox-Treibern, Docker/containerd, KVM/QEMU, Plattformagenten und GPU-Infrastrukturkomponenten.
- Cloud- und Kubernetes-Umgebungen: Unterstützung von CloudStack, Kubernetes, KubeVirt, GPU-Operator, CSI/CNI-Integrationen, GPU-Passthrough, SR-IOV, BlueField-DPUs, VM-Netzwerk und Container-Netzwerk.
- Speicherintegration: Unterstützung bei der Integration und Validierung von StorPool, Weka, lokalem NVMe und anderen unterstützten Speicherplattformen.
- Betriebsbereitschaft: Durchführung von Abnahmetests, Erstellung von Berichten zur Bereitstellungsbereitschaft, Pflege von Runbooks und Sicherstellung, dass die Infrastruktur vor der Übergabe an den Kunden oder die Produktion vollständig betriebsbereit ist.
- Day-2-Betrieb: Durchführung kontrollierter Firmware-, OS-, Treiber-, BIOS-, Switch- und Hardwarewartung sowie Unterstützung bei Produktionsvorfällen und Infrastruktur-Eskalationen.
- Vorfallmanagement: Untersuchung von Betriebsstörungen, Durchführung von Ursachenanalysen, Unterscheidung zwischen temporären Workarounds und dauerhaften Lösungen sowie Zusammenarbeit mit Engineering zur Beseitigung wiederkehrender Probleme.
- Observability: Validierung von Telemetrie und Überwachung über Hosts, GPUs, DPUs, Switches, Speicher und Plattformkomponenten mithilfe von Tools wie Zabbix, Prometheus, Grafana, Loki, DCGM/NVML und NVIDIA NetQ oder Äquivalenten.
- Leistungsvalidierung: Festlegung von Baselines für GPU-, Netzwerk-, Speicher- und Hostleistung sowie Unterstützung bei Benchmarking und Infrastrukturvalidierung.
- Dokumentation: Pflege genauer Aufzeichnungen über Rack-Höhen, Kabelkarten, Portzuordnungen, Seriennummern, Vermögensaufzeichnungen, IP-Zuweisungen, Änderungen und betriebliche Verfahren.
- Bereichsübergreifende Koordination: Partnerschaft mit Infrastruktur-, Netzwerk-, Speicher-, Plattform-, Flottenautomatisierungs-, Observability-, Produktengineering-, Vertriebsengineering- und Servicebereitstellungsteams.
- Anbieterverwaltung: Koordination mit Rechenzentrumsanbietern, Systemintegratoren, Server- und Speicheranbietern, NVIDIA und Netzwerkanbietern zur Lösung von Bereitstellungs- und Infrastrukturproblemen.
- Kontinuierliche Verbesserung: Rückmeldung von Feldeerfahrungen in Referenzarchitekturen, BOMs, Rack-Designs, Verkabelungsstandards, Bereitstellungs-Playbooks, Validierungsprozesse und Automatisierung.
Anforderungen
- Rechenzentrumsinfrastruktur: Starke praktische Erfahrung in der Bereitstellung und Wartung von Rechenzentrumsinfrastruktur, idealerweise in GPU-, HPC-, AI-Cloud-, Private-Cloud- oder hochdichten Rechenzentrumsumgebungen.
- Bare-Metal-Bereitstellung: Nachgewiesene Fähigkeit, Server von der physischen Installation und Bare Metal durch Validierung und Produktionsbereitschaft zu bringen.
- GPU-Infrastruktur: Erfahrung mit NVIDIA-GPU-Servern, Treibern, Firmware, PCIe-Topologie, Hardwarevalidierung und Hochleistungsrechenumgebungen.
- Nächste Generation AI-Infrastruktur: Vertrautheit mit NVL72-Stil Rack-Skalierungsarchitekturen, NVLink/NVSwitch-Domänen, In-Rack-Netzwerken, hochdichter Stromversorgung und OEM/NVIDIA-Validierungsanforderungen.
- Rechenzentrumsbereitschaft: Fähigkeit zur Bewertung von Leistungsdichte, Kühlung, Rack-Abmessungen, Bodenbelastung, Containment, Wartungszugang und anderen physischen Anforderungen für AI-Infrastruktur.
- Linux: Starke Linux-Fehlerbehebungsfähigkeiten und Erfahrung in der Verwaltung von Betriebssystemen, Kernen, Treibern und Hardware-Schnittstellen.
- Netzwerk: Praktisches Wissen über VLANs, VRFs, BGP, ECMP, OVS/OVN, Routing, OOB-Management und Hochgeschwindigkeits-Rechenzentrumsverbindungen.
- GPU-Netzwerk: Vertrautheit mit NVIDIA/Mellanox-Netzwerken, RoCE/RDMA, SR-IOV, BlueField-DPUs und hochleistungsfähiger Ost-West-Infrastruktur.
- Virtualisierung und Container: Erfahrung mit KVM/QEMU, VFIO, PCI-Passthrough, Docker/containerd, Kubernetes und/oder KubeVirt.
- Speicher: Erfahrung in der Integration oder Fehlerbehebung von lokalem NVMe, Speicherknoten und Unternehmens- oder verteilten Speicherplattformen.
- Automatisierung: Vertrautheit mit Terraform, Ansible, Bash und/oder Python für Bereitstellung, Validierung, Konfiguration oder betriebliche Automatisierung.
- Observability: Erfahrung mit Infrastrukturüberwachung, Telemetrie, Protokollen, Metriken, Gesundheitsprüfungen und Leistungsdashboards.
- Dokumentation: Starke Detailgenauigkeit und Disziplin bei der Erstellung genauer als gebauter Dokumentation, Runbooks, Validierungsunterlagen und Übergabematerialien.
- Fehlerbehebung: Starke systematische Denkweise über physische Infrastruktur, Hardware, Firmware, Netzwerk, Linux, Speicher und Plattformebenen.
- Betriebsmentalität: Komfortable Unterstützung von Produktionsumgebungen, Bereitstellungsfenstern, betrieblichen Eskalationen und kundenrelevanten Vorfällen.
- Kommunikation: Fähigkeit, technische Probleme, Risiken, Workarounds und dauerhafte Lösungen klar an Engineering-Teams, Anbieter und Führungskräfte zu erklären.
- Persönliche Eigenschaften: Sehr praktisch, detailorientiert, ruhig unter Druck, autonom und komfortabel sowohl in Rechenzentren als auch remote mit Smart-Hands-Teams zu arbeiten.
Vorteile
- Attraktives Vergütungspaket, das Ihre Fachkenntnisse, Erfahrungen, übertragbaren Fähigkeiten und Marktbedingungen widerspiegelt.
- Vollzeit- oder Vertragsengagement, abhängig von der vereinbarten Regelung.
- Europa-basiertes Remote-Arbeitsumfeld mit Flexibilität.
- Gelegenheit, an modernster GPU-Cloud- und AI-Infrastruktur in erheblichem Maßstab zu arbeiten.
- Praktische Erfahrung mit NVIDIA-GPU-Plattformen, hochdichten Rechenzentrumsumgebungen, RoCE/RDMA-Netzwerken, Kubernetes, Virtualisierung, Speicher und fortschrittlicher Observability.
- Breiter bereichsübergreifender Umfang, der Hardware, Rechenzentrumsbetrieb, Netzwerk, Speicher, Linux und Cloud-Plattformen umfasst.
- Wichtige Rolle in einem schnell wachsenden internationalen Scale-up.
- Starke Möglichkeiten für technisches Wachstum und Karriereentwicklung, während sich die Infrastrukturplattform erweitert.
- Freundliches, vielfältiges, flexibles und internationales Arbeitsumfeld.
- Inklusive Arbeitsumgebung, die sich für Chancengleichheit und Respekt für alle qualifizierten Kandidaten einsetzt.
Senior Technical Operations & Deployment Engineer (GPU Cloud Infrastructure) Arbeitgeber: Jobgether
Unser Partnerunternehmen bietet eine hervorragende Arbeitsumgebung für Produktmanager, die in einem dynamischen und internationalen Umfeld tätig sein möchten. Mit flexiblen, vollständig remote Arbeitsmöglichkeiten und Zugang zu urbanen Büros in Paris, Lille oder London fördert das Unternehmen Innovation und Zusammenarbeit. Zudem werden umfassende Gesundheits- und Rentenpläne sowie kontinuierliche Entwicklungsmöglichkeiten geboten, um sicherzustellen, dass Mitarbeiter in ihrer Karriere wachsen und sich wohlfühlen.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior Technical Operations & Deployment Engineer (GPU Cloud Infrastructure) erhalten könntest
✨Das richtige Netzwerk nutzen
In der Automatisierungstechnik lohnt es sich, Teil von Fachgruppen oder Online-Communities zu sein, wie z.B. LinkedIn-Gruppen oder speziellen Foren. Diese Plattformen sind nicht nur gut für den Austausch mit Kollegen, sondern auch für den direkten Kontakt mit Unternehmen, die Stellen ausschreiben.
✨Messebesuche planen
Auf Messen und Branchenveranstaltungen wie der SPS IPC Drives oder der Hannover Messe gibt es oft die Möglichkeit, direkt vor Ort mit Unternehmen zu sprechen. Nutzt die Chance, um euch über Jobgether und deren offene Stellen zu informieren und vielleicht sogar einen ersten Eindruck zu hinterlassen.
✨Praktische Erfahrungen sammeln
Falls ihr noch nicht so viel Erfahrung habt, schaut nach Möglichkeiten für Workshops oder Projekten in der Automatisierungstechnik, die euch praktische Kenntnisse vermitteln. Das zeigt nicht nur eure Initiative, sondern verschafft euch auch einen Pluspunkt im Bewerbungsprozess.
✨Bewirb dich direkt über unsere Seite
Wenn ihr euch für eine Stelle bei Jobgether interessiert, bewerbt euch direkt über unsere Website. So landet eure Bewerbung direkt im Fokus und ihr zeigt, dass ihr wirklich hinter der Stelle steht. Zudem könnt ihr in der Übersicht der Ausschreibungen oft mehr über das Team und die Unternehmenskultur erfahren.
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Technical Operations & Deployment Engineer (GPU Cloud Infrastructure) mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Bring deine technischen Fähigkeiten zur Geltung:In der Automatisierungstechnik sind spezifische technische Fähigkeiten gefragt. Hebe deine Kenntnisse in Bereichen wie SPS-Programmierung, Roboter- oder Prozessautomatisierung klar in deinem Lebenslauf hervor. Vielleicht hast du sogar Zertifikate oder Schulungen, die deine Kenntnisse belegen – zeig das!
Präzise CV-Gestaltung:Achte bei deinem Lebenslauf darauf, dass du klar und präzise die Projekte auflistest, an denen du gearbeitet hast. Konzentriere dich auf messbare Ergebnisse und technische Herausforderungen, die du gemeistert hast. Das wird deine Eignung für die Stelle bei Jobgether unterstreichen.
Motivation und Teamarbeit betonen:Im Anschreiben solltest du nicht nur deine technischen Fähigkeiten beeindruckend darstellen, sondern auch deine Motivation für die Automatisierungstechnik betonen. Berichte, wie wichtig dir Teamarbeit und innovative Lösungen sind – das passt gut zur Vollzeitstelle bei Jobgether!
Verlinke relevante Projekte oder Portfolios:Falls du an spannenden Projekten gearbeitet hast, die irgendetwas mit Automatisierungstechnik zu tun haben, verlinke diese in deiner Bewerbung! Ein Portfolio oder Links zu veröffentlichten Arbeiten können dir helfen, dich von anderen Bewerbungen abzuheben.
Wie man sich auf ein Vorstellungsgespräch bei Jobgether vorbereitet
✨Verstehe die Werkzeuge der Automatisierungstechnik
Mach dich mit den gängigen Tools der Branche vertraut, wie PLC-Programmierung und SCADA-Systemen. Vielleicht wirst du im Gespräch sogar auf eine technische Herausforderung stoßen, also sei bereit, konkrete Beispiele aus deiner bisherigen Erfahrung zu nennen, in denen du diese Tools angewendet hast.
✨Bereite dich auf technische Fragen vor
Erwarte technische Fragen, die sich auf Automatisierungssysteme und deren Integration beziehen könnten. Das bedeutet, dass wir uns ein paar Systemdesign-Fragen ansehen und darüber nachdenken sollten, wie wir Probleme mit bestehenden Automatisierungssystemen lösen würden. Das zeigt nicht nur dein Wissen, sondern auch deine Problemlösungsfähigkeiten.
✨Zeige deine Projekte und Erfolge
Hast du bereits an Projekten in der Automatisierungstechnik gearbeitet? Bringe ein Portfolio mit, das deine besten Arbeiten zeigt. Das kann alles umfassen - von Prozessoptimierungen bis zu erfolgreich implementierten Lösungen. Du willst der Jury zeigen, was du drauf hast und wie du Ergebnisse lieferst!
✨Motivation und langfristige Perspektive
Da es sich um eine Vollzeitstelle handelt, sollten wir uns auch Gedanken darüber machen, warum du langfristig in diesem Bereich arbeiten möchtest. Sei bereit, deine Motivation zu erklären, wie du in der Automatisierungstechnik wachsen möchtest und wie du zum Erfolg von Jobgether beitragen kannst. Das zeigt, dass du wirklich an einer Karriere in diesem Bereich interessiert bist!