Auf einen Blick
- Aufgaben: Leite die Lösung komplexer Infrastruktur- und Plattformprobleme und unterstütze NVIDIA GPU-Infrastrukturen.
- Unternehmen: Führendes Unternehmen im Bereich KI-Infrastruktur mit innovativer Kultur.
- Vorteile: Attraktives Gehalt, Gesundheitsleistungen und Möglichkeiten zur beruflichen Weiterentwicklung.
- Weitere Informationen: Dynamisches Umfeld mit hervorragenden Aufstiegschancen und Mentoring-Möglichkeiten.
- Warum dieser Job: Gestalte die Zukunft der Technologie und arbeite an spannenden Projekten mit KI.
- Qualifikationen: Mindestens 7 Jahre Erfahrung in Infrastruktur- und Plattformoperationen sowie Expertenkenntnisse in Linux und Kubernetes.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Responsibilities
- Lead the investigation and resolution of complex infrastructure, networking, and platform-related incidents.
- Act as a senior escalation point for operational teams during critical service-impacting events.
- Support large-scale NVIDIA GPU infrastructure and high-performance networking environments.
- Troubleshoot complex Linux, Kubernetes, networking, storage, and hardware-related issues.
- Analyze platform performance, capacity, stability, and reliability trends to proactively identify risks.
- Lead root cause analysis activities and drive long-term corrective actions.
- Collaborate with engineering teams, hardware vendors, and datacenter personnel to resolve complex technical challenges.
- Participate in major incident management and service restoration activities.
- Provide technical leadership for Kubernetes platform operations and supporting infrastructure services.
- Drive improvements in platform reliability, observability, monitoring, and operational processes.
- Identify opportunities to automate repetitive operational activities and improve operational efficiency.
- Contribute to operational readiness reviews, infrastructure changes, upgrades, and service introductions.
- Support the adoption and operation of AI-powered infrastructure services and operational capabilities through k0rdent AI.
- Evaluate emerging technologies and operational practices to improve service delivery and platform resilience.
- Mentor and support AI Infrastructure & Platform Operations Engineers.
- Share technical knowledge through documentation, training sessions, and operational reviews.
- Develop and maintain operational standards, runbooks, troubleshooting guides, and best practices.
- Help define operational processes, escalation paths, and service reliability standards.
- Act as a trusted technical advisor during operational planning and service improvement initiatives.
Requirements
- 7+ years of experience in infrastructure operations, platform operations, site reliability engineering, network operations, cloud operations, datacenter operations, or related technical roles.
- Expert-level Linux administration and troubleshooting skills.
- Strong networking expertise, including experience diagnosing complex performance, connectivity, and reliability issues.
- Strong experience operating Kubernetes in production environments.
- Experience supporting large-scale production infrastructure and distributed systems.
- Proven experience leading technical investigations and managing complex incidents.
- Experience performing root cause analysis and driving long-term operational improvements.
- Strong understanding of observability, monitoring, and service reliability practices.
- Excellent troubleshooting and analytical skills across multiple infrastructure domains.
- Strong communication, collaboration, and stakeholder management skills.
- Experience in one or more of the following areas is highly desirable: NVIDIA GPU infrastructure and accelerated computing platforms, Infini Band networking and NVIDIA UFM, AI infrastructure environments, HPC environments, Platform Engineering or Site Reliability Engineering (SRE), Large-scale Kubernetes operations, Infrastructure automation technologies and Infrastructure-as-Code practices, Observability platforms such as Grafana, Prometheus, ELK, or Open Telemetry, Performance analysis and optimisation of distributed infrastructure platforms, Technical leadership, mentoring, or team lead responsibilities.
- Core Competencies
Demonstrates expert-level Linux administration and troubleshooting, strong networking expertise, and extensive experience in Kubernetes operations.
Proven ability to lead technical investigations, perform root cause analysis, and drive operational improvements in large-scale infrastructure environments.
- Hard Skills
- Linux Administration
- Kubernetes
- Networking Troubleshooting
- Root Cause Analysis
- Performance Analysis
- Infrastructure Operations
- Site Reliability Engineering
- Cloud Operations
- Distributed Systems
- Operational Improvements
- Soft Skills
- Communication Skills
- Collaboration Skills
- Stakeholder Management
- Mentoring Skills
- Analytical Skills
- Tools & Technologies
- NVIDIA GPU Infrastructure
- Infini Band Networking
- Grafana
- Prometheus
- ELK
- Open Telemetry
- AI Infrastructure
- HPC Environments
- Infrastructure-as-Code
- Operational Standards
- #J-18808-Ljbffr
Senior AI Infrastructure, Platform Operations Engineer Arbeitgeber: Jobtailor
Als Global Director B2B – Business Development bei uns profitieren Sie von einer dynamischen und innovativen Arbeitsumgebung, die auf Zusammenarbeit und Kreativität setzt. Wir bieten Ihnen nicht nur attraktive Vergütungsmodelle und umfassende Weiterbildungsmöglichkeiten, sondern auch die Chance, in einem internationalen Team zu arbeiten, das Vielfalt und persönliche Entwicklung fördert. Unsere Unternehmenskultur legt großen Wert auf Flexibilität und Work-Life-Balance, sodass Sie Ihre Karriereziele in einem unterstützenden Umfeld erreichen können.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior AI Infrastructure, Platform Operations Engineer erhalten könntest
✨Netzwerken in der IT-Community
In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.
✨Online-Foren und Gruppen nutzen
Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!
✨Direkt bei Jobtailor bewerben
Viele Unternehmen, wie Jobtailor, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.
✨Überzeugende Projekte zeigen
Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior AI Infrastructure, Platform Operations Engineer mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!
Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!
Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!
Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf Jobtailor und die ausgeschriebene Position Senior AI Infrastructure, Platform Operations Engineer zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.
Wie man sich auf ein Vorstellungsgespräch bei Jobtailor vorbereitet
✨Technische Vorbereitung ist alles!
Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.
✨Praxisbeispiele parat haben
In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.
✨Soft Skills betonen
Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!
✨Fragen zum Unternehmen vorbereiten
Schau dir spezifisch die Projekte von Jobtailor an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.