Auf einen Blick
- Aufgaben: Betreibe und überwache hochverfügbare Systeme in einem dynamischen Umfeld.
- Unternehmen: NVIDIA, ein führendes Unternehmen im Bereich KI und beschleunigtes Computing.
- Vorteile: Attraktives Gehalt, Aktienoptionen und umfassende Sozialleistungen.
- Weitere Informationen: Flexible Arbeitszeiten und Möglichkeiten zur beruflichen Weiterentwicklung.
- Warum dieser Job: Gestalte die Zukunft der Technologie mit und arbeite in einem vielfältigen Expertenteam.
- Qualifikationen: Erfahrung mit Kubernetes, Cloud-Plattformen und großflächigen Produktionssystemen.
Das prognostizierte Gehalt liegt zwischen 63000 - 77000 € pro Jahr.
At NVIDIA, our Compute Infrastructure Support (CIS) team looks for a driven Site Reliability Engineer passionate about innovation and excellence.
As an SRE, you will be vital in delivering world‑class support for our on‑prem and cloud products and services.
Your work will help maintain near 100% availability.
This role offers a chance to work with powerful technology and join a diverse expert team.
Together, you will build reliable systems that advance our innovative progress in AI and accelerated computing.
What you’ll be doing
- Operate within a 24/7 follow‑the‑sun support model across multiple continents, working closely with a U.
S.-based manager.
Manage a 4‑day, 10‑hour schedule, including either Saturday or Sunday, with flexible early or late shifts to maintain global coverage.
- Monitor and manage extensive production GPU and Kubernetes environments to ensure high availability and performance.
Apply advanced tools to detect, prevent, and respond to incidents proactively.
- Apply in‑depth systems knowledge to analyze logs, metrics, and system behavior, diagnosing issues and implementing effective resolutions.
- Develop and complete predictive automated support routines to prevent potential issues from impacting production.
- Improve automation by integrating incident analysis insights into auto‑healing and automated break‑fix solutions.
- Perform comprehensive systems administration, network administration, and security monitoring tasks.
- Coordinate with domain experts and service owners to resolve complex issues efficiently.
- Continuously improve service quality and operational processes based on incident feedback.
- Foster strong interpersonal and communication skills to ensure effective coordination across teams during incident resolution.
- Deliver outstanding customer focus, ensuring clients feel supported and valued throughout all interactions.
What we need to see
- Advanced hands‑on experience with Kubernetes, SLURM, and large‑scale cluster management.
- Familiarity with GPU hardware and high‑performance computing environments.
- Proficiency with observability and incident management tools (Grafana, Open Telemetry, Pager Duty, JIRA).
- Experience with Cloud platforms (AWS, Azure, GCP, OCI) is a plus; strong preference for on‑prem expertise.
- Highly motivated with strong communication skills, demonstrating the ability to work effectively with multi‑functional teams.
- 8+ years of experience coordinating large‑scale production systems and more than 3 years of experience working in high‑availability Internet, Cloud, or Data Center settings.
- BS in Computer Science, Engineering, Physics, Mathematics, or equivalent experience.
- Expert‑level Linux system administration, automation using Ansible and/or Python and strong expertise in shell scripting, DNS, DHCP, storage systems, and core networking.
- Proven experience in problem‑solving and maintaining large‑scale bare‑metal infrastructure.
- Excellent partnership, documentation, and mentoring skills.
Ways to stand out from the crowd
- Experience with scripting languages, particularly Python.
- Prior experience running virtual machines under community‑supported or commercial hypervisors.
- Knowledge of application containers and container orchestration systems.
- Basic understanding of Git.
- Demonstrate ability to master and maintain complicated environments.
Your base salary will be determined based on your location, experience, and the pay of employees in similar positions.
The base salary range is 168,000 USD - 270,250 USD for Level 4, and 208,000 USD - 333,500 USD for Level 5.
You will also be eligible for equity and benefits.
Applications for this job will be accepted at least until August 14, 2026.
This posting is for an existing vacancy.
NVIDIA uses AI tools in its recruiting processes.
NVIDIA is committed to fostering an inclusive work environment and proud to be an equal opportunity employer.
As we highly value diversity in our current and future employees, we do not discriminate (including in our hiring and promotion practices) on the basis of race, religion, color, national origin, gender, gender expression, sexual orientation, age, marital status, veteran status, disability status or any other characteristic protected by law.
#J-18808-Ljbffr
Service Reliability Engineer Arbeitgeber: Nvidia
NVIDIA ist ein herausragender Arbeitgeber, der innovative Technologien im Bereich Künstliche Intelligenz vorantreibt. Mit einem dynamischen Arbeitsumfeld in einer der fortschrittlichsten Technologiestädte bietet NVIDIA nicht nur wettbewerbsfähige Vergütungen, sondern auch umfangreiche Möglichkeiten zur beruflichen Weiterentwicklung und Zusammenarbeit mit führenden Experten der Branche. Hier haben Sie die Chance, an bahnbrechenden Projekten zu arbeiten und Ihre Fähigkeiten in einem unterstützenden Team weiterzuentwickeln, während Sie an der Spitze der technologischen Entwicklung stehen.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Service Reliability Engineer erhalten könntest
✨Netzwerken in der IT-Community
In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.
✨Online-Foren und Gruppen nutzen
Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!
✨Direkt bei Nvidia bewerben
Viele Unternehmen, wie Nvidia, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.
✨Überzeugende Projekte zeigen
Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!
Wir glauben, dass du diese Fähigkeiten brauchst, um Service Reliability Engineer mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!
Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!
Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!
Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf Nvidia und die ausgeschriebene Position Service Reliability Engineer zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.
Wie man sich auf ein Vorstellungsgespräch bei Nvidia vorbereitet
✨Technische Vorbereitung ist alles!
Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.
✨Praxisbeispiele parat haben
In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.
✨Soft Skills betonen
Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!
✨Fragen zum Unternehmen vorbereiten
Schau dir spezifisch die Projekte von Nvidia an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.