Auf einen Blick
- Aufgaben: Gestalte eine zuverlässige und leistungsstarke KI-Infrastruktur für die Zukunft.
- Unternehmen: Nebius, ein führendes Unternehmen im Bereich Cloud-Infrastruktur für KI.
- Vorteile: Wettbewerbsfähige Vergütung, Karrierechancen und flexible Arbeitsbedingungen.
- Weitere Informationen: Dynamisches, internationales Team mit Fokus auf Innovation und Zusammenarbeit.
- Warum dieser Job: Arbeite an bahnbrechenden KI-Projekten und forme die Zukunft der Technologie.
- Qualifikationen: Erfahrung mit Kubernetes, Python und Infrastruktur-as-Code.
Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.
Über Nebius: Nebius führt eine neue Ära in der Cloud-Infrastruktur für die globale KI-Wirtschaft an. Wir bauen eine Full-Stack-AI-Cloud-Plattform, die Entwickler und Unternehmen von der Daten- und Modellschulung bis zur Produktionsbereitstellung unterstützt, ohne die Kosten und die Komplexität des Aufbaus großer interner AI/ML-Infrastrukturen. Unser Team von über 1.500 Mitarbeitern umfasst Hunderte von Ingenieuren mit tiefem Fachwissen in Hardware, Software und KI-Forschung und -Entwicklung.
Token Factory ist Teil von Nebius Cloud, einer der größten GPU-Clouds der Welt, die Zehntausende von GPUs betreibt. Wir entwickeln eine Inferenzplattform, die jede Art von Grundmodell - Text, Vision, Audio und aufkommende multimodale Architekturen - schnell, zuverlässig und mühelos in großem Maßstab bereitstellt. Um dieses Versprechen zu erfüllen, benötigen wir einen Ingenieur, der die Plattform unter extremen Lasten fehlerfrei arbeiten lässt und sich bei unerwarteten Ereignissen elegant erholt.
In dieser Rolle sind Sie verantwortlich für die Zuverlässigkeit, Leistung und Beobachtbarkeit des gesamten Inferenzstacks. Ihr Tag beginnt mit dem Entwerfen und Verfeinern von Telemetrie-Pipelines - Metriken, Protokollen und Traces, die Hunderte von Terabyte an Signalen in klare, umsetzbare Erkenntnisse umwandeln. Von dort aus könnten Sie Kubernetes-Autoscaler optimieren, um mehr Effizienz aus GPUs herauszuholen, Terraform-Module erstellen, die Resilienz in jeden neuen Cluster einbacken, oder unsere Anforderungsweiterleitungs- und Wiederholungslogik absichern, sodass selbst vorübergehende Fehler von den Benutzern unbemerkt bleiben.
Wenn Vorfälle auftreten, verlassen Sie sich auf die Automatisierung und die Runbooks, die Sie erstellt haben, um Probleme in Minuten zu erkennen, zu isolieren und zu beheben, und treiben dann die Post-Mortem-Kultur voran, die Wiederholungen verhindert. All diese Bemühungen zielen auf ein einziges Ziel ab: die Plattform reibungslos zu skalieren und dabei aggressive Kosten- und Zuverlässigkeitsziele zu erreichen.
Erfolg in dieser Rolle erfordert tiefes Wissen in Kubernetes, Prometheus, Grafana, Terraform und der Kunst der Infrastruktur als Code. Sie skripten sicher in Python oder Bash, verstehen die Nuancen des Alarmdesigns und der SLOs für hochdurchsatzfähige APIs und haben genug Zeit in der Produktion verbracht, um zu wissen, wie verteilte Back-Ends in der realen Welt ausfallen. Erfahrung mit GPU-intensiven Workloads - sei es mit vLLM, Triton, Ray oder einem anderen Beschleuniger-Stack - wird Ihnen zugutekommen, ebenso wie ein Hintergrund in MLOps oder Modell-Hosting-Plattformen.
Vor allem kümmern Sie sich um den Aufbau selbstheilender Systeme, gedeihen beim Debuggen der Leistung von der Kernel- bis zur Anwendungsschicht und genießen die Zusammenarbeit mit Softwareingenieuren, um Zuverlässigkeit zu einer Funktion zu machen, über die die Benutzer nie nachdenken müssen. Wenn die Vorstellung, die Infrastruktur zu schützen, die die multimodale KI von morgen antreibt, Sie begeistert, würden wir uns freuen, Ihre Geschichte zu hören.
Vorteile & Vergünstigungen:
- Wettbewerbsfähige Vergütung
- Karrierewachstum und Lernmöglichkeiten
- Flexibilität und Eigenverantwortung
- Kollaborative und innovative Kultur
- Gelegenheit, an bedeutenden KI-Projekten zu arbeiten
- Internationales Umfeld und talentierte Teams
Wie ist es, bei Nebius zu arbeiten: Schnelllebig - Mutiges Denken - Ständiges Wachstum - Bedeutungsvolle Auswirkungen - Vertrauen und echte Verantwortung - Gelegenheit, die Zukunft der KI zu gestalten.
Gleichstellungserklärung: Nebius ist ein Arbeitgeber, der Chancengleichheit bietet. Wir setzen uns dafür ein, ein integratives und diverses Arbeitsumfeld zu fördern und Chancengleichheit in allen Aspekten der Beschäftigung zu gewährleisten. Wir diskriminieren nicht aufgrund von Rasse, Hautfarbe, Religion, Geschlecht (einschließlich Schwangerschaft), nationaler Herkunft, Abstammung, Alter, Behinderung, genetischen Informationen, Familienstand, Veteranenstatus, sexueller Orientierung, Geschlechtsidentität oder -ausdruck oder einer anderen durch geltendes Recht geschützten Eigenschaft. Bewerber müssen berechtigt sein, in dem Land zu arbeiten, in dem sie sich bewerben, und müssen einen Nachweis über die Beschäftigungsberechtigung als Bedingung für die Einstellung vorlegen. Wenn Sie während des Bewerbungsprozesses Unterstützung benötigen, lassen Sie es uns bitte wissen.
Senior Site Reliability Engineer — Token Factory (Inference Platform) in Berlin Arbeitgeber: Nebius
Nebius ist ein hervorragender Arbeitgeber, der eine dynamische und innovative Arbeitsumgebung bietet, in der Mitarbeiter die Möglichkeit haben, an bedeutenden KI-Projekten zu arbeiten. Mit einem starken Fokus auf Karrierewachstum, Flexibilität und einer kollaborativen Kultur fördert Nebius die persönliche und berufliche Entwicklung seiner Mitarbeiter. Die internationale Ausrichtung und das talentierte Team bieten zudem einzigartige Vorteile, um in einem sich schnell entwickelnden Bereich wie der Cloud-Infrastruktur für die globale KI-Wirtschaft erfolgreich zu sein.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior Site Reliability Engineer — Token Factory (Inference Platform) in Berlin erhalten könntest
✨Engagier dich in Entwickler-Communities!
Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.
✨Zeig deine Fähigkeiten!
Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Nebius anzuklopfen, wenn du dich auf die Stelle als Senior Site Reliability Engineer — Token Factory (Inference Platform) bewirbst – so wissen sie gleich, was sie von dir erwarten können!
✨Nutze Jobplattformen speziell für Tech-Jobs!
Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.
✨Such dir Mentoren und Feedback!
Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Nebius vorzubereiten!
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior Site Reliability Engineer — Token Factory (Inference Platform) in Berlin mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.
Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.
Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.
Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Nebius klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.
Wie man sich auf ein Vorstellungsgespräch bei Nebius vorbereitet
✨Technische Vorbereitung auf die Coding-Challenges
In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!
✨Das eigene Portfolio im besten Licht präsentieren
Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.
✨Teamfähigkeit und Kommunikation betonen
In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.
✨Vorbereitung auf Fragen zur Software-Architektur
Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.