Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure

Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure

Karlsruhe Vollzeit 75000 - 95000 € / Jahr (geschätzt) Homeoffice (teilweise)
United States Digital Space LLC

Auf einen Blick

  • Aufgaben: Gestalte robuste Systeme und verbessere die Zuverlässigkeit unserer KI-basierten Telefonassistenten.
  • Unternehmen: Innovatives Health-Tech-Startup aus Karlsruhe mit einem dynamischen Team.
  • Vorteile: Attraktives Gehalt, hybrides Arbeiten und persönliches Weiterentwicklungsbudget.
  • Weitere Informationen: Wachstumsmöglichkeiten in einer offenen und kollaborativen Arbeitsumgebung.
  • Warum dieser Job: Sei Teil eines revolutionären Projekts im Gesundheitswesen und arbeite mit modernster Technologie.
  • Qualifikationen: Erfahrung in DevOps oder SRE und starke Problemlösungsfähigkeiten.

Das prognostizierte Gehalt liegt zwischen 75000 - 95000 € pro Jahr.

  • Position
  • Level: Experienced Engineer - typischerweise drei bis sechs Jahre relevante Produktionserfahrung
  • Gehalt: 75.000-95.000 Euro brutto pro Jahr, abhängig von Erfahrung und Verantwortungsumfang
  • Hybrid: Während der Einarbeitung zwei bis drei Tage pro Woche in Karlsruhe, danach je nach Standort flexibel, bevorzugt ein bis zwei Tage pro Woche

Über the company the company ist ein Health-Tech-Startup aus Karlsruhe.

Mit Medi Voice entwickeln wir einen KI-basierten Telefonassistenten, der Anliegen in Arztpraxen und MVZ autonom bearbeitet - von der Terminvergabe bis zur Rezeptanfrage.

Hinter jedem Anruf steht ein verteiltes System aus Telefonie, Echtzeit-Audioverarbeitung, KI-Diensten und Schnittstellen zu Praxisverwaltungssystemen.

Genau hier kommst du ins Spiel.

Warum wir diese Rolle schaffen

Bisher haben die Engineers, die unser Produkt entwickeln, auch Infrastruktur, Observability und operative Schutzmechanismen aufgebaut.

Mit unserem Wachstum schaffen wir nun erstmals eine dedizierte Reliability-Rolle: für eine Person, die Probleme eigenständig untersucht, fundierte Optionen erarbeitet und die gewählte Lösung verlässlich in Produktion bringt.

Wir priorisieren Reliability-Themen gemeinsam.

Du verantwortest Untersuchung, Entscheidungsgrundlage, Umsetzung und Follow-through.

In den kommenden zwei bis drei Jahren kann dein Verantwortungsbereich mit wachsendem Kontext und Vertrauen bis zur übergreifenden Gestaltung der Reliability-Disziplin bei the company wachsen.

  • Aufgaben
  • Systeme robust machen: Du sorgst für Workload-Isolation, Redundanz, sinnvolles Autoscaling und passende Cluster-Kapazität - genug Reserven für Lastspitzen, ohne unnötig Ressourcen laufen zu lassen.

Störungen sollen gar nicht erst zu Ausfällen werden.

  • Bekannte Schwachstellen durchdringen: Du untersuchst bekannte Zuverlässigkeitsrisiken, sammelst belastbare Evidenz und bringst konkrete Handlungsoptionen mit.
  • Lösungen umsetzen: Du baust Verbesserungen selbst - als Produktionscode, Infrastructure as Code, Automatisierung, Test, Runbook oder technischen Schutzmechanismus.
  • Observability betreuen und weiterentwickeln: Du übernimmst die Pflege unserer Alerting-Infrastruktur und verbesserst Signale, Alert-Ownership und Routing - echte Probleme erreichen sofort die richtigen Menschen, Rauschen erreicht niemanden.
  • Plattform aktuell halten: Du hältst Kubernetes, Infrastruktur-Charts und Komponenten in einem Rhythmus aktuell, der Lifecycle-Risiken kontrolliert, ohne jedes Upgrade zur Top-Priorität zu machen.
  • Incidents methodisch begleiten: Du arbeitest bei Störungen ruhig und methodisch mit, trennst Fakten von Annahmen und treibst die abgeleiteten Verbesserungen bis zum Abschluss.

Die systemübergreifende Ursachenanalyse wächst mit deinem Systemwissen - sie ist ausdrücklich keine Erwartung ab Tag eins.

  • Gemeinsame Verantwortung stärken: Du arbeitest eng mit den Produktteams zusammen.

Sie behalten die Verantwortung für ihre Systeme; du stärkst gemeinsame Reliability-Praktiken und treibst vereinbarte Maßnahmen bis zum Abschluss.

Die Reihenfolge legen wir anhand von Wirkung, Risiko und Aufwand gemeinsam fest.

  • Qualifikation
  • Produktionserfahrung: Typischerweise drei bis sechs Jahre Arbeit mit produktiven Systemen, etwa in Dev Ops, SRE, Backend oder Infrastructure Engineering.

Entscheidend ist die Qualität deiner Erfahrung, nicht die exakte Jahreszahl.

  • Troubleshooting und

Engineering: Du gehst auch in unbekannten verteilten Systemen methodisch vor, denkst in Failure Modes und Blast Radius und setzt Verbesserungen hands-on in Code, Ia C und Automatisierung um.

  • Eigeninitiative: Du wartest nicht nur auf Tickets, sondern bemerkst Probleme, gehst ihnen nach und bringst durchdachte Optionen mit.
  • Zusammenarbeit: Du überzeugst durch Evidenz statt Hierarchie, kannst eine andere Teamentscheidung professionell mittragen und sprichst erneut klar an, wenn neue Erkenntnisse die Lage verändern.
  • Sicherheitsbewusstsein: Bei patientennahen Systemen behandelst du Identität, korrektes Routing, Mandantentrennung und Fail-closed-Verhalten als Teil der Zuverlässigkeit - und fragst nach, bevor du eine unsichere Grenze überschreitest.
  • Reflektierte KI-Nutzung: Du nutzt KI-Werkzeuge pragmatisch, hältst aber Verifikation, Kontext und Verantwortung beim Menschen.
  • Sprachen: Sehr gutes Englisch. Deutsch ist hilfreich, aber für diese interne Engineering-Rolle kein Muss.

Ein vollständiger Stack-Match ist nicht nötig.

Entscheidend sind deine Arbeitsweise, echte Produktionserfahrung und die Fähigkeit, neue technische Domänen zuverlässig zu erschließen.

Unser technischer Kontext

Unser Umfeld umfasst AWS, Kubernetes/EKS, EC2, RDS/Postgre SQL, Prometheus, Grafana, Loki, Sentry, Linux-Netzwerke und Infrastructure as Code.

Hinzu kommen SIP/RTP-basierte Telefonie, Echtzeit-Audio, GPU-Workloads, externe KI-Dienste sowie Integrationen mit Termin- und Praxisverwaltungssystemen.

Erfahrung mit einzelnen Teilen davon ist ein Plus, aber keine Voraussetzung.

Wie wir arbeiten

Wir treffen technische Entscheidungen in offener Diskussion statt über Hierarchie. Gut begründete Bedenken haben Gewicht, und wir ändern den Kurs, wenn die Evidenz dafür spricht.

Diese Rolle trägt echte Verantwortung, ist aber nicht der Ort, an den Produktionsprobleme oder Schuld weitergereicht werden.

Bei Incidents verbessern wir Schutzmechanismen und klären Verantwortlichkeiten - ohne Sündenböcke oder Heldenkultur.

Unser Anrufvolumen beginnt gegen 07:00 Uhr und steigt ab 08:00 Uhr stark an.

Ein früher Arbeitsbeginn ist praktisch, aber wir suchen keine dauerhaft verfügbare Frühschicht.

Wir suchen jemanden, der mit uns sicherstellt, dass ein Ausfall um 07:00 Uhr eine entworfene und getestete Antwort hat - unabhängig vom persönlichen Tagesrhythmus.

Wir sind AI-native: KI gehört für uns zu Code, Untersuchung und Entscheidungsvorbereitung. Urteilsvermögen, Verifikation und Verantwortung bleiben menschlich.

Benefits

  • Eine seltene Kombination aus Cloud-Infrastruktur, Echtzeit-Audio, Telefonie und KI in einem patientennahen Produkt.
  • Eine dedizierte Rolle mit eigenem Umsetzungsraum und erfahrenen Engineers als Partner.
  • Eine klare Entwicklungsperspektive bis zur übergreifenden Gestaltung der Reliability-Disziplin.
  • Hybrides Arbeiten mit einem modernen Büro im Herzen von Karlsruhe.

Während der Einarbeitung zwei bis drei Tage pro Woche in Karlsruhe, danach je nach Standort flexibel, bevorzugt ein bis zwei Tage pro Woche.

  • Ein persönliches Weiterentwicklungsbudget und fachliches Mentoring.
  • Bewerbungsprozess
  • Remote-Kennenlernen (30 Minuten): Hintergrund, Erwartungen und Rolle.
  • Technischer Deep Dive: Ein realistischer Reliability-Fall; uns interessieren deine Fragen, Hypothesen und Entscheidungen, nicht auswendig gelernte Tooldetails.
  • Teamgespräch in Karlsruhe: Gegenseitiges Kennenlernen und Raum für offene Fragen.
  • Deine Bewerbung

Ein klassisches Anschreiben ist nicht nötig. Schick uns deinen Lebenslauf (Zeugnisse optional) und beantworte stattdessen kurz diese Frage:

Erzähle uns von einem Produktionsproblem, das dir selbst aufgefallen ist, ohne dass es als Ticket existierte.

Wie hast du es untersucht, welche Optionen hast du vorgeschlagen und was wurde anschließend umgesetzt?

Wir freuen uns darauf, dich kennenzulernen.

#J-18808-Ljbffr

Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure Arbeitgeber: United States Digital Space LLC

Reserved ist ein dynamisches und wachsendes Modeunternehmen, das seinen Mitarbeitenden eine inspirierende Arbeitsumgebung bietet. Mit einer modernen Arbeitswelt, attraktiven Rabatten und umfangreichen Benefits wie Bike Leasing und betrieblicher Altersvorsorge fördern wir nicht nur die Work-Life-Balance, sondern auch die persönliche und berufliche Entwicklung unserer Mitarbeiter. In Mannheim hast du die Möglichkeit, in einem kreativen Team zu arbeiten und deine Leidenschaft für Mode in einem unterstützenden Umfeld auszuleben.

United States Digital Space LLC

Kontaktdaten:

United States Digital Space LLC Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei United States Digital Space LLC anzuklopfen, wenn du dich auf die Stelle als Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei United States Digital Space LLC vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure mit Bravour zu bestehen

Produktionssysteme
Troubleshooting
Engineering
Failure Modes
Blast Radius
Infrastructure as Code (IaC)
Automatisierung

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei United States Digital Space LLC klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei United States Digital Space LLC vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.