Als Site Reliability Engineer bei ventx arbeiten Sie an der Schnittstelle zwischen Entwicklung und Betrieb. Sie verantworten die Zuverlässigkeit, Skalierbarkeit und Performance unserer Kundeninfrastrukturen, die auf Kubernetes und Public Cloud Plattformen basieren.
Ihre Kernaufgaben umfassen den Aufbau und die Automatisierung von Monitoring-Lösungen, die Implementierung von Infrastructure-as-Code-Ansätzen sowie die kontinuierliche Verbesserung von CI/CD-Pipelines. Sie analysieren Störungen, entwickeln Lösungen zur Vermeidung von Wiederholungen und arbeiten eng mit den Entwicklungsteams zusammen.
Wir suchen einen Kandidaten, der bereits Erfahrung im Betrieb von verteilten Systemen mitbringt und Scrum-Methoden anwenden kann. Die Position erfordert Hands-on-Mentalität sowie die Fähigkeit, komplexe technische Sachverhalte verständlich zu kommunizieren.
Deine Aufgaben
- Entwicklung und Wartung von Monitoring- und Alerting-Systemen zur Sicherstellung der Systemverfügbarkeit
- Automatisierung von Infrastrukturprozessen mittels Infrastructure as Code
- Betrieb und Optimierung von Kubernetes-Clustern in Cloud-Umgebungen
- Analyse und Behebung von Incidents einschließlich Post-Mortem-Dokumentation
- Implementierung von Backup- und Disaster-Recovery-Strategien
- Zusammenarbeit mit Entwicklungsteams zur Verbesserung der Deployments und Release-Prozesse
- Erstellung und Pflege von Runbooks sowie technischer Dokumentation
Dein Profil (Must-Haves)
- Mindestens 3 Jahre Berufserfahrung als SRE, DevOps Engineer oder in vergleichbarer Rolle
- Erfahrung mit Infrastructure as Code (Terraform, Ansible oder Pulumi)
- Fundierte Kenntnisse in Kubernetes (EKS, GKE oder AKS)
- Erfahrung mit Monitoring-Lösungen wie Prometheus, Grafana oder Datadog
- Praktische Erfahrung mit mindestens einer Public Cloud Plattform (AWS, Azure oder GCP)
- Erfahrung mit Git-basierten Workflows und CI/CD-Pipelines (GitLab CI, GitHub Actions oder Jenkins)
- Sehr gute Deutschkenntnisse in Wort und Schrift
- Gute Englischkenntnisse in Wort und Schrift
Wünschenswert (Nice-to-Haves)
- Zertifizierungen wie CKA, CKAD, AWS Solutions Architect oder Azure Administrator
- Erfahrung mit Service Mesh (Istio, Linkerd oder Consul Connect)
- Kenntnisse in Programmiersprachen wie Python, Go oder Bash-Scripting
- Erfahrung mit Container-Sicherheitstools (Trivy, Falco oder Aqua Security)
- Kenntnisse von Chaos Engineering (Gremlin, Litmus oder Chaos Monkey)
- Erfahrung mit Log-Aggregation (ELK Stack, Loki oder Splunk)
Benefits
- Kostenlose Kantine
- Kostenlose Getränke
- Essenszuschuss und Snacks
- Massagen
- Zuschuss zu Mitarbeiteraktivitäten
- Wunschhardware
- Hervorragende Arbeitsplatzausstattung
- Chill-Out Area
- Wasch- und Bügelservice
- Dusche
Hybrides Arbeiten: bis zu 50% Remote, der Rest vor Ort.
#J-18808-Ljbffr
Site Reliability Engineer (SRE) München (m/w/d) Arbeitgeber: ventx GmbH
Als Arbeitgeber bieten wir ein modernes und dynamisches Umfeld, in dem Leistung geschätzt wird und persönliche Weiterentwicklung im Fokus steht. Unsere flachen Hierarchien und die Unterstützung im Team fördern eine offene Kommunikation und kreative Ideenfindung. Zudem erwarten dich attraktive Benefits wie kostenlose Getränke, moderne Büroräume und regelmäßige Team-Events, die das Arbeiten bei uns zu einem besonderen Erlebnis machen.