Auf einen Blick
- Aufgaben: Automatisiere den Betrieb und die Bereitstellung von großflächigen SaaS-Systemen.
- Unternehmen: KNIME, eine führende AI-Plattform für Datenwissenschaft.
- Vorteile: Flexibles Arbeiten, Gesundheitsangebote und kontinuierliche Weiterbildung.
- Weitere Informationen: Dynamisches Umfeld mit hervorragenden Entwicklungsmöglichkeiten.
- Warum dieser Job: Sei Teil eines innovativen Teams und gestalte die nächste Generation von Cloud-Diensten.
- Qualifikationen: Erfahrung mit Cloud-Technologien und Kubernetes, sowie Programmierkenntnisse in Python.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Die Site Reliability Engineer bei KNIME stellt sicher, dass unsere nächste Generation der Cloud-Plattform mit Zuverlässigkeit, Sicherheit und Kosteneffizienz als erstklassige Engineering-Ergebnisse aufgebaut, betrieben und skaliert wird. Durch aktive Bereitschaft und praktische Zusammenarbeit mit Engineering-Teams setzt diese Rolle die operativen Standards, die KNIME SaaS stabil, beobachtbar und produktionsbereit halten.
Wir entwerfen, bauen und starten derzeit unsere nächste Generation von Produkten und Dienstleistungen in der Cloud. Wir suchen jemanden, der bereit ist, Teil dieses innovativen Prozesses zu sein. Dies umfasst die Anpassung unserer branchenführenden Datenwissenschafts- und Analyseplattform zu einer verwalteten Plattform, die Tausende von Benutzern bedienen kann. Die Fähigkeit, Infrastructure as Code zu entwickeln, ist entscheidend, da wir bestreben, unsere Qualität und Funktionalität mit innovativen Lösungen in Einklang zu bringen, die Wachstums-, Kosten- und Haltbarkeitsbedenken adressieren können. Sie werden in einem Cloud-Plattform-Team arbeiten, das mit mehreren Entwicklungsteams zusammenarbeitet, um KNIME-Produkte in produktionsbereite Umgebungen zu bringen.
Verantwortlichkeiten:
- Automatisierung der Bereitstellung und des Betriebs von groß angelegten SaaS-Systemen durch Code. Erfahrung mit Kubernetes-Operatoren ist von Vorteil.
- Aufbau von Infrastruktur als Code mit Tools wie Helm, Terraform, Amazon CloudFormation und Azure ARM.
- Teilnahme an Bereitschaftsdiensten, Vorfalltriage und -minderung, Fehlersuche in Live-Umgebungen, Bereitstellung von Ursachenanalysen und Problemlösungen.
- Festlegung von Standards für Produktbereitstellungen, einschließlich Zuverlässigkeit, Skalierbarkeit, Rückverfolgbarkeit und Überwachung.
- Kommunikation mit Produkt- und Entwicklungsteams zur Förderung der Akzeptanz.
- Instrumentierung bereitgestellter Systeme hinsichtlich Leistung, Zuverlässigkeit und Kosteneffektivität.
- Einbindung in Produkt- und Ingenieurteams zur Planung, Übernahme von Abhängigkeitsrisiken und Förderung der konsistenten Anwendung von Zuverlässigkeits- und Betriebsstandards über Teams hinweg.
Anforderungen:
- Sie besitzen eine oder mehrere aktuelle Zertifizierungen auf einer Cloud-Plattform wie AWS, Kubernetes, Linux oder ähnlichen Technologien.
- Starke Cloud-Erfahrung mit mindestens einem der Cloud-Anbieter AWS und Azure. Der ideale Kandidat beherrscht beide.
- Sie verfügen über fundierte Kenntnisse von VPC, IAM, EKS, ECR, EC2, S3, RDS, CloudWatch und deren Gegenstücken in den Azure-Umgebungen.
- Erfahrung in der Bereitstellung von Softwaresystemen in einer Kubernetes-Umgebung.
- Fundierte Kenntnisse der Kubernetes-Konzepte und die Fähigkeit, Bereitstellungslösungen unter Verwendung gängiger Kubernetes-Muster zu erstellen.
- Scripting-Kenntnisse in Python, Shell sind erforderlich, zusätzliche Programmiererfahrung in Go, Java sind von Vorteil.
- Systemkenntnisse und Erfahrung mit Linux.
- Expertise in Netzwerken, einschließlich Sicherheit, Routing, Lastenausgleich und Firewalls.
- Kenntnis der Best Practices rund um Service-Telemetrie, einschließlich Metrikaggregation, verteiltes Logging und Tracing in großen, verteilten Systemen.
- Fundierte Kenntnisse von OAuth/OIDC-Identitätsanbietern wie Keycloak.
- Fundierte Kenntnisse relationaler Datenbanken wie Postgres.
- Fähigkeit, sowohl unabhängig als auch im Team zu arbeiten. Dazu gehört eine klare und präzise Kommunikation in einer geografisch und kulturell verstreuten Organisation.
Was Erfolg bedeutet:
- Plattformstabilität in großem Maßstab: Die Multi-Tenant-SaaS-Plattform hält ihre Verfügbarkeits-SLO über alle Tenant-Tiers, während die Infrastruktur von ihrem aktuellen Zustand zu einem global verteilten kommerziellen Release wächst.
- Betriebliche Exzellenz, die in das Engineering eingebettet ist: Jedes Team, das auf die Plattform liefert, folgt einem gemeinsamen Standard für die Produktionsbereitschaft, wodurch entkommene Defekte und wiederholte Vorfälle reduziert werden.
- Automatisierte, skalierbare Operationen: Mieter-Onboarding, Bereitstellungen und Vorfallbehebung sind pipeline-gesteuert, was manuelle Arbeit eliminiert und es dem Team ermöglicht, ohne gleichmäßiges Wachstum der Mitarbeiterzahl zu skalieren.
- Kommerzielle Bereitschaft: Die Plattform erfüllt die Sicherheits- und Compliance-Anforderungen von Unternehmen, unterstützt verbrauchsbasierte Abrechnung und kann die erforderliche Onboarding-Geschwindigkeit für einen kommerziellen Start aufrechterhalten, ohne dass der Betrieb zum Engpass wird.
Was wir bieten:
- Zweckorientierte Auswirkungen: Die Möglichkeit, eine treibende Kraft und Cloud-Botschafter zu sein, während wir unsere nächste Generation von Dienstleistungsangeboten entwerfen und aufbauen.
- Handwerk & Zusammenarbeit: Arbeiten Sie mit erfahrenen Ingenieuren in einer systemorientierten Kultur, die Einfachheit, Wartbarkeit und sauberes Design schätzt.
- Lernen: Kontinuierliches Wachstum durch praktische Herausforderungen, Austausch mit Kollegen und Einblicke in neueste Themen der KI und Datenanalyse.
- Flexibilität, Gesundheit und Wohlbefinden: Hybrides Arbeiten, flexible Arbeitszeiten, subventionierte Sport- oder Yogakurse, Physiotherapie und Grippeimpfungen an ausgewählten Standorten.
KNIME ist eine führende KI-Plattform, die es Organisationen ermöglicht, ihre Daten durch intuitive, skalierbare und kollaborative Datenwissenschaft zu verstehen. Wir befähigen Datenprofis und Geschäftsanwender gleichermaßen, KI- und Daten-Workflows zu erstellen, bereitzustellen und zu verwalten, die bessere Entscheidungen vorantreiben. Hunderte von globalen Unternehmen nutzen die KNIME-Plattform, darunter Citi, Bosch und P&G. KNIME ist ein Arbeitgeber, der Chancengleichheit bietet. Wir setzen uns dafür ein, Möglichkeiten für unterschiedliche Perspektiven zu schaffen, bei denen sich jeder unabhängig von seinem Hintergrund einbezogen fühlt.
(Senior) Site Reliability Engineer (m/f/d) in Berlin or Konstanz Arbeitgeber: KNIME
KNIME ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern in Berlin oder Konstanz eine dynamische und unterstützende Arbeitsumgebung bietet. Mit einem starken Fokus auf persönliche Entwicklung und Teamarbeit ermöglicht KNIME seinen Mitarbeitern, ihre technischen Fähigkeiten durch Mentoring und kontinuierliches Lernen zu erweitern. Die flexiblen Arbeitszeiten und das hybride Arbeitsmodell fördern nicht nur die Work-Life-Balance, sondern auch das Wohlbefinden der Mitarbeiter, während sie an bedeutenden Projekten arbeiten, die echten Einfluss auf die Datenwissenschaft haben.