Auf einen Blick
- Aufgaben: Entwickle und betreibe die Infrastruktur für KI-Agenten-Workflows in der Produktion.
- Unternehmen: Payward, das Unternehmen hinter Kraken, bietet eine moderne Finanzinfrastruktur.
- Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen, Boni und umfassende Gesundheitsleistungen.
- Weitere Informationen: Dynamisches Umfeld mit vielfältigen Karrieremöglichkeiten und einem engagierten Team.
- Warum dieser Job: Gestalte die Zukunft der offenen Finanzen mit innovativer Technologie und echten Auswirkungen.
- Qualifikationen: Mindestens 5 Jahre Erfahrung in der Systemzuverlässigkeit oder Plattformtechnik.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Payward - das Mutterunternehmen hinter Kraken, NinjaTrader, Breakout, xStocks, Payward Services und CF Benchmarks - hat in den letzten 15 Jahren eine der modernsten und global zugänglichen Finanzinfrastrukturplattformen in der Branche aufgebaut, die darauf abzielt, ein offenes, globales Finanzsystem voranzutreiben.
Die AI Infrastructure-Abteilung ist innerhalb der Datenorganisation angesiedelt und verantwortlich für den Aufbau, Betrieb und die Skalierung der Systeme, die KI-Agenten in der Produktion unterstützen - sowohl interne Tools als auch externe Produkte. Diese Gruppe stellt sicher, dass die Orchestrierungs-, Ausführungs- und Modellbereitstellungsschichten, die agentische Workflows untermauern, zuverlässig, beobachtbar und skalierbar sind.
Die Aufgaben umfassen:
- Entwurf, Aufbau und Betrieb der Infrastruktur, die die KI-Agenten-Workflows in der Produktion unterstützt
- Sicherstellung der Zuverlässigkeit, Skalierbarkeit und Beobachtbarkeit von agentischen Systemen über interne und externe Produkte
- Entwicklung von Plattformdiensten, APIs, SDKs und Selbstbedienungsfunktionen, die es Engineering-Teams ermöglichen, die KI-Infrastruktur und die Agenten-Plattformdienste einfach zu nutzen
- Verwaltung und Wartung der Rechen-, Orchestrierungs- und Bereitstellungsinfrastruktur, die die Modellinferenz und die Ausführung von Agenten antreibt
- Implementierung robuster Überwachungs-, Alarmierungs- und Vorfallreaktionsverfahren, die auf KI/ML-Workloads zugeschnitten sind
- Nutzung von Infrastructure as Code (IaC) Tools wie Terraform zur Bereitstellung und Verwaltung von Cloud (AWS) Infrastrukturkomponenten
- Aufbau und Pflege von CI/CD-Pipelines, die eine schnelle, zuverlässige Bereitstellung von KI-Diensten und Agenten-Workflows unterstützen
- Definition und Implementierung von Sicherheitsvorkehrungen, Fehlerbehandlung und Wiederherstellungsmustern, die spezifisch für agentische und LLM-gestützte Systeme sind
- Zusammenarbeit mit AI- und Data Engineering-Teams zur Übersetzung experimenteller Agentenprototypen in robuste Produktionssysteme
- Verwaltung containerisierter Workloads mit Kubernetes, um eine effiziente Bereitstellung, Skalierung und Orchestrierung von KI-Diensten sicherzustellen
- Implementierung von Zugriffskontrollen und Sicherheitsbest Practices in den Umgebungen der KI-Infrastruktur
- Dokumentation von Architektur, Betriebsanleitungen und Best Practices zur Unterstützung des Wissensaustauschs im Team
Was Sie mitbringen:
- 5+ Jahre Erfahrung als Site Reliability Engineer, Infrastruktur Engineer, Plattform Engineer oder in einer ähnlichen Rolle in einer Produktionsumgebung
- Praktische Erfahrung in der Unterstützung von ML-Infrastruktur, Modellbereitstellung oder MLOps-Workflows in der Produktion
- Erfahrung im Aufbau von Entwicklerplattformen, internen Tools, APIs oder SDKs, die von Engineering-Teams in großem Maßstab genutzt werden
- Starkes Verständnis der Prinzipien des Plattform-Engineerings, einschließlich Entwicklererfahrung, Selbstbedienungsinfrastruktur und API-gesteuertem Plattformdesign
- Kenntnisse in Infrastructure as Code-Tools, insbesondere Terraform
- Erfahrung mit Containerisierung und Orchestrierung, insbesondere Kubernetes und Docker
- Solides Verständnis der Cloud-Infrastruktur, vorzugsweise AWS
- Starke Skriptfähigkeiten (bash/shell) und Kenntnisse in mindestens einer Programmiersprache (Python bevorzugt)
- Erfahrung im Entwurf und Betrieb von Überwachungs-, Monitoring- und Alarmierungssystemen
- Erfahrung in der Implementierung von Vorfallreaktionsverfahren und Teilnahme an Bereitschaftsdiensten
- Starke Zusammenarbeit mit Teams aus Daten, KI und Engineering
- Hohe Eigenverantwortung in einer schnelllebigen, risikobehafteten Produktionsumgebung
Wünschenswerte Qualifikationen:
- Erfahrung im Aufbau oder Betrieb von Infrastrukturen für agentenbasierte oder LLM-gestützte Systeme
- Vertrautheit mit Agentenorchestrierungsframeworks (z.B. LangGraph, CrewAI oder ähnliche)
- Hintergrund in der Dateninfrastruktur, einschließlich Vertrautheit mit Airflow, Kafka, Spark oder Datenlake-Tools
- Erfahrung mit CI/CD-Pipelines und Bereitautomatisierung für KI/ML-Workloads
- Einblick in Bewertungsframeworks und Modellleistungsüberwachung im großen Maßstab
- Erfahrung in schnelllebigen 0→1-Umgebungen oder Plattformaufbauteams
- Erfahrung im Aufbau von SDKs, Entwickler-Tools oder internen Plattformprodukten mit starkem Fokus auf Benutzerfreundlichkeit und Akzeptanz
- Erfahrung mit der Cloudflare-Cloud-Plattform und dem Produktökosystem, einschließlich Netzwerk, Sicherheit, Leistung und Zero Trust-Lösungen
Unser Engagement:
Payward wird von Menschen aus der ganzen Welt unterstützt und wir feiern die vielfältigen Talente, Hintergründe, Beiträge und einzigartigen Perspektiven, die jeder mitbringt. Wir stellen basierend auf Verdienst ein und suchen nach Menschen mit den richtigen Fähigkeiten, Kenntnissen und Fertigkeiten für die Stelle. Wir ermutigen Sie, sich auf Stellen zu bewerben, bei denen Sie die aufgeführten Anforderungen nicht vollständig erfüllen, insbesondere wenn Sie leidenschaftlich oder sachkundig im Bereich Krypto sind.
Wir betrachten qualifizierte Bewerber mit strafrechtlicher Vorgeschichte für eine Anstellung in unserem Team und bewerten Kandidaten in Übereinstimmung mit den Anforderungen der San Francisco Fair Chance Ordinance.
Vergütung: $96K - $192K. Dies ist die angestrebte jährliche Gehaltsspanne für diese Rolle.
Site Reliability Engineer – AI Agents Arbeitgeber: Kraken Digital Asset Exchange
Kraken ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, an innovativen Lösungen für eine nachhaltige Energiezukunft zu arbeiten. Mit einem starken Fokus auf Teamarbeit und persönlichem Wachstum fördert das Unternehmen eine inklusive und dynamische Arbeitskultur, in der jeder Einzelne einen bedeutenden Beitrag zur Bekämpfung des Klimawandels leisten kann. Die Position des Senior Software Engineer im Bereich Customer Entities ermöglicht es Ihnen, an spannenden technischen Herausforderungen zu arbeiten und gleichzeitig Teil eines Unternehmens zu sein, das sich für eine grünere Zukunft einsetzt.
Kontaktdaten:
Kraken Digital Asset Exchange Recruiting-Team