Senior HPC Systems Engineer

Senior HPC Systems Engineer

Vollzeit 74250 - 90750 € / Jahr (geschätzt) Homeoffice (teilweise)
P

Auf einen Blick

  • Aufgaben: Bau und Betrieb von HPC-Clustern für Verteidigungs- und Forschungsprogramme.
  • Unternehmen: Parallel Works, ein innovatives Unternehmen im Bereich Hochleistungsrechnen und KI.
  • Vorteile: Wettbewerbsfähiges Gehalt, Gesundheitsleistungen, 401(k) mit Unternehmensbeitrag und großzügiger Urlaub.
  • Weitere Informationen: Dynamisches Umfeld mit Möglichkeiten zur beruflichen Weiterentwicklung und direktem Kundenkontakt.
  • Warum dieser Job: Gestalte die Zukunft des Hochleistungsrechnens und arbeite an spannenden Projekten.
  • Qualifikationen: Mindestens 10 Jahre Erfahrung in der Produktion von Linux-Systemen und HPC-Administration.

Das prognostizierte Gehalt liegt zwischen 74250 - 90750 € pro Jahr.

Parallel Works baut und betreibt ACTIVATE, eine Steuerungsebene für Hochleistungsrechnen und KI. Unsere Kunden führen große wissenschaftliche und KI-Workloads auf ihren eigenen On-Premises-Clustern, in Regierungs- und kommerziellen Cloud-Umgebungen sowie bei kommerziellen GPU-Anbietern aus. ACTIVATE bietet ihnen einen Zugang zu all dem. Die Sicherheitsgrenze ist auf Impact Level 5 autorisiert, mit FIPS-validierter Kryptografie und STIG-Härtung.

Die Arbeit umfasst die meisten Bereiche, die auf großflächiges Rechnen angewiesen sind: Wetter- und Klimavorhersage, Verteidigungs- und Geheimdienstprogramme, Luft- und Raumfahrt sowie strukturelle Analysen, Molekular- und Materialwissenschaften, Energie und KI-Forschung. Ein Quartal kann das Einrichten eines GPU-Clusters für eine dieser Gemeinschaften, die Föderation eines bestehenden On-Premises-Systems eines Labors mit zusätzlicher Kapazität, die es zuvor nicht hatte, und das Ausführen eines vor Jahrzehnten geschriebenen Domain-Codes auf aktueller Hardware umfassen.

Kundenerfolg setzt unsere Prioritäten. Wir sind ein kleines Ingenieurbüro, daher arbeiten Ingenieure hier direkt mit den Nutzern der Systeme und begleiten ein Problem vom ersten Bericht bis zur Lösung. Dies nennen wir Mission Engineering: zu verstehen, was ein Kunde erreichen möchte und warum das Rechnen für ihn wichtig ist.

Parallel Works sucht einen Senior HPC Systems Engineer, um die Cluster hinter unseren Verteidigungs- und Forschungsprogrammen aufzubauen und zu betreiben. Die Arbeit umfasst das Hochfahren von GPU-Knoten, die Konfiguration von Slurm, Fehlersuche bei Fabrik- und Speicherproblemen, Sicherheits-Härtung und Tier-3-Eskalation.

Die Rechenumgebungen sind hybrid. Einige Cluster sind im Besitz des Kunden, einige laufen in akkreditierten Regierungs-Cloud-Regionen, und einige sind dedizierte GPU-Cluster bei kommerziellen Anbietern. In mehreren Programmen tragen die On-Premises-Systeme die Hauptlast, während die Cloud die Überlastung übernimmt. Die Position ist senior: Sie bearbeitet die Eskalationen, die der Rest des Teams nicht lösen kann, und schult die Junior-Ingenieure.

Was Sie tun werden:

  • Clusterbetrieb: Produktion von Slurm-Clustern aufbauen und betreiben. slurmctld und slurmdbd, Partitionen und QOS, Konten und Fair Share, GPU GRES, Prolog und Epilog, cgroup-Durchsetzung.
  • Hybride Föderation: Verbindung von kundenbesessenen Clustern mit der Steuerungsebene, Abstimmung ihres Standort-Schedulers, Speichers und Identitätsquelle, damit Konten und Zuweisungen in jeder Umgebung gleich funktionieren.
  • On-Premises-Hardware: Bare-Metal-Bereitstellung, Out-of-Band-Management, Firmware, Rack-Netzwerk und Fehlermanagement mit Standortmitarbeitern oder Anbietern.
  • GPU und Fabrik: Validierung von GPU-Knoten, bevor Benutzer ankommen. Treiber- und CUDA-Stack, DCGM-Gesundheitsprüfungen, XID-Triage, Fabrikmanager und NVLink-Prüfungen, InfiniBand-Verifizierung, NCCL-Tuning.
  • Speicher und Automatisierung: Parallel- und Hochdurchsatzspeicher optimieren und die Ansible-, Terraform- und Image-Bau-Pipelines schreiben, die einen Cluster reproduzierbar machen.
  • Sicherheit und Eskalation: STIG-Härtung, Scan-Behebung, FIPS-validierte Kryptografie, Sicherheits-Paket-Artefakte, Tier-3-Eskalationen und ein Teil der Rufbereitschaft.

10 oder mehr Jahre Erfahrung im Betrieb von Produktions-Linux-Systemen über mehr als eine Distribution hinweg. RHEL, Rocky oder Alma auf der Regierungsseite und Debian oder Ubuntu auf der kommerziellen GPU-Seite, da diese Cluster normalerweise mit Ubuntu ausgeliefert werden. Kernel- und Netzwerk-Tuning, systemd, cgroups, NUMA. Produktion von Slurm-Administration. Sie haben einen Scheduler konfiguriert, debuggt und aktualisiert, auf den andere angewiesen waren.

Mindestens ein paralleles oder hochdurchsatzfähiges Dateisystem in der Produktion, plus InfiniBand- oder RoCE-Fabriken. NVIDIA GPU-Knotenoperationen im Multi-Node-Maßstab, einschließlich Treiber-Stack-Management und Fehlertriage. Erfahrung mit kundenbesessenen oder On-Premises-Clustern sowie öffentlicher Cloud, einschließlich Bare-Metal-Bereitstellung und Out-of-Band-Management. DevOps-Erfahrung mit Infrastruktur-als-Code-Frameworks wie Ansible oder Terraform. Beherrschung gängiger Skriptsprachen wie Bash und Python.

US-Staatsbürgerschaft und Berechtigung für eine Geheimhaltungsfreigabe, da die Arbeit exportkontrollierte Regierungsumgebungen erreicht. Eine aktive Freigabe ist von Vorteil. Wir sponsern Kandidaten, die berechtigt sind, aber derzeit nicht freigegeben sind.

Bevorzugte Qualifikationen:

  • Erfahrung in einem Regierungs-Supercomputing-Zentrum, nationalen Labor oder universitären Forschungsrechenzentrum.
  • Arbeiten mit STIG, SCAP, Tenable, eMASS oder RMF, oder Zeit innerhalb von FedRAMP oder Impact Level-Grenzen.
  • Ausführen von GPU-Workloads auf Kubernetes oder OpenShift mit Helm und Operatoren sowie Verwendung von HPC-Containern wie Apptainer, Enroot oder Pyxis.
  • Ausführen von PBS Pro neben Slurm und Überwachung mit Prometheus und Grafana, einschließlich Nutzung und Abrechnungsberichterstattung.

Medizinische, Augen- und Zahnversorgung, ein 401(k) mit Unternehmensbeitrag, kurzfristige Invaliditätsversicherung, großzügige bezahlte Urlaubs- und Krankheitszeiten.

Gleichberechtigte Beschäftigungschance: Parallel Works ist ein Arbeitgeber, der Chancengleichheit bietet. Wir berücksichtigen alle qualifizierten Bewerber ohne Rücksicht auf Rasse, Farbe, Religion, Geschlecht, sexuelle Orientierung, Geschlechtsidentität, nationale Herkunft, Alter, Behinderung, geschützten Veteranenstatus oder eine andere durch das Gesetz geschützte Eigenschaft.

Senior HPC Systems Engineer Arbeitgeber: Parallel Works

Parallel Works ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, an bedeutenden Projekten im Bereich Hochleistungsrechnen und KI zu arbeiten. Mit einem starken Fokus auf Kundenerfolg und einer engen Zusammenarbeit zwischen Ingenieuren und Nutzern fördert das Unternehmen eine Kultur des Lernens und der persönlichen Entwicklung. Die Mitarbeiter profitieren von umfassenden Sozialleistungen, flexiblen Arbeitsbedingungen und der Chance, in einem dynamischen Umfeld zu wachsen, das innovative Lösungen für komplexe Herausforderungen bietet.

P

Kontaktdaten:

Parallel Works Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior HPC Systems Engineer erhalten könntest

Nutze Ingenieur-Events und Messen

Ingenieurs-Events und Messen sind der perfekte Ort, um persönliche Kontakte zu knüpfen. Schau dir die nächsten Karrieretage oder Fachmessen in deiner Nähe an. Dort kannst du nicht nur potenzielle Arbeitgeber treffen, sondern auch direkt mit Fachleuten plaudern, die dir Insider-Tipps geben können.

Schnapp dir Praktika und Werkstudentenstellen

Wenn du noch nicht das passende Vollzeitangebot gefunden hast, lohnt es sich, zunächst Praktika oder Werkstudentenstellen in deinem Wunschunternehmen zu ergattern. Diese Positionen bieten dir nicht nur wertvolle Einblicke, sondern auch die Möglichkeit, nach dem Abschluss übernommen zu werden. Lass uns deine Suche unterstützen, indem du auf unserer Website nach offenen Stellen schaust!

Werde Mitglied in Ingenieur-Communities

In vielen Städten gibt es spezielle Ingenieur-Communities oder Foren, wo sich Gleichgesinnte treffen. Dort kannst du nicht nur deinen Horizont erweitern, sondern auch direkt von anderen erfahren, wo die besten Stellen ausgeschrieben sind. Networking ist in unserer Branche Gold wert!

Nutze Alumni-Netzwerke

Falls du an einer Hochschule studiert hast, schau mal in deren Alumni-Netzwerk rein. Oft gibt es dort spezielle Jobangebote oder Mentorenschaften, und du kannst von den Erfahrungen früherer Absolventen profitieren. So findest du schnellere einen Fuß in die Tür bei Unternehmen, die dich interessieren!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior HPC Systems Engineer mit Bravour zu bestehen

HPC Cluster Management
Slurm Konfiguration
GPU Node Betrieb
Bare Metal Provisioning
Out of Band Management
FIPS validierte Kryptographie
STIG-Härtung

Einige Tipps für deine Bewerbung 🫡

Technische Fähigkeiten im Fokus:Wenn du dich bei Parallel Works für die Position als Senior HPC Systems Engineer bewirbst, stelle sicher, dass dein Lebenslauf deine technischen Fähigkeiten und Projekte klar hervorhebt. Welche Software, Technologien oder Ingenieurmethoden beherrschst du? Achte darauf, relevante Zertifikate oder spezielle Ausbildungen anzugeben!

Praktische Erfahrungen zählen:Ingenieurwesen lebt von praktischen Erfahrungen! Wenn du Praktika oder Projekte hast, in denen du dein Wissen anwenden konntest, führe diese in deinem Lebenslauf auf. Zeige, wie du Probleme gelöst und Ergebnisse erzielt hast – Zahlen und Fakten werden hier sehr geschätzt!

Motivation für das Unternehmen:In deinem Anschreiben solltest du nicht nur deine Qualifikationen betonen, sondern auch, warum du für Parallel Works arbeiten möchtest. Welche Werte oder Projekte des Unternehmens sprechen dich an? Zeige, dass du nicht nur irgendeinen Job suchst, sondern dass du einen Beitrag zu unserem Team leisten möchtest.

Saubere und klare Struktur:Achte darauf, dass deine Bewerbungsunterlagen klar strukturiert sind. Verwende Absätze und Aufzählungen, um Informationen übersichtlich zu präsentieren. Ein gut gegliedertes Dokument macht es einfacher, deine Qualifikationen auf den ersten Blick zu erkennen und hinterlässt einen professionellen Eindruck.

Wie man sich auf ein Vorstellungsgespräch bei Parallel Works vorbereitet

Technisches Wissen nachweisen

Im Ingenieurwesen zählt technisches Wissen unglaublich viel, also sei bereit, spezifische technische Fragen zu beantworten. Mach dich mit gängigen Werkzeugen und Software in deinem Bereich vertraut, und stelle sicher, dass du bereit bist, dein Verständnis über Konstruktions- oder Analyseverfahren zu demonstrieren.

Einen Projektportfolios präsentieren

Gerade bei einer Vollzeitstelle im Ingenieurwesen erwartet man oft, dass du praktische Erfahrungen vorweisen kannst. Bereite eine Auswahl von Projekten vor, an denen du gearbeitet hast, und erarbeite, wie du Herausforderungen gemeistert hast. Zeige, wie deine Erfahrungen zu den Anforderungen bei Parallel Works passen.

Zusammenarbeit und Teamarbeit betonen

Ingenieure arbeiten selten alleine. Sei bereit, Beispiele anzuführen, wo du in einem Team gearbeitet hast oder interdisziplinär mit anderen zusammengearbeitet hast. Zeige, wie du deine individuellen Stärken in einer Gruppenarbeit einsetzen konntest und welche Rolle du gespielt hast.

Fragen zur praktischen Anwendung stellen

Nutze die Gelegenheit, um mehr über die alltäglichen Herausforderungen bei Parallel Works zu erfahren. Frage gezielt nach Projekten oder Initiativen, an denen du beteiligt sein könntest, und wie das Team mit technischen Hürden umgeht. Das zeigt nicht nur dein Interesse, sondern auch deine mentale Vorbereitung auf die Realität des Jobs.