Member of Technical Staff, Cluster Administration

Member of Technical Staff, Cluster Administration

Vollzeit Homeoffice (teilweise)
I

Auf einen Blick

  • Aufgaben: Verwalte und betreibe unsere leistungsstarke GPU-Compute-Infrastruktur für effizientes Engineering.
  • Unternehmen: Innovatives Unternehmen, das an der Spitze der KI-Inferenztechnologie steht.
  • Vorteile: Attraktives Gehalt, Gesundheitsleistungen, 401(k)-Zuschuss und flexible Arbeitsmöglichkeiten.
  • Weitere Informationen: Dynamisches Umfeld mit großartigen Karrierechancen und der Möglichkeit, remote zu arbeiten.
  • Warum dieser Job: Gestalte die Zukunft der KI mit und verbessere die Systeme hinter vLLM.
  • Qualifikationen: Erfahrung in der Verwaltung von Compute-Clustern und starke Linux-Kenntnisse erforderlich.

Inferact’s mission is es, vLLM als die weltweit führende KI-Inferenz-Engine zu entwickeln und den Fortschritt der KI zu beschleunigen, indem Inferenz kostengünstiger und schneller gemacht wird. Gegründet von den Schöpfern und Hauptverwaltern von vLLM, befinden wir uns an der Schnittstelle von Modellen und Hardware – eine Position, die Jahre in Anspruch genommen hat.

Wir suchen einen praktischen Cluster-Administrationsingenieur, der die hochleistungsfähige GPU-Computing-Infrastruktur betreut und betreibt, die die Produktivität der Inferact-Engineering-Teams sicherstellt. Inferact läuft auf teuren, leistungsstarken GPU- und HPC-Clustern über Neo-Cloud- und dedizierte Compute-Anbieter. Ihre Aufgabe ist es, sicherzustellen, dass die Infrastruktur rund um die Uhr gesund, verfügbar, beobachtbar und nutzbar ist.

Sie übernehmen die Verantwortung für die Cluster-Gesundheit, GPU-Verfügbarkeit, Überwachung, Alarmierung, Planung, Zugriff, Diagnosen und Vorfallreaktion in den Systemen, auf die unsere Ingenieure täglich angewiesen sind. Sie arbeiten eng mit der Engineering-Leitung und den Infrastrukturverantwortlichen zusammen, um zu standardisieren, wie wir Computing über Anbieter bereitstellen, betreiben, debuggen und skalieren. Ihre Arbeit wird sich direkt darauf auswirken, wie schnell Inferact die Systeme, die vLLM antreiben, entwickeln, testen und verbessern kann.

Fähigkeiten und Qualifikationen

  • Mindestens: Bachelor-Abschluss oder gleichwertige Erfahrung in Informatik, Ingenieurwesen, Systemadministration oder ähnlichem.
  • Praktische Erfahrung in der Verwaltung großer Compute-Cluster, HPC-Umgebungen, Universitäts- oder Forschungscluster, Supercomputing-Systeme oder Produktions-GPU-Cluster.
  • Starke Grundlagen in der Linux-Systemadministration in den Bereichen Netzwerk, Prozesse, Speicher, Paketverwaltung, Shell-Skripting, Protokolle, Zugriffskontrolle und System-Debugging.
  • Erfahrung im Betrieb von GPU-Servern, einschließlich Treiberverwaltung, GPU-Gesundheitsüberwachung, Knotenfehler, Speicherfehler, Planungsprobleme und Hardware-Diagnosen.
  • Erfahrung mit Cluster-Planung und Ressourcenallokation unter Verwendung von SLURM, Kubernetes oder ähnlichen Werkzeugen.
  • Fähigkeit, dringende Infrastrukturvorfälle von Anfang bis Ende zu übernehmen, wenn Compute-Probleme die Engineering-Teams blockieren.
  • Fähigkeit zur Automatisierung betrieblicher Workflows mit Bash, Python, Ansible, Terraform, Helm oder ähnlichen Werkzeugen.

Bevorzugte Qualifikationen

  • Erfahrung im Betrieb von GPU-Computing über Anbieter wie Lambda, CoreWeave, Crusoe, Nebius, Together, Fireworks, RunPod oder ähnliche Umgebungen.
  • Erfahrung in der Verbesserung der Cluster-Nutzung, Reduzierung von untätiger oder nicht verfügbarer GPU-Kapazität und Debugging von Planungs- oder Ressourcenengpassproblemen.
  • Vertrautheit mit Hochleistungs-GPU-Netzwerken wie InfiniBand, RoCE, NVLink / NVSwitch, RDMA, NCCL oder ähnlichen Systemen.
  • Erfahrung mit Speicher für HPC- oder ML-Workloads, einschließlich NFS, Lustre, Ceph, verteilte Dateisysteme oder andere Hochdurchsatz-Speichersysteme.
  • Erfahrung in der Verwaltung von sicherem Zugriff, Identität, Berechtigungen, SSH, VPNs, Bastion-Hosts, Geheimnissen und grundlegender Infrastruktur-Sicherheits-Hygiene.
  • Hintergrund in der Forschungs- oder wissenschaftlichen Datenverarbeitung, ML-Infrastruktur, SRE, Plattformengineering oder Infrastrukturoperationen für engineeringlastige Teams.

Bonuspunkte, wenn Sie haben:

  • GPU- oder HPC-Infrastruktur in einem Universitätslabor, nationalen Labor, Forschungsinstitution, KI-Infrastrukturunternehmen, Hedgefonds, HFT-Firma oder großangelegtem ML-Plattformteam verwaltet.
  • Überwachungs-, Alarmierungs-, Handbuch-, Gesundheitsprüfungs- oder Remediation-Workflows erstellt, die den operativen Aufwand oder die Zeit zur Vorfallbehebung erheblich reduziert haben.
  • Kubernetes-Cluster für ML- oder GPU-Workloads in bedeutendem Maßstab betrieben.
  • Standardisierte Bereitstellung, Diagnosen, Überwachung und Betriebsabläufe über mehrere Compute-Anbieter hinweg.
  • Echte operative Verantwortung für Infrastruktur getragen, die von vielen Ingenieuren oder Forschern genutzt wird.

Logistik

  • Standort: Diese Rolle ist in San Francisco, Kalifornien, angesiedelt. Für außergewöhnliche Kandidaten wird Remote-Arbeit in den USA in Betracht gezogen.
  • Vergütung: Abhängig von Hintergrund, Fähigkeiten und Erfahrung liegt die erwartete jährliche Gehaltsspanne für diese Position zwischen 200.000 und 400.000 USD + Eigenkapital.
  • Visumsponsoring: Wir sponsern Visa fallweise.
  • Leistungen: Inferact bietet großzügige Gesundheits-, Zahn- und Sehleistungen sowie eine 401(k)-Unternehmensbeteiligung.

Member of Technical Staff, Cluster Administration Arbeitgeber: Inferact

Inferact ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, an der Spitze der KI-Infrastruktur zu arbeiten. Mit einem dynamischen Arbeitsumfeld in San Francisco und großzügigen Gesundheits- sowie Altersvorsorgeleistungen fördert das Unternehmen eine Kultur des Wachstums und der Zusammenarbeit. Hier haben Sie die Chance, Ihre Fähigkeiten in der Clusteradministration weiterzuentwickeln und direkt zur Beschleunigung des Fortschritts in der KI beizutragen.

I

Kontaktdaten:

Inferact Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Member of Technical Staff, Cluster Administration erhalten könntest

Netzwerken in der IT-Community

In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.

Online-Foren und Gruppen nutzen

Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!

Direkt bei Inferact bewerben

Viele Unternehmen, wie Inferact, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.

Überzeugende Projekte zeigen

Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!

Wir glauben, dass du diese Fähigkeiten brauchst, um Member of Technical Staff, Cluster Administration mit Bravour zu bestehen

Cluster Administration
GPU Compute Infrastructure
HPC Environments
Linux Systems Administration
Networking
Shell Scripting
Driver Management

Einige Tipps für deine Bewerbung 🫡

Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!

Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!

Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!

Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf Inferact und die ausgeschriebene Position Member of Technical Staff, Cluster Administration zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.

Wie man sich auf ein Vorstellungsgespräch bei Inferact vorbereitet

Technische Vorbereitung ist alles!

Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.

Praxisbeispiele parat haben

In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.

Soft Skills betonen

Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!

Fragen zum Unternehmen vorbereiten

Schau dir spezifisch die Projekte von Inferact an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.