Auf einen Blick
- Aufgaben: Entwickle und optimiere KI-Infrastruktur für große Trainings- und Inferenz-Workloads.
- Unternehmen: Andromeda Cluster, ein innovatives Unternehmen im Bereich KI-Infrastruktur.
- Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen, umfassende Sozialleistungen und unbegrenzter Urlaub.
- Weitere Informationen: Dynamisches Umfeld mit großartigen Entwicklungsmöglichkeiten und einem inklusiven Team.
- Warum dieser Job: Sei Teil eines schnell wachsenden Unternehmens und forme die Zukunft der KI-Infrastruktur.
- Qualifikationen: Erfahrung mit GPU-Clustern und tiefes Verständnis für verteiltes Training.
Standort: Nordamerika Remote/SF-Hybrid · Vollzeit
Über Andromeda
Andromeda Cluster wurde von Nat Friedman und Daniel Gross gegründet, um Startups in der Frühphase Zugang zu skalierter KI-Infrastruktur zu ermöglichen, die zuvor nur für Hyperscaler reserviert war. Wir haben mit einem einzigen verwalteten Cluster begonnen - dieser war jedoch fast sofort voll. Seitdem haben wir leise die Systeme, das Netzwerk und die Orchestrierungsebene aufgebaut, die die KI-Infrastruktur der Welt zugänglicher machen. Heute arbeitet Andromeda mit führenden KI-Labors, Rechenzentren und Cloud-Anbietern zusammen, um Rechenleistung dort bereitzustellen, wo sie am dringendsten benötigt wird. Unsere Plattform leitet Trainings- und Inferenzjobs über das globale Angebot und ermöglicht Flexibilität und Effizienz in einem der am schnellsten wachsenden Märkte der Welt. Unsere langfristige Vision ist es, die Liquiditätsschicht für globale KI-Rechenleistung aufzubauen. Wir erweitern uns in neue Bereiche, um die hellsten Köpfe im Bereich KI-Infrastruktur, Forschung und Engineering zu finden.
Die Rolle
Dies ist keine allgemeine SRE-Rolle und auch keine Support-Rolle. Sie werden direkt mit den Teams arbeiten, die groß angelegte Trainings- und Inferenzjobs auf unseren Clustern ausführen. Sie sind verantwortlich für deren Einarbeitung, das Abstimmen ihrer Jobs und das Debuggen ihrer Fehler, während Sie die Infrastruktur und Automatisierung besitzen, die diese Cluster zuverlässig macht. Forward deployed bedeutet, dass Sie Zeit in den Umgebungen der Kunden verbringen: ihren Trainingscode lesen, in ihren Slack-Kanälen sitzen, ihre Ausführungen beobachten und Lösungen bereitstellen, die in unsere Plattform integriert werden. Wenn ein Multi-Hundert-GPU-Lauf ins Stocken gerät, sind Sie die Person, die herausfindet, ob es am Fabric, dem Treiber, dem Scheduler oder ihrem Dataloader liegt, und dann sicherstellt, dass es nicht noch einmal auf die gleiche Weise passiert.
Was Sie tun werden
- Als primärer technischer Ansprechpartner für Teams fungieren, die groß angelegte Trainings- und Inferenzlasten ausführen.
- Die Einarbeitung von Anfang bis Ende übernehmen; Umgebungseinrichtung, Orchestrierungswahl (Slurm, Kubernetes oder direkter SSH-Zugriff), Speicherlayout, erster erfolgreicher Lauf im großen Maßstab.
- In den Umgebungen der Kunden arbeiten, um echte Fehler zu diagnostizieren: NCCL-Timeouts, Stragglers, Checkpoint-I/O-Störungen, degradierte Links, OOM-Muster, Container- und Treiberinkompatibilitäten.
- Ihr Wissen über Code nutzen, um Probleme zu reproduzieren, zu isolieren, zu beheben und zu dokumentieren.
- Die Leistung des verteilten Trainings bei Live-Arbeitslasten profilieren und verbessern.
- Die Zuverlässigkeitsergebnisse für die Konten, auf denen Sie eingesetzt sind, übernehmen.
- Die Gesundheit und Leistung von Hochgeschwindigkeitsverbindungen (InfiniBand, RoCE, NVLink) sicherstellen, die das verteilte Training unterstützen.
- Jedes wiederholte Bereitstellungsproblem in Automatisierung umwandeln.
- Die Incident-Response für komplexe, mehrschichtige Fehler leiten.
Was wir suchen
- Praktische Erfahrung im Betrieb von GPU-Clustern in der Produktion.
- Produktionskenntnisse mit InfiniBand, RoCE oder NVLink-Fabriken im Kontext des verteilten Trainings.
- Expertenkenntnisse in Linux: Kernel-Tuning, Treibermanagement, cgroup/namespace-Interna, Container-Runtimes und Leistungsprofilierung.
- Starke Erfahrung im Betrieb von Kubernetes in der Produktion mit GPU-Arbeitslasten.
- Erfahrung mit Python, Go oder Bash.
- Praktische Erfahrung im Aufbau von Monitoring und Alarmierung für GPU-spezifische Telemetrie.
Starke Kandidaten könnten Folgendes haben:
- Erfahrung mit hochleistungsfähigen parallelen Dateisystemen.
- Erfahrung in der Zusammenarbeit mit externen Ingenieurteams.
- Erfahrung im Betrieb von Produktionsinferenz.
Was Erfolg aussieht
Am Ende Ihres ersten Jahres: Sie kennen die tatsächlichen technischen Ziele jedes Ihrer Konten, einschließlich dessen, was sie trainieren, wie ihr Skalierungsfahrplan aussieht und welche realen Einschränkungen bestehen.
Warum Sie es hier lieben werden
- Wachstumsumfeld: Kommen Sie frühzeitig in ein Unternehmen, das im Zentrum des KI-Infrastrukturbooms steht.
- Eigentum: Erster FDE für das Solutions Engineering-Team, Sie werden diese Funktion von Grund auf neu aufbauen.
- Wettbewerbsfähige Vergütung: + bedeutendes Eigenkapital.
- Umfassende Leistungen: für Sie und Ihre Angehörigen, einschließlich Gesundheitsversorgung, Zahnmedizin und Sehhilfe, 401(k) und unbegrenztem PTO.
Andromeda Cluster ist ein Arbeitgeber, der Chancengleichheit bietet. Wir feiern Vielfalt und setzen uns dafür ein, ein integratives Umfeld für alle Mitarbeiter zu schaffen.
Forward Deployed Engineer - SRE Arbeitgeber: Andromeda
Andromeda Cluster ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, an der Spitze des schnellsten Wachstumsmarktes für Infrastrukturtechnologie zu arbeiten. Mit einem dynamischen Arbeitsumfeld, das Innovation und Zusammenarbeit fördert, profitieren Sie von umfassenden Leistungen, einschließlich wettbewerbsfähiger Vergütung und unbegrenztem Urlaub. Hier haben Sie die Chance, Ihre Fähigkeiten in einem aufstrebenden Unternehmen einzubringen und aktiv zur Gestaltung der Zukunft der KI-Infrastruktur beizutragen.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Forward Deployed Engineer - SRE erhalten könntest
✨Netzwerken in der IT-Community
In der IT-Consulting-Welt sollten wir regelmäßig auf Veranstaltungen wie Tech-Meetups oder Konferenzen gehen. Hier können wir nicht nur unser Netzwerk erweitern, sondern auch direkt mit potenziellen Arbeitgebern ins Gespräch kommen und unser Interesse an einer Vollzeitstelle zeigen.
✨Online-Foren und Gruppen nutzen
Sich in Online-Foren und Communities wie Stack Overflow oder LinkedIn-Gruppen umzusehen, kann uns helfen, Insider-Tipps zu erhalten und Informationen über offene Stellen in der IT-Beratung zu sammeln. Vergiss nicht, aktiv zu werden und Fragen zu stellen oder dein Wissen zu teilen – das erhöht unsere Sichtbarkeit!
✨Direkt bei Andromeda bewerben
Viele Unternehmen, wie Andromeda, stemmen ihre Vollzeitstellen bevorzugt über ihre eigenen Karriere-Webseiten. Also, lass uns regelmäßig auf deren Seite vorbeischauen und uns direkt bewerben, statt nur die üblichen Jobportale zu nutzen.
✨Überzeugende Projekte zeigen
Wir sollten unser Portfolio oder relevante Projekte gut sichtbar machen, egal ob das auf Github, persönlich oder auf LinkedIn ist. Bei IT-Consulting-Stellen kommt es oft auf praktische Erfahrungen an, also lass uns zeigen, was wir können!
Wir glauben, dass du diese Fähigkeiten brauchst, um Forward Deployed Engineer - SRE mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Zeige deine technischen Skills!:In der IT-Beratung zählen deine technischen Kenntnisse und Fähigkeiten. Achte darauf, relevante Programmiersprachen, Tools und Systeme in deinem Lebenslauf aufzulisten. Zeig auch, wenn du Zertifikate hast, die deine Kompetenz unterstützen – das könnte dir einen echten Vorteil verschaffen!
Verstehe die Branche!:Unterstreiche in deinem Anschreiben, dass du ein gutes Verständnis für aktuelle Trends und Herausforderungen in der IT-Branche hast. Zeig, dass du nicht nur die technischen Aspekte beherrschst, sondern auch die Bedürfnisse der Kunden erkennen und lösen kannst!
Deine Projekte zählen!:Falls du bereits an IT-Projekten gearbeitet hast, verlinke diese oder beschreibe sie in deinem Lebenslauf. Praktische Erfahrungen – sei es in Form von Praktika oder privaten Projekten – sind besonders wertvoll in der IT-Beratung. Zeige uns, was du kannst!
Individuelle Bewerbung ist der Schlüssel!:Jede Bewerbung sollte individuell auf Andromeda und die ausgeschriebene Position Forward Deployed Engineer - SRE zugeschnitten sein. Teile uns mit, warum gerade du eine gute Wahl für unser Team bist. Das zeigt dein Engagement und deine Motivation, die über eine Standardbewerbung hinausgeht.
Wie man sich auf ein Vorstellungsgespräch bei Andromeda vorbereitet
✨Technische Vorbereitung ist alles!
Da du dich auf eine Vollzeitstelle in der IT-Beratung bewirbst, solltest du dir wirklich einen Überblick über die wichtigsten Tools und Technologien verschaffen, die in der Branche verwendet werden. Sei bereit, technische Fragen zu beantworten, die sich auf Software-Architektur oder Systemintegration beziehen könnten.
✨Praxisbeispiele parat haben
In der IT-Beratung ist es wichtig, konkrete Beispiele aus deiner bisherigen Erfahrung zu bringen. Überlege dir Projekte, bei denen du erfolgreich einen Kunden beraten hast oder Herausforderungen gelöst hast. Das zeigt, dass du nicht nur theoretisches Wissen hast, sondern auch in der Praxis erfolgreich sein kannst.
✨Soft Skills betonen
Ein großer Teil der IT-Beratung ist die Kommunikation mit Kunden und das Verständnis ihrer Bedürfnisse. Bereite dich darauf vor, über deine zwischenmenschlichen Fähigkeiten zu sprechen, wie du mit herausfordernden Kunden umgehst oder wie du in Teams arbeitest. Das wird den Interviewern zeigen, dass du mehr als nur technisches Wissen mitbringst!
✨Fragen zum Unternehmen vorbereiten
Schau dir spezifisch die Projekte von Andromeda an und überlege dir, welche Fragen du dazu stellen möchtest. Zeig Interesse an den aktuellen Herausforderungen, vor denen das Unternehmen steht, und wie du dazu beitragen könntest. Das hebt dich von anderen Bewerbern ab und zeigt, dass du wirklich motiviert bist.