Auf einen Blick
- Aufgaben: Verwalte den technischen Release-Pfad von Apertus-Modellen und integriere sie in die Open-Source-Community.
- Unternehmen: Führende technische Universität mit Zugang zu einem der größten KI-fähigen Supercomputer Europas.
- Vorteile: Attraktive Anstellungsbedingungen, flexible Arbeitszeiten und umfassende Weiterbildungsmöglichkeiten.
- Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrieremöglichkeiten und der Chance, an national bedeutender Technologie zu arbeiten.
- Warum dieser Job: Arbeite an bahnbrechenden KI-Projekten und trage zur Open-Source-Entwicklung bei.
- Qualifikationen: Starke Python-Kenntnisse und Erfahrung in der Softwareentwicklung sowie im Umgang mit LLM-Inferenzstacks.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Wir suchen einen erfahrenen Ingenieur, der den technischen Veröffentlichungsweg der Apertus-Modelle verantwortet. Der ideale Kandidat wird Apertus in das Open-Source-Inferenz-Ökosystem integrieren, quantisierte Varianten erstellen und sicherstellen, dass jede Veröffentlichung sofort für die Community funktioniert. Diese Rolle erfordert starke Python- und Softwareengineering-Fähigkeiten, Erfahrung mit LLM-Inferenz-Stacks und eine nachweisliche Erfolgsbilanz bei Open-Source-Beiträgen.
Projekt Hintergrund: Wir trainieren offene Grundmodelle mit Hunderten von Milliarden von Parametern auf Tausenden von GPUs auf einem der größten AI-fähigen Supercomputer in Europa. Das Team besteht aus mehr als einem Dutzend Vollzeitingenieuren, die eng mit führenden Forschern von EPFL und ETH Zürich zusammenarbeiten, hat die Modelle Apertus 1 und Apertus 1.5 veröffentlicht und arbeitet mit über dreißig akademischen Partnern zusammen, um vollständig offene (Open Source), verantwortungsvoll trainierte, mehrsprachige, multimodale KI-Modelle für Forschung und Industrie bereitzustellen. Apertus wird auf Alps, der Supercomputing-Infrastruktur des Schweizerischen Nationalen Supercomputing-Zentrums (CSCS), trainiert und entwickelt.
Diese Rolle befindet sich an der Schnittstelle zwischen dem Trainingsteam und der Open-Source-Community: Die soziale Seite des Community-Engagements wird von unserem Community-Manager übernommen, während diese Rolle den technischen Veröffentlichungsweg verantwortet. Der Ingenieur wird sicherstellen, dass Apertus-Veröffentlichungen im gesamten Open-Source-LLM-Ökosystem sofort funktionieren, von serverbasierten Inferenzlösungen bis hin zu persönlichen Bereitstellungen.
- Upstream-Integration und Release-Engineering: Verwalten Sie den technischen Veröffentlichungsweg der trainierten Apertus-Modelle: Checkpoint-Konvertierung und Vorbereitung von Veröffentlichungsartefakten (Gewichte, Konfigurationen, Tokenizer, Modellkarten) zusammen mit dem Trainingsteam.
- Implementieren und unterstützen Sie Apertus-Modellarchitekturen in Community-Bibliotheken wie Hugging Face Transformers, vLLM, SGLang und llama.cpp und begleiten Sie diese Beiträge durch die Überprüfung, damit die Unterstützung durch die Community gewährleistet ist.
- Überprüfen Sie die Kompatibilität neuer Veröffentlichungen mit den wichtigsten Inferenz-Engines und Modellformaten.
- Koordinieren Sie den Veröffentlichungszeitpunkt und technische Materialien mit dem Community-Manager.
- Quantisierung: Erstellen Sie quantisierte Varianten veröffentlichter Modelle (z.B. FP8, INT4/AWQ/GPTQ, GGUF), die für Server- und persönliche Bereitstellungen geeignet sind.
- Validieren Sie quantisierte Varianten anhand von Evaluierungsbenchmarks, um sicherzustellen, dass die Qualität erhalten bleibt.
- Dokumentation und Beispiele: Stellen Sie Beispielskripte und Referenzkonfigurationen bereit, die zeigen, wie man Apertus-Modelle mit vLLM, SGLang und Transformers bedient und verwendet.
- Unterstützen Sie persönliche und lokale Bereitstellungsökosysteme wie LM Studio, Ollama und llama.cpp.
- Pflegen Sie die Bereitstellungsdokumentation und Fehlersuche-Leitfäden für die Community.
Profil:
- MSc oder PhD in Informatik, Datenwissenschaft, künstlicher Intelligenz, maschinellem Lernen oder einem verwandten Bereich.
- Außergewöhnliche BSc-Kandidaten mit starker Ingenieurerfahrung werden ebenfalls berücksichtigt.
- Starke Python- und Softwareengineering-Fähigkeiten, einschließlich Erfahrung mit Open-Source-Beitragsabläufen (Pull-Requests, Code-Review, CI).
- Erfahrung mit LLM-Inferenz-Stacks wie Hugging Face Transformers, vLLM oder SGLang.
- Starke Zusammenarbeit und Kommunikationsfähigkeiten sowie die Fähigkeit, in Forschungs-, Ingenieur- und communityorientierten Teams zu arbeiten.
- Praktische Erfahrung in den Kernbereichen dieser Rolle ist erforderlich. Dies kann projekt- oder studienbasiert sein; formale Berufserfahrung wird bevorzugt.
- Ein hohes Maß an Flexibilität: Prioritäten, Werkzeuge und tägliche Aufgaben ändern sich mit Trainingsplänen, Veröffentlichungen und einem sich schnell bewegenden Feld.
- Eine nachweisliche Erfolgsbilanz bei zusammengeführten Beiträgen zu ML- oder Inferenzbibliotheken (z.B. Transformers, vLLM, SGLang, llama.cpp) ist stark bevorzugt.
- Erfahrung in der Konvertierung von Modellen zwischen Formaten und Frameworks (z.B. Megatron-LM-Checkpoints, safetensors, GGUF).
- Vertrautheit mit persönlichen und lokalen Bereitstellungstools wie LM Studio, Ollama oder llama.cpp.
- Erfahrung im Schreiben von entwicklerorientierter Dokumentation und Beispielcode.
Nice to have:
- Veröffentlichte Forschung in den für diese Rolle relevanten Bereichen oder Vertrautheit mit kürzlich veröffentlichter Forschung zu diesen Themen.
- Erfahrung in der Quantisierung von Modellen ohne Leistungsabfall (FP8, INT4, AWQ, GPTQ) und der Bewertung quantisierter Modelle.
- Erfahrung mit LLM-Evaluierungswerkzeugen und Benchmark-Pipelines.
- Vertrautheit mit der GPU-Inferenzleistungsoptimierung und dem Betrieb in großem Maßstab.
- Erfahrung mit Apple Silicon / MLX oder anderen Inferenzzielen für Verbraucherhardware.
Wir bieten:
- Ein anregendes akademisches Umfeld an einer der weltweit führenden technischen Universitäten.
- Zugang zu Alps, einem der größten AI-fähigen Supercomputer in Europa.
- Die Möglichkeit, mit führenden Forschern auf diesem Gebiet zusammenzuarbeiten und sich mit ihnen auszutauschen.
- Zusammenarbeit mit Top-Forschern und Ingenieuren von EPFL, ETH Zürich, CSCS und anderen Schweizer Institutionen.
- Attraktive Arbeitsbedingungen und umfassende Vorteile, einschließlich der Pensionspläne von ETH Zürich/EPFL.
- Flexible Arbeitszeiten, einschließlich Optionen für Remote-Arbeit.
- Berufliche Entwicklungsmöglichkeiten, einschließlich Teilnahme an Konferenzen und spezialisierter Schulungen.
- Die Chance, zu Open-Source-Projekten mit globaler Wirkung beizutragen.
- Teil der souveränen KI-Entwicklung der Schweiz zu sein und an Technologien mit nationaler Bedeutung zu arbeiten.
Im Einklang mit unseren Werten fördert die ETH Zürich eine inklusive Kultur. Wir setzen uns für Chancengleichheit ein, schätzen Vielfalt und pflegen ein Arbeits- und Lernumfeld, in dem die Rechte und die Würde aller Mitarbeiter und Studierenden respektiert werden. Nachhaltigkeit ist ein Kernwert für uns – wir arbeiten kontinuierlich auf eine klimaneutrale Zukunft hin.
Apertus Engineer: Deployment Arbeitgeber: Eidgenössische Technische Hochschule Zürich
Als Software Research & Development Engineer bei ETH Zürich profitieren Sie von einer inspirierenden und kollaborativen Arbeitsumgebung in einer weltweit anerkannten Forschungseinrichtung. Wir bieten spannende Herausforderungen, vielfältige Projekte und die Möglichkeit, Ihre Fähigkeiten weiterzuentwickeln, während Sie an der Schnittstelle zwischen Forschung, Technik und Betrieb arbeiten. Unsere Kultur fördert Vielfalt und Inklusion, und wir setzen uns aktiv für eine nachhaltige Zukunft ein.
Kontaktdaten:
Eidgenössische Technische Hochschule Zürich Recruiting-Team