Apertus Engineer: Deployment

Apertus Engineer: Deployment

Vollzeit 80000 - 100000 € / Jahr (geschätzt) Kein Homeoffice möglich
I

Auf einen Blick

  • Aufgaben: Verwalte den technischen Release-Pfad von Apertus-Modellen und integriere sie in die Open-Source-Community.
  • Unternehmen: Führende technische Universität mit Zugang zu einem der größten AI-fähigen Supercomputer Europas.
  • Vorteile: Attraktive Anstellungsbedingungen, flexible Arbeitszeiten und umfassende Weiterbildungsmöglichkeiten.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrieremöglichkeiten und Zusammenarbeit mit führenden Forschern.
  • Warum dieser Job: Arbeite an bahnbrechenden KI-Projekten und trage zur Open-Source-Entwicklung bei.
  • Qualifikationen: MSc oder PhD in Informatik oder verwandten Bereichen; starke Python-Kenntnisse erforderlich.

Das prognostizierte Gehalt liegt zwischen 80000 - 100000 € pro Jahr.

Wir suchen einen erfahrenen Ingenieur, der den technischen Veröffentlichungsweg der Apertus-Modelle verantwortet. Der ideale Kandidat wird Apertus in das Open-Source-Inferenz-Ökosystem integrieren, quantisierte Varianten erstellen und sicherstellen, dass jede Veröffentlichung sofort für die Community funktioniert.

Diese Rolle erfordert starke Python- und Softwareengineering-Fähigkeiten, Erfahrung mit LLM-Inferenz-Stacks und eine nachweisliche Erfolgsbilanz bei Open-Source-Beiträgen.

Projekt Hintergrund

Wir trainieren offene Grundmodelle mit Hunderten von Milliarden von Parametern auf Tausenden von GPUs auf einem der größten AI-bereiten Supercomputer in Europa. Das Team besteht aus mehr als einem Dutzend Vollzeitingenieuren, die eng mit führenden Forschern von EPFL und ETH Zürich zusammenarbeiten, hat die Modelle Apertus 1 und Apertus 1.5 veröffentlicht und arbeitet mit über dreißig akademischen Partnern zusammen, um vollständig offene, verantwortungsvoll trainierte, mehrsprachige, multimodale KI-Modelle für Forschung und Industrie bereitzustellen. Apertus wird auf Alps, der Supercomputing-Infrastruktur des Schweizerischen Nationalen Supercomputing-Zentrums (CSCS), trainiert und entwickelt.

Diese Rolle befindet sich an der Schnittstelle zwischen dem Trainingsteam und der Open-Source-Community: Die soziale Seite des Community-Engagements wird von unserem Community-Manager übernommen, während diese Rolle den technischen Veröffentlichungsweg verantwortet.

Aufgabenbeschreibung

  • Der Ingenieur wird sicherstellen, dass Apertus-Veröffentlichungen im gesamten Open-Source-LLM-Ökosystem sofort funktionieren, von serverbasierten Inferenzlösungen bis hin zu persönlichen Bereitstellungen.
  • Verwaltung des technischen Veröffentlichungsweges von trainierten Apertus-Modellen: Checkpoint-Konvertierung und Vorbereitung von Veröffentlichungsartefakten (Gewichte, Konfigurationen, Tokenizer, Modellkarten) zusammen mit dem Trainingsteam.
  • Implementierung und Unterstützung von Apertus-Modellarchitekturen in Community-Bibliotheken wie Hugging Face Transformers, vLLM, SGLang und llama.cpp sowie Begleitung dieser Beiträge durch den Überprüfungsprozess, damit die Unterstützung durch die Community gewährleistet ist.
  • Überprüfung der Kompatibilität neuer Veröffentlichungen mit den wichtigsten Inferenz-Engines und Modellformaten.
  • Koordination des Veröffentlichungszeitpunkts und technischer Materialien mit dem Community-Manager.
  • Produktion quantisierter Varianten von veröffentlichten Modellen (z.B. FP8, INT4/AWQ/GPTQ, GGUF) geeignet für Server- und persönliche Bereitstellungen.
  • Validierung quantisierter Varianten anhand von Evaluierungsbenchmarks, um sicherzustellen, dass die Qualität erhalten bleibt.
  • Bereitstellung von Beispielskripten und Referenzkonfigurationen, die zeigen, wie man Apertus-Modelle mit vLLM, SGLang und Transformers bereitstellt und verwendet.
  • Unterstützung persönlicher und lokaler Bereitstellungsökosysteme wie LM Studio, Ollama und llama.cpp.
  • Pflege der Bereitstellungsdokumentation und Troubleshooting-Leitfäden für die Community.

Profil

  • Essentieller MSc oder PhD in Informatik, Datenwissenschaft, Künstlicher Intelligenz, Maschinellem Lernen oder einem verwandten Bereich.
  • Außergewöhnliche BSc-Kandidaten mit starker Ingenieurerfahrung werden ebenfalls berücksichtigt.
  • Starke Python- und Softwareengineering-Fähigkeiten, einschließlich Erfahrung mit Open-Source-Beitragsabläufen (Pull-Requests, Code-Review, CI).
  • Erfahrung mit LLM-Inferenz-Stacks wie Hugging Face Transformers, vLLM oder SGLang.
  • Starke Zusammenarbeit und Kommunikationsfähigkeiten sowie die Fähigkeit, in forschungs-, ingenieur- und communityorientierten Teams zu arbeiten.
  • Praktische Erfahrung in den Kernbereichen dieser Rolle ist erforderlich, dies kann projekt- oder studienbasiert sein; formale Berufserfahrung wird bevorzugt.
  • Ein hohes Maß an Flexibilität: Prioritäten, Werkzeuge und tägliche Aufgaben ändern sich mit Trainingsplänen, Veröffentlichungen und einem sich schnell bewegenden Feld.
  • Eine nachweisliche Erfolgsbilanz bei zusammengeführten Beiträgen zu ML- oder Inferenzbibliotheken (z.B. Transformers, vLLM, SGLang, llama.cpp) ist stark bevorzugt.
  • Erfahrung in der Konvertierung von Modellen zwischen Formaten und Frameworks (z.B. Megatron-LM-Checkpoints, safetensors, GGUF).
  • Vertrautheit mit persönlichen und lokalen Bereitstellungstools wie LM Studio, Ollama oder llama.cpp.
  • Erfahrung im Schreiben von entwicklerorientierter Dokumentation und Beispielcode.

Nice to have

  • Veröffentlichte Forschung in den für diese Rolle relevanten Bereichen oder Vertrautheit mit kürzlich veröffentlichter Forschung zu diesen Themen.
  • Erfahrung in der Quantisierung von Modellen ohne Leistungsabfall (FP8, INT4, AWQ, GPTQ) und der Bewertung quantisierter Modelle.
  • Erfahrung mit LLM-Evaluierungswerkzeugen und Benchmark-Pipelines.
  • Vertrautheit mit der GPU-Inferenzleistungsoptimierung und dem Betrieb in großem Maßstab.
  • Erfahrung mit Apple Silicon / MLX oder anderen Verbraucher-Hardware-Inferenzzielen.

Wir bieten

  • Ein anregendes akademisches Umfeld an einer der weltweit führenden technischen Universitäten.
  • Zugang zu Alps, einem der größten AI-bereiten Supercomputer in Europa.
  • Die Möglichkeit, mit führenden Forschern auf diesem Gebiet zusammenzuarbeiten und sich mit ihnen auszutauschen.
  • Zusammenarbeit mit Top-Forschern und Ingenieuren von EPFL, ETH Zürich, CSCS und anderen Schweizer Institutionen.
  • Attraktive Arbeitsbedingungen und umfassende Vorteile, einschließlich der Pensionspläne von ETH Zürich/EPFL.
  • Flexible Arbeitsbedingungen, einschließlich Optionen für Remote-Arbeit.
  • Berufliche Entwicklungsmöglichkeiten, einschließlich Teilnahme an Konferenzen und spezialisierter Schulungen.
  • Die Chance, zu Open-Source-Projekten mit globaler Wirkung beizutragen.
  • Teil der souveränen KI-Entwicklung der Schweiz zu sein und an Technologien mit nationaler Bedeutung zu arbeiten.
  • Die Rolle kann entweder in Lausanne an der EPFL oder in Zürich an der ETH Zürich angesiedelt sein.

Apertus Engineer: Deployment Arbeitgeber: Immigration Policy Lab

Die Immigration Policy Lab in Zürich ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, in einem dynamischen und unterstützenden Umfeld zu arbeiten. Unsere Forschungsstation Früebüel fördert nicht nur Ihre berufliche Weiterentwicklung durch gezielte Schulungen und Workshops, sondern bietet auch attraktive Vorteile wie ÖV-Abonnemente und Car Sharing, um Ihre Work-Life-Balance zu unterstützen. Werden Sie Teil eines engagierten Teams, das sich leidenschaftlich für innovative landwirtschaftliche Lösungen einsetzt.

I

Kontaktdaten:

Immigration Policy Lab Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Apertus Engineer: Deployment mit Bravour zu bestehen

Python
Software Engineering
Open-Source Contribution Workflows
LLM Inference Stacks
Hugging Face Transformers
vLLM
SGLang