AI Research Engineer (Model Compression & Quantization)

AI Research Engineer (Model Compression & Quantization)

Vollzeit 60000 - 80000 € / Jahr (geschätzt) Homeoffice
T

Auf einen Blick

  • Aufgaben: Entwickle innovative Kompressionstechniken für multimodale KI-Systeme.
  • Unternehmen: Führendes Unternehmen im Bereich KI-Forschung mit Fokus auf Effizienz.
  • Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und Möglichkeiten zur beruflichen Weiterentwicklung.
  • Weitere Informationen: Dynamisches Team mit exzellenten Wachstumschancen in einem spannenden Forschungsumfeld.
  • Warum dieser Job: Gestalte die Zukunft der KI mit und arbeite an bahnbrechenden Projekten.
  • Qualifikationen: Abschluss in Informatik oder verwandtem Bereich, idealerweise mit Promotion.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Als Mitglied unseres KI-Forschungsteams werden Sie Innovationen in der Modellkompression und effizienten Bereitstellung für fortschrittliche multimodale KI-Systeme vorantreiben, einschließlich großer Sprachmodelle (LLMs) und Bild-Sprach-Modelle (VLMs). Ihre Arbeit wird sich darauf konzentrieren, den Modellfußabdruck und die Rechenkosten zu reduzieren, während die Genauigkeit erhalten bleibt, um leistungsstarke KI effizient auf ressourcenbeschränkten Edge-Geräten auszuführen.

Sie werden Kompressionstechniken wie Quantisierung, Wissensdistillation und Pruning anwenden und weiterentwickeln, um komplexe multimodale Architekturen zu optimieren, die Text, Bilder und Audio integrieren. Wir erwarten von Ihnen tiefgehende Expertise in Methoden zur Modellkompression und einen starken Hintergrund in multimodalen Modellarchitekturen.

Sie werden einen praktischen, forschungsgetriebenen Ansatz verfolgen, um neuartige Kompressionsstrategien zu entwickeln, zu testen und umzusetzen, die Modellgröße, Latenz, Durchsatz und Genauigkeit in Einklang bringen. Ihre Aufgaben umfassen den Aufbau robuster Kompressionspipelines, die Festlegung von Leistungs- und Treuekennzahlen sowie die Behebung von Engpässen in der Produktionsinferenz.

Das ultimative Ziel ist es, skalierbare, speichereffiziente und latenzarme KI-Systeme auf Edge-Geräten (d.h. Smartphones) bereitzustellen, die hohe Treue und greifbaren realen Wert erhalten.

Verantwortlichkeiten:

  • Wenden Sie Low-Bit-Quantisierung an, um die Modellgröße und die Inferenzlatenz für generative KI-Modelle (LLMs, VLMs, multimodal) zu reduzieren, während Genauigkeit und Ausgabequalität erhalten bleiben.
  • Nutzen Sie Wissensdistillation, um Fähigkeiten von größeren Lehrermodellen auf kleinere Schülermodelle zu übertragen und effizientes multimodales Denken über Text-, Bild- und Audioeingaben zu ermöglichen.
  • Implementieren Sie Pruning-Techniken, um redundante Parameter und Aufmerksamkeitsköpfe zu entfernen, wodurch der Rechenaufwand reduziert wird, ohne die Aufgabenleistung zu beeinträchtigen.
  • Analysieren Sie die Trade-offs zwischen Modelleffizienz (Größe, Latenz, Speicher) und Genauigkeit über Quantisierungs-, Distillations- und Pruning-Methoden; schlagen Sie Verbesserungen basierend auf empirischen Ergebnissen vor.
  • Führen Sie Forschung und Anwendung von gemischter Präzisionsquantisierung und anderen fortschrittlichen Kompressionsstrategien durch (z.B. adaptive Pruning-Zeitpläne, Distillation mit Zwischenmerkmalsabgleich), um das Gleichgewicht zwischen Genauigkeit und Leistung zu optimieren.
  • Bleiben Sie über die neuesten Forschungen zur Modellkompression informiert, einschließlich neuer Techniken für multimodale und generative Architekturen.
  • Dokumentieren Sie Methoden, Experimente und Ergebnisse klar, um Reproduzierbarkeit, interne Zusammenarbeit und Kommunikation mit Stakeholdern zu unterstützen.
  • Verfassen Sie technische Arbeiten und veröffentlichen Sie Ergebnisse auf erstklassigen Konferenzen (z.B. NeurIPS, ICML, ICLR, CVPR, ACL, AAAI), um das Feld der Modellkompression für multimodale KI voranzutreiben.

Qualifikationen:

  • Ein Abschluss in Informatik oder einem verwandten Bereich.
  • Idealerweise ein PhD in NLP, Maschinellem Lernen oder einem verwandten Bereich, ergänzt durch eine solide Erfolgsbilanz in der KI-Forschung.

AI Research Engineer (Model Compression & Quantization) Arbeitgeber: Tether Operations Limited

Consor ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern in Zürich eine inspirierende Arbeitsumgebung bietet, in der Innovation und Teamarbeit im Vordergrund stehen. Mit einem klaren Fokus auf persönliche und berufliche Weiterentwicklung sowie einer positiven Unternehmenskultur, die Vielfalt und Kreativität fördert, ermöglicht Consor seinen Mitarbeitern, an bedeutenden Projekten im Gesundheitswesen zu arbeiten und echte Veränderungen zu bewirken.

T

Kontaktdaten:

Tether Operations Limited Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um AI Research Engineer (Model Compression & Quantization) mit Bravour zu bestehen

Modellkompression
Quantisierung
Wissenstransfer
Pruning-Techniken
Multimodale Modellarchitekturen
Leistungsmetriken
Fidelity-Metriken