Auf einen Blick
- Aufgaben: Entwickle innovative Komprimierungsmethoden und integriere sie in unsere Pipeline.
- Unternehmen: Führendes Unternehmen im Bereich angewandte Forschung mit Fokus auf maschinelles Lernen.
- Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitsmodelle und Unterstützung bei Umzügen.
- Weitere Informationen: Dynamisches Team mit Möglichkeiten zur beruflichen Weiterentwicklung und internationaler Zusammenarbeit.
- Warum dieser Job: Gestalte die Zukunft der KI durch praktische Anwendungen und echte Auswirkungen.
- Qualifikationen: PhD in Informatik oder verwandten Bereichen und Erfahrung in der Produktion von Python-Code.
Das prognostizierte Gehalt liegt zwischen 100 - 100 € pro Stunde.
Dies ist eine angewandte Forschungsrolle. Sie entwickeln neue Kompressionsmethoden und setzen diese um, anstatt darüber zu schreiben. Der Zyklus ist kurz: Literatur lesen, Prototyp erstellen, auf realen Modellen benchmarken, in unsere Pipeline integrieren, mit Kunden iterieren, die komprimierte Modelle in der Produktion verwenden. Sie werden von Anfang an einen erheblichen technischen Umfang besitzen. Erwarten Sie, über den gesamten Stack hinweg zu arbeiten: Pruning-Algorithmen, Quantisierung, Evaluierungsinfrastruktur und der Produktionscode, den Kunden tatsächlich verwenden.
Woran Sie arbeiten werden:
- Verbesserung und Erweiterung unseres strukturellen Pruning-Algorithmus für neue Architekturen (MoE, multimodal, vision-language)
- Kombination von Pruning mit Quantisierung (NVFP4/FP8/INT4, sub-4 bit mixed precision) in unserer Kompressionspipeline
- Erweiterung und Verbesserung unserer Modell-Retraining-Pipeline (SFT, GKD, DPO, GRPO)
- Komprimierung von Kundenmodellen (Llama, Qwen, Gemma und proprietäre Feinabstimmungen) für Cloud- und Edge-Bereitstellungen
- Hardwarebewusste Optimierung für verschiedene Beschleunigerziele (A100/H100/B300 und Edge-Hardware)
Was wir suchen:
- PhD in Informatik, maschinellem Lernen oder gleichwertig
- Veröffentlichte Arbeiten zu Quantisierung, Pruning oder LLM-Training
- Produktionsreifer Python-Code (nicht nur Jupyter-Notebooks). Sie schreiben Code, den andere lesen und ausführen können
- Erfahrung darin, eine Methode von einem Papier zu einem funktionierenden System auf realen Modellen zu bringen
- Komfort im Umgang mit LLMs, GPUs und der Bewertung von Benchmarks
- Sie liefern ab. Sie beenden Dinge.
Bonus:
- Open-Source-Beiträge zur ML-Infrastruktur (vLLM, llama.cpp, transformers, TensorRT-LLM, bitsandbytes, GPTQ/AWQ-Implementierungen)
- Erfahrung mit MoE-Architekturen oder multimodalen Modellen (Qwen Omni)
- Hintergrund in der Kernel-Optimierung
Praktisch:
- Standort Wien. Hybrid oder vollständig remote
- Arbeitssprache ist Englisch
- Wir sponsern Visa und unterstützen Umzüge
- Wir verlangen keine Veröffentlichungen, unterstützen jedoch die Präsentation von Arbeiten an geeigneten Orten, wenn es zum Unternehmen und zum Projekt passt
Applied Research Scientist — Model Compression Arbeitgeber: Ora Computing
Als Arbeitgeber bieten wir Ihnen die Möglichkeit, in einem dynamischen und innovativen Umfeld zu arbeiten, in dem Ihre Ideen und Beiträge von Anfang an geschätzt werden. Unsere Unternehmenskultur fördert Zusammenarbeit und kontinuierliches Lernen, während wir Ihnen durch flexible Arbeitsmodelle und Unterstützung bei der Relocation eine ausgewogene Work-Life-Balance ermöglichen. Bei uns haben Sie die Chance, an spannenden Projekten zu arbeiten und Ihre Fähigkeiten in der angewandten Forschung weiterzuentwickeln, während Sie Teil eines engagierten Teams in Wien sind.