Auf einen Blick
- Aufgaben: Entwickle und trainiere Belohnungsmodelle aus großflächigen menschlichen Präferenzdaten.
- Unternehmen: Innovatives Startup, das die Datenannotation revolutioniert.
- Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen, flexible Arbeitszeiten und persönliche Entwicklung.
- Weitere Informationen: Dynamische Startup-Kultur mit tollen Wachstumschancen und einem inspirierenden Arbeitsplatz in Zürich.
- Warum dieser Job: Gestalte die Zukunft der KI mit realem Einfluss auf innovative Projekte.
- Qualifikationen: Erfahrung in der Forschung zu Belohnungsmodellen und fundierte Kenntnisse in Reinforcement Learning.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Rapidata bietet eine API für Menschen, die die Daten-Generierung und -Annotation revolutioniert. Wir liefern hoch skalierbares, extrem schnelles menschliches Feedback, das die KI-Systeme der Zukunft antreibt – und zwar in Echtzeit für führende KI-Labore. Unser Netzwerk erreicht über 20 Millionen aktive Annotatoren in 192 Ländern, verteilt Mikrotasks („Rapids“) und liefert verifizierte Labels nahezu in Echtzeit.
Wir suchen einen Reward Model Research Engineer, um die Belohnungsmodelle zu entwerfen, zu trainieren und in Produktion zu bringen, die Rapidatas Echtzeit-Menschenfeedback in hochwertige Trainingssignale für RLHF und DPO umwandeln. Dies ist eine Rolle von der Forschung bis zur Produktion: Sie arbeiten an den Modellierungsproblemen, die bestimmen, ob rauschhafte, groß angelegte menschliche Präferenzdaten ein zuverlässiges Belohnungssignal werden – einschließlich Prozessbelohnungsmodellen (PRMs), die mehrstufiges Denken bewerten, anstatt nur Endergebnisse.
Sie schließen die Lücke zwischen unserer Infrastruktur zur Datensammlung mit Menschen im Loop und den Belohnungsmodellen, die sie nutzen, und beschäftigen sich mit der Generalisierung über Generator-Modelle, Robustheit gegenüber Annotator-Rauschen und Inferenzzeit-Leittechniken wie Best-of-N und Beam Search – und validieren Ihre Modelle dann in einem Live-System, das global skaliert.
Was Sie tun werden
- Entwerfen, trainieren und bewerten von Belohnungsmodellen – einschließlich Prozessbelohnungsmodellen (PRMs) – aus groß angelegten menschlichen Präferenzdaten
- Aufbauen und Verbessern von Inferenzzeit-Leitmethoden wie Best-of-N-Sampling und Beam Search, um die belohnungsgeführte Generierung robuster zu machen
- Entwickeln von Trainingsaufbauten, die die Generalisierung über verschiedene Generator-/Politikmodelle verbessern (z.B. Multi-Student-Stil PRM-Training)
- Übersetzen von Forschungsarbeiten zur Belohnungsmodellierung in produktionsbereite Pipelines, die direkt in Rapidatas RLHF/DPO-Datenflywheel integriert werden
- Zusammenarbeiten mit dem Datenplattform-Team, um Strategien zur Datensammlung und aktives Lernen zu entwerfen, die Engpässe beim Training von Belohnungsmodellen reduzieren
- Streng benchmarken von Belohnungsmodellen auf Genauigkeit, Robustheit und Zuverlässigkeit vor der Bereitstellung
- Finden klar sowohl technischen als auch nicht-technischen Stakeholdern, einschließlich Partner-KI-Labore, zu kommunizieren
Was wir suchen
- Praktische Forschungserfahrung im Aufbau von Belohnungsmodellen oder Prozessbelohnungsmodellen (PRMs) für LLMs, idealerweise durch eine MSc/PhD-Arbeit oder gleichwertige angewandte Forschung
- Solides Verständnis der Grundlagen des Reinforcement Learning und der RLHF/DPO-Trainingspipelines
- Praktische Erfahrung mit Inferenzzeit-Leittechniken (Best-of-N, Beam Search) und der Bewertung von mehrstufigem Denken
- Starke Python- und Deep-Learning-Framework-Fähigkeiten (PyTorch)
- Erfahrung in der Umsetzung von Forschungsprototypen in validierte, produktionsbereite Systeme
- Solide statistische und mathematische Grundlagen
- Ausgezeichnete Englischkenntnisse in Wort und Schrift
Nice-to-Have
- Erfahrung mit sicherheitsrelevanten agentischen Systemen, Schutzvorrichtungen oder LLM-basierten Tool-Calling-Agenten
- Veröffentlichungen oder Open-Source-Beiträge in der Belohnungsmodellierung, im Denken oder im Reinforcement Learning
- Erfahrung mit hierarchischem oder modellbasiertem RL
- In Zürich ansässig oder bereit, dorthin umzuziehen
Was wir bieten
- Wettbewerbsfähiges Gehalt und Eigenkapital in einem Startup mit starkem Wachstum, IP und Unterstützung durch erstklassige VCs
- Die Möglichkeit, frühzeitig in ein schnell wachsendes Startup einzutreten, mit einer großen Chance, die Richtung des Unternehmens mitzugestalten
- Chancen für persönliche und berufliche Entwicklung, während unser Team wächst
- Eine unterhaltsame und offene (Startup-)Kultur
- Geräumiges Büro mit Bergblick im Zentrum von Zürich, nahe Sihlcity (3 Minuten vom Bahnhof Binz entfernt), mit großer Terrasse, Tischtennis, Pizzaofen, Hängematte und Grill
- Hardware-Budget, das auf Ihre Vorlieben zugeschnitten ist
- Unbegrenzte Snacks und Getränke nach Wahl
Reward Model Research Engineer Arbeitgeber: Next Matter
Bei Rapidata bieten wir eine dynamische und innovative Arbeitsumgebung, in der Sie als Senior Systems Engineer die Möglichkeit haben, komplexe Systeme zu gestalten und zu optimieren. Unsere Unternehmenskultur fördert Kreativität und Eigenverantwortung, während wir gleichzeitig auf kontinuierliches Lernen und persönliche Entwicklung setzen. Mit einem engagierten Team und modernsten Technologien sind wir bestrebt, die Brücke zwischen künstlicher und menschlicher Intelligenz zu schlagen und dabei einen bedeutenden Einfluss auf Millionen von Menschen auszuüben.