Reward Model Research Engineer

Reward Model Research Engineer

Vollzeit 60000 - 80000 € / Jahr (geschätzt) Kein Homeoffice möglich
R

Auf einen Blick

  • Aufgaben: Entwickle und trainiere Belohnungsmodelle für KI-Trainingsdaten.
  • Unternehmen: Innovatives Startup im Bereich Datenannotation mit starkem Wachstum.
  • Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen, Hardware-Budget und unbegrenzte Snacks.
  • Weitere Informationen: Offene Unternehmenskultur mit tollen Wachstumschancen und einem inspirierenden Arbeitsumfeld.
  • Warum dieser Job: Gestalte die Zukunft der KI mit realen Anwendungen und wachsendem Einfluss.
  • Qualifikationen: Erfahrung in der Forschung zu Belohnungsmodellen und starke Python-Kenntnisse.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Rapidata bietet eine API für Menschen, die die Daten-Generierung und -Annotation revolutioniert. Wir liefern hoch skalierbares, extrem schnelles menschliches Feedback, das die KI-Systeme der Zukunft antreibt und die Datensammlung für RLHF und DPO in Internetgeschwindigkeit für führende KI-Labore ermöglicht. Unser Netzwerk erreicht über 20 Millionen aktive Annotatoren in 192 Ländern, verteilt Mikrotasks ("Rapids") und liefert verifizierte Labels in nahezu Echtzeit.

Wir suchen einen Reward Model Research Engineer, um die Reward-Modelle zu entwerfen, zu trainieren und in Produktion zu bringen, die mit Rapidatas Echtzeit-Mensch-Feedback für qualitativ hochwertige Trainingssignale für RLHF und DPO zusammenarbeiten. Dies ist eine Forschungs-zu-Produktion-Rolle: Sie werden an den Modellierungsproblemen arbeiten, die bestimmen, ob rauschhafte, groß angelegte menschliche Präferenzdaten ein zuverlässiges Belohnungssignal werden, einschließlich Prozessbelohnungsmodellen (PRMs), die mehrstufiges Denken bewerten.

Sie werden die Verbindung zwischen unserer Mensch-in-der-Schleife-Datensammel-Infrastruktur und den Belohnungsmodellen, die sie konsumieren und begleiten, schließen, wobei Sie die Generalisierung über Generator-Modelle, Robustheit gegenüber Annotator-Rauschen und Inferenzzeit-Leittechniken angehen und Ihre Modelle in einem Live-System validieren, das global skaliert.

Was Sie tun werden:

  • Entwerfen, trainieren und bewerten von Belohnungsmodellen, einschließlich Prozessbelohnungsmodellen (PRMs), aus groß angelegten menschlichen Präferenzdaten
  • Aufbauen und Verbessern von Inferenzzeit-Leitmethoden, um die belohnungsgeführte Generierung robuster zu machen
  • Entwickeln von Trainingsaufbauten, die die Generalisierung über verschiedene Generator-/Politikmodelle verbessern
  • Übersetzen von Forschungsarbeiten zur Belohnungsmodellierung in produktionsbereite Pipelines, die direkt in Rapidatas RLHF/DPO-Datenflywheel integriert werden
  • Zusammenarbeiten mit dem Datenplattform-Team, um Datensammel- und aktives Lernstrategien zu entwerfen, die Engpässe beim Training von Belohnungsmodellen reduzieren
  • Streng Benchmarking von Belohnungsmodellen auf Genauigkeit, Robustheit und Zuverlässigkeit vor der Bereitstellung
  • Finden klar sowohl technischen als auch nicht-technischen Stakeholdern, einschließlich Partner-KI-Labors, kommunizieren

Was wir suchen:

  • Praktische Forschungserfahrung im Aufbau von Belohnungsmodellen für LLMs oder Diffusionsmodelle, idealerweise durch eine MSc/PhD-Arbeit oder gleichwertige angewandte Forschung
  • Solides Verständnis der Grundlagen des Reinforcement Learning und der RLHF/DPO-Trainingspipelines
  • Praktische Erfahrung mit Inferenzzeit-Leittechniken und der Bewertung von mehrstufigem Denken
  • Starke Python- und Deep-Learning-Framework-Fähigkeiten (PyTorch)
  • Erfahrung bei der Umwandlung von Forschungsprototypen in validierte, produktionsbereite Systeme
  • Solide statistische und mathematische Grundlagen
  • Exzellente Kommunikationsfähigkeiten in Englisch, sowohl mündlich als auch schriftlich

Nice-to-Have:

  • Erfahrung mit agentischen Systemsicherheit, Schutzvorrichtungen oder LLM-basierten Tool-Calling-Agenten
  • Veröffentlichungen oder Open-Source-Beiträge in der Belohnungsmodellierung, im Denken oder im Reinforcement Learning
  • Erfahrung mit hierarchischem oder modellbasiertem RL
  • In Zürich ansässig oder bereit, dorthin umzuziehen

Was wir bieten:

  • Wettbewerbsfähiges Gehalt und Eigenkapital in einem Startup mit starkem Wachstum, IP und Unterstützung von erstklassigen VCs
  • Die Möglichkeit, frühzeitig einem schnell wachsenden Startup beizutreten, mit einer überproportionalen Chance, die Richtung des Unternehmens zu gestalten
  • Chancen für persönliche und berufliche Entwicklung, während unser Team wächst
  • Eine unterhaltsame und offene (Startup-)Kultur
  • Geräumiges Büro mit Bergblick in der Nähe von Sihlcity, Zürich, mit Terrasse, Tischtennis, Pizzaofen, Hängematte und Grill
  • Hardware-Budget, das auf Ihre Vorlieben zugeschnitten ist
  • Unbegrenzte Snacks und Getränke Ihrer Wahl

Reward Model Research Engineer Arbeitgeber: Rapidata AG

Rapidata ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, in einem dynamischen und schnell wachsenden Start-up-Umfeld zu arbeiten. Mit einem wettbewerbsfähigen Gehalt, Eigenkapitalbeteiligung und einer offenen Unternehmenskultur fördern wir persönliches und berufliches Wachstum. Unser modernes Büro in Zürich mit Blick auf die Berge und zahlreichen Annehmlichkeiten sorgt dafür, dass Sie sich wohlfühlen und kreativ arbeiten können.

R

Kontaktdaten:

Rapidata AG Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Reward Model Research Engineer mit Bravour zu bestehen

Belohnungsmodellierung
Reinforcement Learning Grundlagen
RLHF/DPO Trainingspipelines
Inference-Zeit Steuerungstechniken
Multi-Step Reasoning
Python
Deep Learning Frameworks (PyTorch)