Reward Model Research Engineer

Reward Model Research Engineer

Zürich Vollzeit 60000 - 80000 € / Jahr (geschätzt) Vor Ort
R

Auf einen Blick

  • Aufgaben: Entwickle und trainiere Belohnungsmodelle für KI-Trainingsdaten.
  • Unternehmen: Innovatives Startup, das die Datenannotation revolutioniert.
  • Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen und ein kreatives Arbeitsumfeld.
  • Weitere Informationen: Spaßige Unternehmenskultur mit tollen Büros und unbegrenzten Snacks.
  • Warum dieser Job: Gestalte die Zukunft der KI mit realen Anwendungen und wachsendem Einfluss.
  • Qualifikationen: Erfahrung in der Forschung zu Belohnungsmodellen und starke Python-Kenntnisse.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Über Rapidata

Rapidata bietet eine API für Menschen, die die Branche der Datengenerierung und -annotation revolutioniert. Wir liefern hochgradig skalierbares, extrem schnelles menschliches Feedback, das die KI-Systeme der Zukunft antreibt und die Sammlung von Trainingsdaten für RLHF und DPO mit Internetgeschwindigkeit für führende KI-Labore ermöglicht. Unser Netzwerk erreicht über 20 Millionen aktive Annotatoren in 192 Ländern, verteilt Mikrotasks ("Rapids") und liefert verifizierte Labels in nahezu Echtzeit.

Die Rolle

Wir suchen einen Reward Model Research Engineer, um die Belohnungsmodelle zu entwerfen, zu trainieren und in die Produktion zu bringen, die neben Rapidatas Echtzeit-Menschenfeedback für qualitativ hochwertige Trainingssignale für RLHF und DPO arbeiten. Dies ist eine Forschungs-zu-Produktion-Rolle: Sie werden an den Modellierungsproblemen arbeiten, die bestimmen, ob rauschhafte, großangelegte menschliche Präferenzdaten ein zuverlässiges Belohnungssignal werden, einschließlich Prozessbelohnungsmodellen (PRMs), die mehrstufiges Denken bewerten. Sie schließen die Schleife zwischen unserer Dateninfrastruktur mit Menschen im Loop und den Belohnungsmodellen, die sie konsumieren und begleiten, und beschäftigen sich mit der Generalisierung über Generatormodelle, Robustheit gegenüber Annotatorrauschen und Techniken zur Anleitung in der Inferenzzeit, bevor Sie Ihre Modelle in einem Live-System validieren, das global skaliert.

Was Sie tun werden

  • Entwerfen, trainieren und bewerten von Belohnungsmodellen, einschließlich Prozessbelohnungsmodellen (PRMs), aus großangelegten menschlichen Präferenzdaten
  • Aufbauen und Verbessern von Methoden zur Anleitung in der Inferenzzeit, um die belohnungsgeführte Generierung robuster zu machen
  • Entwickeln von Trainingsaufbauten, die die Generalisierung über verschiedene Generator-/Politikmodelle verbessern
  • Übersetzen von Forschungsarbeiten zur Belohnungsmodellierung in produktionsbereite Pipelines, die direkt in Rapidatas RLHF/DPO-Datenflywheel integriert werden
  • Zusammenarbeiten mit dem Datenplattform-Team, um Strategien zur Datensammlung und aktives Lernen zu entwerfen, die Engpässe beim Training von Belohnungsmodellen reduzieren
  • Streng benchmarken von Belohnungsmodellen auf Genauigkeit, Robustheit und Zuverlässigkeit vor der Bereitstellung
  • Finden klar sowohl technischen als auch nicht-technischen Stakeholdern, einschließlich Partner-KI-Labors, kommunizieren

Was wir suchen

  • Praktische Forschungserfahrung im Aufbau von Belohnungsmodellen für LLMs oder Diffusionsmodelle, idealerweise durch eine MSc/PhD-Arbeit oder gleichwertige angewandte Forschung
  • Solides Verständnis der Grundlagen des Reinforcement Learning und der RLHF/DPO-Trainingspipelines
  • Praktische Erfahrung mit Techniken zur Anleitung in der Inferenzzeit und der Bewertung von mehrstufigem Denken
  • Starke Python- und Deep-Learning-Framework-Fähigkeiten (PyTorch)
  • Erfahrung in der Umwandlung von Forschungsprototypen in validierte, produktionsbereite Systeme
  • Solide statistische und mathematische Grundlagen
  • Exzellente Englischkenntnisse in Wort und Schrift

Nice-to-Have

  • Erfahrung mit sicherheitsrelevanten agentischen Systemen, Schutzvorrichtungen oder LLM-basierten Tool-Calling-Agenten
  • Veröffentlichungen oder Open-Source-Beiträge in der Belohnungsmodellierung, im Denken oder im Reinforcement Learning
  • Erfahrung mit hierarchischem oder modellbasiertem RL
  • In Zürich ansässig oder bereit, dorthin umzuziehen

Was wir bieten

  • Wettbewerbsfähiges Gehalt und Eigenkapital in einem Startup mit starkem Wachstum, IP und Unterstützung von erstklassigen VCs
  • Die Möglichkeit, frühzeitig in einem schnell wachsenden Startup einzusteigen, mit einer überproportionalen Chance, die Richtung des Unternehmens zu gestalten
  • Chancen für persönliche und berufliche Entwicklung, während unser Team wächst
  • Eine unterhaltsame und offene (Startup-)Kultur
  • Geräumiges Büro mit Bergblick in der Nähe von Sihlcity, Zürich, mit Terrasse, Tischtennis, Pizzaofen, Hängematte und Grill
  • Hardware-Budget, das auf Ihre Vorlieben zugeschnitten ist
  • Unbegrenzte Snacks und Getränke Ihrer Wahl

Reward Model Research Engineer Arbeitgeber: Rapidata AG

Rapidata ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, an der Spitze der Daten- und KI-Industrie zu arbeiten. Mit einem wettbewerbsfähigen Gehalt, Beteiligungen an einem schnell wachsenden Start-up und einer offenen Unternehmenskultur fördern wir persönliches und berufliches Wachstum in einem inspirierenden Umfeld mit Blick auf die Berge in Zürich. Genießen Sie eine Vielzahl von Annehmlichkeiten, darunter unbegrenzte Snacks, ein großzügiges Büro und die Chance, die Zukunft der KI aktiv mitzugestalten.

R

Kontaktdaten:

Rapidata AG Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Reward Model Research Engineer mit Bravour zu bestehen

Entwicklung von Belohnungsmodellen
Reinforcement Learning Grundlagen
RLHF/DPO Trainingspipelines
Inference-Time Guidance Techniken
Bewertung von mehrstufigem Denken
Python Programmierkenntnisse
Deep Learning Frameworks (PyTorch)