Auf einen Blick
- Aufgaben: Entwickle und trainiere Belohnungsmodelle für KI-Trainingsdaten.
- Unternehmen: Innovatives Startup, das die Datenannotation revolutioniert.
- Vorteile: Wettbewerbsfähiges Gehalt, Aktienoptionen und ein kreatives Arbeitsumfeld.
- Weitere Informationen: Spaßige Unternehmenskultur mit tollen Büros und unbegrenzten Snacks.
- Warum dieser Job: Gestalte die Zukunft der KI mit realen Anwendungen und wachsendem Einfluss.
- Qualifikationen: Erfahrung in der Forschung zu Belohnungsmodellen und starke Python-Kenntnisse.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Über Rapidata
Rapidata bietet eine API für Menschen, die die Branche der Datengenerierung und -annotation revolutioniert. Wir liefern hochgradig skalierbares, extrem schnelles menschliches Feedback, das die KI-Systeme der Zukunft antreibt und die Sammlung von Trainingsdaten für RLHF und DPO mit Internetgeschwindigkeit für führende KI-Labore ermöglicht. Unser Netzwerk erreicht über 20 Millionen aktive Annotatoren in 192 Ländern, verteilt Mikrotasks ("Rapids") und liefert verifizierte Labels in nahezu Echtzeit.
Die Rolle
Wir suchen einen Reward Model Research Engineer, um die Belohnungsmodelle zu entwerfen, zu trainieren und in die Produktion zu bringen, die neben Rapidatas Echtzeit-Menschenfeedback für qualitativ hochwertige Trainingssignale für RLHF und DPO arbeiten. Dies ist eine Forschungs-zu-Produktion-Rolle: Sie werden an den Modellierungsproblemen arbeiten, die bestimmen, ob rauschhafte, großangelegte menschliche Präferenzdaten ein zuverlässiges Belohnungssignal werden, einschließlich Prozessbelohnungsmodellen (PRMs), die mehrstufiges Denken bewerten. Sie schließen die Schleife zwischen unserer Dateninfrastruktur mit Menschen im Loop und den Belohnungsmodellen, die sie konsumieren und begleiten, und beschäftigen sich mit der Generalisierung über Generatormodelle, Robustheit gegenüber Annotatorrauschen und Techniken zur Anleitung in der Inferenzzeit, bevor Sie Ihre Modelle in einem Live-System validieren, das global skaliert.
Was Sie tun werden
- Entwerfen, trainieren und bewerten von Belohnungsmodellen, einschließlich Prozessbelohnungsmodellen (PRMs), aus großangelegten menschlichen Präferenzdaten
- Aufbauen und Verbessern von Methoden zur Anleitung in der Inferenzzeit, um die belohnungsgeführte Generierung robuster zu machen
- Entwickeln von Trainingsaufbauten, die die Generalisierung über verschiedene Generator-/Politikmodelle verbessern
- Übersetzen von Forschungsarbeiten zur Belohnungsmodellierung in produktionsbereite Pipelines, die direkt in Rapidatas RLHF/DPO-Datenflywheel integriert werden
- Zusammenarbeiten mit dem Datenplattform-Team, um Strategien zur Datensammlung und aktives Lernen zu entwerfen, die Engpässe beim Training von Belohnungsmodellen reduzieren
- Streng benchmarken von Belohnungsmodellen auf Genauigkeit, Robustheit und Zuverlässigkeit vor der Bereitstellung
- Finden klar sowohl technischen als auch nicht-technischen Stakeholdern, einschließlich Partner-KI-Labors, kommunizieren
Was wir suchen
- Praktische Forschungserfahrung im Aufbau von Belohnungsmodellen für LLMs oder Diffusionsmodelle, idealerweise durch eine MSc/PhD-Arbeit oder gleichwertige angewandte Forschung
- Solides Verständnis der Grundlagen des Reinforcement Learning und der RLHF/DPO-Trainingspipelines
- Praktische Erfahrung mit Techniken zur Anleitung in der Inferenzzeit und der Bewertung von mehrstufigem Denken
- Starke Python- und Deep-Learning-Framework-Fähigkeiten (PyTorch)
- Erfahrung in der Umwandlung von Forschungsprototypen in validierte, produktionsbereite Systeme
- Solide statistische und mathematische Grundlagen
- Exzellente Englischkenntnisse in Wort und Schrift
Nice-to-Have
- Erfahrung mit sicherheitsrelevanten agentischen Systemen, Schutzvorrichtungen oder LLM-basierten Tool-Calling-Agenten
- Veröffentlichungen oder Open-Source-Beiträge in der Belohnungsmodellierung, im Denken oder im Reinforcement Learning
- Erfahrung mit hierarchischem oder modellbasiertem RL
- In Zürich ansässig oder bereit, dorthin umzuziehen
Was wir bieten
- Wettbewerbsfähiges Gehalt und Eigenkapital in einem Startup mit starkem Wachstum, IP und Unterstützung von erstklassigen VCs
- Die Möglichkeit, frühzeitig in einem schnell wachsenden Startup einzusteigen, mit einer überproportionalen Chance, die Richtung des Unternehmens zu gestalten
- Chancen für persönliche und berufliche Entwicklung, während unser Team wächst
- Eine unterhaltsame und offene (Startup-)Kultur
- Geräumiges Büro mit Bergblick in der Nähe von Sihlcity, Zürich, mit Terrasse, Tischtennis, Pizzaofen, Hängematte und Grill
- Hardware-Budget, das auf Ihre Vorlieben zugeschnitten ist
- Unbegrenzte Snacks und Getränke Ihrer Wahl
Reward Model Research Engineer Arbeitgeber: Rapidata AG
Rapidata ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, an der Spitze der Daten- und KI-Industrie zu arbeiten. Mit einem wettbewerbsfähigen Gehalt, Beteiligungen an einem schnell wachsenden Start-up und einer offenen Unternehmenskultur fördern wir persönliches und berufliches Wachstum in einem inspirierenden Umfeld mit Blick auf die Berge in Zürich. Genießen Sie eine Vielzahl von Annehmlichkeiten, darunter unbegrenzte Snacks, ein großzügiges Büro und die Chance, die Zukunft der KI aktiv mitzugestalten.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Reward Model Research Engineer erhalten könntest
✨Wende dich an die richtigen Communities
Schau dir Online-Communities und Foren an, die sich um Data Science drehen, wie Kaggle oder GitHub. Engagiere dich dort aktiv, teile deine Projekte und lerne von anderen – das wird dir helfen, nicht nur einen Fuß in die Tür zu bekommen, sondern auch wertvolle Kontakte zu knüpfen.
✨Präsentiere deine Daten-Projekte
Baue ein Portfolio auf, das deine besten Projekte zeigt. Nutze Plattformen wie GitHub oder eine persönliche Webseite, um deine Arbeiten zu veröffentlichen. Arbeitgeber im Data Science-Bereich schauen oft direkt auf praktische Erfahrungen, also zeig, was du drauf hast!
✨Nimm an Meetups und Hackathons teil
Besuche lokale Data Science-Meetups oder nehme an Hackathons teil. Diese Veranstaltungen sind nicht nur super, um dein Wissen zu erweitern, sondern auch Gold wert für Networking. Du lernst Fachkollegen kennen und kannst auf Lockere Art und Weise Eventualjobs ergattern.
✨Direkte Bewerbungen über unsere Seite
Vergiss nicht, direkt auf unserer Website nach Stellenangeboten bei Rapidata AG zu schauen. Hier kannst du dich auf offene Datenwissenschaftsstellen bewerben und zeigst damit direktes Interesse, das viele Arbeitgeber schätzen!
Wir glauben, dass du diese Fähigkeiten brauchst, um Reward Model Research Engineer mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Lass deine Daten sprechen!:In einem Bereich wie Data Science ist es entscheidend, dass du deine praktischen Fähigkeiten präsentierst. Wenn du an Projekten gearbeitet hast, die deine Analysefähigkeiten oder dein Wissen über Machine Learning demonstrieren, teile sie in deinem Lebenslauf oder füge einen Link zu deinem GitHub-Portfolio bei. Die Daten, die du analysiert hast, und die Tools, die du verwendest, sollten klar hervorgehoben werden.
Ergebnisse quantifizieren!:Unterstütze deine Erfahrung mit quantifizierbaren Ergebnissen. Zeige, wie du durch deine Analysen oder Modelle zur Entscheidungsfindung beigetragen hast oder wie deine Berechnungen den Rohdaten neue Erkenntnisse entlockt haben. Arbeitgeber in der Data Science sind oft an konkreten Verbesserungen und Effizienzsteigerungen interessiert!
Erläutere deine Lernbereitschaft!:Da es sich um eine Vollzeitstelle handelt, zeige in deinem Anschreiben, dass du bereit bist, zu lernen und dich weiterzuentwickeln. Sprich über deine Neugier für neue Technologien oder Methoden im Data Science Bereich. Vielleicht hast du auch Kurse besucht oder Zertifikate erworben, die deine Begeisterung zeigen!
Die richtige technische Sprache!:Achte darauf, dass deine Bewerbung alle relevanten technischen Begriffe enthält, die in der Data Science gebräuchlich sind. Nenne spezifische Programmier- und Analysetools wie Python, R oder SQL, die du beherrschst. Dies macht es für die Rekrutierer einfacher, schnell zu erkennen, dass du für die Rolle als Reward Model Research Engineer bei Rapidata AG gut geeignet bist.
Wie man sich auf ein Vorstellungsgespräch bei Rapidata AG vorbereitet
✨Bereite deine technischen Skills vor
In einem Vorstellungsgespräch für eine Data-Science-Position wird oft dein Wissen über Tools wie Python, R oder SQL getestet. Mach dich mit gängigen Algorithmen und deren Einsatzmöglichkeiten vertraut, denn technische Fragen können schnell kommen. Lass uns sicherstellen, dass du in diesen Bereichen glänzt!
✨Verschaffe dir einen Überblick über Projekte
Da es sich um eine Vollzeitstelle handelt, ist es wichtig, dass du konkrete Erfahrungen und Projekte vorweisen kannst. Wenn du bereits an Data-Science-Projekten gearbeitet hast, sei bereit, diese in der Tiefe zu erläutern und zu diskutieren, wie du die Probleme gelöst hast. Dein Portfolio kann hier einen echten Unterschied machen!
✨Vorbereitung auf case studies
In Data-Science-Interviews sind case studies und praktische Probleme häufig Teil des Gesprächs. Übe, wie du strukturiert und logisch an solche Aufgaben herangehst. Arbeitgeber möchten sehen, wie du Daten analysierst und Lösungen entwickelst – bring also deine analytischen Fähigkeiten mit!
✨Zeige deine Leidenschaft für Daten
Mehr denn je geht es bei einer Vollzeitstelle darum, dass du nicht nur die Skills hast, sondern auch wirklich für das Feld brennst. Teile Anekdoten oder Erfahrungen, die zeigen, wie du zur Datenwissenschaft gekommen bist und was dich fasziniert. Diese Begeisterung kann für Rapidata AG entscheidend sein!