Staff Research Engineer – Multimodal Generative Modelling

Staff Research Engineer – Multimodal Generative Modelling

Vollzeit 80000 - 100000 € / Jahr (geschätzt) Hybrid
S

Auf einen Blick

  • Aufgaben: Entwickle innovative multimodale Modelle für interaktive Sprach- und Videoanwendungen.
  • Unternehmen: Synthesia, führende KI-Videoplattform mit über 90% der Fortune 100 als Kunden.
  • Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und die Möglichkeit, an bahnbrechenden Projekten zu arbeiten.
  • Weitere Informationen: Dynamisches Team mit exzellenten Wachstumschancen in einem innovativen Umfeld.
  • Warum dieser Job: Gestalte die Zukunft der Kommunikation mit modernster Technologie und mache einen echten Unterschied.
  • Qualifikationen: Erfahrung in generativen Modellen und starke Programmierkenntnisse in PyTorch.

Das prognostizierte Gehalt liegt zwischen 80000 - 100000 € pro Jahr.

Synthesia ist die weltweit führende KI-Video-Plattform für Unternehmen, die von über 90 % der Fortune 100 genutzt wird. Das Unternehmen wurde 2017 gegründet und hat seinen Hauptsitz in London, mit Büros und Teams in ganz Europa und den USA. Synthesia entwickelt Produkte, um die visuelle Kommunikation und die Entwicklung von Unternehmensfähigkeiten zu verbessern, damit Menschen besser arbeiten und im Mittelpunkt erfolgreicher Organisationen stehen können.

Über die Rolle

Synthesias langfristige Vision ist es, die besten menschlich-interaktiven Modelle zu entwickeln: Systeme, die nicht nur mit Menschen sprechen, sondern sie auch wahrnehmen und auf sie reagieren, indem sie auf die Aktionen und Emotionen eines Benutzers reagieren, nicht nur auf deren Worte. Heute verlassen sich über 60.000 Unternehmen auf unsere Plattform, und der nächste Schritt in dem, was wir ihnen anbieten können, hängt von Modellen ab, die Text, Audio und Video in ein einziges interaktives Erlebnis in Echtzeit kombinieren.

Als Staff Research Engineer werden Sie Teil des Voice-Teams innerhalb unserer über 40 Personen umfassenden F&E-Abteilung, aber Ihr Aufgabenbereich wird weit über die Stimme hinausgehen. Sie helfen dabei, diese breitere Vision über Teams hinweg zu definieren und voranzutreiben, schlagen ehrgeizige Forschungsrichtungen vor und übernehmen die direkte Verantwortung für das Design und die Implementierung der kritischsten Komponenten.

Was Sie tun werden:

  • Gestalten Sie unseren Fahrplan zur Schaffung neuer Modellfähigkeiten und zur Freischaltung neuer Funktionen für unsere Kundenbasis, sowohl auf kurzen als auch auf langen Zeitrahmen.
  • Schlagen Sie neuartige multimodale Systemarchitekturen (insbesondere Text und Stimme) vor.
  • Entwickeln und bewerten Sie Streaming- und Gesprächssysteme für latenzinteraktive Sprach-Video-Synthese.
  • Entwerfen Sie Lösungen, die emotionale Ausdruckskraft und natürliche Interaktion verstärken.
  • Implementieren und bringen Sie Designs zum Leben, vom Pretraining bis zum Post-Training.
  • Integrieren und testen Sie neuartige Architekturen (neuronale Codecs, Diffusion, Flow-Matching), um Realismus und Reaktionsfähigkeit zu verbessern.
  • Definieren Sie neue Bewertungsmetriken für Gesprächssysteme, einschließlich latenzbewusster und interaktionsbasierter Messungen.
  • Verfolgen Sie die neuesten Forschungen in audio-visueller Diffusion, autoregressiven Modellen, neuronalen Codecs und multimodalen LLMs.
  • Kuratieren Sie neue Datensätze zur Ergänzung vorhandener Daten.
  • Leiten Sie Post-Training-Initiativen wie DPO, Feinabstimmung und Destillation, um Modelle in Produktionsqualität zu bringen.
  • Stellen Sie Modelle mit optimierter Laufzeit zur Verfügung, um Kunden zu bedienen, und gehen Sie anschließend auf deren Feedback ein.

Sie werden in dieser Rolle erfolgreich sein, wenn Sie:

  • Die Fähigkeit haben, neuartige Ideen und Designs einzubringen, die das Feld der interaktiven multimodalen Systeme voranbringen.
  • Ein starkes Verständnis für generative Modellierung haben, idealerweise angewendet auf sequenzielle oder multimodale Daten.
  • Praktische Erfahrung mit großen Sprachmodellen oder ähnlichen transformer-basierten Architekturen haben.
  • Eine hohe Kompetenz in PyTorch besitzen, einschließlich verteiltem Training und Modelloptimierung.
  • Ein solides Verständnis von Zeitreihenmodellierung und Tokenisierung haben, vorzugsweise im Kontext von Audio, Sprache oder Video.
  • Eine nachgewiesene Fähigkeit haben, schnell Prototypen zu erstellen, Hypothesen zu testen und effizient zu iterieren.
  • Erwiesene Erfahrung im Training von Deep-Learning-Modellen von Anfang bis Ende haben, von der Datenvorbereitung bis zur Bewertung.
  • Starke allgemeine Software-Engineering-Fähigkeiten besitzen, die Beiträge zu einer großen, gemeinsamen Forschungsinfrastruktur ermöglichen.

Besonders relevante Erfahrungen:

  • Ein generatives Modell in ein Live-Produkt implementiert haben, das in bedeutendem Maßstab verwendet wird, nicht nur veröffentlicht oder prototypisiert.
  • An Gesprächs- oder interaktiven Systemen gearbeitet haben, bei denen Latenz, Reaktionsfähigkeit und Benutzererfahrung erste Klasse waren, nicht nachträglich.
  • An LLMs mit großflächigen Trainings gearbeitet haben, die zu Modellen mit anständigen Denkfähigkeiten führten.
  • Ein Forschungsproblem von Anfang bis Ende besessen haben: von der Architekturvorschlag über Pretraining, Post-Training und Produktionsbereitstellung.
  • Übergreifend mit Modalitäten oder Teams (z.B. Audio und Video oder Forschung und Produkt) zusammengearbeitet haben, um ein einheitliches System zu liefern.

Bonuspunkte für:

  • Erfahrung mit Echtzeit- oder Streaming-Architekturen.
  • Vertrautheit mit modernen Architekturen in der Audio- und Sprachgenerierung, wie z.B. Diffusionsmodelle, neuronale Codecs, Flow-Matching-Modelle oder autoregressive Decoder.
  • Exzellenz in einer oder mehreren der folgenden Modalitäten: Stimme, Text, Video.
  • Nachweis von originären Forschungsbeiträgen, wie Publikationen oder Open-Source-Arbeiten an erstklassigen Veranstaltungsorten (z.B. NeurIPS, CVPR, ICML, ICLR, Interspeech).

Staff Research Engineer – Multimodal Generative Modelling Arbeitgeber: Synthesia

Synthesia ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einer starken Unternehmenskultur, die Kreativität und Zusammenarbeit fördert, sowie umfangreichen Wachstums- und Entwicklungsmöglichkeiten, ist dies der ideale Ort für Fachleute, die ihre Karriere im Bereich der Entwicklerbeziehungen vorantreiben möchten. Die vollständig remote Arbeitsweise ermöglicht es Ihnen, flexibel zu arbeiten und gleichzeitig Teil eines globalen Teams zu sein, das an der Spitze der KI-Technologie steht.

S

Kontaktdaten:

Synthesia Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Staff Research Engineer – Multimodal Generative Modelling mit Bravour zu bestehen

Generative Modelling
Multimodale Systemarchitekturen
Voice-zu-Voice Modelle
Interaktive Sprach-Video-Synthese
Neural Codecs
Diffusionsmodelle
Flow-Matching Modelle