VLM Research Engineer (m/f/d)

VLM Research Engineer (m/f/d)

Berlin Vollzeit 60000 - 80000 € / Jahr (geschätzt) Kein Homeoffice möglich
Almetra

Auf einen Blick

  • Aufgaben: Entwickle vision-language Modelle für Videoverständnis und baue Produktionspipelines.
  • Unternehmen: Innovatives Unternehmen im Bereich KI mit einer unterstützenden Kultur.
  • Vorteile: Mitarbeiteraktienoptionen, flexible Arbeitszeiten und Team-Retreats.
  • Weitere Informationen: Flache Hierarchien und ein diverses Team aus über 10 Nationalitäten.
  • Warum dieser Job: Sei an der Spitze der KI-Entwicklung in der Fertigung und mache echten Einfluss.
  • Qualifikationen: PhD oder gleichwertige Erfahrung in Computer Vision oder maschinellem Lernen.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Wir suchen einen Research Engineer, der die Grenzen von Vision-Language-Modellen für das Verständnis von Videos in der realen Welt erweitert. Sie werden an angewandten, hochmodernen multimodalen Modellen arbeiten und diese in Produktionspipelines umwandeln, die von Kunden genutzt werden.

Ihre Rolle:

  • Entwerfen und Anpassen von Vision-Language- und Videomodellen für Szenenverständnis, zeitliche Schlussfolgerungen und Aktivitäts-/Handlungskennung
  • Aufbauen und Pflegen von großangelegten Trainings- und Evaluierungspipelines auf GPU-Clustern
  • Kuratieren und Erweitern von Video-Text- und Aktionsdatensätzen, einschließlich synthetischer Labels und retrieval-basierter Augmentierung
  • Entwickeln robuster Benchmarks für Video-QA, Befolgen von Anweisungen und zeitliches Verständnis und diese zur iterativen Verbesserung von Modellen nutzen
  • Modellarchitekturen für Effizienz und Bereitstellung optimieren (Kompression, Pruning, Distillation)
  • Bereitstellen produktionsbereiter Inferenzpipelines für Produkt- und Kunden-Teams, enge Zusammenarbeit mit CV-, Plattform- und Robotik-Ingenieuren

Sie bringen mit:

  • Abgeschlossenes PhD (oder gleichwertige Forschungserfahrung) in Computer Vision, Machine Learning, Robotik oder einem verwandten Bereich
  • Starker Hintergrund im videozentrierten Deep Learning: Szenenverständnis, zeitliche/aktivitäts-/handlungsbezogene Erkennung oder Videoerzeugung
  • Erfahrung im Training und Anpassen großer Vision- oder VLM-Modelle (z.B. InternVL, Qwen-VL, DeepSeek-VL, ähnliche Stacks)
  • Nachgewiesene Arbeit mit Multi-GPU-Training (PyTorch, verteilt, gemischte Präzision) und großangelegten Datensätzen
  • Solide Ingenieurgewohnheiten: sauberer Python-Code, reproduzierbare Experimente, zuverlässige Daten- und Trainingspipelines
  • Erfahrung darin, Forschung in nutzbare Systeme (Demos, interne Tools oder produktisierte Funktionen) in schnelllebigen Teams zu überführen

Nice to have:

  • Veröffentlichungen in erstklassigen Fachzeitschriften (CVPR, ICCV, ECCV, NeurIPS, ICLR usw.) zu Video, multimodalem Lernen oder Szenenverständnis
  • Erfahrung mit 3D/4D-Szenenrepräsentationen, Aktionsgenerierung oder Projekten im Stil von embodied/sense-plan-act
  • Optimierung der Inferenz: Quantisierung, TensorRT, Modell-Distillation oder Bereitstellung auf eingeschränkter Hardware
  • Frühere Erfahrung in einem Startup oder einer angewandten Forschungsumgebung

Was wir bieten:

  • Employee Share Options Program für alle unbefristeten Mitarbeiter*
  • Eine wachsende Liste von Vorteilen: derzeit umfasst sie den Urban Sports Club und vierteljährliche Team-Retreats.
  • Seien Sie an vorderster Front dabei, wenn es darum geht, was künstliche Intelligenz in der Fertigung bedeutet
  • Praktische Erfahrung in einem AI-first Softwareunternehmen sammeln
  • Unterstützende und inklusive Kultur, die Vielfalt schätzt und die Förderung unterrepräsentierter Gruppen innerhalb des Unternehmens vorantreibt
  • Zusammenarbeit mit einem vielfältigen (derzeit mehr als 10 Nationalitäten) und talentierten Team, das an bahnbrechenden Projekten mit realer Auswirkung arbeitet
  • Vernetzen mit Fachleuten und Führungskräften auf dem Gebiet, was Türen zu potenziellen zukünftigen Karrieremöglichkeiten öffnet
  • Wir haben eine sehr flache Hierarchie, offenes 360° Feedback und flexible Arbeitszeiten

Ethik: Wir setzen uns dafür ein, ethische KI-Software zu entwickeln.

Haben Sie nicht alle Anforderungen erfüllt? Almetra setzt sich dafür ein, einen Arbeitsplatz zu schaffen, der vielfältig, fair und inklusiv ist. Wir ermutigen Kandidaten aus allen Hintergründen, auch wenn sie nicht jede Qualifikation erfüllen, sich zu bewerben. Wir sind fest davon überzeugt, dass ein Team mit unterschiedlichen Perspektiven unser Unternehmen nur stärkt und Innovationen vorantreibt. Unser Engagement erstreckt sich auch auf die Schaffung einer barrierefreien Umgebung für alle, einschließlich Menschen mit Behinderungen. Bitte lassen Sie uns wissen, ob Sie während des Bewerbungsprozesses oder während der Zusammenarbeit mit uns Unterstützung benötigen, und wir werden unser Bestes tun, um Sie zu unterstützen.

*Nur Vollzeit- und unbefristete Stellen sind für Aktienoptionen berechtigt. Teilzeitstellen, Vertragsstellen, Werkstudenten, Praktika und freiberufliche Stellen sind nicht für Aktienoptionen berechtigt.

VLM Research Engineer (m/f/d) Arbeitgeber: Almetra

Almetra ist ein hervorragender Arbeitgeber, der Ihnen die Möglichkeit bietet, an der Spitze der KI-gestützten Fertigungstechnologie zu arbeiten. Mit einem klaren Karrierepfad zum Account Executive innerhalb von 12-15 Monaten und einer unterstützenden, inklusiven Unternehmenskultur, die Vielfalt schätzt, fördern wir das Wachstum unserer Mitarbeiter. Genießen Sie flexible Arbeitszeiten, ein flaches Hierarchiemodell und die Chance, mit einem talentierten, internationalen Team an Projekten mit echtem Einfluss zu arbeiten.

Almetra

Kontaktdaten:

Almetra Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um VLM Research Engineer (m/f/d) mit Bravour zu bestehen

Computer Vision
Machine Learning
Robotics
Video-centric Deep Learning
Scene Understanding
Temporal Reasoning
Activity Recognition