Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d)

Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d)

Vollzeit 81000 - 99000 € / Jahr (geschätzt) Kein Homeoffice möglich
W

Auf einen Blick

  • Aufgaben: Entwickle und besitze die Evaluierungsplattform für KI-Qualität im Rechtsbereich.
  • Unternehmen: Innovatives Unternehmen im Rechtssektor, unterstützt von einem globalen Marktführer.
  • Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und ein kreatives Arbeitsumfeld.
  • Weitere Informationen: Dynamisches Team in Berlin mit großartigen Wachstumschancen.
  • Warum dieser Job: Gestalte die Zukunft der Rechtsberatung mit modernster KI-Technologie.
  • Qualifikationen: Mindestens 5 Jahre Erfahrung in der Softwareentwicklung, idealerweise mit LLM-Produkten.

Das prognostizierte Gehalt liegt zwischen 81000 - 99000 € pro Jahr.

About Us

There are hundreds of thousands of lawyers across Europe, and at Libra we're transforming how they work.

Our AI platform combines deep legal reasoning with cutting-edge generative technology, fundamentally changing how lawyers research, draft, and deliver legal work.

We operate with the speed and ownership of a startup, while being backed by the scale and stability of an established leader.

Libra is an independent business unit within the Legal & Regulatory division of Wolters Kluwer, a leading global provider of information, software, and services for professionals.

For 180 years, Wolters Kluwer has supported and simplified the work of experts and organizations through innovative solutions, relying today on more than 20,000 colleagues worldwide to bring that vision to life.

About The Role

As an Evals Engineer (m/w/d) at Libra, you'll be the first dedicated hire on a new team that owns how we measure quality: the datasets, rubrics, judges and harnesses that decide whether an AI feature is good enough to ship, and the automated optimization that runs against them.

Optimizing a system against a target is newly automatable: LLM optimizers like GEPA now propose and test the candidates themselves.

Nobody has to invent the experiments any more, and the system will improve in whatever direction the evals point, whether or not that's where you meant to go.

That makes defining what good means the highest-leverage work we do, and it has to be done task by task, from scratch, for a legal AI platform at European scale.

You'll work in a lean, agile environment with AI Engineers, Legal Engineers and Product, based at the vibrant Merantix AI Campus in Berlin, surrounded by a community of AI innovators.

What you'll do

  • Build and own the eval platform: datasets, judges, harnesses, regression gates, cost and quality in one view, on Python , Fast API and Langfuse .

Make it self-service, so AI Engineers can evaluate and tune their own features without going through you, and eval-driven development becomes the most effective path rather than a tax.

  • Map the quality landscape: good means something different for research, drafting, summarisation and retrieval, and again per jurisdiction.

Work out what a defensible measure looks like for each, going first on the ones nobody has evaluated before and then making them repeatable without you.

  • Design the rubrics and set the standard for LLM-as-judge: turn Legal Engineers' and subject-matter experts' judgment into version-controlled criteria, keep judges recalibrated as models and jurisdictions change, and make authoring cheap enough to do at volume on privileged material.
  • Deep-dive results and traces until you can say why something failed, then find the lever that moves it and automate the fix.
  • Unhobble the optimizer: instrument the app so prompts, hyperparameters and harness architecture become levers a search can safely pull, then run automated optimization (GEPA, DSPy) over them against a fitness function you trust, widening that surface as you go.
  • Make cheaper models win: treat quality per euro as a first-class metric, instrumented per call, and find the configuration where a smaller model matches or beats an expensive one.
  • Own guardrails: ungrounded advice, invented or misattributed citations, jurisdiction and language leakage, prompt injection from ingested documents.

Design them, red-team them, prove they hold.

What you'll bring

Education

  • Bachelor's degree or equivalent in a relevant technical field (e. g. Computer Science, Software Engineering, Statistics, Data Science); advanced degree is a plus.

Experience

  • Minimum 5 years in software engineering, at least 1 building LLM-powered products in production .
  • Strong Python : Fast API , modern tooling, and the data stack (pandas, numpy, notebooks), because much of this job is analysis.
  • Hands-on experience designing evaluations : datasets, rubrics, LLM-as-judge, benchmarking, human labelling.
  • Solid security and data-privacy practice. You'll handle traces, documents and datasets derived from privileged legal material.
  • AI coding agents (Claude Code, Codex, Cursor) in your daily workflow.
  • Genuine interest in the legal domain.
  • Bonus
  • automated prompt or pipeline optimization (GEPA, DSPy or similar), and a broader data science toolkit, e. g. embedding clustering to check dataset coverage.

Skills

A strong engineer who hasn't hand-written code in months .

The architecture is yours, the typing isn't.

You ship more working software than you ever did alone, reject code that runs but is shaped wrong, and leave less rework and cognitive debt behind you.

You think in systems and expect them to be gamed .

The app, the evals, the optimizer and the people using them are one loop.

Once evals gate releases, everything optimizes toward them, so some judgments stay human.

Hard to fool by a single number . "Could these all be within variance?" comes before any ranking, and a judge's reliability before you trust its grades. You repor

#J-18808-Ljbffr

Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d) Arbeitgeber: wk

Als Arbeitgeber bietet Registered Agent Solutions Inc. - Wolters Kluwer eine dynamische und unterstützende Arbeitsumgebung, die auf Teamarbeit und individuellem Wachstum basiert. Mit hybriden Arbeitsmodellen und der Möglichkeit, in einem Netzwerk von Büros landesweit zu arbeiten, fördern wir eine ausgewogene Work-Life-Balance und bieten zahlreiche Weiterbildungsmöglichkeiten. Unsere Unternehmenskultur legt Wert auf offene Kommunikation und Kundenorientierung, was es unseren Mitarbeitern ermöglicht, bedeutende Beziehungen aufzubauen und einen echten Einfluss auf den Erfolg unserer Kunden zu haben.

W

Kontaktdaten:

wk Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d) erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei wk anzuklopfen, wenn du dich auf die Stelle als Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d) bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei wk vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior AI Evals Engineer (AI Quality & Safety) - Libra-Legal AI Assistant (m/w/d) mit Bravour zu bestehen

Python
FastAPI
Datenanalyse
Entwicklung von Evaluierungen
Datensätze
Rubriken
LLM-as-Judge

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei wk klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei wk vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.