Auf einen Blick
- Aufgaben: Entwickle die Evaluierungsengine für agentische KI und baue vertrauenswürdige Bewertungsmethoden.
- Unternehmen: Resaro, ein unabhängiges Unternehmen für KI-Sicherheit mit innovativen Lösungen.
- Vorteile: Wettbewerbsfähiges Gehalt, flexible Arbeitszeiten und Möglichkeiten zur beruflichen Weiterentwicklung.
- Weitere Informationen: Dynamisches Team mit Fokus auf innovative Technologien und Karrierewachstum.
- Warum dieser Job: Gestalte die Zukunft der KI-Evaluierung und arbeite an spannenden, realen Herausforderungen.
- Qualifikationen: Mindestens 5 Jahre Erfahrung in der Softwareentwicklung, insbesondere mit agentischer KI.
Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.
Resaro is an independent, third‑party AI assurance company.
We build the software and run the evaluations that let enterprises and public‑sector bodies deploy AI they can actually trust - across computer vision, LLMs, vision‑language models, and, increasingly, agentic and autonomous systems, for clients in government, defence, and regulated commercial sectors.
Our product, the Approved Intelligence Platform (AIP), is where this becomes real software: customers register the AI systems they want tested, run rigorous evaluations, and produce defensible, auditable evidence and reports.
Agentic AI is moving from pilots into operational, high‑stakes deployments faster than anyone can assure it - the overwhelming majority of agent pilots still fail before production, on governance, traceability, and reliability gaps rather than raw capability.
Closing that gap is the product.
That\’s what you’ll build.
The Role
We\’re hiring a Senior AI Engineer to be our go‑to person for agentic AI evaluation - the technical owner of how AIP measures whether tool‑using, multi‑step agents are fit to deploy.
You\’ll build the evaluation engine behind our agentic MVP and the roadmap beyond it, and you\’ll be the person the team turns to when an agentic question is hard.
As autonomous and embodied systems mature, you\’ll help extend the same rigour into those emerging areas.
This is a hands‑on individual‑contributor role with domain ownership.
You report to the Engineering Manager for the evaluation engine and partner closely with Product, who owns the roadmap.
You set the technical bar for this vertical; you don\’t line‑manage.
- What You’ll Do
- Own the agentic‑evaluation engine.
Build the capability that scores agents on the metrics that matter – intent resolution, tool‑selection and parameterisation accuracy, task adherence, planning quality, tool‑call ordering, response completeness against a reference, and when an agent should defer to a human.
- Evaluate stateful, multi‑turn behaviour – not single prompts.
Agents carry memory and act over long horizons; your harnesses must expose how behaviour drifts, degrades, or becomes unsafe across a session.
- Make evaluation trustworthy.
Design for evaluator integrity: isolate the runner from the agent, assert on semantics not just structure, count crashed/incomplete tasks as failures, audit ground truth, and build tests that probe the test setup itself.
A benchmark you can\’t trust is worse than none.
- Build the agentic‑security surface.
Partner on red‑team and adversarial evaluation – tool‑chain exploits, RBAC and permission‑inheritance failures, multi‑turn safety erosion – so we catch what a motivated adversary would.
- Close the lab‑to‑production gap.
Design evaluations that surface where agents that look good in a demo fail in a real, customer‑specific deployment – the gap that makes independent assurance necessary.
- Translate governance into engineering. Work with our governance analysts to turn EU AI Act, NIST AI RMF, and ISO 42001 requirements into concrete, testable evaluation logic.
- Set the technical bar for the vertical – through spikes, ADRs, and code review – and keep your reasoning legible so the team can build on it.
- Extend into emerging autonomy. As embodied and other autonomous systems become real evaluation targets, help us adapt the engine to them.
- What We’re Looking For
- 5+ years of professional software engineering, shipping and operating production systems (not prototypes) in Python.
- Demonstrated depth in agentic AI – you’ve built, orchestrated, or rigorously evaluated LLM agents, and understand tool‑calling, memory, multi‑step control flow, and modern interoperability (MCP for tools, A2A for agent‑to‑agent) at more than a tutorial level.
- A real grasp of how agents are measured – and how measurement fails.
You know the standard execution‑based benchmarks (GAIA, τ²‑bench, OSWorld, SWE‑bench Verified, Web Arena) and why a high benchmark score routinely overstates production reliability.
- Strong engineering judgement – you can take an ambiguous, research‑adjacent problem, scope it, decompose it, and drive it to a shipped, tested, observable outcome without close supervision.
- A genuine bias to go deep and stay hands‑on, paired with the communication to be the person others come to for this domain – you document decisions and leave work others can pick up.
- Clear written and verbal communication, and comfort being measured against concrete quarterly outcomes, including across a distributed Singapore‑Europe team.
- Nice To Have
- Agentic security / red‑team experience – adversarial testing, jailbreak/tool‑chain exploits, or agent identity and on‑behalf‑of authorisation.
- Evaluation, testing, or assurance tooling for any AI domain — LLM/RAG, agentic, or computer vision – including LLM‑as‑judge pipelines and their failure modes.
- Familiarity with AI governance frameworks (EU AI Act, NIST AI RMF, ISO 42001) and translating principles into engineering requirements.
- Emerging embodied / autonomous AI exposure – vision‑language‑action models, simulators, or world‑model approaches (a plus, not a requirement).
- Data‑intensive pipelines with columnar/lakehouse formats (Parquet/Iceberg) and Duck DB or similar.
- Container‑based or serverless execution frameworks (Nuclio or comparable) for running evaluations at scale.
- Kubernetes/Helm and GPU/CUDA infrastructure for model inference.
- Experience where evidence, auditability, and reproducibility were first‑class requirements (regulated, safety‑critical, or defence contexts).
We hire to a high, transparent bar.
We look for production‑grade code (correct, tested, observable, maintainable by others); communication and handover (you write clearly and document decisions); independent operation (you scope and drive ambiguous problems to shipped outcomes); and a T‑shaped profile – deep in agentic AI evaluation, broad enough to operate across the stack and the ML‑evaluation domain.
#J-18808-Ljbffr
Senior AI Engineer - Agentic AI Evaluation Arbeitgeber: Resaro
Resaro ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, an der Spitze der KI-Technologie zu arbeiten und dabei einen bedeutenden Einfluss auf sicherheitskritische Systeme zu haben. Mit einem starken Fokus auf Teamarbeit und individueller Entwicklung fördert Resaro eine offene und integrative Arbeitskultur, in der Mitarbeiter ihre Fähigkeiten in einem dynamischen Umfeld weiterentwickeln können. Die Lage des Unternehmens ermöglicht es den Mitarbeitern, eng mit verschiedenen Branchen zusammenzuarbeiten, was zu spannenden Projekten und wertvollen Erfahrungen führt.
StudySmarter Expertenrat🤫
Wir sind der Meinung, dass du so Senior AI Engineer - Agentic AI Evaluation erhalten könntest
✨Engagier dich in Entwickler-Communities!
Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.
✨Zeig deine Fähigkeiten!
Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Resaro anzuklopfen, wenn du dich auf die Stelle als Senior AI Engineer - Agentic AI Evaluation bewirbst – so wissen sie gleich, was sie von dir erwarten können!
✨Nutze Jobplattformen speziell für Tech-Jobs!
Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.
✨Such dir Mentoren und Feedback!
Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Resaro vorzubereiten!
Wir glauben, dass du diese Fähigkeiten brauchst, um Senior AI Engineer - Agentic AI Evaluation mit Bravour zu bestehen
Einige Tipps für deine Bewerbung 🫡
Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.
Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.
Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.
Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Resaro klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.
Wie man sich auf ein Vorstellungsgespräch bei Resaro vorbereitet
✨Technische Vorbereitung auf die Coding-Challenges
In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!
✨Das eigene Portfolio im besten Licht präsentieren
Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.
✨Teamfähigkeit und Kommunikation betonen
In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.
✨Vorbereitung auf Fragen zur Software-Architektur
Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.