AI Inference Engineer (all genders)

AI Inference Engineer (all genders)

Frankfurt am Main Vollzeit 49500 - 60500 € / Jahr (geschätzt) Homeoffice (teilweise)
EXXETA

Auf einen Blick

  • Aufgaben: Entwickle und betreibe innovative AI-Inferenzplattformen in regulierten Umgebungen.
  • Unternehmen: Exxeta – ein dynamisches Unternehmen, das digitale Lösungen mit echtem Impact schafft.
  • Vorteile: Attraktive Vergütung, flexible Arbeitszeiten und ein kreatives Team.
  • Weitere Informationen: Vielfältige Entwicklungsmöglichkeiten in einem unterstützenden und inklusiven Umfeld.
  • Warum dieser Job: Gestalte die Zukunft der AI-Technologie und arbeite an spannenden Projekten.
  • Qualifikationen: Erfahrung in Cloud- und Plattformengineering sowie Begeisterung für AI-Systeme.

Das prognostizierte Gehalt liegt zwischen 49500 - 60500 € pro Jahr.

Standorte: Karlsruhe, Frankfurt am Main, Leipzig, Mannheim, Stuttgart

Als AI Inference Engineer baust du die technische Grundlage für produktive AI-Systeme in regulierten Umgebungen. Du entwickelst und betreibst LLM-Inferenzplattformen, die on-premises oder in privaten Cloud-Umgebungen laufen – sicher, skalierbar, beobachtbar und wirtschaftlich.

Du sorgst dafür, dass moderne Modelle nicht nur in einer Demo überzeugen, sondern unter realen Produktionsbedingungen zuverlässig funktionieren: mit sauberer GPU-Planung, niedriger Latenz, kontrollierten Kosten, belastbarem Monitoring und klar definierten Betriebsmodellen.

Was erwartet dich

  • Du konzipierst, entwickelst und betreibst produktive LLM-Inferenzplattformen für Kunden mit hohen Anforderungen an Datensouveränität, Sicherheit und Betriebskontrolle – on-premises, in privaten Cloud-Umgebungen oder souveränen europäischen Cloud-Setups.
  • Gemeinsam mit Cloud-, Plattform-, Security- und Data-Engineering-Teams sowie unseren Kunden überführst du AI-Use-Cases in den produktiven Betrieb.
  • Dabei integrierst du moderne Inferenz-Engines und Open-Weights-Modelle in Kubernetes-, Container- und Plattformumgebungen.
  • Außerdem planst und optimierst du GPU- und Speicherressourcen sowie Inferenz-Workloads: Von Modellgrößen, Quantisierung und Batching bis hin zu KV-Cache-Strategien, Latenz, Durchsatz und Kosten.
  • Du verantwortest die Runtime produktiver AI-Systeme, inklusive Modellserving, APIs, Authentifizierung, Secrets, Observability, Logging.
  • Aus Kundenprojekten entwickelst du wiederverwendbare Referenzarchitekturen, Deployment-Templates und Betriebs-Playbooks und stärkst so unsere Applied-AI-Capability.

Was erwarten wir von dir

  • Persönlicher Background: Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, LLMOps, DevOps, Backend Engineering oder Machine Learning Engineering. Entscheidend ist deine Erfahrung im Aufbau und Betrieb produktiver Systeme und dein Antrieb zu schneller persönlicher Weiterentwicklung.
  • Inference Engineering: Du verstehst die technischen und wirtschaftlichen Zusammenhänge moderner LLM-Inferenz, von Model-Serving und GPU-Auslastung über Quantisierung, Batching und KV-Cache-Management bis hin zu Latenz, Durchsatz und Kosten.
  • Cloud & Plattformen: Docker, Kubernetes, Helm, Terraform, CI/CD, Linux sowie Observability gehören für dich zum Arbeitsalltag.
  • AI-Verständnis: Du kannst Transformer-basierte Modelle wie LLMs und Embeddings einordnen und fundierte technische Entscheidungen für produktive AI-Systeme treffen.
  • Security & Governance: Themen wie Identitäten, Berechtigungen, Secrets, Logging, Auditierung und Compliance denkst du, insbesondere in regulierten Umgebungen, von Anfang an mit.
  • Kommunikation & Arbeitsweise: Du vermittelst komplexe technische Zusammenhänge verständlich, arbeitest pragmatisch und bewegst dich auch in dynamischen Projektumfeldern sicher.
  • Pluspunkt: Erfahrung mit vLLM, SGLang oder vergleichbaren Inference-Technologien, GPU-Clustern, souveränen Cloud- oder Private-Cloud-Umgebungen.
  • On the road: Du bist reisebereit und flexibel, unsere Kunden bundesweit vor Ort zu beraten.

Warum Exxeta

Bei Exxeta entwickeln wir digitale Lösungen, die wirklich etwas verändern – in Unternehmen, Märkten und Köpfen. Über 1200 Kolleg:innen bringen dafür Technologie, Ideen und unterschiedliche Perspektiven zusammen. Was uns antreibt: Neugier, Teamspirit und der Anspruch, echten Impact zu schaffen. Hightech with a heartbeat eben.

Wir sind ein Zuhause für Menschen, die etwas bewegen wollen. Diversität und unterschiedliche Perspektiven bereichern unser Team. Haltung, Ideen und Lust aufs Machen - das zählt bei uns!

Bewirb dich jetzt!

Ania Rapp
Senior Talent Acquisition Partner
+49 172 9912855

AI Inference Engineer (all genders) Arbeitgeber: EXXETA

Ingérop ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, an bedeutenden Bauprojekten sowohl lokal als auch international mitzuwirken. Mit einem starken Fokus auf persönliche Entwicklung und einem dynamischen, unterstützenden Teamumfeld fördern wir eine Kultur der Selbstbestimmung und des Engagements. Unsere Mitarbeiter profitieren von flexiblen Arbeitsmodellen und einer Vielzahl von Weiterbildungsmöglichkeiten, die es ihnen ermöglichen, ihre Karriere aktiv zu gestalten.

EXXETA

Kontaktdaten:

EXXETA Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um AI Inference Engineer (all genders) mit Bravour zu bestehen

Platform Engineering
Cloud Infrastructure
MLOps
LLMOps
DevOps
Backend Engineering
Machine Learning Engineering