AI Inference Engineer (all genders) in Darmstadt

AI Inference Engineer (all genders) in Darmstadt

Darmstadt Vollzeit Vor Ort
E

AI first Moderner Tech-Stack Als AI Inference Engineer baust du die technische Grundlage für produktive AI-Systeme in regulierten Umgebungen. Du entwickelst und betreibst LLM-Inferenzplattformen, die on-premises oder in privaten Cloud-Umgebungen laufen – sicher, skalierbar, beobachtbar und wirtschaftlich. Du sorgst dafür, dass moderne Modelle nicht nur in einer Demo überzeugen, sondern unter realen Produktionsbedingungen zuverlässig funktionieren: mit sauberer GPU-Planung, niedriger Latenz, kontrollierten Kosten, belastbarem Monitoring und klar definierten Betriebsmodellen. Was erwartet dich Du konzipierst, entwickelst und betreibst produktive LLM-Inferenzplattformen für Kunden mit hohen Anforderungen an Datensouveränität, Sicherheit und Betriebskontrolle – on-premises, in privaten Cloud-Umgebungen oder souveränen europäischen Cloud-Setups. Gemeinsam mit Cloud-, Plattform-, Security- und Data-Engineering-Teams sowie unseren Kunden überführst du AI-Use-Cases in den produktiven Betrieb. Dabei integrierst du moderne Inferenz-Engines und Open-Weights-Modelle in Kubernetes-, Container- und Plattformumgebungen. Außerdem planst und optimierst du GPU- und Speicherressourcen sowie Inferenz-Workloads: Von Modellgrößen, Quantisierung und Batching bis hin zu KV-Cache-Strategien, Latenz, Durchsatz und Kosten. Du verantwortest die Runtime produktiver AI-Systeme, inklusive Modellserving, APIs, Authentifizierung, Secrets, Observability, Logging Aus Kundenprojekten entwickelst du wiederverwendbare Referenzarchitekturen, Deployment-Templates und Betriebs-Playbooks und stärkst so unsere Applied-AI-Capability. Was erwarten wir von dir Persönlicher Background: Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, LLMOps, DevOps, Backend Engineering oder Machine Learning Engineering. Entscheidend ist deine Erfahrung im Aufbau und Betrieb produktiver Systeme und dein Antrieb zu schneller persönlicher Weiterentwicklung Inference Engineering: Du verstehst die technischen und wirtschaftlichen Zusammenhänge moderner LLM-Inferenz, von Model-Serving und GPU-Auslastung über Quantisierung, Batching und KV-Cache-Management bis hin zu Latenz, Durchsatz und Kosten. Cloud

AI Inference Engineer (all genders) in Darmstadt Arbeitgeber: Exxeta AG

Exxeta ist ein hervorragender Arbeitgeber, der dir die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten, das sich auf Cloud DevOps und AI spezialisiert hat. Hier wirst du Teil eines engagierten Teams, das nicht nur technische Exzellenz anstrebt, sondern auch großen Wert auf persönliche und fachliche Weiterentwicklung legt. Mit einer offenen Unternehmenskultur, die Teamarbeit und Transparenz fördert, sowie vielfältigen Wachstumschancen, ist Exxeta der ideale Ort für alle, die einen echten Unterschied machen möchten.

E

Kontaktdaten:

Exxeta AG Recruiting-Team