AI Research Engineer (Kernel & Inference Optimization)

AI Research Engineer (Kernel & Inference Optimization)

Zürich Vollzeit 60000 - 80000 € / Jahr (geschätzt) Homeoffice (teilweise)
T

Auf einen Blick

  • Aufgaben: Optimiere KI-Modelle für schnelle und effiziente Anwendungen in der realen Welt.
  • Unternehmen: Innovatives Unternehmen im Bereich KI mit Fokus auf Teamarbeit.
  • Vorteile: Attraktives Gehalt, Gesundheitsleistungen und Möglichkeiten zur beruflichen Weiterentwicklung.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrieremöglichkeiten und innovativen Projekten.
  • Warum dieser Job: Gestalte die Zukunft der KI mit modernster Technologie und echten Herausforderungen.
  • Qualifikationen: Abschluss in Informatik oder verwandtem Bereich, idealerweise mit Promotion in NLP oder Machine Learning.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

About the job

As a member of our AI model team, you will drive innovation in model serving and inference architectures for advanced AI systems.

Your work will focus on optimizing model deployment and inference strategies to deliver highly responsive, efficient, and scalable performance across real‑world applications.

You will work on a wide spectrum of systems, ranging from resource‑efficient models designed for limited hardware environments to complex, multi‑modal architectures that integrate data such as text, images, and audio.

Responsibilities

  • Design and deploy state‑of‑the‑art model serving architectures that deliver high throughput and low latency while optimizing memory usage.

Ensure these pipelines run efficiently across diverse environments, including resource‑constrained devices and edge platforms.

Establish clear performance targets such as reduced latency, improved token response, and minimized memory footprint.

  • Build, run, and monitor controlled inference tests in both simulated and live production environments.

Track key performance indicators such as response latency, throughput, memory consumption, and error rates, with special attention to metrics specific to resource‑constrained devices.

Document iterative results and compare outcomes against established benchmarks to validate performance across platforms.

  • Identify and prepare high‑quality test datasets and simulation scenarios tailored to real‑world deployment challenges, specifically those encountered on low‑resource devices.

Set measurable criteria to ensure that these resources effectively evaluate model performance, latency, and memory utilization under various operational conditions.

  • Analyze computational efficiency and diagnose bottlenecks in the serving pipeline by monitoring both processing and memory metrics.

Address issues such as suboptimal batch processing, network delays, and high memory usage to optimize the serving infrastructure for scalability and reliability on resource‑constrained systems.

  • Work closely with cross‑functional teams to integrate optimized serving and inference frameworks into production pipelines designed for edge and on‑device applications.

Define clear success metrics such as improved real‑world performance, low error rates, robust scalability, optimal memory usage and ensure continuous monitoring and iterative refinements for sustained improvements.

Qualifications

  • A degree in Computer Science or related field.

Ideally Ph D in NLP, Machine Learning, or a related field, complemented by a solid track record in AI R&D (with good publications in A* conferences).

  • Must have knowledge of Metal Shading Language (MSL). You should be comfortable writing custom compute shaders from scratch.
  • Proven experience in low‑level kernel optimizations and inference optimization on mobile devices is essential.

Your contributions should have led to measurable improvements in inference latency, throughput, and memory footprint for domain‑specific applications, particularly on resource‑constrained devices and edge platforms.

  • A deep understanding of modern model serving architectures and inference optimization techniques is required.

This includes state‑of‑the‑art methods for achieving low‑latency, high‑throughput performance, and efficient memory management in diverse, resource‑constrained deployment scenarios.

  • Must have strong expertise in writing GPU kernels for mobile devices (i. e., smartphones) as well as a deep understanding of model serving frameworks and engines.

Practical experience in developing and deploying end‑to‑end inference pipelines, from optimizing models for efficient serving to integrating these solutions on resource‑constrained devices is required.

  • Demonstrated ability to apply empirical research to overcome challenges in model serving, such as latency optimization, computational bottlenecks, and memory constraints.

You should be proficient in designing robust evaluation frameworks and iterating on optimization strategies to continuously push the boundaries of inference performance and system efficiency.

  • Distributed
  • Inference

Systems: Designing and optimizing high‑performance inference engines using techniques like Tensor Parallelism, Pipeline Parallelism, and Expert Parallelism to handle massive models on GPU clusters.

  • Deep understanding of the math and structure behind Diffusion Models and Vision Transformers.
  • Understanding of Pruning, Quantization, Flash attention, KV Cache, Speculative Decoding (Eagle) etc.
  • #J-18808-Ljbffr

AI Research Engineer (Kernel & Inference Optimization) Arbeitgeber: Tether

Tether ist ein hervorragender Arbeitgeber, der kreative Talente in einem dynamischen, globalen Team willkommen heißt. Als AI Filmmaker haben Sie die Möglichkeit, an innovativen Projekten zu arbeiten und Ihre Fähigkeiten mit modernsten KI-Tools weiterzuentwickeln. Die flexible Remote-Arbeitsumgebung fördert eine ausgewogene Work-Life-Balance und ermöglicht es Ihnen, Ihre kreativen Ideen direkt in die Markenkommunikation einzubringen.

T

Kontaktdaten:

Tether Recruiting-Team

StudySmarter Expertenrat🤫

Wir sind der Meinung, dass du so AI Research Engineer (Kernel & Inference Optimization) erhalten könntest

Engagier dich in Entwickler-Communities!

Lass uns mal ehrlich sein: In der Software-Entwicklung sind Netzwerke Gold wert! Tummel dich in GitHub-Projekten, nehme an lokalen Meetups oder Hackathons teil und vernetze dich mit anderen Entwicklern. So steigerst du nicht nur deine Sichtbarkeit, sondern lernst auch die neuesten Trends und Technologien kennen.

Zeig deine Fähigkeiten!

Erstelle ein Portfolio, das deine besten Projekte und Code-Examples zeigt. Nichts überzeugt mehr als ein praktischer Beweis deiner Skills. Das kann auch helfen, bei Tether anzuklopfen, wenn du dich auf die Stelle als AI Research Engineer (Kernel & Inference Optimization) bewirbst – so wissen sie gleich, was sie von dir erwarten können!

Nutze Jobplattformen speziell für Tech-Jobs!

Plattformen wie Stack Overflow Jobs oder AngelsList sind perfekte Orte, um Vollzeitstellen in der Software-Entwicklung zu finden. Hier sind viele tolle Unternehmen auf der Suche nach Talenten wie uns, also schau regelmäßig vorbei und bewirb dich direkt über die Website.

Such dir Mentoren und Feedback!

Hol dir Feedback von erfahrenen Entwicklern, die dir Tipps geben können, was Recruiter wirklich suchen. Ob über LinkedIn oder persönliche Kontakte: Menschen, die sich in der Branche auskennen, können enorm wertvoll sein, um dir zu helfen, dich optimal auf deine Bewerbung bei Tether vorzubereiten!

Wir glauben, dass du diese Fähigkeiten brauchst, um AI Research Engineer (Kernel & Inference Optimization) mit Bravour zu bestehen

Modellservierung
Optimierung von Inferenzarchitekturen
GPU-Kernel-Programmierung
Metal Shading Language (MSL)
Niedriglevelige Kernel-Optimierungen
Inferenzoptimierung auf mobilen Geräten
Entwicklung und Bereitstellung von End-to-End-Inferenzpipelines

Einige Tipps für deine Bewerbung 🫡

Highlights deiner Coding-Skills:In der Software-Entwicklung kommt es auf konkrete Fähigkeiten an. Vergiss nicht, relevante Programmiersprachen und Frameworks in deinen Lebenslauf aufzunehmen. Zeig uns, was du kannst – vielleicht mit einem Link zu deinem GitHub-Profil oder einer Übersicht deiner Side Projects, die deine Programmierkenntnisse illustrieren.

Dokumentation deiner Erfolge:Gerade bei einer Vollzeitstelle in der Software-Entwicklung sind konkrete Ergebnisse Gold wert. Nenn uns Zahlen und Ergebnisse aus deinen vorherigen Projekten. Hast du den Code optimiert oder Systemfehler behoben? Solche Erfolge zeigen, dass du die Sprache der Entwickler sprichst und einen echten Mehrwert bringst.

Attraktive Projektbeschreibungen:Wenn du an Projekten gearbeitet hast, die hervorstechen, beschreibe sie ausführlich in deinem Lebenslauf. Was war das Problem, das du gelöst hast? Welche Technologien hast du eingesetzt? Das gibt uns einen klaren Einblick in deine Herangehensweise und Problemlösungsfähigkeiten.

Motivation zeigen:In deinem Anschreiben solltest du deine Motivation für die Stelle im Bereich Software-Entwicklung bei Tether klar herausstellen. Warum sprichst gerade du die Anforderungen für diese Vollzeitrolle an? Mach deutlich, was dich an der Arbeit bei uns reizt und wie du über das rein Technische hinaus wachsen möchtest.

Wie man sich auf ein Vorstellungsgespräch bei Tether vorbereitet

Technische Vorbereitung auf die Coding-Challenges

In der Software-Entwicklung sind technische Fragen oft ein zentraler Teil des Interviews. Macht euch mit Plattformen wie LeetCode oder HackerRank vertraut, um eure Problemlösungsfähigkeiten zu trainieren. Zeigt im Interview viel Selbstbewusstsein beim Erklären eurer Ansätze!

Das eigene Portfolio im besten Licht präsentieren

Stellt sicher, dass ihr ein aussagekräftiges Portfolio habt, das einige eurer besten Projekte zeigt. Seid bereit, darüber zu sprechen, was eure Rolle war, welche Technologien ihr verwendet habt und welche Herausforderungen es gab. Das gibt den Interviewern einen Einblick in eure praktische Erfahrung.

Teamfähigkeit und Kommunikation betonen

In einer Vollzeit-Position wird Kommunikation im Team sehr wichtig sein. Seid bereit, Beispiele aus der Vergangenheit zu teilen, in denen ihr effektiv im Team gearbeitet habt. Dies zeigt, dass ihr nicht nur technische Fähigkeiten habt, sondern auch gut ins Team passt.

Vorbereitung auf Fragen zur Software-Architektur

Bereitet euch darauf vor, Fragen zur Software-Architektur zu beantworten. Themen wie RESTful APIs, Microservices und Cloud-Architekturen können Teil eures Interviews sein. Zeigt euer Verständnis durch Diskussionen und Beispiele aus eurer bisherigen Arbeit oder Projekte.