Spitzenbesetzung

Inference Engineer Jobs und Projekte

Inference Engineers optimieren, wie Modelle in Produktion ausgeführt werden. Bei großen Sprach- und Deep-Learning-Modellen entscheiden Serving, GPU-Auslastung, Quantisierung, Batching und Latenz direkt über Kosten und Nutzererlebnis.

Notizbuch mit unscharfer Handschrift, Lesebrille und Laptop

Inference Engineers optimieren, wie Modelle in Produktion ausgeführt werden. Bei großen Sprach- und Deep-Learning-Modellen entscheiden Serving, GPU-Auslastung, Quantisierung, Batching und Latenz direkt über Kosten und Nutzererlebnis.

Hier findest du Jobs, Projekte und offene Mandate für Inference Engineer, GPU Inference Engineer und LLM Serving Engineer. Die Rolle ist besonders relevant, wenn Modelle bereits existieren, aber schneller, günstiger oder zuverlässiger betrieben werden müssen.

Aktuelle offene Inference Engineer Jobs und Projekte

Aktuell ist kein öffentliches Inference-Mandat dabei. Hinterlege dein Profil mit Serving-Stack, GPU-Erfahrung und Verfügbarkeit.

Du bist Inference Engineer?

Du bist offen für ein neues Projekt oder hörst dir gute Mandate zumindest an? Hinterlege dein Profil und deine Verfügbarkeit. Wir melden uns, wenn ein Projekt zu deinem Schwerpunkt passt.

Alle offenen Mandate ansehen

Welche Jobs gibt es für Inference Engineer?

Festanstellungen gibt es in AI-Plattformteams, Model Serving, Deep Tech, LLM-Produkten und performancekritischen ML-Systemen. Die Rolle arbeitet eng mit MLOps, Research und Platform Engineering.

Welche Projekte gibt es für Inference Engineer?

LLM Serving optimieren

Durch Batching, KV-Cache, Quantisierung und Scheduling werden Latenz und Durchsatz verbessert.

GPU-Auslastung erhöhen

Compute wird so geplant und profiliert, dass teure Ressourcen besser genutzt werden.

Serving-Framework migrieren

Bestehende Inferenz wird auf vLLM, TensorRT-LLM oder andere spezialisierte Stacks überführt.

Quantisierung und Modellkompression

Modelle werden kleiner oder schneller, ohne die relevante Qualität unkontrolliert zu verlieren.

Performance Monitoring

Latenz, Throughput, OOM, Queueing und Kosten werden messbar gemacht.

Senior Inference Engineer Jobs und Projekte

Senior Inference Engineers optimieren nicht nur einzelne Kernel. Sie verstehen End-to-End-Latenz, Hardware, Serving-Architektur und Produktanforderungen und priorisieren Verbesserungen nach realem Nutzen.

Welche Skills werden gesucht?

Die Rolle verbindet Systems Engineering und ML.

Serving

vLLM, TensorRT, Triton oder vergleichbare Stacks.

GPU/Systeme

CUDA-Grundlagen, Profiling, Speicher, Parallelism und Hardwareeigenschaften.

Optimization

Quantisierung, Batching, Caching, Scheduling und Modellkompression.

Betrieb

Observability, Autoscaling, Capacity Planning und Kosten.

Remote Inference Engineer Jobs und Projekte

Viele Performance- und Serving-Aufgaben sind remote möglich, solange Zugriff auf relevante Hardware und Metriken besteht. Spezielle Lab- oder On-Prem-Umgebungen können Einschränkungen haben.

Inference Engineer Jobs in Deutschland und im DACH-Raum

Inference-Rollen sind spezialisiert und häufig in AI-Plattformen, Deep Tech oder leistungsintensiven Produktteams angesiedelt. Internationale Teams sind üblich.

Freelance oder Festanstellung?

Freelance passt für Performance Audits, Migration und kurzfristige Skalierungsprobleme. Festanstellung passt für dauerhafte Serving-Plattformen.

Woran erkennen Auftraggeber ein gutes Inference Engineer-Profil?

Zeig vor allem Vorher/Nachher und Ursache. Welche Latenz- oder Kostenklasse? Welcher Bottleneck? Welche Optimierung? Welche Qualitätsauswirkung?

Abgrenzung zu ähnlichen Rollen

Inference Engineer ist nicht MLOps Engineer. MLOps deckt den gesamten ML-Lifecycle breiter ab. Inference Engineering fokussiert tief auf Serving und Performance.

Gehalt und Tagessatz

Nutze Rollenprofil und allgemeine Marktberichte. Keine MLOps-Tagessätze automatisch als Inference-Benchmark verwenden.

Wie komme ich an passende Inference Engineer-Jobs und Mandate?

Hinterlege Serving-Stack, Hardware, Modelltypen und Performance-Schwerpunkte. Solche Mandate werden oft über konkrete Bottlenecks gematcht.

Abschluss

Du machst Modelle schneller und wirtschaftlicher in Produktion?

Dann zeig Bottlenecks, Hardware und messbare Optimierungen. Hinterlege dein Profil für passende Inference- und Serving-Mandate.

Offene Mandate ansehen

Als Inference Engineer vormerken

Wir suchen aktuell Inference Engineer für verschiedene Mandate.

Du musst nicht jede Woche Projektbörsen durchsuchen. Hinterlege dein Profil einmal. Wenn ein Mandat zu deiner Rolle, Erfahrung, Verfügbarkeit und deinem gewünschten Setup passt, melden wir uns mit den Eckdaten.

Keine Serienmails. Keine beliebigen Jobvorschläge. Entscheidend ist der fachliche Match.

Mehr Angaben (optional)

Hinweis nach Art. 13 DSGVO: Verantwortlich ist die im Impressum genannte Stelle. Deine Daten werden ausschließlich zur Aufnahme in den Talent-Pool und zur Kontaktaufnahme bei passenden Mandaten verarbeitet. Rechtsgrundlage ist deine Einwilligung (Art. 6 Abs. 1 lit. a DSGVO). Du kannst sie jederzeit widerrufen und die Löschung verlangen.

Häufige Fragen

Wo finde ich Inference Engineer Jobs?

Aktuelle AI-Plattform- und Serving-Mandate findest du auf <a href="/mandate">/mandate</a>.

Was macht ein LLM Serving Engineer?

Er optimiert Modellbereitstellung, Durchsatz, Latenz, GPU-Nutzung und Stabilität.

Gibt es Inference-Projekte freelance?

Ja, besonders für Performance Audits, Serving-Migration und Kostenoptimierung.

Sind Inference-Jobs remote?

Viele Aufgaben ja, wenn Hardwarezugriff remote möglich ist.

Was muss ein Senior-Profil zeigen?

Messbare Performanceprobleme, Bottleneck-Analyse und belastbare Optimierungen.

Wie komme ich in den Talent-Pool?

Hinterlege Serving-, GPU- und Performance-Erfahrung.

Nächster Schritt

Welcher Weg passt zu Ihrer Situation?

Wählen Sie den Pfad, der zu Ihrem Bedarf passt. Jede Erstberatung ist unverbindlich und führt zu einer ehrlichen Markt-Einschätzung.

Verwandte Themen
Begriffe & Tiefenwissen

Passende Glossar-Einträge