Spitzenbesetzung

Probeaufgabe für KI-Rollen: was sie leistet und wie Sie sie fair gestalten

Eine Probeaufgabe zeigt, wie ein Kandidat an ein echtes Problem herangeht. Arbeitsproben erreichen in der Meta-Analyse von Sackett und Kollegen (2022) eine Validität von .33, strukturierte Interviews .42. Am meisten bringt die Kombination: eine kurze, realistische Aufgabe, im Gespräch gelöst oder besprochen, mit festem Bewertungsraster. Lange Hausaufgaben schrecken erfahrene Kandidaten ab.

Notizbuch mit unscharfer Handschrift, Lesebrille und Laptop

Was die Forschung sagt

Paul Sackett und Kollegen haben 2022 im Journal of Applied Psychology frühere Meta-Analysen zur Personalauswahl neu berechnet. Für die Verfahren, die direkt an der Tätigkeit ansetzen, ergab sich:

VerfahrenValidität 2022Frühere Schätzung (1998)
Strukturiertes Interview.42.51
Fachwissenstest.40.48
Arbeitsprobe.33.54

Quelle: Sackett, Zhang, Berry, Lievens (2022), Journal of Applied Psychology, frühere Werte nach Schmidt und Hunter (1998).

Die Werte sind niedriger als früher angenommen, die tätigkeitsbezogenen Verfahren bleiben aber unter den stärksten. Für KI-Rollen heißt das: Eine Probeaufgabe lohnt sich, ersetzt aber das strukturierte Gespräch nicht.

Vier Formen im Vergleich

FormDauer, RichtwertStärkeRisiko
Fallgespräch im Interview45 bis 60 Minutenzeigt Vorgehen und Rückfragen livewenig Zeit für Tiefe
Kurze Hausaufgabe mit Zeitlimit2 bis 3 StundenErgebnis zum AnschauenKandidaten mit Job springen bei mehr ab
Code- oder Architektur-Review45 Minutenprüft Urteilsvermögen an echter Arbeitbraucht vorbereitetes Material
Bezahlte Probearbeit1 bis 2 Tagesehr nah an der echten ArbeitAufwand, nur für die letzten ein bis zwei Kandidaten

Beispiele je Rolle

RolleAufgabe
Data ScientistEin anonymisierter Datensatz mit Kündigungen von Großkunden. Welche drei Hypothesen prüfen Sie zuerst, und wie?
Data EngineerZwei Tabellen aus ERP und CRM, Kundennummern passen nur zu 80 Prozent. Wie gehen Sie vor, und welche Fragen stellen Sie dem Vertrieb?
Machine Learning EngineerEin Modell läuft im Notebook. Skizzieren Sie den Weg in den Betrieb mit Tests und Monitoring.
MLOps EngineerHeute wird ein Modell alle drei Monate von Hand ausgeliefert. Was verbessern Sie in den ersten 90 Tagen?
LLM EngineerEin Wissensassistent liefert in drei von zehn Fällen falsche Antworten. Wie finden Sie die Ursache?

Weitere Fälle und Fragen je Rolle: Interviewfragen Data Engineer, Interviewfragen Data Scientist, Interviewfragen MLOps Engineer.

Bewertungsraster für Probeaufgaben

Kriterium1 Punkt2 Punkte3 Punkte
Rückfragenkeineeinigezuerst Ziel, Daten und Nutzer
Vorgehenungeordnetnachvollziehbarbegründete Reihenfolge mit Alternativen
Umgang mit Unsicherheitignoriert sieerwähnt siebenennt, wie sie gemessen oder reduziert wird
Ergebnisunvollständigbrauchbarbrauchbar und verständlich erklärt

Jede Person im Auswahlteam bewertet zuerst allein. Mehr zum Vorgehen: KI-Kandidaten bewerten.

Fair bleiben

  • Echte, aber anonymisierte Daten. Keine vertraulichen Kundendaten, keine Aufgaben, deren Ergebnis Sie produktiv nutzen wollen.
  • Zeit begrenzen. Sagen Sie vorher, wie lange die Aufgabe dauern soll, und halten Sie sich daran.
  • Rückmeldung geben. Wer Zeit investiert hat, bekommt eine kurze Begründung, auch bei einer Absage.
  • Längere Probearbeit bezahlen. Bei mehr als einem halben Tag ist eine Vergütung ein fairer Ausgleich.

Keine Zeit, Probeaufgaben zu bauen und auszuwerten?

Wir prüfen Kandidaten an realistischen Fällen und schicken Ihnen die Bewertung mit jedem Profil.

Erstberatung anfragen

Quellen

  • Sackett, P. R., Zhang, C., Berry, C. M., Lievens, F. (2022): Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology
  • Schmidt, F. L., Hunter, J. E. (1998), zitiert nach Sackett et al. (2022)

Häufige Fragen

Wie sollte eine Probeaufgabe für einen Data Scientist aussehen?

Kurz und realistisch: ein anonymisierter Datensatz mit einer echten Geschäftsfrage, gelöst oder besprochen im Gespräch. Bewertet werden Rückfragen, Vorgehen und Umgang mit Unsicherheit.

Wie lang darf eine Hausaufgabe für KI-Kandidaten sein?

Als Richtwert zwei bis drei Stunden mit klarem Zeitlimit. Längere Aufgaben schrecken erfahrene Kandidaten mit Job ab.

Wie aussagekräftig sind Arbeitsproben?

In der Meta-Analyse von Sackett und Kollegen (2022) erreichen Arbeitsproben eine Validität von .33, strukturierte Interviews .42. Am meisten bringt die Kombination beider.

Sollte man Probearbeit bezahlen?

Bei mehr als einem halben Tag ist eine Vergütung ein fairer Ausgleich und erhöht die Bereitschaft guter Kandidaten, mitzumachen.

Coding-Test oder Fallaufgabe?

Für die meisten KI-Rollen eine Fallaufgabe. Sie zeigt Rückfragen und Vorgehen. Ein reiner Algorithmus-Test prüft Fähigkeiten, die im Alltag dieser Rollen selten den Ausschlag geben.

Nächster Schritt

Welcher Weg passt zu Ihrer Situation?

Wählen Sie den Pfad, der zu Ihrem Bedarf passt. Jede Erstberatung ist unverbindlich und führt zu einer ehrlichen Markt-Einschätzung.

Verwandte Themen
Begriffe & Tiefenwissen

Passende Glossar-Einträge