Képes egy nagy nyelvi modell, például a ChatGPT igazságosan értékelni az emberi teljesítményt? Dirk Sliwka, a Kölni Egyetem professzora pontosan ezt kutatta – és a válasz árnyaltabb, mint várnánk. A kutatás eredményei szerint az AI bizonyos esetekben valóban pontosabb és konzisztensebb értékelést ad, mint egy ember.
Sliwka vizsgálata kimutatta: minél objektívebb és strukturáltabb egy feladat, annál megbízhatóbban teljesít az AI értékelőként. Kódolási feladatoknál, szövegelemzésnél vagy adott sémák alapján végzett munkánál a nyelvi modellek kevesebb torzítással dolgoznak, mint az emberi értékelők. Azonban minél szubjektívebb a teljesítmény – például kreativitás, vezetői hatás vagy csapatdinamika –, annál nehezebben boldogul az LLM. Az emberi ítélet és a kontextuális intelligencia itt egyelőre pótolhatatlan.
A HR-szakemberek számára ez a kutatás egy fontos eligazítást ad: az AI nem fogja lecserélni a teljesítményértékelést, de mint kiegészítő eszköz komoly potenciált hordoz. A cégeknek érdemes átgondolniuk, melyek azok a feladatkörök, ahol az AI-alapú értékelés csökkenti az elfogultságot, és hol marad elengedhetetlen az emberi ítélőképesség. A tehetségmenedzsment jövője valószínűleg egy hibrid modellben keresendő.