L'addestramento di un modello con l'apprendimento per rinforzo spreca inutilmente molta capacità di calcolo. La maggior parte dei prompt utilizzati nell'addestramento non insegna nulla al modello, perché o li indovina sempre o li sbaglia sempre.
Solo una piccola frazione, tra l'1 e il 15% dei casi, si trova effettivamente sulla frontiera di apprendimento (dove il modello ha ancora qualcosa da imparare).
Trovare questi prompt è costoso. Un addestratore centralizzato deve generare otto tentativi per prompt prima di sapere se insegna qualcosa, consumando risorse preziose per tentativi ed errori.
Inoltre, affidarsi esclusivamente a un addestratore centrale solleva dubbi sulla verifica del lavoro. Non esiste un modo semplice per dimostrare che i dati di addestramento e le ricompense assegnate siano autentici.
