Temperature 0 Non è Deterministica nei Modelli di LLM
Un’analisi su come la non determinismo nei modelli LLM si manifesta a temperature zero e perché le risposte non sono sempre identiche.
Un team di ricercatori ha scoperto che anche a temperature zero, i modelli linguistici di grandi dimensioni (LLM) non producono sempre risposte identiche. L’esperienza condotta da Horace He e colleghi del Thinking Machines Lab ha rivelato che, nonostante la temperatura zero dovrebbe garantire una risposta deterministica, le differenze emergono a causa di errori di calcolo e variabilità nei dati. L’articolo esplora il motivo di questa non determinismo e presenta un modello matematico per prevedere la probabilità di divergenza delle risposte.
La Non Determinismo a Temperature Zero
La temperatura zero implica che il modello seleziona sempre il token con la probabilità più alta, rendendo il processo teoricamente deterministico. Tuttavia, i calcoli effettuati dal computer non sono sempre associativi, portando a errori di calcolo. Questi errori, pur piccoli, possono causare differenze nei risultati. L’articolo spiega come la non determinismo si manifesta a causa di errori di precisione e variabilità nei dati.
La non determinismo non è solo un problema di calcolo, ma anche di variabilità nei dati.
Un Modello per Prevedere la Probabilità di Divergenza
Il team ha sviluppato una formula per stimare la probabilità che una risposta diverga a causa di errori di calcolo. La formula considera la densità dei gap (differenze tra i logiti) e l’errore di calcolo. I risultati mostrano che la probabilità di divergenza aumenta con l’errore e la densità dei gap. L’articolo presenta una simulazione che conferma la validità della formula. La formula è basata su un’analisi matematica che considera la probabilità di errore e la densità dei gap. I risultati della simulazione mostrano che la formula è in grado di prevedere con buona precisione la probabilità di divergenza. Questo modello può essere utilizzato per prevedere il tasso di divergenza delle risposte in un modello LLM.
Implicazioni Pratiche e Possibili Soluzioni
La non determinismo a temperature zero ha implicazioni pratiche per l’uso dei modelli LLM. I ricercatori sottolineano che è importante considerare l’errore di calcolo e la variabilità nei dati quando si valutano le risposte. L’articolo propone una soluzione per ridurre l’errore di calcolo, utilizzando kernel batch-invarianti. Questa soluzione ha un costo in termini di throughput, ma riduce significativamente la non determinismo.
La soluzione proposta riduce l’errore di calcolo, ma ha un costo in termini di throughput.
Il team ha anche discusso le limitazioni del loro modello. La formula non considera il terzo token migliore e assume che l’errore sia simmetrico e indipendente dal gap. Inoltre, la formula non tiene conto del fatto che un flip non è sempre un errore, ma può indicare una diversa formulazione del testo. L’articolo conclude con un invito a considerare l’errore di calcolo e la variabilità nei dati quando si valutano le risposte dei modelli LLM.
