Un errore di capitalizzazione ha reso inutilizzabile il mio bot di supporto AI, e non era nel modello nuovo
Un errore di capitalizzazione ha reso inutilizzabile il mio bot di supporto AI, e non era nel modello nuovo

Un errore di capitalizzazione ha reso inutilizzabile il mio bot di supporto AI, e non era nel modello nuovo. Il problema si è verificato in un’applicazione reale che testa tre modelli di OpenAI, confrontandoli con le esatte specifiche richieste dal sistema. Il modello in produzione ha prodotto risposte con un’etichetta “Request_refund” con la prima lettera maiuscola, mentre il sistema atteso richiedeva “request_refund” in minuscolo. Questo errore ha causato un blocco silenzioso del sistema, senza che il modello nuovo avesse lo stesso problema. Il test è stato condotto su 47 messaggi reali di clienti, tutti provenienti da un dataset pubblico di dati bancari.
Un test di regressione per verificare la conformità
Il progetto ha utilizzato un controllore rigoroso per verificare se le risposte soddisfano esattamente le specifiche richieste. Il controllore ha rilevato che il modello in produzione aveva un problema con la capitalizzazione, mentre il modello nuovo non ne aveva. Il test ha incluso un confronto tra due versioni delle istruzioni, una in cui il modello non veniva informato delle regole per decidere se richiedere un intervento umano o la priorità, e una in cui le regole erano chiare. Il modello nuovo ha seguito sempre le specifiche richieste, mentre il modello in produzione ha prodotto risposte non conformi.
Il modello in produzione ha prodotto risposte non conformi a causa di un errore di capitalizzazione. Il sistema atteso richiedeva “request_refund” in minuscolo, ma il modello in produzione ha utilizzato “Request_refund” con la prima lettera maiuscola. Questo errore ha causato un blocco silenzioso del sistema, senza che il modello nuovo avesse lo stesso problema. Il test ha incluso un confronto tra due versioni delle istruzioni, una in cui il modello non veniva informato delle regole per decidere se richiedere un intervento umano o la priorità, e una in cui le regole erano chiare.
Un sistema di valutazione basato su regole e AI
Il sistema di valutazione ha utilizzato un controllore basato su regole e un modello AI per valutare le risposte. Il controllore ha verificato se le risposte erano in formato JSON, includevano i campi richiesti e utilizzavano valori consentiti. Il modello AI ha valutato la qualità delle risposte, simile a un revisore umano. Il controllore ha rilevato che il modello in produzione aveva un problema con la capitalizzazione, mentre il modello nuovo non ne aveva.
Il modello nuovo ha seguito sempre le specifiche richieste, mentre il modello in produzione ha prodotto risposte non conformi. Il test ha incluso un confronto tra due versioni delle istruzioni, una in cui il modello non veniva informato delle regole per decidere se richiedere un intervento umano o la priorità, e una in cui le regole erano chiare. Il modello nuovo ha seguito sempre le specifiche richieste, mentre il modello in produzione ha prodotto risposte non conformi. Il test ha anche incluso un confronto tra due versioni delle istruzioni, una in cui il modello non veniva informato delle regole per decidere se richiedere un intervento umano o la priorità, e una in cui le regole erano chiare.
