Capitolo 7. Lavorare con i dati di testo
Questo lavoro è stato tradotto utilizzando l'AI. Siamo lieti di ricevere il tuo feedback e i tuoi commenti: translation-feedback@oreilly.com
Nel Capitolo 4 abbiamo parlato di due tipi di caratteristiche che possono rappresentare le proprietà dei dati: le caratteristiche continue che descrivono una quantità e le caratteristiche categoriche che sono elementi di un elenco fisso. C'è un terzo tipo di caratteristica che si trova in molte applicazioni: il testo. Ad esempio, se vogliamo classificare un messaggio di posta elettronica come legittimo o come spam, il contenuto dell'email conterrà sicuramente informazioni importanti per questo compito di classificazione. O forse vogliamo conoscere l'opinione di un politico sul tema dell'immigrazione. In questo caso, i discorsi o i tweet di quell'individuo potrebbero fornire informazioni utili. Nel servizio clienti, spesso vogliamo scoprire se un messaggio è un reclamo o una richiesta di informazioni. Possiamo utilizzare l'oggetto e il contenuto di un messaggio per determinare automaticamente l'intento del cliente, il che ci permette di inviare il messaggio al reparto appropriato o addirittura di inviare una risposta completamente automatica.
I dati testuali sono solitamente rappresentati come stringhe, composte da caratteri. In ognuno degli esempi appena citati, la lunghezza dei dati testuali varierà. Questa caratteristica è chiaramente molto diversa dalle caratteristiche numeriche che abbiamo discusso ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access