A chi serve questo pezzo
A chi ha già provato. Chi ha esportato le recensioni in un foglio di calcolo, le ha lette per due sere, ha segnato qualche parola ricorrente e poi ha lasciato perdere perché non sapeva se quello che aveva trovato fosse vero o solo quello che si aspettava. Il problema non è tecnico ed è quasi sempre lo stesso: leggere è un’operazione che non lascia traccia e senza traccia non si può controllare niente, nemmeno se stessi.
Non serve a chi ha venti recensioni. Qualunque metodo di conteggio, su venti righe, è una complicazione che non paga. La soglia da cui il conto comincia a dire qualcosa che l’occhio non vede sta più in alto di quanto si creda, e ci torniamo alla fine.
1. Il caso, per esteso
Cercavo una nicchia. Volevo capire, in un settore di applicazioni per telefono, se ci fosse spazio per entrarci: quali problemi le persone segnalano di continuo, quali di questi nessuno ha risolto, e quali di quelli irrisolti valgono abbastanza da giustificare il lavoro. La materia prima erano le recensioni pubbliche dei prodotti già sul mercato. Non i miei clienti: i clienti degli altri, che scrivono gratis e in pubblico e che non hanno nessun motivo di essere gentili.
Credevo di sapere due cose. La prima è che i problemi ricorrenti in quel settore fossero, grosso modo, quelli che avrei elencato io a memoria. La seconda è che un prodotto molto votato sia un prodotto con pochi problemi.
Sono partito costruendo un programma che fa due cose, una dopo l’altra. Prese separatamente sono entrambe ragionevoli. È la sequenza a ingannare.
Primo passaggio: mettere insieme le recensioni che si somigliano. Questa operazione si chiama clustering e funzionava: i gruppi venivano dal materiale, non da un elenco che avevo deciso io. Fra quelli che ne sono usciti ce n’era uno da 172 segnalazioni, il più grosso, e il programma lo indicava come l’occasione principale.
Secondo passaggio: dare un valore a ogni gruppo. Qui il programma guardava qual era la categoria di problema più frequente lì dentro, che è quello che in statistica si chiama moda, cercava quella categoria in una tabella di pesi e attribuiva quel peso al gruppo intero. La tabella l’avevo scritta io due giorni prima, senza aver letto una sola recensione.
Il difetto sta nel salto fra i due. Recensioni che si somigliano nelle parole non sono recensioni che segnalano lo stesso problema, e in quel gruppo da 172 c’erano undici categorie diverse di problemi.
| Categoria | Segnalazioni |
|---|---|
| difficoltà a usare l’applicazione | 79 |
| prezzo | 23 |
| altro | 23 |
| funzione che non parte | 18 |
| permessi e riservatezza | 10 |
| prestazioni | 9 |
| qualità dei contenuti | 3 |
| affidabilità della sincronizzazione | 2 |
| funzione assente | 2 |
| integrazione con altri programmi | 2 |
| primo avvio | 1 |
La categoria più frequente riguardava 79 segnalazioni su 172. Quelle 79 hanno scelto la riga della tabella dei pesi, e da quella riga è uscito il valore dell’intero gruppo. Le altre 93 si sono ritrovate il punteggio di una categoria a cui non appartenevano. Non è che non abbiano contato: hanno contato per la dimensione del gruppo, ed è la dimensione che lo ha portato in cima. Non hanno contato per stabilire di che cosa parlasse.
Alla voce che avrebbe dovuto dire di che cosa si trattava, intanto, non c’era scritto niente. Quella riga la scrive un modello linguistico, e su questo gruppo la chiamata è fallita due volte di seguito: al posto dell’etichetta è rimasta la scritta di ripiego che il programma usa quando non ne ha una, e la descrizione è rimasta vuota.
Il punto non è il guasto, sono le due righe accanto. Il passaggio che doveva descrivere il gruppo non ha prodotto niente, quello che doveva valutarlo ha prodotto un numero con il decimale, e il report ha messo in cima alla classifica una voce senza nome. Nessuno dei due passaggi sapeva dell’altro.
La media, al posto della moda, non salva il conto. L’ho verificato dopo. Dando a ogni categoria il peso della sua riga e tenendo conto di quante segnalazioni porta, il gruppo scende a 0,57 e non raggiunge la soglia di 0,60 che serviva per dichiararlo l’occasione forte: sarebbe finito fra quelli da verificare.
Poi però c’è la riga che si chiama «altro», 23 segnalazioni. Non è una categoria di problema, è il posto dove finisce quello che non è stato riconosciuto, e in tabella ha il peso più basso di tutti. Contarla significa trasformare «non ho capito cosa avessero scritto» in «vale poco». Se si toglie dal conto il gruppo risale a 0,64, sopra la soglia, e torna primo.
Tre modi di fare la stessa somma, tutti difendibili, e il verdetto cambia due volte. Nessuno dei tre ha letto una recensione in più degli altri.
È questo il meccanismo da portarsi via: prendere la moda di un insieme e trattarla come la descrizione dell’insieme. Succede con i tag del gestionale, con le categorie dei ticket, con il campo “motivo principale” nei moduli. Il risultato è un’etichetta che descrive meno della metà di quello che pretende di descrivere, e nessun modo di accorgersene guardandola.
Il risultato è che il programma non ha scoperto di cosa parlassero le persone. Ha misurato quanto le persone parlassero delle cose a cui avevo pensato io. Che è una domanda legittima, se è quella che vuoi fare. Ma non era quella che credevo di aver fatto e la differenza tra le due non si vede guardando l’output: l’output è identico, ed è una classifica ordinata con i decimali che sembra un risultato in entrambi i casi.
Ci sono arrivato per una via laterale. Uno dei gruppi individuati come più promettenti aveva l’etichetta vuota: il programma aveva raccolto un centinaio abbondante di lamentele dichiarando che erano la stessa cosa, e alla voce di che cosa si tratta non c’era niente. Quel vuoto era l’unica parte onesta del risultato. Tutto il resto aveva un nome e i nomi li avevo scritti io.
2. Riassunto e conteggio non sono la stessa operazione
È la distinzione più importante di tutto il pezzo ed è operativa.
Se chiedi a qualcuno (o a qualcosa) riassumi queste cinquecento recensioni, quello che torna indietro è un testo. Ben scritto, plausibile, e irrimediabilmente inverificabile: non c’è modo di prendere una frase del riassunto e risalire alle righe che l’hanno prodotta. Se il riassunto dice «molti utenti lamentano lentezza», molti significa nove o centonovanta, e non c’è modo di saperlo se non rileggendo tutto, che è esattamente quello che stavi cercando di evitare.
Se invece chiedi quante recensioni parlano di lentezza, e quali sono, torna indietro un numero e un elenco di righe. Il numero può essere sbagliato, ma si può controllare: ne prendi dieci, le leggi, e vedi se parlano davvero di lentezza.
La differenza pratica: il riassunto è un’opinione che non puoi contestare, il conteggio è un’affermazione che puoi smentire. Solo la seconda è una base per decidere, perché solo la seconda ti dice quando ti sei sbagliato.
Corollario spiacevole: il conteggio è molto più noioso da leggere, ma è un difetto solo in apparenza.
3. Raggruppare è un problema senza risposta giusta, e non è un modo di dire
Non esiste il raggruppamento corretto di un insieme di recensioni. Non è difficile da trovare: è stato dimostrato che non c’è.
Il risultato è del 2002 ed è di Jon Kleinberg. Chiediamo a un metodo di raggruppamento tre cose che sembrano tutte ovvie: che il risultato non cambi se misuriamo le distanze in centimetri anziché in metri; che sia in grado, in linea di principio, di produrre qualunque raggruppamento; e che se avviciniamo tra loro le cose già insieme e allontaniamo quelle già separate, il risultato resti quello. Sono tre richieste che nessuno metterebbe in discussione. Kleinberg ha dimostrato che nessun metodo può soddisfarle tutte e tre insieme.1
Dieci anni dopo, tre ricercatori hanno provato a spostare la domanda dal metodo alla valutazione: ammesso che non esista il raggruppamento giusto, si può almeno dire quale dei due sia migliore? La risposta è che non si può, se non si sa perché quella persona sta raggruppando e cosa ne farà dopo. Il raggruppamento non va trattato come un problema di matematica indipendente dall’uso, ma sempre dentro il suo uso finale.2
La conseguenza commerciale è immediata e vale la pena essere brutali: chi vi offre «la segmentazione oggettiva della vostra clientela» vi sta vendendo un oggetto che è stato dimostrato non esistere. Ogni raggruppamento è la risposta a una domanda, e la domanda la portate voi. L’unica scelta onesta è dichiararla prima di cominciare, invece di scoprirla dopo, travestita da risultato.
4. Due operazioni diverse che si chiamano allo stesso modo
Raggruppare, nel senso tecnico, significa assegnare gli elementi a classi che non sono definite in anticipo e che dovrebbero riflettere la struttura del materiale.3 Le classi non definite in anticipo non sono un dettaglio del procedimento: sono la definizione del procedimento.
Smistare del materiale dentro caselle note è un’altra operazione. È altrettanto legittima, ha metriche proprie e risponde a una domanda sensata. Ma è una domanda diversa, e i due risultati sono indistinguibili guardandoli: escono entrambi come una classifica ordinata con i decimali.
La confusione fra le due è l’errore più comune di questo mestiere, e assume una forma particolarmente subdola. Nel caso che ho raccontato i gruppi venivano trovati leggendo, quindi il raggruppamento era genuino. Quello che era già deciso non erano i gruppi: era quanto valeva ciascuna categoria di problema, stabilito da un elenco di categorie con accanto un peso, scritto prima di leggere qualsiasi cosa.
Il punto interessante è cosa succede alle cose che in quell’elenco non ci sono. Nel mio elenco non c’era una voce per la pubblicità. Le lamentele sulla pubblicità finivano quindi sotto «altro», che aveva il peso più basso della tabella. Quando poi i temi sono stati fatti emergere dal materiale, la pubblicità è risultata la voce con più prove raccolte di tutte.
Le cose per cui non avete una casella non diventano piccole. Diventano invisibili, e lo diventano in modo indistinguibile dall’essere davvero irrilevanti. È l’unico motivo per cui vale la pena rinunciare alla comodità di una griglia decisa prima.
5. Il numero che dovrebbe dirvi quanti gruppi ci sono e perché spesso non lo fa
Esiste una misura classica, la silhouette, che per ogni elemento confronta quanto è vicino ai compagni di gruppo rispetto a quanto è vicino al gruppo più prossimo. Serve a scegliere quanti gruppi fare: si prova con diverse impostazioni e si tiene quella col punteggio più alto.
Su testi brevi e simili tra loro quella misura spesso non decide, e non è colpa del materiale. Premia i gruppi tondeggianti e ben staccati, e in spazi con moltissime dimensioni le distanze tendono a somigliarsi tutte, il che appiattisce i punteggi e rende le soluzioni indistinguibili.4 Inoltre era nata per scegliere il numero di gruppi dentro una singola rappresentazione, non per confrontarne diverse.5 Su frasi corte il punteggio migliora spezzettando: il massimo si ottiene facendo un gruppo per ogni frase, che come raggruppamento è la definizione del fallimento.
La correzione non è cercare una misura migliore. È togliere a quel numero il potere di decidere e stamparlo come diagnosi: una curva piatta, messa nel documento finale, è la prova che quel criterio non aveva le carte per scegliere. Vale la pena notare che il procedimento migliora togliendo, non aggiungendo.
6. Come si fa, in pratica
Se quel numero non può decidere, resta comunque la differenza tra un raggruppamento che regge e uno prodotto senza accorgersene. La regola operativa è in tre passaggi: prima leggere, poi nominare, poi contare. Mai: nominare, contare, leggere.
Primo passaggio, senza categorie. Per ogni recensione non si chiede «in quale categoria rientra», ma «cosa voleva fare questa persona, e cosa glielo ha impedito». Due campi in linguaggio libero, nelle parole di chi ha scritto. Nessun elenco fornito. A questo stadio non si classifica, si riduce: mille righe di prosa diventano mille coppie obiettivo-ostacolo, molto più maneggevoli e senza aver perso niente.
Una recensione produce quante coppie servono, non una. È il dettaglio che sembra pedanteria e non lo è: se ogni documento produce una voce sola, chi si lamenta di sei cose viene contato sulla prima che nomina, e i problemi che le persone tendono a citare per primi risultano sistematicamente più diffusi. Il conteggio resta plausibile e diventa falso.
Secondo passaggio, i gruppi emergono. Si guarda cosa si somiglia. Su poche centinaia si fa a mano, ordinando alfabeticamente gli ostacoli e scorrendo: i doppioni saltano fuori da soli. Su migliaia servono strumenti che misurino quanto due frasi si somiglino. In entrambi i casi la regola non cambia: il nome del gruppo si scrive dopo aver guardato cosa c’è dentro, con le parole che ci sono dentro.
Terzo passaggio, si conta.
7. Le poche colonne fisse
Per ogni recensione, cinque campi, sempre gli stessi:
- tema principale (uno solo, obbligatorio)
- temi secondari (zero o più)
- tono (lamentela, richiesta, lode: e sì, una stessa recensione può contenerne più di uno)
- tipo di cliente, se ricavabile: chi paga e chi no, chi è nuovo e chi usa il prodotto da anni
- frase di riferimento: il pezzo di testo originale da cui hai ricavato il tema
Perché pochi campi fissi battono la descrizione libera: perché una descrizione libera non si somma. Se per una recensione scrivi «lamenta lentezza generale» e per un’altra «trova il caricamento pesante», hai due frasi diverse per la stessa cosa e nessun modo automatico di accorgertene. Cinque colonne con valori limitati si contano, si ordinano, si filtrano, e soprattutto si controllano.
Il campo che tutti dimenticano è il terzo. Una recensione entusiasta che contiene una richiesta è oro, perché arriva da qualcuno che il prodotto lo usa e lo tiene: se non distingui il tono, quella richiesta finisce nel mucchio delle lamentele e la leggi come un problema invece che come una domanda.
Il campo che quasi nessuno raccoglie è il quarto, ed è quello che cambia le decisioni. Dieci persone che chiedono la stessa cosa non valgono uguale se otto pagano già e due no.
Un’avvertenza sul terzo campo: il tono va registrato, ma non va usato per raggruppare. Si raggruppano lamentele e richieste; le lodi si contano a parte. Se le mescolate finiscono nello stesso gruppo due frasi che dicono il contrario sulla stessa funzione, perché si somigliano nelle parole.
8. La citazione obbligatoria
Ogni riga contata deve puntare alla frase originale da cui è nata. Se non ci si può risalire, il numero non esiste.
È una regola dura e conviene applicarla senza eccezioni, perché è l’unica che impedisce al procedimento di degradare silenziosamente. Un conteggio senza frasi di riferimento continua a funzionare, continua a produrre tabelle credibili, e non c’è nessun momento in cui si rompe visibilmente: semplicemente, dopo qualche settimana, nessuno sa più se sia vero.
Attenzione a un dettaglio che sembra pedanteria e non lo è: la frase deve essere copiata, non riformulata. Un modello linguistico a cui si chiede «qual è la frase che dimostra questo» tende a produrre una parafrasi elegante che nel testo originale non c’è. Sembra la stessa cosa. Non lo è: l’ancoraggio è perso e non se ne accorge nessuno. Il controllo è banale e va automatizzato: la frase riportata deve comparire, carattere per carattere, dentro il testo originale. Se non compare, si butta.
9. Il controllo a campione
Qui la maggior parte delle guide dice «verifica un campione» e passa oltre. I dettagli sono tutto.
Quante righe. Abbastanza da poterle sbagliare in modo informativo. Su un corpus di qualche centinaio, qualche decina di righe è un campione che dice qualcosa; sotto la ventina si misura più il caso che il metodo.
Scelte come. Non le prime venti, che sono quasi sempre le più recenti o le più lunghe. Non quelle che ti incuriosiscono. Estratte a caso, con un criterio riproducibile, e possibilmente stratificate: un po’ per ogni tema e per ogni valutazione, altrimenti controlli il gruppo più numeroso e ignori quelli in cui l’errore è più probabile.
In cieco. Le classificate voi, a mano, senza guardare cosa ha risposto la macchina, e solo dopo confrontate. Sembra una formalità burocratica ed è la parte decisiva: vedere prima la risposta altrui non vi fa copiare, vi fa trovare ragionevole quello che leggete. È la stessa dinamica dell’articolo, applicata a voi che verificate voi stessi.
Cosa fare quando ne sbagliano tre. Dipende da come li sbagliate, non da quanti. Tre errori sparsi e diversi sono rumore: si annotano e si va avanti. Tre errori dello stesso tipo, per esempio tutte le richieste lette come lamentele, non sono errori ma un difetto sistematico: quello va corretto e poi si ricomincia da capo, perché ha inquinato tutto il corpus e non solo le tre righe che avete visto.
Quando buttare tutto. Quando l’accordo è basso e non si riesce a descrivere lo schema degli errori. Un metodo che sbaglia in modo comprensibile si aggiusta; un metodo che sbaglia in modo incomprensibile non si aggiusta, si sostituisce.
Il controllo che nessuno fa, e che vale più di tutti
Prima di prendersela con lo strumento: rifate la stessa classificazione a mano, sulle stesse righe, a qualche giorno di distanza, e confrontatevi con voi stessi.
È scomodo e ci vuole un pomeriggio. Serve perché stabilisce il tetto. L’accordo fra voi e lo strumento non va confrontato con il cento per cento, che non è raggiungibile da nessuno: va confrontato con l’accordo fra voi e voi stessi. Se siete coerenti all’ottanta per cento, uno strumento che vi segue all’ottanta per cento è arrivato dove potevate arrivare voi, e continuare a limarlo è tempo buttato.
Senza questo controllo si finisce sistematicamente in uno dei due errori opposti: buttare uno strumento che andava bene, o fidarsi di uno che andava male. Non c’è modo di sapere in quale dei due siete senza il metro.
10. La prova che separa un gruppo vero da un’idea vostra
Se non c’è il raggruppamento giusto, cosa distingue un gruppo reale da uno prodotto dal modo in cui avete guardato? La risposta della letteratura è semplice e quasi nessuno la applica: la resistenza al ricampionamento.
Il procedimento, dovuto a Christian Hennig, è questo. Si raggruppa normalmente. Poi si estrae dagli stessi dati un nuovo campione della stessa dimensione, pescando con reimmissione, così che alcuni elementi compaiano due volte e altri nessuna. Si raggruppa di nuovo. Per ogni gruppo dell’originale si cerca il più simile nel nuovo e si misura quanto si sovrappongono. Si ripete molte volte. Un gruppo che sotto questo trattamento non ricompare si considera dissolto.6 Le soglie in uso corrente, che sono convenzioni pratiche e non risultati formali: sotto 0,6 un gruppo va trattato come instabile, sopra 0,7 come stabile.
Tolta la meccanica: un gruppo che sopravvive solo alla vostra selezione di dati non è un gruppo, è un’opinione con dentro delle righe. Il controllo costa poco, si automatizza una volta sola, e produce l’unico numero da mettere accanto a ciascun tema quando si presenta il lavoro a qualcuno che ha il diritto di non crederci.
È anche il controllo che nel mio caso non c’è ancora. Lo dico perché è il pezzo mancante più importante di tutto il procedimento, e perché chiunque vi proponga un’analisi di questo tipo dovrebbe essere in grado di dirvi se l’ha fatto.
11. Il secchio degli avanzi
I metodi basati sulla densità hanno un modo esplicito di trattare gli avanzi: separano i gruppi sostenuti da regioni dense e possono lasciare come rumore i punti che non appartengono a nessuno di essi.7 Il procedimento usato nel caso era diverso: il metodo agglomerativo assegnava ogni riga a un gruppo. Non poteva produrre un residuo dichiarato; poteva soltanto nasconderlo dentro un gruppo.
Il segnale da riconoscere: il gruppo più numeroso e insieme il più difficile da nominare non è necessariamente il tema principale. Può essere il residuo che il metodo non sa lasciare fuori. E il residuo dice una cosa diversa e utile: quanta parte del materiale il modo di guardare adottato non riesce a vedere.
Nel caso che ho raccontato il gruppo da 172 era il più numeroso e l’unico rimasto senza nome. La spiegazione tecnica del nome mancante l’ho già data e regge. Ma la composizione suggerisce anche una possibilità diversa, che riguarda il contenuto e non l’etichetta, e le due non si escludono: undici categorie, con la più frequente sotto la metà, sono compatibili con un contenitore di avanzi. Non ho la prova che lo fosse. Ho la coincidenza fra i due segnali che dovrebbero farlo sospettare.
12. Gli strumenti, dal più veloce da mettere in piedi al più lento
Nessuno di questi risolve il problema. Tutti risolvono un pezzo del lavoro e il costo che conta non è il prezzo di listino ma quanto tempo passa prima che lo strumento cominci a restituirvi qualcosa.
Il foglio di calcolo. Va nominato per primo per onestà, e risolve più casi di quanti si creda. Con qualche centinaio di righe, cinque colonne e un paio di tabelle pivot si arriva a un conteggio verificabile e a una classifica per frequenza in un pomeriggio di lavoro. Fa bene: contare, filtrare, ordinare, e tenere insieme il numero e la frase originale nella stessa riga, che è la cosa più importante. Si ferma: quando i doppioni sono formulati in modo diverso, perché il foglio non sa che «lento» e «impiega una vita» sono la stessa cosa, e a quel punto il lavoro lo state facendo a mano voi. Costo di impostazione: quasi zero. È la scelta giusta molto più spesso di quanto ammetta chi vende alternative.
NotebookLM (di Google, con un livello gratuito e piani a pagamento). Carichi i documenti, fai domande, e ottieni risposte con il rimando al punto del documento da cui vengono. È il caso d’uso più vicino a questo articolo, perché la citazione della fonte è nativa e non un’aggiunta: la regola della citazione obbligatoria è imposta dallo strumento invece che dalla vostra disciplina. Fa bene: interrogare un corpus e non perdere l’ancoraggio. Si ferma: non conta. Vi dice che un tema c’è e vi mostra dove, ma se gli chiedete quante volte compare state di nuovo chiedendo un riassunto, con tutti i problemi del riassunto. Costo di impostazione: mezz’ora, ed è il migliore rapporto fra ciò che ottieni e ciò che dovete imparare.
Obsidian. Per chi lavora su testi propri e vuole tenere tutto in locale, senza che niente esca dal suo computer. Fa bene: collegare, annotare, ritrovare, e costruire nel tempo una struttura che è tua e resta tua. Si ferma: non è uno strumento di analisi, è uno strumento di custodia; il conteggio ve lo dovete organizzare. Costo di impostazione: alto, e cresce con la voglia di personalizzare, che è la sua principale trappola.
Notion. Per chi il materiale ce l’ha già lì e vuole solo dargli una forma. Fa bene: imporre le colonne fisse del punto 4 senza che tu debba costruirle, e permettere a più persone di annotare insieme senza sovrascriversi. Si ferma: sui volumi, e sul fatto che diventa comodo abbastanza da farvi smettere di chiedervi se i numeri siano giusti. Costo di impostazione: basso se ci lavori già, alto se lo adotti apposta.
Quando i documenti sono migliaia. Cambia il problema, non solo la scala. A quel punto nessuno di questi basta perché il collo di bottiglia si sposta: non è più leggere, è raggruppare il simile senza deciderlo prima, che richiede di misurare quanto due frasi si somiglino e di stabilire quanto vicine debbano essere per stare insieme. Quella soglia è la decisione più delicata di tutto il procedimento, non esiste un valore giusto in assoluto, e chi ve la nasconde dietro un pulsante ha preso quella decisione al posto vostro. È il momento in cui conviene farsi aiutare da qualcuno, o accettare di lavorare su un campione più piccolo scelto bene, che è quasi sempre l’opzione migliore e quasi sempre l’ultima presa in considerazione.
13. Gli errori che farete
Sono cinque, ripetibili, e nessuno di essi produce un risultato che sembri sbagliato. Producono risultati ordinati, plausibili e presentabili: per questo l’unica difesa è il controllo, non l’occhio.
Fissare il valore prima di conoscere i fatti. Attribuire un peso alle categorie di problema prima di aver letto il materiale è comodo e invisibile: il raggruppamento resta onesto, la classifica no. E quello che non ha una casella nell’elenco finisce sotto «altro», dove il peso è per definizione il più basso.
Imporre la forma del risultato. «Dammi almeno venti gruppi», «quali sono i tre problemi principali», «nessun gruppo troppo grande». Sono vincoli ragionevoli come guardrail e disastrosi come criteri: producono esattamente il numero richiesto e lo fanno sembrare una scoperta.
Delegare una decisione a una soglia scritta mesi prima. Una regola numerica è comoda perché toglie una decisione, e le decisioni che ci togliamo di mezzo sono quelle che non rileggiamo più. Ogni soglia va conservata con la data in cui è stata scelta e il motivo, altrimenti diventa una convinzione.
Confrontare numeri che hanno cambiato significato. Cambiata l’unità di conteggio, i punteggi nuovi non sono paragonabili ai vecchi perché il denominatore è un’altra cosa. Due numeri con lo stesso nome e la stessa forma sembrano la stessa grandezza, e nessuno mette un cartello.
Stampare una precisione che il numero non ha. Tre cifre decimali su un punteggio che non distingue la posizione undici dalla venti sono una promessa non mantenibile. Tre fasce, alto medio basso, sono meno soddisfacenti da guardare e sono oneste.
14. Quando non conviene farlo
Questa sezione esiste perché è quella che vi fa risparmiare i soldi, ed è l’unica del pezzo scritta contro l’interesse di chi la scrive.
Sotto il centinaio di documenti, leggerli tutti è più veloce che impostare qualunque conteggio, e in più li leggete davvero. Il conto comincia a rendere quando il materiale supera quello che siete disposti a rileggere una seconda volta, ed è la seconda lettura che conta.
Con fonti troppo diverse tra loro (recensioni pubbliche, richieste di assistenza, verbali di telefonate) i corpus non si sommano: la stessa persona scrive in modo diverso a seconda di chi la sta ascoltando. Si contano separatamente e si confrontano dopo.
Quando chi scrive non è chi usa. È il limite più serio e non lo risolve nessuno strumento. Chi lascia recensioni è una minoranza autoselezionata, mossa da un’emozione forte in una delle due direzioni. Chi ha un problema medio lo aggira e non scrive niente, ed è quasi sempre il gruppo più numeroso. Un conteggio sulle recensioni misura molto bene la forma del malcontento espresso. Non misura la soddisfazione, e non c’è modo di farglielo dire.
Quando la domanda richiede un giudizio e non un conteggio. «Vale la pena entrare in questo mercato» non è una domanda a cui un conteggio risponde. Dice quali problemi esistono e con che frequenza. Non dice se qualcuno pagherebbe per risolverli, che è un’altra domanda e ha un altro metodo.
E i fenomeni che sfuggono comunque. L’ironia viene letta alla lettera. Il sottinteso non c’è. Il documento che si contraddice al proprio interno viene classificato sulla parte più esplicita. Le recensioni pilotate si sommano alle altre come se fossero persone.
15. Una nota sulla privacy
Se i documenti caricati su un servizio di terzi contengono materiale di clienti, nomi, richieste di assistenza, contratti, la questione non si chiude in un paragrafo. Riguarda tre cose distinte che vengono spesso confuse: cosa entra nell’addestramento dei modelli, cosa dicono i contratti dei fornitori a riguardo, e cosa resta in capo a chi quei dati li ha raccolti, che è il titolare del trattamento anche quando a elaborarli è qualcun altro.
L’avvertimento è questo: la scelta dello strumento è anche una scelta su dove finiscono i documenti dei propri clienti, e arriva prima del primo caricamento. Il caso raccontato qui era più semplice, perché il materiale erano recensioni pubbliche e non documenti di un cliente. Restano dati personali anche quelli, e accessibile non vuol dire libero.
16. Dove si è spostato il problema
Tolto l’elenco dei temi, resta in piedi il numero dei temi. La soglia che decide quanto due frasi debbano somigliarsi per finire insieme viene cercata automaticamente, ma con due vincoli scritti nella configurazione: un tetto alla quota di materiale che un singolo gruppo può prendersi, e un numero minimo di gruppi, che è venti. Sono richieste sulla forma del risultato, non misure di quanto quella partizione sia sostenuta dai dati. Con quei vincoli, trovare venti gruppi non è una scoperta: è una condizione di uscita.
Il programma non decide più di cosa parli la gente. Decide ancora in quante cose la gente parli, e quel numero l’ho scritto io.
Da cui la domanda da fare a chiunque vi consegni una segmentazione, ed è una sola: chi ha scelto quanti gruppi fare, e in base a cosa? Nove volte su dieci la risposta è un parametro. Ogni tanto è una misura. La differenza è tutto.
17. La forma del risultato
A fine lavoro, quello che resta è meno spettacolare di quanto si immagini, e questo è un bene.
Resta una tabella con una riga per ogni recensione e le cinque colonne fisse. Resta un elenco di temi con, accanto, quante volte compaiono, da quante persone diverse, e con quale tono. Resta, per ogni tema, l’elenco delle frasi originali da cui è stato ricavato, così che chiunque possa risalire dal numero alla riga. Resta il risultato del controllo a campione, con gli errori trovati e il loro tipo. E resta l’elenco delle cose che il conteggio non è in grado di dire, scritto insieme al resto e non nascosto in fondo.
Non resta una raccomandazione, perché quella dipende da cose che nelle recensioni non ci sono.
Nota sui grafici, e perché qui non ce ne sono
In questo campo il grafico d’ordinanza è la nuvola di puntini colorati: migliaia di dimensioni schiacciate su due, ogni colore un gruppo. È bello, si mette nelle presentazioni e va letto sapendo che due cose che l’occhio fa automaticamente sono sbagliate.
La prima: non si possono leggere le dimensioni relative dei gruppi. L’algoritmo più diffuso dilata i gruppi densi e comprime quelli radi, per costruzione, quindi due macchie della stessa grandezza possono contenere numeri di elementi molto diversi.8 La seconda: le distanze tra le macchie possono non voler dire niente. Questi metodi conservano chi sta vicino a chi, non quanto.9 Che l’errore sia diffuso non è un’impressione: una rassegna di 114 lavori scientifici lo documenta come pratica corrente.10
I grafici che valgono, in questo mestiere, sono altri e più noiosi: quanto ogni gruppo resiste al ricampionamento, dove la macchina e un essere umano si sono trovati in disaccordo, e come si comporta la misura che avrebbe dovuto decidere quanti gruppi fare. Tre figure brutte che dicono se il lavoro tiene. La nuvola colorata dice come sta il lavoro in fotografia.
Bibliografia
Footnotes
-
Kleinberg, Jon M. “An Impossibility Theorem for Clustering.” Neural Information Processing Systems (2002). https://proceedings.neurips.cc/paper/2002/hash/43e4e6a6f341e00671e123714de019a8-Abstract.html ↩
-
Guyon, Isabelle & Luxburg, Ulrike & Williamson, Robert. (2009). Clustering: Science or art. https://proceedings.mlr.press/v27/luxburg12a.html ↩
-
Rautenstrauch, P., & Ohler, U. (2025). Shortcomings of silhouette in single-cell integration benchmarking. Nature Biotechnology. https://doi.org/10.1038/s41587-025-02743-4 ↩
-
P. J. Rousseeuw, Silhouettes: a graphical aid to the interpretation and validation of cluster analysis, Journal of Computational and Applied Mathematics 20, 1987, per la misura originale (https://doi.org/10.1016/0377-0427(87)90125-7). Sulla concentrazione delle distanze in alta dimensionalità: K. Beyer et al., When Is Nearest Neighbor Meaningful?, ICDT 1999 (https://doi.org/10.1007/3-540-49257-7_15). ↩
-
Rautenstrauch, P., & Ohler, U. (2025). Shortcomings of silhouette in single-cell integration benchmarking. Nature Biotechnology. https://doi.org/10.1038/s41587-025-02743-4 ↩
-
C. Hennig, Cluster-wise assessment of cluster stability, Computational Statistics & Data Analysis 52, 2007 (https://doi.org/10.1016/j.csda.2006.11.025). Implementazione di riferimento:
clusterbootnel pacchetto Rfpc(https://cran.r-project.org/package=fpc). Si veda anche C. Hennig, What are the true clusters?, Pattern Recognition Letters 64, 2015 (https://doi.org/10.1016/j.patrec.2015.04.009). ↩ -
R. J. G. B. Campello, D. Moulavi, J. Sander, Density-Based Clustering Based on Hierarchical Density Estimates, Advances in Knowledge Discovery and Data Mining, PAKDD 2013, pp. 160–172. https://doi.org/10.1007/978-3-642-37456-2_14 ↩
-
M. Wattenberg, F. Viégas, I. Johnson, How to Use t-SNE Effectively, Distill, 2016. https://doi.org/10.23915/distill.00002 ↩
-
L. McInnes, J. Healy, J. Melville, UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction, arXiv:1802.03426, 2018. https://arxiv.org/abs/1802.03426 ↩
-
H. Jeon, J. Park, S. Shin, J. Seo, Stop Misusing t-SNE and UMAP for Visual Analytics, arXiv:2506.08725, 2025. https://arxiv.org/abs/2506.08725 ↩