MECCANISMOUNICO.IT

Tempo di lettura:

5–8 minuti

Meno di una volta su cento.

È la probabilità che ChatGPT o l’AI di Google, a cui fai la stessa domanda cento volte, ti restituiscano la stessa lista di aziende consigliate. Se vuoi anche lo stesso ordine si scende a circa una volta su mille. L’hanno misurato SparkToro e Gumshoe tra novembre e dicembre scorsi, con 600 volontari e quasi 3.000 esecuzioni degli stessi prompt su ChatGPT, Claude e Google.

Nello stesso periodo sono nati decine di strumenti che vendono un numero: la tua AI visibility, cioè quanto spesso le intelligenze artificiali ti nominano quando qualcuno chiede un fornitore come te. Te lo mostrano in una dashboard con la freccia verde o rossa rispetto al mese prima.

La domanda che quasi nessuno si fa è quanta parte di quella freccia sia rumore.

Per chi è (e per chi no) questo articolo

Questo articolo è per te se:

  • stai valutando uno strumento per sapere se ChatGPT, Gemini o Perplexity ti citano
  • ricevi già un report mensile di AI visibility, fatto da te o dall’agenzia, e non sai bene cosa farci
  • lavori in un settore B2B di nicchia dove i clienti possibili sono centinaia e non milioni

Non è per te se:

  • cerchi una classifica dei migliori tool, ce ne sono già parecchie
  • lavori in un grande marchio consumer con un analista dedicato e migliaia di prompt monitorati
  • vuoi sapere come farti citare di più: qui si parla di come leggere il numero, non di come alzarlo

Cosa c’è dentro quel numero

Da quando le risposte le dà direttamente l’AI, come raccontavo parlando di SEO nel 2026, sapere se ti nomina è diventata una domanda legittima. Il problema è come ci si risponde.

Semplificando, uno strumento di AI visibility fa tre cose. Prende una lista di domande. Le rivolge ogni giorno a due o tre modelli. Conta in quante risposte compare il tuo nome e magari quello dei concorrenti.

I piani d’ingresso sembrano generosi. Uno dei più usati, Peec AI, parte da 50 prompt eseguiti ogni giorno su tre modelli: fanno 4.500 risposte al mese, un numero che dà una bella sensazione di solidità.

Però quelle 4.500 risposte non sono 4.500 osservazioni indipendenti. Sono le stesse 50 domande ripetute. E le 50 domande le ha scelte qualcuno, di solito in un pomeriggio.

Due tipi di rumore (e il tool ne toglie uno solo)

Il primo è quello misurato da SparkToro: la stessa domanda produce risposte diverse a ogni giro. Qui la ripetizione funziona davvero. Se fai la stessa domanda trenta volte capisci abbastanza bene quanto spesso compari, anche se l’ordine della lista cambia sempre. Lo studio conclude proprio questo: la percentuale di presenza su tante esecuzioni è una misura ragionevole mentre la “posizione in classifica” dentro l’AI non significa niente.

Il secondo rumore è la scelta delle domande. E questo la ripetizione non lo tocca.

A fine luglio Go Fish Digital ha misurato la propria visibilità su oltre 1.500 risposte. Compariva nel 23,6% dei prompt scritti per categoria, del tipo “migliori agenzie SEO per aziende software”, e solo nel 3,6% di quelli che descrivono la situazione di un acquirente vero con i suoi vincoli e le sue parole. Stessa azienda e stessa settimana, ma un punteggio più di sei volte diverso a seconda di come si formula la domanda.

Il punteggio misura quanto sei visibile sulle domande che hai deciso di monitorare. Tutto il resto è fuori dal campione.

Il margine d’errore che nessuna dashboard mostra

Facciamo un conto a spanne con la statistica che si studia alle superiori. Se il tuo nome compare più o meno in una domanda su cinque e le domande monitorate sono 50, il margine d’errore di quella stima è intorno ai dieci punti percentuali in più o in meno.

Vuol dire che un passaggio dal 18% al 24% da un mese all’altro può essere tutto rumore. Basta un aggiornamento del modello, un concorrente che ha fatto uscire un comunicato o due domande che quel mese sono cadute dalla parte giusta. Poi ci sono i ritocchi alla lista: ogni volta che qualcuno aggiunge o toglie prompt la serie storica ricomincia da capo, anche se il grafico prosegue come se niente fosse.

Nel B2B di nicchia il problema pesa di più. Le domande che fanno davvero i tuoi clienti sono poche e molto specifiche, e sui temi stretti i modelli hanno meno materiale da cui pescare. Le risposte ballano di più proprio dove a te interessa.

Quanto costa decidere su un numero che balla

L’abbonamento è la parte che si vede. Il costo vero arriva dopo, quando il numero comincia a guidare le decisioni.

Lo schema tipico è questo:

  • il punteggio scende di qualche punto e parte la riscrittura delle pagine servizio
  • il mese dopo risale per conto suo e la riscrittura si prende il merito
  • a fine anno nessuno sa più dire cosa abbia funzionato e cosa no

Succede lo stesso con i report delle campagne quando nessuno tiene traccia di cosa si è imparato davvero, ed è uno dei motivi per cui suggerisco di chiederlo per iscritto all’agenzia parlando di Meta Andromeda.

È lo stesso meccanismo che descrivo parlando di server-side tracking e dati falsati. Quando una metrica comoda prende il posto di quella vera il costo non sparisce. Si sposta sulle decisioni che ci costruisci sopra.

Come lo leggerei in una PMI B2B

Non serve rinunciare alla misura. Serve cambiare l’ordine in cui la si imposta:

  1. prima di scegliere il tool scrivi quale decisione cambieresti in base al numero, e se non ne trovi nessuna aspetta
  2. costruisci le domande con le parole vere dei clienti: mail, richieste di preventivo, appunti dei commerciali, le query più lunghe di Search Console
  3. tieni separate le domande di categoria da quelle di situazione e non farne mai una media
  4. congela la lista per almeno un trimestre e leggi il dato a trimestre
  5. confronta con il CRM chiedendo ai nuovi contatti se hanno usato un assistente AI per trovare o confrontare fornitori

Se poi scopri che sulle domande di situazione non compari quasi mai, il problema probabilmente non si risolve dentro lo strumento. È lo scenario che racconto parlando degli agenti AI che scelgono i fornitori B2B: prima di misurare quanto ti citano conviene chiedersi cosa dovrebbero citare.

Il punto chiave

Un punteggio di AI visibility è una stima fatta su un campione di domande scelto da qualcuno, con un margine d’errore spesso più largo delle variazioni che ti mostra. Va usato per leggere tendenze lente su domande che non cambi, non per reagire alla freccia del mese. Se la decisione che ne ricavi resterebbe uguale con cinque punti in più o in meno, quel numero ti costa attenzione e non ti dà niente in cambio.

Cosa fare ora

  • se non hai ancora un tool, prova a mano: dieci domande prese dalle mail dei clienti, fatte cinque volte ciascuna su due assistenti, annotando solo se compari
  • se ricevi già un report chiedi a chi lo produce quante domande monitora, da dove arrivano e quando sono state cambiate l’ultima volta
  • ignora qualsiasi “posizione media nell’AI”, anche se è il numero più grande della dashboard
  • tratta ogni variazione sotto i dieci punti come un’ipotesi da verificare
  • aggiungi al primo contatto una domanda sugli assistenti AI e rileggi le risposte a fine trimestre accanto al punteggio