86 % des citations obtenues par une marque dans les réponses IA viennent de sources qu’elle contrôle déjà : son site, ses réseaux, ses fiches d’annuaire, qui à elles seules pèsent 44 % du total, d’après Yext, sur 1,6 million de réponses LLM, étude publiée le 9 octobre 2025. Reste à savoir si votre marque en fait partie. Le protocole ci-dessous couvre ChatGPT, Perplexity, Claude et Gemini, avec un tableau de suivi et 4 indicateurs à remplir chaque semaine.
Pour mesurer la visibilité d’une marque sur ChatGPT et Perplexity, il faut poser les mêmes prompts représentatifs des questions clients, en session privée, sur plusieurs moteurs, à intervalle régulier, puis noter dans un tableau si la marque est citée et sous quelle forme. Le sentiment se note à part. Comptez 30 minutes par semaine pour obtenir une tendance exploitable au bout d’un mois.
Ce qu’il faut avant de commencer
Un tableur suffit. Google Sheets ou Notion font l’affaire, à condition d’arrêter d’éparpiller les prompts dans des documents séparés : c’est souvent ce qui rend le suivi ingérable au bout de quelques semaines. Ouvrez ChatGPT et Perplexity dans une fenêtre de navigation privée (Cmd + Maj + N sous Chrome, Ctrl + Maj + N sous Firefox et Edge). Un compte gratuit couvre l’essentiel pour démarrer. Préparez une liste de 10 à 15 prompts pour un premier suivi hebdomadaire. Un audit complet, lui, teste une cinquantaine de requêtes pour rester statistiquement représentatif. Comptez environ 1 heure de collecte la première semaine, le temps de roder le protocole, puis 30 minutes une fois la routine posée.
Construire la liste de prompts à tester
Les prompts qui comptent sont ceux qu’un client poserait avant d’acheter. Évitez les variations autour de votre propre nom de marque : elles ne testent rien, puisque la marque cherchée est déjà connue du modèle. Partez des questions déjà posées à votre service client, des recherches « meilleur X pour Y » et des comparatifs sectoriels que vos prospects consultent. Quatre familles couvrent la plupart des cas :
- Recommandation générique : « quel outil de [catégorie] choisir pour [contexte] ? »
- Comparaison directe : « différence entre [marque A] et [marque B] »
- Résolution de problème : « comment résoudre [problème que votre produit adresse] ? »
- Question de niche : une requête précise sur un cas d’usage secondaire
Perplexity est pensé comme un moteur de recherche IA, avec une architecture proche du RAG (retrieval-augmented generation) : il récupère des pages web sources avant de rédiger sa réponse. C’est ce mécanisme qui explique pourquoi il puise jusqu’à 24 % de ses citations dans des sources de niche sur les requêtes sans marque explicite. Gardez la formulation identique d’une semaine sur l’autre. Changer un mot change parfois la réponse.
Lancer le test dans ChatGPT, Perplexity, Claude et Gemini
Le protocole tient en cinq étapes, à répéter pour chaque prompt de la liste.
- Ouvrez une fenêtre de navigation privée par moteur testé : ChatGPT, Perplexity, Claude, Gemini. L’historique de conversation influence les réponses suivantes, la session doit repartir de zéro.
- Collez le prompt tel quel, sans le reformuler ni ajouter de contexte sur votre marque.
- Relancez le même prompt 2 à 3 fois dans des sessions distinctes. Une seule réponse ne prouve rien : les modèles varient leurs sorties d’un run à l’autre, y compris sur le même moteur et la même heure.
- Notez la réponse complète, pas seulement si la marque apparaît. Consignez la position dans la liste et le nombre de concurrents cités. Sur Perplexity, vérifiez aussi sous le bouton « Sources », en bas de chaque réponse, si un lien pointe vers votre site.
- Ne chaînez jamais deux prompts différents dans la même conversation : le context window accumulé contamine la réponse suivante.
Précisez aussi le modèle exact, pas seulement la plateforme : sur le sélecteur souvent nommé « Modèle » en haut de l’écran, GPT-5.1, Claude Opus 5.5 et la dernière version de Gemini ne répondent pas de la même façon au même prompt. Un écart de 615 fois entre Grok et Claude sur le volume de citations d’une même marque a été mesuré en mars 2026, d’après Superlines. Tester un seul moteur revient à ignorer l’essentiel du signal.
Suivre les résultats dans un tableau
Chaque ligne du tableau correspond à un test : un prompt, sur un moteur, à une date donnée. Voici la structure minimale, avec deux lignes d’exemple.
| Date | Moteur | Marque citée | Citation avec lien | Concurrents cités | Sentiment |
|---|---|---|---|---|---|
| 03/03/2026 | ChatGPT | Oui, 2e position | Non | 3 | Neutre |
| 03/03/2026 | Perplexity | Oui, 1re position | Oui | 2 | Positif |
ChatGPT cite une marque 3,2 fois plus souvent qu’il ne fournit un lien vers sa source. La colonne « Citation avec lien » reste donc vide la plupart du temps et c’est attendu : elle distingue la mention simple, qui construit une association mentale, de la citation sourcée, qui peut générer un clic réel.
Les 4 KPI qui comptent
Le taux de mention (brand mention rate) se calcule ainsi : nombre de réponses citant la marque, divisé par le nombre total de prompts testés, multiplié par 100. Sur un panel de 15 prompts interrogés 3 fois sur 4 moteurs, la base de calcul monte à 180 réponses par semaine.
Le taux de citation (citation rate) ne compte, lui, que les mentions accompagnées d’un lien source cliquable vers votre site. Un taux de mention élevé et un taux de citation faible signifient que la marque est connue du modèle, sans que son contenu remonte comme source vérifiable.
Le sentiment se code en positif ou négatif, avec une valeur neutre par défaut quand la mention n’est qu’une ligne dans une liste de solutions. Un sentiment négatif répété sur le même prompt appelle un contenu correctif ciblé sur ce point précis.
Le share of voice compare votre taux de mention à celui des concurrents cités sur les mêmes prompts, prompt par prompt. C’est ce chiffre-là qui doit guider la priorité de contenu, pas l’autorité de domaine seule.
Calculez ces quatre indicateurs en fin de semaine de collecte, jamais en cours de route : un taux de mention recalculé après 3 prompts sur 15 n’a aucune valeur, il faut le panel complet. Reportez les quatre chiffres sur la même ligne que la semaine dans le tableau, ils se lisent ensemble, jamais isolément.
Lire les résultats sans se tromper
Quand le taux de citation baisse pour tout un secteur au même moment, la cause est un changement de modèle ou de pondération côté OpenAI, Anthropic ou Perplexity. Votre marque n’y est pour rien : notez-le dans le tableau et continuez le protocole sans dévier. Une baisse isolée sur votre seule marque se lit dans votre propre tableau : comparez la semaine du décrochage aux trois précédentes avant de conclure quoi que ce soit.
Une étude Ahrefs sur la manière dont ChatGPT fait chuter le trafic organique des sites confirme pourquoi ce suivi vaut la peine : d’après Semrush, 93 % des sessions de recherche dans l’AI Mode se terminent sans clic externe. Le trafic de référence généré reste marginal, 1,08 % du trafic web global mais ChatGPT en concentre 87,4 % à lui seul avec un taux de conversion de 15,9 % contre 1,76 % pour le SEO classique : une marque citée sans être cliquée reste une marque qui ne le sait jamais si personne ne fait tourner ce protocole.
Pièges courants
Tester en étant connecté à son propre compte ChatGPT biaise la réponse : l’historique de conversation et les préférences mémorisées influencent ce que le modèle met en avant. Testez toujours déconnecté. Si vous devez rester connecté, désactivez au minimum la mémoire depuis Paramètres > Personnalisation > Mémoire.
Ne confondez pas votre position Google et votre visibilité dans les réponses IA : ce sont deux mesures indépendantes, chacune avec son propre protocole. Ahrefs a mesuré en 2026 que 80 % des citations LLM proviennent de pages absentes du top 100 Google, contre seulement 38 % pour les citations dans les AI Overviews, plus proches du SEO classique. Un bon classement Google ne dispense jamais de faire tourner le test ci-dessus, ni l’inverse.
Publier un nouveau contenu et re-tester une semaine plus tard pour juger de son effet n’a pas de sens : l’impact d’un contenu neuf sur les réponses des LLM prend généralement 3 à 6 mois à se matérialiser, rarement quelques jours.
Dernier piège : oublier de fixer une base de référence avant de commencer. Sans mesure du mois 0, aucune évolution suivante n’est interprétable, seulement une photo isolée.
Faire tenir le protocole dans la durée
Le tableau manuel tient jusqu’à 15-20 prompts par semaine. Au-delà, le copier-coller devient le vrai goulot d’étranglement, pas l’analyse. Dupliquez l’onglet du tableur chaque semaine plutôt que d’empiler les lignes dans un seul onglet géant : ça évite d’écraser l’historique par erreur de copier-coller et ça garde chaque semaine comparable à la précédente en un coup d’œil, sans filtre à reconstruire à chaque fois.
Datez chaque onglet au format AAAA-MM-JJ, par exemple 2026-03-03, plutôt que « semaine 1 » : au bout de 3 mois de collecte, retrouver la bonne semaine devient sinon un jeu de devinettes.
Après quatre semaines de suivi
Le tableau donne une tendance sur le taux de mention et le taux de citation, moteur par moteur, comparée à la semaine 1. Le sentiment se lit à part, sur les mêmes lignes. Si le taux de citation stagne sous 20 % après 28 jours, retravaillez en priorité le contenu qui répond aux prompts de niche plutôt que d’ajouter des prompts au tableau. Fixez le prochain point de mesure dans 28 jours, le même jour.