Citations IA : ce que disent vraiment les 54 études compilées par Cyrus Shepard
Lecture critique de la méta-analyse de Cyrus Shepard sur les 23 facteurs de citations IA, prolongée par un découpage en 5 familles opérationnelles et des sources récentes qui actualisent le débat.
On est tous d'accord pour affirmer que la visibilité sur les moteurs de réponses IA est désormais une priorité de l'acquisition organique. C'est encore plus le cas aujourd'hui que les AI Overviews sont disponibles en France depuis le 22 juillet 2026.
Au niveau des leviers pour améliorer sa visibilité sur ces moteurs, les approches restent encore très approximatives. Les études se sont multipliées et il nous manquait une vue d'ensemble.
Cyrus Shepard, fondateur de Zyppy est venu proposer une étude complète compilant un total de 54 études, brevets et expérimentations. Son objectif n'était pas de proposer une nouvelle liste, l'objectif était surtout de consolider ce qui existe en pondérant chaque facteur de citation dans une grille selon 3 critères : des observations répétées, leur force et enfin le support officiel de chaque plateforme.
Son travail est donc une base très solide et potentiellement suffisante pour déployer une stratégie de visibilité sur les moteurs IA. 2 limites subsistent cependant : cette étude reste une photographie à un instant précis (dont les données datent de juillet 2025). Il ne donne pas non plus d'ordre ou de priorisation.
Dans cet article nous allons confronter cette grille aux différentes mesures parues depuis celle-ci et proposer une classification par famille afin de traduire cette liste en une réelle approche stratégique.
Sommaire
- Ce que Shepard a fait, et pourquoi son article compte
- Cinq familles, et l'ordre dans lequel elles se traitent
- Famille 1, l'accessibilité technique : la condition de tout le reste
- Famille 2, la performance dans la recherche : être récupéré avant d'être cité
- Famille 3, la structure et la formulation : ce qui se joue dans la page
- Famille 4, les signaux de confiance et d'entité : le chantier long
- Famille 5, l'arbitrage : ce qui reste quand les quatre autres sont traitées
- Par où commencer
1. Ce que Shepard a fait, et pourquoi son article compte
On doit rappeler que Cyrus Shepard est une personnalité très connue dans le secteur du SEO et maintenant du GEO. Il est le fondateur de Zyppy SEO et ancien Head of SEO chez Moz. Il publie du contenu depuis plus de 15 ans sur les facteurs de classement.
Comme nous l'avons dit, sa méthode a été de compiler les études disponibles publiquement et d'en compiler toutes les données. Il est parti de 75 sources et il a restreint son analyse à 54 en prenant bien entendu les analyses les plus fiables du marché. Sur cette base, il a catégorisé, croisé et isolé chaque observation et constat afin de leur attribuer un score sur 3 critères :
- Répétabilité : combien d'études convergent vers un même facteur
- Force des preuves : un scoring selon l'ampleur des analyses source
- Support officiel : la documentation officielle confirme-t-elle ce facteur ?
Cette méthode de scoring peut sembler rudimentaire mais je pense qu'elle fait un bon travail, les études de grande envergure se voient attribuer un scoring plus fort ce qui est tout à fait logique. Si un facteur revient systématiquement, il gagne également en score.
Un point fort qui ressort de cette étude et qui ne me surprend pas, c'est que les fondamentaux qui ressortent de cette étude sont globalement très proches de ceux qu'on connait en SEO classique. Ce n'est évidemment pas un constat surprenant et remet en question la rupture méthodologique que beaucoup affirment sur le marché.
Un point fort de cette étude est qu'elle rétablira certaines vérités sur des fausses promesses qui circulent sur le marché et elle révèle aussi une dissociation grandissante entre classement et citation et enfin l'apparition de nouveaux signaux moins connus.
2. Cinq familles, et l'ordre dans lequel elles se traitent
Dans son article, Cyrus Shepard conclut en proposant des catégories conceptuelles (Relevance, Trust, Topical Authority, Extractability).
Dans cette analyse, j'ai décidé de classifier autrement et de raisonner davantage sur un regroupement plus opérationnel quand on pose une stratégie. J'ai pour cela constitué 5 familles correspondant chacune à 5 terrains d'intervention :
- Famille 1 Accessibilité technique : Vos pages sont-elles visibles et explorables par les moteurs
- Famille 2 Performance dans la recherche : Votre positionnement organique
- Famille 3 Structure et formulation : tout ce qui concerne la structure et sémantique d'une page
- Famille 4 Signaux de confiance et d'entité : tout ce qui place la marque et ses auteurs autour d'une entité reconnaissable.
- Famille 5 L'arbitrage : J'y place ici le reste des facteurs davantage sujets à débat et sur lesquels on va moins reposer sa stratégie
Ce que je souhaitais apporter à l'analyse de Cyrus Shepard réside surtout dans l'organisation et la manière d'approcher cette grille en répondant à une question centrale : par où commencer ?
Ce qui est certain, on ne peut prendre les critères de cette grille par ordre de pondération, on doit raisonner autrement en exploitant davantage une bonne classification et nous allons voir en détail celle que je propose dans cet article.
| Rang | Ce qui le justifie | Statut |
|---|---|---|
| 1. Accessibilité | Cette catégorie compte parmi les facteurs les plus importants et place cette famille comme base d'approche | mesuré |
| 2. Recherche | Cette famille vient après 5 facteurs distincts relativement importants | mesuré |
| 3. Page | C'est l'une des familles les plus denses et potentiellement le cœur du travail | mesuré |
| 4. Entité | C'est la famille qui rassemble les leviers les plus longs et difficiles, c'est évidemment aussi l'une des plus importantes mais pas pour amorcer une stratégie | éditorial |
| 5. Arbitrage | C'est le reste qui reste entièrement de l'arbitrage, c'est la famille qui pèse le moins | éditorial |
Je rappelle bien que cet ordre ne suit donc pas la pondération mais un ordre plus logique de déploiement, évidemment cela est fonction de votre niveau de maturité sur le marché que vous ciblez. Un leader peut très vite prioriser la famille 4 car il sera bon sur les précédentes.
3. Famille 1, l'accessibilité technique : la condition qui détermine tout le reste
C'est la famille qui rassemble les chantiers les plus simples mais aussi les plus essentiels surtout quand le socle de base n'est pas sain. En SEO vous avez appris à ne jamais travailler sa popularité sur un site cassé techniquement, c'est un peu le même principe.

On va commencer par revenir sur les différentes catégories de bots IA (j'en exclus donc les bots classiques)
Nous avons donc :
- Les bots d'entraînement qui constituent un corpus
- Les bots de recherche IA qui produisent un index interrogeable
- Les récupérations déclenchées par l'utilisateur qui pose une question
Voici un tableau de classification des différents bots à connaitre :
| Agent | Éditeur | Ce qu'il fait réellement | Ce que le blocage coûte | Visible dans les logs |
|---|---|---|---|---|
| GPTBot | OpenAI | Récupère pour l'entraînement | La connaissance du modèle à long terme | oui |
| OAI-SearchBot | OpenAI | Alimente l'index de recherche | Votre présence dans les réponses ChatGPT | oui |
| ChatGPT-User | OpenAI | Récupère à la demande d'un utilisateur | La page ouverte depuis une conversation | oui |
| ClaudeBot | Anthropic | Récupère pour l'entraînement | La connaissance du modèle à long terme | oui |
| Claude-SearchBot | Anthropic | Alimente l'index de recherche | Votre présence dans les réponses Claude | oui |
| Claude-User | Anthropic | Récupère à la demande d'un utilisateur | La page ouverte depuis une conversation | oui |
| PerplexityBot | Perplexity | Explore et indexe | Votre présence dans les réponses Perplexity | oui |
| Googlebot | Alimente l'index Search, donc les AI Overviews | Votre présence dans Google, tout court | oui | |
| Google-Extended | Jeton de contrôle, pas un robot. Décide si le contenu déjà exploré peut nourrir l'entraînement Gemini et Vertex | Périmètre à vérifier en primaire avant écriture : entraînement seul, ou entraînement et grounding des applications Gemini | non | |
| Applebot-Extended | Apple | Jeton de contrôle, même fonctionnement | L'entraînement Apple Intelligence | non |
Une petite remarque concernant Google-Extended, il est assez particulier et vous ne le verrez jamais dans les logs serveur.
La décision de bloquer des robots se décide surtout par intérêt économique, un média dont le modèle économique réside dans les abonnements au contenu, doit protéger ses contenus de l'exploration. Un site e-commerce en ligne qui cherche de la visibilité et des recommandations n'a pas de raison apparente de bloquer les robots IA.
Les directives qui limitent l'extraction
3 directives à connaitre et qui limitent l'extraction par les bots : nosnippet, data-nosnippet et max-snippet
À utiliser stratégiquement quand on souhaite maitriser l'extraction sur une page
Le contenu présent mais inaccessible
Tout le contenu nécessitant un clic suppose une réduction forte de son extractabilité.
Les bots IA se concentrent avant tout sur le contenu visible et accessible rapidement.
L'affichage au clic est un frein majeur à l'extraction.
Le blocage au niveau du pare-feu
Ce point est essentiel et soulève une problématique invisible aux outils standards, vous pouvez proposer un robots.txt entièrement permissif et subir un blocage au niveau du réseau de diffusion. Ce blocage invisible peut constituer un frein majeur.
Un audit des logs serveur s'impose pour confirmer que les bots reçoivent bien tous un code 200.
4. Famille 2, la performance dans la recherche : être récupéré avant d'être cité
C'est sur cette famille que nous allons développer davantage l'analyse de Shepard.

Récupéré, cité, retenu
Nous allons partir d'une grille de progression posé par Kevin Indig en 3 étapes : Récupéré, cité, retenu
Pour la première phase on parle du rang de récupération (et pas celui de Google) : on parle donc du classement d'une page dans la recherche interne du moteur. La citation augmente avec le rang bien entendu.
Pour la seconde, il faut intégrer un pool de domaines qui feront l'objet des citations (ce même pool peut représenter les 2 tiers des citations)
Enfin la phase 3 qui concerne la mémoire de marque que nous n'allons pas développer ici mais qui constitue un échelon supplémentaire de visibilité et qui peut aussi se décorréler de la citation.
L'influence du top 10 Google, huit mois plus tard
Un des arguments fondateurs de Shepard affirmait que le rang Google influençait les citations. Une étude Ahrefs publiée en juillet 2025 sur 1,9 million de citations affirmait que 76 % des URL des AI Overviews appartenaient également au TOP 10 organique sur une même requête bien entendu.
Il s'avère que cette corrélation s'est remise en question avec le temps.
Ce sont en fait plusieurs études qui se sont succédé qui font tomber le chiffre à la baisse
Voici un tableau qui le résume bien.
| Série | Période | Échantillon | Ce qui est mesuré | Résultat |
|---|---|---|---|---|
| Ahrefs | juillet 2025 | 1,9 M citations | Part des citations AIO issues du top 10 | 76 % |
| Ahrefs | mars 2026 | 863 K SERP / 4 M URL | Idem | 38 % |
| BrightEdge | octobre 2025 | n.c. | Idem, méthodologie distincte | 54 % |
| BrightEdge | février 2026 | n.c. | Idem | 17 % |
| SE Ranking | février 2026 | 100 K mots-clés, US | Chevauchement de sources par requête, pas une part de citations | 19 % |
Selon Ahrefs les écarts constatés ne sont pas dus qu'au changement des moteurs mais à la méthodologie d'analyse qui a été améliorée. Un résultat donc plus réaliste et donc une vision plus fiable.
YouTube est un des domaines les plus cités et pèse à lui tout seul plus de 18 % des citations.
On confirme donc que Google cherche aussi des formats qui ne se positionnent pas en top 10 du classement organique.
2 explications pour cette baisse : le passage à Gemini 3 et la généralisation du fan-out qui repose sur un sourcing plus étendu et plus dense.
Ce qu'il faut donc en retenir c'est que l'impact du ranking n'est donc pas une systématique et ouvre des opportunités aux acteurs en déficit de visibilité SEO.
Le fan-out
C'est un autre facteur important de la grille de Shepard. C'est un mécanisme essentiel mais qui n'est pas encore compris de tous. Il a été documenté par Google au travers de 2 brevets.
Le principe est assez simple, le fan-out consiste à décomposer une requête en plusieurs sous-requêtes thématiques qui sont toutes exécutées en parallèle et qui explorent des facettes adjacentes. On parle de facettes de comparaison, de variante, d'intention secondaire, entité liées. L'ensemble de ces fan-out sert au final à la formulation de la réponse finale.
Le classement sur une sous-requête du fan-out peut suffire à la citation et c'est la grande différence qui réside ici avec le SEO classique. La notion de facettes prend toute son importance. Cet effet augmente si le nombre de sous-requêtes correctement ciblées augmente.
C'est ce constat qui fait monter le facteur de la couverture thématique (le "topic cluster ranking") qui repose sur ce mécanisme.
Le mode raisonnement
Le mode raisonnement est le degré d'effort d'un LLM calibre sa capacité à chercher de l'information. Dans le cas où un utilisateur sollicite une version plus aboutie avec un effort "élevé", le comportement de recherche peut radicalement changer et la recherche de source peut fortement s'étendre.
Ce facteur qui dépend de la configuration côté utilisateur influence fortement la citation.
Elle dépend simplement de la demande de l'utilisateur qui sollicite le modèle sur un sujet spécifique qu'il n'aurait pas été chercher.
Ce que les liens font encore
Ce qui peut surprendre sur la grille de Shepard est la place du Domain Authority avec une note assez basse de 5,0 alors qu'il s'agit d'un indicateur historiquement important.
Parmi les études que Shepard a repris sur ce sujet, il y a celle de Semrush faite sur 1 000 domaines croisés sur 5 modèles. Les constats qui en ressortent sont surtout l'importance de la qualité, la revalorisation des liens nofollow et des liens images. L'impact de l'autorité se révèle cependant limité au delà d'un certain seuil.
L'autorité à elle seule n'est plus un critère suffisant.
5. Famille 3, la structure et la formulation : ce qui se joue dans la page
C'est la famille qui rassemble le plus de critères et qui sont généralement les plus actionnables. Cette famille peut occuper une majeure partie de votre stratégie.

Placer les informations essentielles rapidement
Il ne faut pas croire que les pages sont explorées intégralement, un plafond de récupération est appliqué et ce mécanisme peut pénaliser des contenus où les réponses arrivent tardivement.
Il faut donc garder en tête que les informations essentielles, celles qu'on veut mettre en avant doivent être accessibles rapidement.
Privilégier la densité face à la longueur
Un contenu long ne favorise pas la citation car par principe une page courte peut répondre aussi efficacement qu'un guide complet.
Cependant un contenu long peut proposer une couverture des fan-out plus large ce qui indirectement favorise une citation.
Il faut donc privilégier la densité qui permet de couvrir plus de fan-out plutôt que la longueur qui ne couvre pas efficacement ces sous-requêtes.
L'autonomie de vos paragraphes
Chaque paragraphe doit pouvoir répondre à une question de façon autonome sans dépendre du reste. C'est un principe essentiel qui revient souvent dans les mécanismes analysés. Il s'applique ici et sont essentiel pour favoriser la récupération et donc la citation.
La fraicheur des contenus
Vos contenus doivent rester d'actualité et le prouver par une date de mise à jour. Un contenu obsolète sera mis de côté par les bots IA. Un point d'importance est d'apporter des preuves que votre page est active et révisée régulièrement.
6. Famille 4, les signaux de confiance et d'entité : le chantier long
Ici, on ne retrouve que 2 facteurs et ce ne sont pas les mieux classés.

Nous avions évoqué dans un autre article que l'EEAT agissait comme un filtre de citation pour les moteurs IA. Les bots vont en effet qualifier leur source avant de récupérer et ils vont pour cela privilégier les entités, marque ou auteur qui sont déjà ancrés dans leur mémoire.
| Ce qui compte | Pourquoi |
|---|---|
| Mentions externes récurrentes dans des publications reconnues | Signal plus fort que le lien seul |
| Profils auteur cohérents, présence multi-plateformes | L'entité auteur se retrouve sur plusieurs sources |
| Nommage uniforme de la marque, des produits, des personnes | Une entité incohérente est plusieurs entités faibles |
| Présence dans les sources | Ce sont les documents que les modèles consultent en priorité |
| Plateforme | Ce qui compte le plus |
|---|---|
| ChatGPT | Le consensus tiers : quand plusieurs sources indépendantes s'alignent, la marque entre au référentiel comme un fait |
| Gemini | Le contenu sous contrôle de marque et les signaux structurés |
| Perplexity | L'expertise de niche, sourcée dans des documents spécialisés |
7. Famille 5, l'arbitrage : ce qui reste quand les quatre autres sont traitées
Cette dernière famille ne représente pas une véritable famille, on y place juste 2 facteurs dont la place n'est pas bien définie et le rôle est encore pas mal discuté aujourd'hui.

Ces 2 facteurs tombent bien entendu avec des notes assez faibles dont un qui a la pire note du classement.
Commençons par celui-ci
llms.txt, à 2 sur 10
La promesse initiale de ce fichier est de permettre d'indiquer aux bots IA quel contenu ils doivent privilégier. On peut très rapidement se douter que ce type de fichier ne peut pas tenir compte tenu de l'usage que l'on pourrait en faire s'il avait un impact fort.
Le rôle de ce fichier texte est très clairement à remettre en question et c'est la documentation officielle de Google qui le confirme dans le guide du 15 mai 2026 qui le classe comme une stratégie à écarter. Ce guide vient appuyer ses propos en généralisant que l'usage de fichiers textes lisibles par les machines ne favorisait pas la citation dans les AI Overviews.
Les propos sont très clairs et appuient fortement sur la baisse de la note pour ce facteur.
On peut ranger ce facteur au côté de la balise meta keywords bien connue en SEO.
Du côté d'Open AI, d'Anthropic ou de Perplexity, aucune annonce n'est venue démentir l'intérêt de ce fichier texte.
Pour appuyer les propos de Google plusieurs tests ont été faits et portent des résultats probants.
| Instrument | Périmètre | Résultat |
|---|---|---|
| Ahrefs | 137 000 domaines, mai 2026 | 97 % des fichiers n'ont reçu aucune requête |
| The SEO Framework | 180 000 requêtes IA, 57 robots, 6 mois | Aucun robot n'est venu chercher le fichier |
| SE Ranking | ~300 000 domaines | ~10 % d'adoption. Modèle statistique et classifieur : effet nul, et retirer la variable améliore la précision du modèle |
| ALLMO | 50 marques allemandes les plus citées | Aucune ne publiait de llms.txt |
Malgré ces constats, son implémentation reste une formalité et pour cette simple raison, on peut décider de le mettre en place tout de même sans rien attendre de résultats en retour. C'est un choix à porter face aux autres facteurs de citations.
Le rôle des données structurées
Ce facteur est le second ayant fait l'objet de nombreux débats sur son rôle sur les citations.
Une étude publiée juste après celle de Shepard appuie sur son impact très faible.
Cette étude analyse 1 885 pages entre août 2025 et mars 2026 comparées à 4 000 pages témoins.
Voici les résultats qui en ressortent :
| Plateforme | Effet mesuré | Lecture |
|---|---|---|
| Google AI Overviews | −4,6 % | Faible mais statistiquement significatif, sans explication claire |
| Google AI Mode | +2,4 % | Statistiquement indistinguable de zéro |
| ChatGPT | +2,2 % | Statistiquement indistinguable de zéro |
La synthèse de cette analyse est qu'aucun balisage de données structurées n'impacte directement la citation par les IA.
L'étude confirme même que les principaux moteurs testés, aucun ne lit le balisage lors de la phase de récupération en temps réel.
Ce qu'il cependant retenir, c'est que malgré un impact directement limité et prouvé par les études, le rôle du schéma continue de se prouver. Il reste une information cohérente qui peut favoriser la compréhension des entités par les moteurs. Il joue même un rôle crucial dans le secteur e-commerce avec les flux shopping et plus récemment sur le commerce agentique.
La recommandation est donc de le travailler sans le placer comme un sujet à part entière de la stratégie. Enrichir ses pages de schémas à mesure qu'on les optimise pour le SEO et l'AI Search.
8. Par où commencer
En résumé de cette analyse, on confirme que la grille posée par Shepard ici est très importante et sert de référence. Le sujet évoluant très vite, cette analyse méritera d'évoluer et d'être réutilisée comme base.
Si je devais retenir 3 choses, je dirais :
- La corrélation entre ranking SEO et citation IA, n'est plus évidence et peut donc dans certains créer des disparités ou bien des complémentarités. Quand l'un est acquis, l'autre ne l'est pas nécessairement.
- L'importance du rôle de l'entité et le filtre EEAT alimente l'autorité de ces entités
- 2 facteurs qui restent à l'écart et sans preuve de leur impact réel
Les quatre chantiers, dans l'ordre
| Ordre | Chantier | Ce qu'il coûte | Quand ça se voit |
|---|---|---|---|
| 1 | Auditer l'accès des moteurs. robots.txt agent par agent, contrôles d'aperçu, rendu HTML, et surtout la configuration du pare-feu applicatif |
Quelques jours | Immédiat |
| 2 | Penser la couverture en clusters de sous-intentions. Couvrir chaque facette par une page dédiée, densifier le maillage entre elles | Le plus de méthode | Plusieurs mois |
| 3 | Construire des pages qui survivent à l'extraction. Réponses denses en haut, passages auto-portants, affirmations ancrées dans des chiffres | Des standards à diffuser | Quelques semaines après indexation |
| 4 | Consolider les signaux d'entité. Cohérence sur le web, bios alignées, présence dans les sources socles, mentions tierces | Le plus long | Le plus durable |
Attention enfin à ne pas confondre les différents états : récupération, citation, mention et recommandation qui sont distinct l'un de l'autres et qui ne mesure pas sous un score unique.