Comment l’IA choisit ses sources (et pourquoi elle en cite une plutôt que la tienne)
Une IA ne « connaît » pas ta page : elle va la chercher au moment de répondre (c’est le RAG, Retrieval-Augmented Generation), puis trie les sources selon cinq signaux (pertinence, structure extractible, preuves, autorité et fraîcheur). Comprendre ce tri, c’est comprendre pourquoi elle cite un site plutôt que le tien, et comment inverser la tendance.
Le RAG : l’IA va chercher AVANT de te répondre
Quand tu poses une question d’actualité à ChatGPT, Perplexity ou Gemini, l’IA ne se contente pas de fouiller dans sa mémoire. Elle fait d’abord une recherche sur le web, récupère quelques pages, les lit, puis rédige sa réponse en s’appuyant dessus. Ce mécanisme porte un nom : le RAG, pour Retrieval-Augmented Generation (génération augmentée par la récupération).
Prends une image simple. Tu poses une question à un ami très cultivé. Soit il répond de tête (ce qu’il a appris il y a des années), soit il ouvre son navigateur, lit trois ou quatre pages fraîches, et te fait un résumé en précisant « je tiens ça de tel site ». Une IA moderne fait la deuxième chose dès que ta question demande une info récente, locale ou précise. Et cette bascule vers le web est devenue la norme : de plus en plus de questions posées aux IA portent sur un commerce, un prix, une actualité ou un service près de chez soi, autant de sujets sur lesquels un modèle ne peut pas répondre de mémoire sans risquer de se tromper. Autrement dit, l’IA répond de plus en plus sur des sujets où elle doit aller chercher.
Le RAG se déroule en deux temps. Phase 1, la récupération : l’IA transforme ta question en requête, interroge un index (souvent celui d’un moteur de recherche) et rapatrie un petit paquet de pages candidates. Phase 2, la génération : elle lit ces pages, en extrait les passages utiles, et compose la réponse en citant celles qui ont réellement servi. Ton contenu ne peut être cité que s’il survit à la phase 1 puis qu’il est jugé exploitable en phase 2. Deux filtres, pas un seul.
Les 5 signaux qui décident si tu es choisi
Une fois les pages candidates récupérées, l’IA doit trancher : lesquelles vais-je lire, extraire et citer ? Elle s’appuie sur cinq grands signaux. Pris ensemble, ils forment la grille de lecture que tout travail de GEO (Generative Engine Optimization, l’optimisation pour les moteurs génératifs) cherche à optimiser.
- La pertinence : ta page répond-elle exactement à l’intention derrière la question ? Pas au mot-clé, à l’intention. Une page qui traite le sujet de front bat une page généraliste qui l’effleure.
- La structure extractible : l’IA peut-elle prélever une réponse propre sans deviner ? Un paragraphe direct, un tableau, une liste sont bien plus faciles à « découper » qu’un bloc de prose sinueux.
- Les preuves : chiffres, dates, sources, exemples concrets. C’est ce qui distingue une simple affirmation d’une donnée réutilisable.
- L’autorité : le site est-il reconnu sur le sujet ? Marque cohérente, auteur identifié, liens entrants, présence sur les pages de référence.
- La fraîcheur : l’info est-elle à jour ? Sur beaucoup de requêtes, une IA préfère un contenu récent à un contenu ancien mais plus complet.
Ces signaux ne sont pas de la théorie : ils ont été testés en laboratoire par une équipe universitaire d’IIT Delhi et de Princeton, sur des milliers de requêtes. C’est le signal « preuves » qui ressort en tête, et les gestes d’écriture qui l’activent sont détaillés dans Chiffres, stats et citations. Pour la fraîcheur, voir la fraîcheur du contenu.
La forme compte autant que le fond
Le signal « structure extractible » mérite qu’on s’y arrête, parce que c’est le plus facile à activer et le plus souvent négligé. L’IA n’a pas à interpréter une réponse déjà pré-découpée : elle la recopie. Un paragraphe dense, lui, l’oblige à un travail de compréhension supplémentaire : un travail qu’elle préfère souvent faire ailleurs, sur une page mieux rangée. Mettre l’info clé dans une structure claire, ce n’est donc pas de la cosmétique : c’est retirer une friction à la machine qui te choisit. Quels formats s’extraient le mieux, et pourquoi : Listes & tableaux.
La position compte aussi, et beaucoup : ce que l’IA prélève vient bien plus souvent du haut de ta page que du bas. C’est mesuré, et c’est le sujet d’Écrire en réponse directe, qui en donne le chiffre et la source : mets ta réponse clé en haut, tôt, et clairement formulée.
Où chaque moteur va vraiment piocher
Grosse nuance que beaucoup ignorent : les IA n’ont pas les mêmes sources préférées. Chaque moteur a ses habitudes, héritées de la manière dont il récupère l’info. Voici le paysage actuel.
| Moteur | Source dominante | Ce que ça implique pour toi |
|---|---|---|
| ChatGPT | Wikipédia en tête de ses sources | Vise les pages de référence, les définitions, les faits établis. La notoriété « encyclopédique » pèse lourd. |
| Perplexity | Reddit en tête de ses sources | Les avis, discussions et retours d’expérience comptent. Être cité dans les forums aide. |
| Gemini | Bon référencement Google (SEO, Search Engine Optimization) + blogs et presse | Le référencement classique reste ton meilleur levier ; un bon positionnement Google nourrit Gemini. |
Concrètement, ça veut dire qu’il n’existe pas une seule « recette IA ». Si ton audience utilise surtout Perplexity, ta présence sur Reddit et les forums spécialisés peut peser plus que ta page d’accueil. Si c’est Gemini, ton SEO Google historique fait déjà une partie du travail. Et pour ChatGPT, tout ce qui te rapproche du statut de « référence citable » (cohérence de marque, autorité, présence sur les pages encyclopédiques du secteur) joue à plein. On cartographie tout ça en détail dans Où les IA vont chercher.
Citation vs mention : ne confonds pas les deux
Dernier point, et il est capital pour bien mesurer tes résultats. Être cité et être mentionné ne sont pas la même chose.
- Une citation, c’est quand l’IA renvoie explicitement vers ta page comme source (un lien, une note, « selon [ton site] »). C’est le Graal : ça amène du trafic et ça prouve que ton contenu a servi à construire la réponse.
- Une mention, c’est quand ton nom de marque apparaît dans le texte de la réponse, sans forcément de lien source. C’est de la notoriété, précieuse aussi, mais qui ne « clique » pas de la même manière.
Pourquoi la distinction compte ? Parce que ces deux résultats viennent de mécaniques différentes. La citation récompense surtout la structure extractible et les preuves (ta page a été lue et découpée à l’instant). La mention récompense surtout l’autorité et la cohérence de marque (ton nom est déjà associé au sujet dans les données du modèle). Optimiser pour l’un ne garantit pas l’autre. Quand tu mesureras ta visibilité (voir Savoir si tu es cité), sépare bien les deux compteurs, sinon tu tireras de fausses conclusions.
FAQ
C’est quoi le RAG, en une phrase ? Le RAG (Retrieval-Augmented Generation) est le mécanisme par lequel une IA va d’abord chercher des pages web pertinentes, puis rédige sa réponse en s’appuyant sur ces pages et en les citant. Ta page ne peut être citée que si elle est d’abord récupérée, puis jugée exploitable au moment de rédiger.
Quels sont les critères qui font qu’une IA me cite ? Cinq signaux principaux : la pertinence (réponds-tu exactement à l’intention ?), la structure extractible (tableaux, listes, réponses directes), les preuves (chiffres, dates, sources), l’autorité (marque et auteur reconnus) et la fraîcheur (contenu à jour). C’est le signal « preuves » que les travaux universitaires d’IIT Delhi et de Princeton placent en tête.
Quelle différence entre être cité et être mentionné ? Être cité, c’est quand l’IA renvoie explicitement vers ta page comme source (avec lien) : ça amène du trafic. Être mentionné, c’est quand ton nom de marque apparaît dans la réponse sans lien source : c’est de la notoriété. Les deux se travaillent, mais avec des leviers différents : structure et preuves pour la citation, autorité et cohérence pour la mention.
Sources
- Documentation OpenAI & Anthropic : user-agents (GPTBot, ClaudeBot, OAI-SearchBot, Claude-SearchBot).
- #1 — C’est quoi le GEO ?
- #2 — Pourquoi le GEO, maintenant
- #3 — Comment l’IA choisit ses sources ← vous êtes ici
- #4 — Mythes & erreurs du GEO
- #5 — Écrire en réponse directe
- #6 — Chiffres, stats & citations
- #7 — Listes & tableaux
- #8 — Les pages FAQ
- #9 — Autorité & maillage
- #10 — La fraîcheur du contenu
- #11 — Laisser les IA lire ton site
- #12 — Entraînement vs recherche
- #13 — Le Schema.org qui aide
- #14 — Où les IA vont chercher
- #15 — Publier ta propre étude
- #16 — Reddit & forums
- #17 — Cohérence de marque
- #18 — Autorité d’auteur (E-E-A-T)
- #19 — Backlinks & RP digitale
- #20 — Optimiser pour ChatGPT
- #21 — Optimiser pour Perplexity
- #22 — Optimiser pour Gemini
- #23 — Optimiser pour Claude
- #24 — Meilleur [métier] à [ville]
- #25 — Google Business Profile & IA
- #26 — GEO pour l’e-commerce
- #27 — Savoir si tu es cité
- #28 — Les métriques qui comptent
- #29 — Panorama des outils GEO
- #30 — La checklist 30 jours
- #31 — Playbook commerce local
Rédaction assistée par IA, sous contrôle éditorial humain.
