RÉPONSE RAPIDE

Le fichier robots d'Instagram nomme GPTBot, ClaudeBot, Google-Extended, PerplexityBot, Applebot-Extended et Amazonbot, et les bloque tous sur l'ensemble du site. Si votre entreprise n'existe que sur Instagram, Meta a demandé à tous les grands modèles d'IA de ne pas la lire, sans qu'on vous ait demandé votre avis. Récupérer un profil comme le ferait un modèle renvoie environ 939 kilo-octets et une cinquantaine de caractères d'information exploitable sur l'entreprise. Pas d'adresse, pas de tarifs, pas d'horaires.


Ouvrez instagram.com/robots.txt dans n'importe quel navigateur. C'est un fichier public et cela prend dix secondes.

Vers le début du fichier, nommément, figurent les robots d'exploration d'OpenAI, Anthropic, Google, Perplexity, Apple et Amazon. Chacun est suivi de Disallow: /, ce qui signifie l'ensemble du site, chaque profil qu'il contient, y compris le vôtre.

Ce n'est pas un réglage dans votre compte. C'est une décision que Meta a prise au nom de chaque entreprise de la plateforme, et il n'existe aucune version de votre profil où elle ne s'applique pas.

Le fichier robots d'Instagram bloque nommément chaque grand robot d'IA

Voici le fichier, lu le 6 septembre 2026. Les lignes concernées sont les suivantes, mot pour mot :

User-agent: Amazonbot        Disallow: /
User-agent: Applebot-Extended Disallow: /
User-agent: ClaudeBot         Disallow: /
User-agent: Google-Extended   Disallow: /
User-agent: GPTBot            Disallow: /
User-agent: PerplexityBot     Disallow: /

L'en-tête qui les précède énonce la position sans détour : la collecte de données sur Instagram par des moyens automatisés est interdite sans l'autorisation écrite expresse d'Instagram.

C'est une décision que Meta peut légitimement défendre. Ses données sont son actif. Le point est seulement que la décision leur appartient et que la conséquence est la vôtre.

[ 01 / instagram.com/robots.txt ]

Nommés, et bloqués sur l'ensemble du site

Lu le 6 septembre 2026. C'est un fichier public et sa vérification prend dix secondes.

Bloqués avec Disallow: /

  • GPTBot · OpenAI, entraînement
  • ClaudeBot · Anthropic, entraînement
  • Google-Extended · Google, entraînement IA
  • PerplexityBot · Perplexity, index de recherche
  • Applebot-Extended · Apple, entraînement IA
  • Amazonbot · Amazon
  • Brightbot

Non nommés dans le fichier

  • Les agents en direct qui récupèrent une page au moment où quelqu'un pose une question. Ce sont des programmes distincts, portant des noms distincts, et Instagram ne les répertorie pas.
Figure 1 · Une décision prise par Meta pour chaque entreprise de la plateforme

instagram.com/robots.txt, lu le 6 septembre 2026. L'en-tête du fichier indique lui-même que la collecte automatisée est interdite sans l'autorisation écrite expresse d'Instagram.

Meta a pris cette décision à votre place, et vous ne pouvez pas passer outre

Vous ne pouvez pas modifier ce fichier. Vous ne pouvez pas en exempter votre propre profil. Il n'existe, dans un compte professionnel, aucun interrupteur qui dise autoriser les modèles d'IA à lire mes horaires d'ouverture.

C'est également vrai d'une page Facebook, et de toute présence qui vit à l'intérieur d'une plateforme plutôt que sur un domaine que vous contrôlez. Les règles qui déterminent si une machine peut lire votre entreprise sont écrites par la société propriétaire des lieux.

C'est un problème différent de celui abordé dans Instagram est là où l'on se souvient de vous. Ce n'est pas là qu'on décide. Cet article-là parlait des personnes. Celui-ci parle des machines que les gens interrogent désormais en premier.

Un profil, c'est 939 kilo-octets et une cinquantaine de caractères d'information utile

Le blocage n'est que la moitié visible. L'autre moitié, c'est ce qu'il y a réellement à lire.

Récupérer quatre grands profils publics comme le ferait le navigateur en direct d'un modèle, puis retirer les scripts et les styles et lire le texte restant, donne ceci :

  • NASA : 939 018 octets téléchargés, 42 caractères de texte extractible
  • National Geographic : 939 316 octets, 59 caractères
  • Starbucks : 939 481 octets, 52 caractères
  • Four Seasons Hotels and Resorts : 939 831 octets, 74 caractères

Dans tous les cas, le texte extractible est le titre de la page et rien d'autre. Sur le profil NASA, 840 087 octets du téléchargement sont du JavaScript. Aucun des quatre ne comporte de données structurées.

La balise meta description sur laquelle une machine se rabattrait se lit, en intégralité : 2M Followers, 333 Following, 62 Posts. C'est Four Seasons. Un groupe hôtelier mondial, et ce qu'obtient une machine, c'est un nombre d'abonnés.

[ 02 / Récupéré comme le ferait un modèle ]

Environ 939 kilo-octets en entrée. Moins de 75 caractères en sortie.

Quatre des plus grands profils publics de la plateforme, scripts et styles retirés, texte restant compté.

@nasa · sur 939 018 octets

42

@natgeo · sur 939 316 octets

59

@starbucks · sur 939 481 octets

52

@fourseasons · sur 939 831 octets

74

enregistrements de données structurées, les quatre

0

de la page NASA est du JavaScript

840 KB

Dans tous les cas, le texte extractible est le titre de la page et rien d'autre. La description sur laquelle une machine se rabat se lit, en intégralité pour Four Seasons : 2M Followers, 333 Following, 62 Posts. Un groupe hôtelier mondial, et ce qu'obtient une machine est un nombre d'abonnés.

0chambre, tarif, adresse, horaire d'ouverture ou langue parlée extractible sur les quatre profils. Si c'est ce que renvoient les plus grands comptes de la plateforme, un hôtel à Girne renvoie la même structure.
Figure 2 · Notre propre mesure, que n'importe qui peut reproduire

Chaque profil récupéré le 6 septembre 2026 avec une chaîne d'agent utilisateur en direct, blocs de script et de style retirés, texte restant compté. Les octets sont un instantané d'une page que Meta reconstruit sans cesse. Le résultat qui compte est le ratio, pas le chiffre exact.

Le blocage n'est que la moitié du problème. La récupération en direct n'obtient rien non plus.

Il y a ici une distinction que la plupart des articles aplatissent, et elle compte parce qu'elle change le correctif.

Les robots qu'Instagram nomme sont ceux qui collectent des données d'entraînement et construisent des index de recherche. Les agents qui récupèrent une page en direct, au moment où quelqu'un pose une question, sont des programmes différents, portant des noms différents, et Instagram ne les répertorie pas.

Une récupération en direct n'est donc pas bloquée. C'est ainsi que les mesures ci-dessus ont été prises. Elle renvoie 939 kilo-octets et une cinquantaine de caractères.

Les deux chemins mènent au même endroit. L'un est fermé par une politique, l'autre est ouvert et vide. Une entreprise invisible pour deux raisons sans rapport n'en est pas moins invisible.

Même quand un modèle vous trouve, moins de gens cliquent

C'est la partie qui se voit survendue dans les deux sens, alors voici les chiffres qui reposent réellement sur une étude.

Le Pew Research Center a suivi la navigation de 900 adultes américains en mars 2025, couvrant 68 879 recherches Google uniques, dont 12 593 ont produit un Aperçu IA. Sur les visites où un aperçu apparaissait, les utilisateurs ont cliqué sur un résultat de recherche classique dans 8 % des cas. Là où aucun aperçu n'apparaissait, 15 %. Cliquer sur un lien à l'intérieur de l'aperçu lui-même s'est produit dans 1 % des visites.

Ce sont des données américaines portant spécifiquement sur Google, et elles ne doivent pas être étirées en une affirmation valable pour tous les modèles sur tous les marchés. Ce qu'elles établissent, c'est une tendance : la réponse arrive de plus en plus souvent sans la visite.

Cloudflare, en mesurant son propre réseau durant la première semaine d'août 2025, a publié le ratio entre pages explorées et visites renvoyées : environ 50 000 pour 1 pour Anthropic, 887 pour 1 pour OpenAI, 118 pour 1 pour Perplexity. Le contenu est lu à une échelle qui n'a jamais correspondu au trafic renvoyé.

Pour un hôtel, ce n'est pas une catastrophe. C'est un changement dans la raison d'être du site web, et cela va dans le même sens que tout le reste : être la source à partir de laquelle la réponse est construite compte plus que d'être le onzième lien bleu.

Personne ne peut prouver que le balisage vous vaut des recommandations, et nous ne le prétendrons pas

C'est ici que la plupart des articles sur ce sujet commencent à vendre quelque chose. L'état honnête des preuves ne l'étaye pas.

Aucune déclaration de Google, OpenAI, Anthropic ou Schema.org n'affirme que l'ajout de données structurées améliore de façon mesurable les chances qu'un modèle d'IA cite votre page. La position de Google lui-même, énoncée publiquement en juillet 2025, est que ce sont les pratiques ordinaires de référencement qui s'appliquent. Il n'existe pas de levier séparé.

Le fichier llms.txt, proposé en 2024 et vendu avec insistance depuis, est pire que non prouvé. Ahrefs a analysé 137 210 domaines en mai 2026 et a constaté que 97 % des fichiers llms.txt publiés n'avaient reçu absolument aucune requête. Sur la faible part restante qui a vu passer du trafic, l'essentiel provenait d'outils d'audit SEO plutôt que de systèmes d'IA. Google a déclaré publiquement ne pas utiliser ce fichier et n'avoir aucun projet de le faire.

Quiconque vend un forfait de visibilité IA construit sur ces deux éléments vend un mécanisme que personne n'a démontré.

Les sites web sont meilleurs que les profils, mais pas autant qu'on l'espérerait

Instagram est la cible facile. La vraie question est ce qu'une machine trouve sur les sites web des hôtels d'ici, alors il a semblé préférable de compter plutôt que de supposer.

Quarante-quatre sites d'hôtels de Chypre du Nord ont été vérifiés le 6 septembre 2026, tirés des membres de la Cyprus Turkish Hotels Association et vérifiés établissement par établissement comme situés dans le nord. Trente-trois pages d'accueil ont pu être récupérées et lues.

Treize de ces trente-trois comportent des données structurées, quelles qu'elles soient. Un seul site se décrit à une machine comme un hôtel. Le reste des données structurées présentes est du type que génère de lui-même un système de gestion de contenu : un fil d'Ariane, un nom de site, un champ de recherche. De la plomberie utile, qui ne dit rien des chambres, des tarifs, de l'emplacement ou de la saison.

Vingt des trente-trois comportent une balise meta description, la ligne unique sur laquelle une machine se rabat quand rien d'autre n'est proposé. Treize n'en ont pas.

Puis le détail qui en dit le plus sur la façon dont ces sites ont été construits. Trois d'entre eux déclarent purement et simplement la mauvaise langue dans leur code de page : deux se déclarent en indonésien et un en vietnamien. Ce sont des réglages par défaut du thème, jamais modifiés, et chaque navigateur, outil de traduction et lecteur automatique les prend au mot.

Trente des quarante-quatre publient un fichier robots, quel qu'il soit. Trois y nomment un robot d'IA, dans un sens ou dans l'autre. Les vingt-sept autres n'ont pris aucune décision, ce qui est différent d'avoir pris la mauvaise, et bien plus facile à corriger.

Personne n'a mesuré cela auparavant, ni pour cette île ni pour aucun petit marché touristique. Les chiffres ci-dessus sont les nôtres.

[ 03 / 44 sites d'hôtels dans le nord ]

Mieux qu'un profil. Pas autant qu'on l'espérerait.

Vérifié le 6 septembre 2026. Trente-trois des quarante-quatre pages d'accueil ont pu être récupérées et lues, et les chiffres de lisibilité portent sur ces trente-trois.

sur 33 comportent des données structurées

13

se décrit comme un hôtel

1

sur 33 ont une balise meta description

20

déclarent une langue totalement erronée

3

sur 44 publient un fichier robots

30

y nomment un robot d'IA

3

Ce que contiennent réellement les données structurées

Un fil d'Ariane, un nom de site, un champ de recherche. Ce qu'un système de gestion de contenu génère de lui-même. Rien sur les chambres, les tarifs, l'emplacement ou la saison.

Les trois déclarations de langue erronées

  • 2 se déclarent en indonésien
  • 1 se déclare en vietnamien
  • Des réglages par défaut du thème que personne n'a modifiés. Chaque navigateur, outil de traduction et lecteur automatique les prend au mot.

Vingt-sept des trente fichiers robots ne nomment aucun robot d'IA du tout. Ce n'est pas la mauvaise décision, c'est l'absence de décision, et c'est bien plus facile à corriger que l'alternative.

Figure 3 · La première fois que cela est compté, ici ou dans tout autre petit marché touristique

Hôtels tirés des membres de la Cyprus Turkish Hotels Association et vérifiés établissement par établissement comme situés dans le nord. Pages d'accueil récupérées et analysées le 6 septembre 2026. Un site est compté comme comportant des données structurées dès lors qu'il en présente, que leur contenu soit correct ou non, ce qui rend le décompte généreux. Aucun hôtel n'est nommé.

La seule surface dont vous contrôlez les règles est celle que vous possédez

Retirez tout ce qui n'est pas prouvé, et une courte liste de choses survit, toutes ennuyeuses et toutes vérifiables.

Une machine peut lire du texte. Elle ne peut pas lire une photographie de votre carte, et elle ne peut pas lire un profil qui renvoie cinquante caractères. Elle ne peut récupérer que ce qu'autorise un robots.txt, et le seul robots.txt que vous ayez le droit d'écrire est celui de votre propre domaine.

Le correctif n'est donc ni une astuce ni un forfait. Il consiste à faire exister les faits sur votre entreprise sous forme de texte, sur des pages que vous contrôlez, à des adresses qui restent stables : ce que vous vendez, où vous êtes, combien cela coûte, quand vous êtes ouverts, dans quelles langues, pour qui.

Ce n'est pas une stratégie d'IA. C'est un site web, construit pour qu'une machine qui le lit en reparte en sachant ce que vous faites.

Ce qu'il vaut réellement la peine de faire à ce sujet

La version gratuite d'abord, parce qu'elle est réelle. Allez lire votre propre site comme le ferait une machine. Désactivez les images dans votre navigateur et regardez ce qu'il reste. Si la réponse est un logo et trois photographies, un modèle n'a rien pour travailler, et un client avec une connexion lente non plus.

Le plafond, c'est là où cela cesse de suffire. Vous ne pouvez pas restructurer un site qui n'a pas de pages, seulement des sections d'une longue image défilante. Vous ne pouvez pas mettre vos chambres et vos tarifs sous forme de texte s'ils vivent dans un PDF ou une photographie. Vous ne pouvez pas contrôler un fichier robots sur un domaine qui n'est pas le vôtre. Ce sont des problèmes de construction, et aucun rangement n'y remédie.

Ce que nous faisons à ce sujet n'a rien de glamour et est spécifique : une page par chose que vous vendez, les faits en texte plutôt qu'en images de texte, les données structurées qui décrivent une entreprise remplies honnêtement, et un fichier robots qui dit oui volontairement plutôt que par défaut.

Nous ne vous promettrons pas une mention dans une réponse. Personne d'honnête ne le peut. Ce qui peut être promis, c'est que lorsqu'une machine viendra lire votre entreprise, il y aura quelque chose à lire, ce qui n'est aujourd'hui pas le cas pour la majeure partie de l'île.

Nous Contacter