Un nouveau filtre multimodal dans la GSC: merci, mais non merci

Le 24 septembre 2026, Harsh Kharbanda, responsable produit de Google Lens, et Moshe Samet, responsable produit de Search Console, ont annoncé un nouveau segment dans le rapport Performance : Web multimodal, qui isole les recherches lancées à partir d’une image.

Les données remontent en réalité au 10 septembre, quatorze jours avant l’annonce. L’ajout est bienvenu, mais il se révèle peu actionnable : le rapport ne livre aucune requête, ce trafic reste marginal en volume, et les indicateurs fournis ne disent presque rien de ce qu’il faudrait corriger pour faire mieux.

Ce que Google a réellement ajouté

Le filtre « Type de recherche » du rapport Performance distingue désormais, sous « Web », deux sous-options : « De type textuel », cochée par défaut, et « Multimodal », signalée par une pastille « Nouveau ». Il n’existe plus de vue Web globale : il faut choisir l’un ou l’autre segment. Le même filtre est disponible dans le rapport IA générative, pour les impressions obtenues dans AI Overviews et AI Mode.

Le billet de Google cite quatre points d’entrée :

  • Google Lens, depuis l’appareil photo du smartphone ;
  • Entourer pour chercher (Circle to Search) sur Android ;
  • l’envoi d’une image dans le champ de recherche de Google ;
  • la commande « Rechercher cette image » du clic droit dans Chrome.

L’infobulle de l’interface, en anglais, donne la règle de classement la plus nette : le segment multimodal suit les recherches déclenchées par une requête « qui utilise une image, une photo ou une capture d’écran », tandis que les requêtes « text-only » relèvent du segment textuel. La moindre image suffit donc à faire basculer une recherche en multimodal, y compris une recherche qui combine photo et texte. La version française de l’infobulle a perdu le « only » au passage.

Interrogé sur Bluesky, John Mueller a d’abord hésité, puis confirmé après vérification auprès de l’équipe que ces données « n’étaient pas comptées auparavant ».
En pratique, on voit que le reporting côté Google a commencé le 10 septembre 2026 (désolé, pas d’historique avant cela).

Pas de liste de requêtes, et c’est compréhensible

Sélectionnez « Multimodal » et cliquez sur l’onglet Requêtes : le tableau est vide et affiche « No query data for multimodal web search ». Ni le billet d’annonce ni les pages d’aide de Search Console ne mentionnent cette limite. On la découvre en ouvrant l’onglet.

L’absence n’a rien d’un oubli. Dans une recherche Lens, la « requête » est une photo. Son nom de fichier (IMG_4127.jpg, Screenshot_20260915.png) ne dit rien de son contenu. Pour fournir un équivalent de la requête, Google devrait conserver les images envoyées par les utilisateurs et les exposer aux propriétaires de sites. Sur des milliards de recherches visuelles par mois, le coût de stockage serait considérable, et beaucoup de ces photos sont prises chez les gens, dans la rue ou sur leur écran : les montrer à un tiers poserait un problème de confidentialité évident.

La seule alternative serait une description textuelle de l’image, les entités que Lens reconnaît (« lion », « fauteuil en rotin », « Tour Eiffel »). Google ne la propose pas.

Il reste donc cinq dimensions exploitables :

  • les pages affichées ;
  • les pays ;
  • les appareils ;
  • l’apparence dans les résultats (extraits de produits, extraits d’avis) ;
  • les dates.

Autrement dit, vous savez où vos pages ressortent, mais jamais à partir de quoi.

Un trafic marginal, et rarement commercial

L’usage de Lens et de la recherche multimodale est en forte croissance.

En octobre 2024, Lilian Rincon, vice-présidente produit de Google Shopping, chiffrait à près de 20 milliards les recherches visuelles mensuelles, dont 20 % liées au shopping, selon Retail Brew. Les 80 % restants servent à identifier une plante, un monument, une œuvre, une personnalité, un texte à traduire.

Dans la grande majorité des cas, la réponse s’affiche dans Lens et l’utilisateur n’a aucune raison de cliquer vers un site, encore moins d’y acheter. En clair, la recherche multimodale génère peu de clics, ou de conversions, comparée aux requêtes « text only ».

La Google Search Console, de son côté, ne relie aucun de ces clics à une conversion, et Google n’indique pas comment isoler ce trafic dans un outil d’analytics.

Des indicateurs qui ne disent pas quoi corriger

Un KPI se doit d’être « actionnable ». C’est à dire permettre de décider d’une action derrière, pour améliorer/augmenter quelque chose. Les métriques du segment multimodal sont assez peu « actionnables » en pratique.

  • Rien ne relie la page à l’image qui l’a fait ressortir. Une fiche produit contient souvent plusieurs visuels. Le rapport n’indique pas lequel a été reconnu, ni ce que l’utilisateur photographiait. Impossible de savoir s’il faut retravailler l’image, son texte alternatif, la légende ou la page entière.
  • L’accès aux données est bridé. Nous avons comparé, jour par jour sur 90 jours, l’API Search Analytics avec type=web et le segment « De type textuel » de l’interface : les chiffres sont identiques à l’unité. L’API ne renvoie que les données « text only », et zéro donnée multimodale. Reste l’export CSV de l’interface, plafonné à 1 000 pages triées par clics. C’est trop limité pour faire des analyses utiles.
  • L’intention de recherche est indétectable. La position moyenne « multimodale » se calcule comme d’habitude : c’est la moyennes des positions occupées par les urls du site sur les SERPs, mais agrégé par page, pas par requête. Le CTR est souvent très faible, voire nul, même quand les impressions se font sur des positions moyennes entre 1 et 2. C’est normalement le signe d’un problème d’intention de recherche, mais faute de comprendre ce qui pêche entre la réponse et la requête, impossible d’améliorer cette situation.

Ce qu’on peut tout de même en tirer

Bon, l’effort est donc louable, mais en l’état, ce n’est pas vraiment utile.

Ce n’est pas complètement un gadget, mais sans évolution, beaucoup de webmasters vont très vite oublier que cela existe.

En attendant, par ordre de priorité :

  1. Ne modifiez pas vos tableaux de bord. Comparez texte avec texte : c’est ce que renvoie déjà l’API, et c’est ce qu’affiche l’interface par défaut.
  2. Mesurez une fois la part du multimodal sur vos sites les plus visuels (e-commerce, mode, décoration, art, tourisme). En dessous de quelques pourcents des clics, n’y consacrez pas davantage de temps.
  3. Exportez les données chaque mois si le segment compte pour vous. Sans API, l’export est le seul moyen de constituer un historique au-delà de ce que conserve l’interface.
  4. Surveillez l’arrivée d’une valeur multimodale dans l’API et d’une éventuelle dimension décrivant l’image. C’est à ce moment que le rapport deviendra exploitable.

Bibliographie

Laisser un commentaire

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.

Ce contenu vous a plu ?

Inscrivez-vous gratuitement à notre newsletter et recevez chaque semaine l'actualité du SEO, du GEO et de l'IA directement dans votre boîte email. Vous pouvez vous désabonner à tout moment !