tidy.
Écrits

Pourquoi Spotlight ne trouve pas le texte de vos PDF scannés

Sebastián Díaz Thomas · Santiago, Chile · septembre 2026

Vous cherchez sur votre Mac un mot dont vous êtes certain qu’il figure dans un document scanné l’an dernier. Spotlight ne renvoie rien. Vous essayez un autre mot. Toujours rien. Vous commencez à vous demander si le fichier est corrompu, ou s’il faut reconstruire l’index.

Le fichier va bien et l’index va bien. Il n’y a tout simplement rien à lire dans ce document pour Spotlight.

Ce qu’est réellement un PDF scanné

Deux choses très différentes portent le même nom de PDF.

Un PDF issu de Word, ou de « Enregistrer au format PDF » depuis un navigateur, contient du texte en tant que texte. Les caractères sont stockés comme des caractères. Spotlight les lit, les indexe et les retrouve.

Un PDF issu d’un scanner, de l’appareil photo d’un téléphone ou d’une app de numérisation est la photographie d’une page enveloppée dans un conteneur PDF. Il n’y a aucun caractère dedans. Il y a des pixels disposés en forme de caractères, ce qui, pour un ordinateur, est une tout autre chose.

Spotlight n’échoue pas à lire les mots. Il n’y a pas de mots. Il a indexé le fichier correctement, et le fichier contient une image.

La vérification en trente secondes

Ouvrez le document dans Aperçu et faites glisser le curseur sur une ligne de texte. Si les mots se surlignent, il y a une couche de texte. Si vous ne faites que dessiner un rectangle sur la page, il n’y en a pas.

Pour vérifier un dossier entier d’un coup, dans le Terminal :

for f in *.pdf; do
  strings "$f" | grep -qm1 "/Type/Font" || echo "pas de couche de texte : $f"
done

Un PDF qui contient du vrai texte porte des objets de police à l’intérieur. La photographie d’une page n’en porte aucun : tout ce que cette commande affiche est donc un scan qu’aucune recherche de votre Mac ne peut lire. Lancez-la sur votre dossier de documents et comptez les lignes. Chez la plupart des gens, le nombre surprend.

Une réserve, pour ne pas lui accorder plus de crédit qu’elle n’en mérite : certains PDF compressent leur structure interne et peuvent être signalés comme dépourvus de texte alors qu’ils en ont. Le test dans Aperçu, plus haut, est celui qui ne ment jamais. Servez-vous de la commande pour un comptage approximatif, pas pour rendre un verdict sur un fichier.

Solution 1 : ajouter une couche de texte au fichier

C’est la solution classique. Un programme de reconnaissance de texte lit l’image et réécrit le texte reconnu dans le PDF, en couche invisible posée exactement sur l’image de chaque mot. Le document paraît identique et se comporte désormais comme un PDF normal : Spotlight l’indexe, Aperçu permet de sélectionner et de copier, et la recherche fonctionne partout sur le Mac.

La plupart des logiciels de scanner le font si vous activez l’option, et il vaut la peine de l’activer avant de numériser les mille pages suivantes. Les applications spécialisées s’en sortent mieux sur les originaux difficiles.

Le hic : cela n’aide que les fichiers que vous traitez. Les scans déjà présents sur votre Mac restent invisibles tant que vous ne revenez pas les repasser tous — le genre de tâche qui n’arrive jamais.

Solution 2 : extraire le texte vous-même

macOS sait lire les images nativement. Dans l’app Raccourcis, une action Extraire le texte d’une image s’exécute sur votre Mac, sans compte et sans envoi — la même reconnaissance qui anime Texte en direct lorsque vous sélectionnez des mots dans une photo.

Vous pouvez construire un raccourci qui prend une image et vous rend son texte, puis en faire ce que vous voulez. C’est gratuit et c’est local. Pratique pour un document de temps en temps ; laborieux comme réponse à un dossier de six cents.

Solution 3 : tenir un index à part

Plutôt que de modifier vos fichiers, une application peut lire chaque document une fois, garder le texte reconnu dans son propre index et chercher là-dedans. Rien n’est réécrit dans le PDF, et la recherche devient instantanée puisque la lecture a déjà eu lieu.

C’est l’approche des gestionnaires documentaires comme DEVONthink, et c’est celle que j’ai retenue dans Tidy. La différence entre eux tient le plus souvent à l’endroit où doivent vivre les documents : certains outils exigent que vous importiez tout dans leur propre bibliothèque, d’autres lisent vos fichiers là où ils se trouvent déjà.

Cette distinction pèse plus lourd qu’il n’y paraît. Si l’outil détient vos documents, le quitter est une migration. S’il se contente de les lire, le quitter consiste à glisser l’app dans la corbeille, et vos dossiers sont exactement tels qu’ils étaient.

Ce que je ferais

Si votre problème concerne tout ce qui vient à partir de maintenant, activez la reconnaissance de texte dans ce qui numérise vos documents. C’est la solution la plus propre, et elle améliore les fichiers pour de bon, indépendamment de toute application.

Si votre problème est la pile que vous avez déjà, un index est plus rapide, car il ne vous demande pas de retraiter et de réenregistrer des milliers de fichiers. Et quoi que vous choisissiez, vérifiez d’abord si vos scans ont une couche de texte : s’ils en ont une, rien de tout cela n’est votre problème et la panne est ailleurs.


L’app que je développe s’appelle Tidy. Elle lit ce que contiennent vos images et vos PDF scannés grâce à la reconnaissance de texte de l’appareil, nomme chaque fichier d’après son contenu et vous laisse chercher à l’intérieur depuis n’importe où avec un raccourci clavier — y compris dans les scans que Spotlight ne voit pas. Vos fichiers restent où ils sont, dans leurs propres dossiers. 9 dollars, achat unique, sans abonnement, macOS 14 ou plus récent, et rien ne quitte votre Mac.

À lire aussi : Renommer des PDF scannés · Ranger le dossier Téléchargements · Tidy et Hazel, côte à côte

Cet article en : English · Español · Deutsch · Français · Português