Comment caviarder un document numérisé
Un contrat numérisé, un formulaire photographié, un relevé reçu par télécopieur : pour un ordinateur, chaque page est une image. Impossible d'y chercher un mot, et un outil qui ne regarde que le texte n'y trouvera rien à masquer.
Une numérisation est une image de texte
Quand vous numérisez une page, le résultat est une image, même enregistrée en PDF. Les noms et les numéros sont des points de couleur, pas des lettres. Pour les repérer automatiquement, un logiciel doit d'abord lire l'image par reconnaissance de texte (souvent appelée OCR, pour reconnaissance optique de caractères), qui retransforme les formes en mots et note l'emplacement de chaque mot sur la page.
Là où la reconnaissance de texte bute
La reconnaissance de texte fonctionne bien sur des pages imprimées, propres et droites. Elle a plus de mal avec :
- les numérisations floues ou de faible résolution, et les photos prises en angle;
- les pages de travers ou coupées;
- les photocopies pâles et les fonds colorés ou à motifs;
- l'écriture à la main, les tampons et les signatures;
- les très petits caractères, et les formulaires remplis de cases et de lignes.
Quand un mot est mal lu, un logiciel qui cherche un nom ou un numéro risque de ne pas le reconnaître. Sur une numérisation, la révision page par page compte encore plus.
Deux pièges propres aux numérisations
- La couche de texte invisible. Bien des numérisations « interrogeables » portent un texte caché par-dessus l'image. Si vous noircissez l'image sans retirer ce texte, le nom peut encore être copié ou trouvé par la recherche. Si vous retirez le texte sans toucher à l'image, le nom reste visible.
- Recouvrir au lieu de modifier l'image. Un rectangle dessiné sur une numérisation est un objet distinct, posé sur l'image. Si l'image elle-même n'est pas modifiée, l'original peut rester dans le fichier, en dessous.
Une façon sûre de caviarder une numérisation
- Numérisez proprement. Une résolution de 300 ppp est un réglage courant pour du texte; gardez les pages droites et complètes.
- Faites lire la numérisation sur votre ordinateur plutôt que de la téléverser dans un service en ligne.
- Révisez chaque page à un zoom qui permet de lire les petits caractères. Vérifiez les en-têtes, les pieds de page, les tampons et les notes manuscrites.
- Cherchez dans le texte reconnu les noms et numéros que vous savez présents dans le document.
- Exportez une nouvelle copie où les zones masquées font partie de l'image elle-même, sans couche de texte restante en dessous.
- Ouvrez la copie exportée et vérifiez-la de nouveau.
Comment Anonyma traite les numérisations
Anonyma lit les pages numérisées sur votre ordinateur par reconnaissance de texte; rien n'est téléversé. Dans la copie exportée, les pages numérisées sont reconstruites en image, de sorte que les zones masquées font partie de l'image, et après l'exportation Anonyma relit la copie pour confirmer que les éléments masqués n'y sont plus. La copie est un nouveau fichier, et votre original n'est pas modifié.
La reconnaissance de texte peut quand même mal lire une numérisation de piètre qualité, et la détection automatique peut manquer des éléments. Vous révisez chaque page avant l'exportation, et vous pouvez chercher n'importe quel mot ou ajouter vos propres zones.
À lire aussi : pourquoi un rectangle noir ne suffit pas et comment masquer un PDF sans le téléverser.
Anonyma lit les numérisations sur votre ordinateur et reconstruit les pages numérisées dans la copie nettoyée. Rien n'est téléversé.
Demander un essai gratuit