Anonyma EN
← Blogue

Comment caviarder un document numérisé

Anonyma · Guide

Un contrat numérisé, un formulaire photographié, un relevé reçu par télécopieur : pour un ordinateur, chaque page est une image. Impossible d'y chercher un mot, et un outil qui ne regarde que le texte n'y trouvera rien à masquer.

Une numérisation est une image de texte

Quand vous numérisez une page, le résultat est une image, même enregistrée en PDF. Les noms et les numéros sont des points de couleur, pas des lettres. Pour les repérer automatiquement, un logiciel doit d'abord lire l'image par reconnaissance de texte (souvent appelée OCR, pour reconnaissance optique de caractères), qui retransforme les formes en mots et note l'emplacement de chaque mot sur la page.

Là où la reconnaissance de texte bute

La reconnaissance de texte fonctionne bien sur des pages imprimées, propres et droites. Elle a plus de mal avec :

Quand un mot est mal lu, un logiciel qui cherche un nom ou un numéro risque de ne pas le reconnaître. Sur une numérisation, la révision page par page compte encore plus.

Deux pièges propres aux numérisations

Une façon sûre de caviarder une numérisation

  1. Numérisez proprement. Une résolution de 300 ppp est un réglage courant pour du texte; gardez les pages droites et complètes.
  2. Faites lire la numérisation sur votre ordinateur plutôt que de la téléverser dans un service en ligne.
  3. Révisez chaque page à un zoom qui permet de lire les petits caractères. Vérifiez les en-têtes, les pieds de page, les tampons et les notes manuscrites.
  4. Cherchez dans le texte reconnu les noms et numéros que vous savez présents dans le document.
  5. Exportez une nouvelle copie où les zones masquées font partie de l'image elle-même, sans couche de texte restante en dessous.
  6. Ouvrez la copie exportée et vérifiez-la de nouveau.

Comment Anonyma traite les numérisations

Anonyma lit les pages numérisées sur votre ordinateur par reconnaissance de texte; rien n'est téléversé. Dans la copie exportée, les pages numérisées sont reconstruites en image, de sorte que les zones masquées font partie de l'image, et après l'exportation Anonyma relit la copie pour confirmer que les éléments masqués n'y sont plus. La copie est un nouveau fichier, et votre original n'est pas modifié.

La reconnaissance de texte peut quand même mal lire une numérisation de piètre qualité, et la détection automatique peut manquer des éléments. Vous révisez chaque page avant l'exportation, et vous pouvez chercher n'importe quel mot ou ajouter vos propres zones.

À lire aussi : pourquoi un rectangle noir ne suffit pas et comment masquer un PDF sans le téléverser.

Anonyma lit les numérisations sur votre ordinateur et reconstruit les pages numérisées dans la copie nettoyée. Rien n'est téléversé.

Demander un essai gratuit