2
juillet
2026
11:09

Comment trouver des caractères dans un texte qui ne correspondent pas à la langue écrite

2 juillet 2026 11:09

Le texte peut contenir des caractères d'apparence similaire, mais qui ne correspondent pas à la langue dans laquelle il est rédigé.

Par exemple, le « C » russe est similaire au « c » latin, le « Х » russe est similaire au « x » latin.
En apparence, POCOMAXA ressemble à un mot russe, mais se compose uniquement de lettres latines.
Les commandes Linux suivantes vous aideront à trouver de telles incohérences.

Rechercher des lettres russes dans un texte anglais

Première option rechercher des lettres russes dans un texte anglais :

Cette requête trouvera les lettres qui ne font pas partie des 26 lettres de l'alphabet anglais de A à Z :

sudo apt install pcregrep
pcregrep --color='auto' -n "[^[:ascii:]]" eng.txt

Dans cette option, on trouvera des mots avec des symboles de langues nationales.
Par exemple : â (circonflexe), é (aigu), ü (tréma).

Deuxième option rechercher des lettres russes dans un test d'anglais

grep --color='auto' -n -P '[\x{0410}-\x{044f}]' eng.txt

Rechercher des lettres anglaises dans le texte russe

Première option rechercher des lettres anglaises dans un texte russe :

Cette requête trouvera les numéros de ligne et mettra en évidence les mots avec les symboles des 26 lettres de l'alphabet anglais de A à Z :

sudo apt install pcregrep
pcregrep --color='auto' -n "[[:ascii:]]" rus.txt

Deuxième option rechercher des mots anglais avec les lettres A à Z dans le texte russe :

grep --color='auto' -n -P -v '[\x{0410}-\x{044f}]' rus.txt

Demande : fichiers de test rus.txt et eng.txt dans l'archive test.zip.



Publications connexes