2
Juli
2026
11:09

So finden Sie Zeichen im Text, die nicht der geschriebenen Sprache entsprechen

2 Juli 2026 11:09

Der Text kann zwar ähnlich aussehende Zeichen enthalten, die jedoch nicht der Sprache entsprechen, in der er verfasst ist.

Beispielsweise ähnelt das russische „C“ dem lateinischen „c“, das russische „Х“ ähnelt dem lateinischen „x“.
Vom Aussehen her ähnelt POCOMAXA einem russischen Wort, besteht aber nur aus lateinischen Buchstaben.
Die folgenden Linux-Befehle helfen Ihnen, solche Inkonsistenzen zu finden.

Suchen Sie nach russischen Buchstaben im englischen Text

Erste Option suche nach russischen Buchstaben im englischen Text:

Diese Abfrage findet Buchstaben, die außerhalb der 26 Buchstaben des englischen Alphabets von A bis Z liegen:

sudo apt install pcregrep
pcregrep --color='auto' -n "[^[:ascii:]]" eng.txt

Bei dieser Option werden Wörter mit Symbolen nationaler Sprachen gefunden.
Zum Beispiel: â (Zirkumflex), é (akut), ü (Umlaut).

Zweite Option suche nach russischen Buchstaben in einem Englischtest

grep --color='auto' -n -P '[\x{0410}-\x{044f}]' eng.txt

Suchen Sie nach englischen Buchstaben im russischen Text

Erste Option suche nach englischen Buchstaben im russischen Text:

Diese Abfrage findet Zeilennummern und markiert Wörter mit Symbolen der 26 Buchstaben des englischen Alphabets A–Z:

sudo apt install pcregrep
pcregrep --color='auto' -n "[[:ascii:]]" rus.txt

Zweite Option suche nach englischen Wörtern mit den Buchstaben A-Z im russischen Text:

grep --color='auto' -n -P -v '[\x{0410}-\x{044f}]' rus.txt

Anwendung: testdateien rus.txt und eng.txt im Archiv test.zip.



Verwandte Veröffentlichungen