A technique known as ASCII smuggling, originally developed to conceal malicious prompt injection attacks against LLMs, is now being widely deployed by email spammers to bypass security filters. The method uses hidden Unicode tag characters that mirror standard ASCII letters. These characters are fully readable by computer text-processing systems but remain completely invisible to human recipients.
Microsoft Defender for Office reported a dramatic surge in ASCII smuggling attacks, rising from 21,000 daily detections in early February to a peak of 2.5 million per day within four days. Spammers embed invisible Unicode tags inside restricted target words, such as financial keywords, causing traditional text-matching filters and regex rules to split the words while human targets view clean, formatted text.
The adoption of ASCII smuggling specifically targets advanced machine learning and natural language processing classifiers used in modern spam defenses. Because sub-word tokenizers are disrupted by hidden characters, standard email classification models fail to evaluate whole words correctly unless paired with visual OCR extraction mechanisms.
Why it matters
LLM tokenization vulnerabilities are now being actively exploited in traditional cybersecurity attack vectors like email spam.
Security teams relying on NLP text classifiers must update tokenizers or implement visual OCR parsing to detect invisible Unicode characters.
Prompt injection research is providing automated threat actors with immediate tools for evading enterprise security filters.
Source: arstechnica.com



