Персональный сайт
Романа Парпалака

Заметки
 
Блог
 
Программы
 
Фото
ГлавнаяБлог201004 → 10

UTF-8 bad chars

10 апреля 2010 года, 1:36

Вопрос о «плохих» данных в UTF-8. Иногда такое знание оказывается полезным. Например, в корректной UTF-8 строке не могут встретиться байты 0xC0, 0xC1. Это может пригодиться при обработке строк для экранировки неизменяемых последовательностей символов (таких, как html-теги). Экранируемые подстроки вырезаются из строки, на их место ставятся символы с кодом 0xC0, строка обрабатывается, после чего подстроки возвращаются назад, вместо 0xC0.

Ключевые слова: PHPОставить комментарий
«Апрель, 2010»
ПнВтСрЧтПтСбВс
1234
567891011
12131415161718
19202122232425
2627282930
Записи:
Посетителям
наверх