Поиск символов Unicode

Вставьте загадочный символ, странный пробел, который прислал пользователь, глиф из предпросмотра шрифта или эмодзи, ломающее ваше регулярное выражение, и поиск вернёт его кодовую точку Unicode (U+XXXX) и сырые байты UTF-8 в шестнадцатеричном виде, по одной строке на символ.

Как определить символ Unicode

  1. 1

    Вставьте символ

    Можно вставить один глиф или целую строку: каждый символ анализируется по порядку.

  2. 2

    Прочитайте кодовую точку

    Получите каноническую запись U+ заглавными буквами, дополненную нулями минимум до четырёх шестнадцатеричных цифр.

  3. 3

    Изучите байты UTF-8

    Посмотрите последовательность из 1–4 байтов, которую символ занимает на диске или при передаче.

  4. 4

    Скопируйте результаты

    Вывод представляет собой таблицу в формате CSV (символ, кодовая точка, байты UTF-8), которую можно выделить и вставить в электронную таблицу или отчёт об ошибке.

Типичная детективная работа, которую можно выполнить с помощью поиска

Большинство ошибок Unicode на экране выглядят одинаково. Чтобы отличить обычный пробел от неразрывного или фигурный апостроф от штриха, нужно проверить кодовую точку.

Частые ловушки, которые решает поиск

Выглядит как На самом деле это Кодовая точка
Пробел Неразрывный пробел U+00A0
Пробел Узкий неразрывный пробел U+202F
(ничего) Пробел нулевой ширины U+200B
(ничего) Соединитель нулевой ширины U+200D
Апостроф Правая одинарная кавычка U+2019
Апостроф Штрих (футы/минуты) U+2032
Дефис Короткое тире U+2013
Дефис Неразрывный дефис U+2011

Раскладка байтов UTF-8 с первого взгляда

  • 1 байт, ASCII, от U+0000 до U+007F (0xxxxxxx)
  • 2 байта, латинское дополнение, арабица, иврит (110xxxxx 10xxxxxx)
  • 3 байта, CJK, большинство символов (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 байта, эмодзи, редкие письменности (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Если столбец базы данных имеет фиксированную длину в байтах, четырёхбайтовое эмодзи займёт четыре ячейки, хотя отображается как один глиф, это частый источник ошибок усечения.

Часто задаваемые вопросы

Обычно это маркеры BOM (U+FEFF) в начале файла или случайные соединители нулевой ширины из текстового редактора. Вставьте один из них в поиск, и он сразу подскажет, что это, после чего вы удалите их простой заменой.

Да. Поиск перебирает символы по одному, поэтому целое слово даёт по одной строке на символ с его кодовой точкой и байтами UTF-8.

Кодовая точка является абстрактным идентификатором символа: U+00E9 всегда обозначает «é», где бы вы его ни хранили. UTF-8 является одной из нескольких кодировок, которые превращают кодовую точку в байты; тот же «é» занимает два байта C3 A9 в UTF-8, но один байт E9 в Latin-1.

Да. Поиск выполняется на нашем сервере: вставленные символы отправляются, анализируются, и их кодовая точка и байты UTF-8 сразу возвращаются. Мы не храним отправленный текст.

Сопутствующие инструменты

Генератор названий городов

Создавайте вымышленные названия городов, посёлков, деревень и столиц для миростроения, карт, игр, историй и тестовых данных с короткими заметками к каждому результату.

Переводчик иконок

Введите английский текст, и каждое слово из встроенного списка получит подходящий эмодзи. Скопируйте результат как текст с эмодзи.

Генератор бегущей строки

Создавайте анимированные бегущие заголовки с настраиваемой скоростью, размером шрифта и цветами. Предпросматривайте CSS-строку marquee или панель объявлений вживую в браузере.

Переводчик Эндермана

Превратите любую фразу в речь Эндермена в стиле Minecraft: растяните гласные и переверните каждое второе слово. Скопируйте результат в чат, на таблички или в посты фанатов.

Генератор шрифтов для Instagram

Генерируйте Unicode-«шрифты» (жирный, курсив, рукописный, моноширинный, фрактура), которые вставляются прямо в ваше био, имя, подписи и комментарии в Instagram.

Символы стрелок для копирования

Копируйте популярные Unicode-стрелки одним щелчком: прямые, двойные, диагональные, крючковые, круговые и треугольные для документов, чатов и дизайна.

Инструмент доступен на других языках