Поиск символов Unicode
Вставьте загадочный символ, странный пробел, который прислал пользователь, глиф из предпросмотра шрифта или эмодзи, ломающее ваше регулярное выражение, и поиск вернёт его кодовую точку Unicode (U+XXXX) и сырые байты UTF-8 в шестнадцатеричном виде, по одной строке на символ.
Как определить символ Unicode
-
1
Вставьте символ
Можно вставить один глиф или целую строку: каждый символ анализируется по порядку.
-
2
Прочитайте кодовую точку
Получите каноническую запись U+ заглавными буквами, дополненную нулями минимум до четырёх шестнадцатеричных цифр.
-
3
Изучите байты UTF-8
Посмотрите последовательность из 1–4 байтов, которую символ занимает на диске или при передаче.
-
4
Скопируйте результаты
Вывод представляет собой таблицу в формате CSV (символ, кодовая точка, байты UTF-8), которую можно выделить и вставить в электронную таблицу или отчёт об ошибке.
Типичная детективная работа, которую можно выполнить с помощью поиска
Большинство ошибок Unicode на экране выглядят одинаково. Чтобы отличить обычный пробел от неразрывного или фигурный апостроф от штриха, нужно проверить кодовую точку.
Частые ловушки, которые решает поиск
| Выглядит как | На самом деле это | Кодовая точка |
|---|---|---|
| Пробел | Неразрывный пробел | U+00A0 |
| Пробел | Узкий неразрывный пробел | U+202F |
| (ничего) | Пробел нулевой ширины | U+200B |
| (ничего) | Соединитель нулевой ширины | U+200D |
| Апостроф | Правая одинарная кавычка | U+2019 |
| Апостроф | Штрих (футы/минуты) | U+2032 |
| Дефис | Короткое тире | U+2013 |
| Дефис | Неразрывный дефис | U+2011 |
Раскладка байтов UTF-8 с первого взгляда
- 1 байт, ASCII, от U+0000 до U+007F (
0xxxxxxx) - 2 байта, латинское дополнение, арабица, иврит (
110xxxxx 10xxxxxx) - 3 байта, CJK, большинство символов (
1110xxxx 10xxxxxx 10xxxxxx) - 4 байта, эмодзи, редкие письменности (
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)
Если столбец базы данных имеет фиксированную длину в байтах, четырёхбайтовое эмодзи займёт четыре ячейки, хотя отображается как один глиф, это частый источник ошибок усечения.
Часто задаваемые вопросы
Обычно это маркеры BOM (U+FEFF) в начале файла или случайные соединители нулевой ширины из текстового редактора. Вставьте один из них в поиск, и он сразу подскажет, что это, после чего вы удалите их простой заменой.
Да. Поиск перебирает символы по одному, поэтому целое слово даёт по одной строке на символ с его кодовой точкой и байтами UTF-8.
Кодовая точка является абстрактным идентификатором символа: U+00E9 всегда обозначает «é», где бы вы его ни хранили. UTF-8 является одной из нескольких кодировок, которые превращают кодовую точку в байты; тот же «é» занимает два байта C3 A9 в UTF-8, но один байт E9 в Latin-1.
Да. Поиск выполняется на нашем сервере: вставленные символы отправляются, анализируются, и их кодовая точка и байты UTF-8 сразу возвращаются. Мы не храним отправленный текст.
Сопутствующие инструменты
Генератор названий городов
Создавайте вымышленные названия городов, посёлков, деревень и столиц для миростроения, карт, игр, историй и тестовых данных с короткими заметками к каждому результату.
Переводчик иконок
Введите английский текст, и каждое слово из встроенного списка получит подходящий эмодзи. Скопируйте результат как текст с эмодзи.
Генератор бегущей строки
Создавайте анимированные бегущие заголовки с настраиваемой скоростью, размером шрифта и цветами. Предпросматривайте CSS-строку marquee или панель объявлений вживую в браузере.
Переводчик Эндермана
Превратите любую фразу в речь Эндермена в стиле Minecraft: растяните гласные и переверните каждое второе слово. Скопируйте результат в чат, на таблички или в посты фанатов.
Генератор шрифтов для Instagram
Генерируйте Unicode-«шрифты» (жирный, курсив, рукописный, моноширинный, фрактура), которые вставляются прямо в ваше био, имя, подписи и комментарии в Instagram.
Символы стрелок для копирования
Копируйте популярные Unicode-стрелки одним щелчком: прямые, двойные, диагональные, крючковые, круговые и треугольные для документов, чатов и дизайна.
Инструмент доступен на других языках
- Pencarian Unicode [ID]
- Wyszukiwarka Unicode [PL]
- Unicode-uppslagning [SV]
- ค้นหา Unicode [TH]
- Unicode-Suche [DE]
- Unicode検索 [JA]
- 유니코드 조회 [KO]
- Búsqueda de Unicode [ES]
- Pesquisa de Unicode [PT]
- Tra cứu Unicode [VI]
- Recherche Unicode [FR]
- بحث يونيكود [AR]
- Unicode opzoeken [NL]
- Unicode Lookup [EN]
- Ricerca Unicode [IT]
- Unicode Arama [TR]
- Unicode 字符查找 [ZH]