Исправление mojibake
Это приватное сравнение больше недоступно
Открыть полный инструмент на одной страницеВставьте текст, который выглядит повреждённым
Вставьте текст наподобие café или японскую строку, ставшую нечитаемой из-за несовпадения кодировок. Оригинал останется в редакторе без изменений.
Не более 50 000 символов. Инструмент сравнивает только вставленный текст Unicode и не проверяет и не исправляет файлы, потоки байтов, базы данных или HTTP-заголовки.
Mojibake возникает, когда читаемые данные отображаются неверными символами из-за того, что байты декодированы несовместимым набором символов. Знакомый пример: café вместо café, если слово было закодировано в UTF-8, а его байты прочитали как Latin-1 или Windows-1252. Вставьте видимый текст, чтобы сравнить строго обратимые гипотезы исправления. Инструмент не меняет оригинал, помечает каждый вариант как гипотезу и выполняет сравнение локально в браузере.
Как сравнить гипотезу исправления mojibake
-
1
Вставьте видимый текст
Используйте текст именно в полученном виде. Инструмент не загружает и не исследует исходный файл.
-
2
Осознанно включите сравнение
Попросите браузер проверить интерпретации байтов Latin-1 и Windows-1252 с помощью строгого декодера UTF-8.
-
3
Сравнивайте, а не угадывайте
Читайте неизменный оригинал рядом с каждым обратимым вариантом и выбирайте только при поддержке контекста.
-
4
Копируйте обычный текст
Скопируйте, скачайте или распечатайте выбранную гипотезу, не перезаписывая исходный текст.
Что исправление mojibake может и чего не может установить
Кодировка сопоставляет символы с байтами и обратно. В UTF-8 символ é представлен двумя байтами C3 A9. Если программа декодирует их как Windows-1252 или ISO-8859-1, на экране может появиться é. Полезная гипотеза исправления обращает именно эту ошибку: рассматривает видимые символы старой кодировки как значения байтов, строго декодирует их в UTF-8 и проверяет, что обратное кодирование варианта даёт те же байты.
Проверка в обоих направлениях отбрасывает неполные и некорректные последовательности UTF-8. Она также отклоняет вариант с символом замены �, поскольку скрывавшаяся за ним информация уже потеряна. Успешная проверка подтверждает возможность гипотезы, но не доказывает, какую кодировку применяла исходная система и какой текст задумывал автор.
| Видимый текст | Проверяемая гипотеза | Возможный вариант | Что проверить |
|---|---|---|---|
café |
Байты UTF-8 прочитаны как Latin-1 | café |
Сверьте написание с источником |
It’s |
Байты UTF-8 прочитаны как Windows-1252 | It’s |
Проверьте пунктуацию и редакционный стиль |
æååã |
Байты UTF-8 прочитаны как Latin-1 | 文字化け |
Сверьте японский текст с надёжной копией |
café |
Две последовательные ошибки кодировки | café |
Проверьте оба контролируемых прохода |
Почему японскому тексту нужен контекст
Японский термин 文字化け буквально обозначает искажённые символы. Если байты японского текста в UTF-8 прочитать в неподходящей старой кодировке, результат может превратиться в длинную смесь латинских букв, символов и знаков, похожих на управляющие. Обратимость полезна, но короткое имя или отдельный символ всё равно могут быть неоднозначными. Сравните вариант с исходным документом, выгрузкой базы данных, сообщением отправителя или другой авторитетной копией.
Ограничения и более безопасное восстановление
Инструмент получает текст Unicode, который браузер уже декодировал. Он не восстановит утраченные ранее байты, не определит кодировку бинарного файла, не исправит столбец базы данных и не изменит HTTP-заголовок Content-Type. Если вариант не появился, сохраните оригинал. По возможности получите настоящие исходные байты, создайте резервную копию, определите заявленную и фактическую кодировки, затем выполните одно декодирование с помощью инструмента для файлов или потоков байтов. Не сохраняйте повреждённый текст поверх единственной исходной копии снова и снова.
Часто задаваемые вопросы
Нет. Это означает, что определённая интерпретация байтов старой кодировки дала корректный UTF-8 и прошла точную обратную проверку. Несколько интерпретаций могут дать одинаковый или различный читаемый текст. Всё равно нужны контекст и авторитетный источник.
Видимые символы могут не быть байтами UTF-8, прочитанными как ISO-8859-1 или Windows-1252; последовательность может быть неполной либо символ замены уже удалил информацию. Сохраните оригинал и исследуйте фактические байты и сведения о кодировке.
Нет. Он сравнивает только вставленный текст Unicode. Инструмент не читает файлы и их кодировку, не подключается к базе данных, не переписывает сохранённые значения и не исправляет заголовки сервера. Перед побайтовым преобразованием сделайте резервную копию источника.
Нет. Сравнение, выбор, копирование, создание TXT и подготовка к печати происходят в браузере. Пошаговый режим может хранить одну проверенную запись в этой вкладке до 30 минут и помещает в URL только непрозрачный идентификатор задания.
Сопутствующие инструменты
Генератор случайных слов
Создавайте случайные списки английских слов. Выберите повседневные, природные, творческие или технические слова, задайте длину и количество, затем скопируйте результат.
Генератор фэнтези-имён
Создавайте имена фэнтези-персонажей по расе, классу и гендерному оттенку для кампаний D&D, миростроения, романов и списков NPC.
Проверка английской орфографии
Вставьте английский текст, чтобы найти частые ошибки из проверенного списка, посмотреть подсказки и скопировать исправленную версию.
Перемешивание слов
Перемешивайте буквы в каждом слове, сохраняя первую и последнюю. Подходит для головоломок, словесных игр и упражнений на чтение.
Счетчик английских переходных слов
Подсчитайте 18 английских переходных слов и фраз в черновике. Посмотрите общий итог, частоту каждого термина и плотность относительно всех слов.
Генератор библиографии
Создавайте корректно оформленные библиографические записи в стилях APA 7, MLA 9, Chicago 17 и Harvard. Книги, журналы, сайты, фильмы и другое.