Исправление mojibake

Сравнение гипотез кодировки
Вставленный текст и все варианты остаются в этом браузере. Пошаговый режим хранит одну проверенную запись в этой вкладке до 30 минут и добавляет в URL только непрозрачный идентификатор задания. Через наши серверы или API исправления ничего не отправляется.

Вставьте текст, который выглядит повреждённым

Вставьте текст наподобие café или японскую строку, ставшую нечитаемой из-за несовпадения кодировок. Оригинал останется в редакторе без изменений.

Не более 50 000 символов. Инструмент сравнивает только вставленный текст Unicode и не проверяет и не исправляет файлы, потоки байтов, базы данных или HTTP-заголовки.

Mojibake возникает, когда читаемые данные отображаются неверными символами из-за того, что байты декодированы несовместимым набором символов. Знакомый пример: café вместо café, если слово было закодировано в UTF-8, а его байты прочитали как Latin-1 или Windows-1252. Вставьте видимый текст, чтобы сравнить строго обратимые гипотезы исправления. Инструмент не меняет оригинал, помечает каждый вариант как гипотезу и выполняет сравнение локально в браузере.

Как сравнить гипотезу исправления mojibake

  1. 1

    Вставьте видимый текст

    Используйте текст именно в полученном виде. Инструмент не загружает и не исследует исходный файл.

  2. 2

    Осознанно включите сравнение

    Попросите браузер проверить интерпретации байтов Latin-1 и Windows-1252 с помощью строгого декодера UTF-8.

  3. 3

    Сравнивайте, а не угадывайте

    Читайте неизменный оригинал рядом с каждым обратимым вариантом и выбирайте только при поддержке контекста.

  4. 4

    Копируйте обычный текст

    Скопируйте, скачайте или распечатайте выбранную гипотезу, не перезаписывая исходный текст.

Что исправление mojibake может и чего не может установить

Кодировка сопоставляет символы с байтами и обратно. В UTF-8 символ é представлен двумя байтами C3 A9. Если программа декодирует их как Windows-1252 или ISO-8859-1, на экране может появиться é. Полезная гипотеза исправления обращает именно эту ошибку: рассматривает видимые символы старой кодировки как значения байтов, строго декодирует их в UTF-8 и проверяет, что обратное кодирование варианта даёт те же байты.

Проверка в обоих направлениях отбрасывает неполные и некорректные последовательности UTF-8. Она также отклоняет вариант с символом замены , поскольку скрывавшаяся за ним информация уже потеряна. Успешная проверка подтверждает возможность гипотезы, но не доказывает, какую кодировку применяла исходная система и какой текст задумывал автор.

Видимый текст Проверяемая гипотеза Возможный вариант Что проверить
café Байты UTF-8 прочитаны как Latin-1 café Сверьте написание с источником
It’s Байты UTF-8 прочитаны как Windows-1252 It’s Проверьте пунктуацию и редакционный стиль
文字化け Байты UTF-8 прочитаны как Latin-1 文字化け Сверьте японский текст с надёжной копией
café Две последовательные ошибки кодировки café Проверьте оба контролируемых прохода

Почему японскому тексту нужен контекст

Японский термин 文字化け буквально обозначает искажённые символы. Если байты японского текста в UTF-8 прочитать в неподходящей старой кодировке, результат может превратиться в длинную смесь латинских букв, символов и знаков, похожих на управляющие. Обратимость полезна, но короткое имя или отдельный символ всё равно могут быть неоднозначными. Сравните вариант с исходным документом, выгрузкой базы данных, сообщением отправителя или другой авторитетной копией.

Ограничения и более безопасное восстановление

Инструмент получает текст Unicode, который браузер уже декодировал. Он не восстановит утраченные ранее байты, не определит кодировку бинарного файла, не исправит столбец базы данных и не изменит HTTP-заголовок Content-Type. Если вариант не появился, сохраните оригинал. По возможности получите настоящие исходные байты, создайте резервную копию, определите заявленную и фактическую кодировки, затем выполните одно декодирование с помощью инструмента для файлов или потоков байтов. Не сохраняйте повреждённый текст поверх единственной исходной копии снова и снова.

Часто задаваемые вопросы

Нет. Это означает, что определённая интерпретация байтов старой кодировки дала корректный UTF-8 и прошла точную обратную проверку. Несколько интерпретаций могут дать одинаковый или различный читаемый текст. Всё равно нужны контекст и авторитетный источник.

Видимые символы могут не быть байтами UTF-8, прочитанными как ISO-8859-1 или Windows-1252; последовательность может быть неполной либо символ замены уже удалил информацию. Сохраните оригинал и исследуйте фактические байты и сведения о кодировке.

Нет. Он сравнивает только вставленный текст Unicode. Инструмент не читает файлы и их кодировку, не подключается к базе данных, не переписывает сохранённые значения и не исправляет заголовки сервера. Перед побайтовым преобразованием сделайте резервную копию источника.

Нет. Сравнение, выбор, копирование, создание TXT и подготовка к печати происходят в браузере. Пошаговый режим может хранить одну проверенную запись в этой вкладке до 30 минут и помещает в URL только непрозрачный идентификатор задания.

Сопутствующие инструменты

Генератор случайных слов

Создавайте случайные списки английских слов. Выберите повседневные, природные, творческие или технические слова, задайте длину и количество, затем скопируйте результат.

Генератор фэнтези-имён

Создавайте имена фэнтези-персонажей по расе, классу и гендерному оттенку для кампаний D&D, миростроения, романов и списков NPC.

Проверка английской орфографии

Вставьте английский текст, чтобы найти частые ошибки из проверенного списка, посмотреть подсказки и скопировать исправленную версию.

Перемешивание слов

Перемешивайте буквы в каждом слове, сохраняя первую и последнюю. Подходит для головоломок, словесных игр и упражнений на чтение.

Счетчик английских переходных слов

Подсчитайте 18 английских переходных слов и фраз в черновике. Посмотрите общий итог, частоту каждого термина и плотность относительно всех слов.

Генератор библиографии

Создавайте корректно оформленные библиографические записи в стилях APA 7, MLA 9, Chicago 17 и Harvard. Книги, журналы, сайты, фильмы и другое.