Sort

Обновлено: 12 сентября 2026 г.

Sort обрабатывает большие текстовые наборы данных локально. Выберите инструмент, исходные файлы и папку результатов, проверьте настройки и нажмите Execute. Содержимое не загружается на сервер.

Общие настройки

Папка результатов находится на устройстве. Буфер чтения по умолчанию — 64 МБ, допустимо от 1 до 256 МБ. Там, где разделитель можно настроить, доступны двоеточие, вертикальная черта, точка с запятой, @, # и ~.

Все 10 инструментов

ИнструментНазначениеПо умолчанию
URL SorterРазделяет url:login:password по категориямВсе категории; без дубликатов
URL CleanerПроверяет и нормализует строки с URLОчистка протокола и рекламы; без дубликатов
Archive ExtractorИзвлекает текст учётных данных из архивовРекурсия; без дублей; 16 потоков
CleanerПроверяет длины и правила login:passwordЛогин 3–64; пароль 4–128
Domain CounterСчитает почтовые домены и применяет порогБез дубликатов
Anti PublicПроверяет по выбранной локальной базеСохраняет public/private; усилие авто
DeduperУдаляет повторные строкиС учётом регистра
FilterИщет подстроку или регулярное выражениеОбычная подстрока; без инверсии
SplitterДелит файл по числу строк500 000 строк; префикс Chunk
JoinerОбъединяет файлыБез дубликатов

URL Sorter создаёт категории для почты, телефона, имени пользователя, неизвестного формата, полной строки URL-логин-пароль и пары логин-пароль. По умолчанию Cleaner не предъявляет требований к символам пароля; режим почта-пароль отключён, удаление рекламы и дубликатов включено.

Archive Extractor поддерживает ZIP, RAR, 7z, TAR, TAR.GZ/TGZ, TAR.BZ2/TBZ2, TAR.XZ/TXZ, GZ/GZIP, BZ2, XZ и ZST/ZSTD. Он читает .txt, .csv и .log, поддерживает вложенные архивы и списки паролей, распознаёт имена файлов со списками паролей. Незнакомый набор архивов сначала проверьте на небольшой выборке.

Файлы результатов

  • URL Sorter: mail_pass.txt, phone_pass.txt, user_pass.txt, unknown.txt, url_login_pass.txt и login_pass.txt.
  • URL Cleaner и Cleaner: cleaned.txt / bad.txt, а также valid.txt / invalid.txt.
  • Deduper, Filter и Joiner: deduped.txt, filtered.txt / unmatched.txt и joined.txt.
  • Splitter и Domain Counter: начиная с Chunk_001.txt, а также domains.txt.
  • Archive Extractor и Anti Public: файлы категорий и archive_results.txt либо public.txt / private.txt.

Примеры времени обработки

Это приблизительные результаты отдельных запусков, а не гарантии. На время влияют накопитель, процессор, структура данных, настройки и количество уникальных значений при удалении дубликатов.

ИнструментИсходные данныеИзмеренное время
Archive Extractor100 ГБоколо 50 секунд
URL Cleaner1 млрд URLоколо 2 минут
URL Sorter1 млрд URL, около 58 ГБоколо 20 секунд
Deduper1 млрд URL, около 58 ГБоколо 2 минут

Характеристики тестового компьютера и метод измерения не записаны.

Обрабатывайте только свои данные или те, с которыми вам разрешено работать. Проверьте формат результата на небольшом файле перед дальнейшими операциями, которые могут привести к потере данных.