Sort
Обновлено: 12 сентября 2026 г.
Sort обрабатывает большие текстовые наборы данных локально. Выберите инструмент, исходные файлы и папку результатов, проверьте настройки и нажмите Execute. Содержимое не загружается на сервер.
Общие настройки
Папка результатов находится на устройстве. Буфер чтения по умолчанию — 64 МБ, допустимо от 1 до
256 МБ. Там, где разделитель можно настроить, доступны двоеточие, вертикальная черта, точка с
запятой, @, # и ~.
Все 10 инструментов
| Инструмент | Назначение | По умолчанию |
|---|---|---|
| URL Sorter | Разделяет url:login:password по категориям | Все категории; без дубликатов |
| URL Cleaner | Проверяет и нормализует строки с URL | Очистка протокола и рекламы; без дубликатов |
| Archive Extractor | Извлекает текст учётных данных из архивов | Рекурсия; без дублей; 16 потоков |
| Cleaner | Проверяет длины и правила login:password | Логин 3–64; пароль 4–128 |
| Domain Counter | Считает почтовые домены и применяет порог | Без дубликатов |
| Anti Public | Проверяет по выбранной локальной базе | Сохраняет public/private; усилие авто |
| Deduper | Удаляет повторные строки | С учётом регистра |
| Filter | Ищет подстроку или регулярное выражение | Обычная подстрока; без инверсии |
| Splitter | Делит файл по числу строк | 500 000 строк; префикс Chunk |
| Joiner | Объединяет файлы | Без дубликатов |
URL Sorter создаёт категории для почты, телефона, имени пользователя, неизвестного формата, полной строки URL-логин-пароль и пары логин-пароль. По умолчанию Cleaner не предъявляет требований к символам пароля; режим почта-пароль отключён, удаление рекламы и дубликатов включено.
Archive Extractor поддерживает ZIP, RAR, 7z, TAR, TAR.GZ/TGZ, TAR.BZ2/TBZ2, TAR.XZ/TXZ, GZ/GZIP,
BZ2, XZ и ZST/ZSTD. Он читает .txt, .csv и .log, поддерживает вложенные архивы и списки
паролей, распознаёт имена файлов со списками паролей. Незнакомый набор архивов сначала проверьте
на небольшой выборке.
Файлы результатов
- URL Sorter:
mail_pass.txt,phone_pass.txt,user_pass.txt,unknown.txt,url_login_pass.txtиlogin_pass.txt. - URL Cleaner и Cleaner:
cleaned.txt/bad.txt, а такжеvalid.txt/invalid.txt. - Deduper, Filter и Joiner:
deduped.txt,filtered.txt/unmatched.txtиjoined.txt. - Splitter и Domain Counter: начиная с
Chunk_001.txt, а такжеdomains.txt. - Archive Extractor и Anti Public: файлы категорий и
archive_results.txtлибоpublic.txt/private.txt.
Примеры времени обработки
Это приблизительные результаты отдельных запусков, а не гарантии. На время влияют накопитель, процессор, структура данных, настройки и количество уникальных значений при удалении дубликатов.
| Инструмент | Исходные данные | Измеренное время |
|---|---|---|
| Archive Extractor | 100 ГБ | около 50 секунд |
| URL Cleaner | 1 млрд URL | около 2 минут |
| URL Sorter | 1 млрд URL, около 58 ГБ | около 20 секунд |
| Deduper | 1 млрд URL, около 58 ГБ | около 2 минут |
Характеристики тестового компьютера и метод измерения не записаны.
Обрабатывайте только свои данные или те, с которыми вам разрешено работать. Проверьте формат результата на небольшом файле перед дальнейшими операциями, которые могут привести к потере данных.