Скануйте сторінку на наявність посилань за один крок

Ви відкриваєте сторінку, щоб завантажити один файл, а натомість знаходите десять кнопок «Завантажити», дві спливаючі вкладки та таймер зворотного відліку. Справжнє посилання поховане десь на сторінці. Сканування сторінки на наявність посилань означає наведення інструменту на URL-адресу та дозволення йому витягнути фактичні файли для завантаження — зображення, відео, документи та архіви — без того, щоб ви клацали рекламні пастки.

Цей посібник розповідає, чому існує сканування посилань, поширені способи, якими люди це роблять, як це робити в Seedr, а також обмеження, які ви повинні знати, перш ніж довіряти будь-якому інструменту з підозрілою сторінкою.

Що насправді робить сканування сторінок

Веб-сторінка — це HTML. У цьому HTML є <a> теги, <img> теги, <video> теги, а іноді й JavaScript, який створює посилання на льоту. Сканер посилань читає сторінку, проходить по цих тегах і повертає кожну URL-адресу, яка вказує на ресурс, доступний для завантаження.

Причина корисності полягає в тому, що сучасні сторінки завантаження є безладними. Файлові хости приховують справжнє посилання за перенаправленнями. Форуми вбудовують посилання для завантаження всередину блоків цитат. Сайти галерей генерують мініатюри, але приховують файл повної роздільної здатності в атрибуті даних. Ручне копіювання кожного посилання є повільним, а фальшива кнопка «Завантажити зараз» поруч зі справжньою розміщена там навмисно.

Люди, які регулярно сканують сторінки, поділяються на кілька категорій: дослідники, які завантажують партію PDF-файлів з архіву публікацій, любителі відео, які збирають епізоди з фан-вікі, і будь-хто, хто намагається завантажити папку зображень, не натискаючи на кожне з них.

Звичайні способи, якими це роблять люди

Існує кілька підходів, кожен з яких має свої компроміси.

  • Перегляд джерела браузера або DevTools. Ви відкриваєте інспектор, шукаєте в HTML href або .mp4, і копіюєте посилання вручну. Це працює, але є виснажливим, і ви пропускаєте все, що генерується JavaScript після завантаження сторінки.
  • Розширення браузера як DownThemAll або Video DownloadHelper. Вони сканують активний DOM і перераховують кожне знайдене посилання. Швидко, але ви повинні довіряти розширенню кожній сторінці, яку відвідуєте, і багато з них занедбані або підтримуються рекламою.
  • Інструменти командного рядка такі як wget --spider, curl через grep, або yt-dlp для медіа-сайтів. Потужні та скриптові. Недоліком є те, що вам потрібен термінал, деякі знання регулярних виразів, а знайдені посилання все одно потрібно десь завантажувати.
  • Спеціалізовані онлайн-скрепери. Вставте URL-адресу, отримайте список посилань. Зручно, але багато з них повільні, обмежують кількість результатів або показують власні спливаючі вікна. Конфіденційність також є питанням: вони бачать кожну сторінку, яку ви скануєте.
  • Клацніть правою кнопкою миші «Зберегти сторінку як» зберігає HTML та активи, але не надає вам чистого списку посилань для вибору.

Жоден з цих способів не є неправильним. Питання в тому, як часто ви це робите і де має опинитися результат.

Виконання цього в Seedr

Seedr розглядає URL-адресу як завдання. Ви вставляєте посилання, Seedr завантажує сторінку, і знайдені файли з'являються у вашому хмарному сховищі — без локального завантаження, без ручного копіювання.

  1. Увійдіть до Seedr та відкрийте вкладку «Завдання».
  2. Скопіюйте URL-адресу сторінки з потрібними посиланнями (або пряме посилання для завантаження).
  3. Натисніть Add link або клацніть правою кнопкою миші на порожній області та виберіть Add link.
  4. Вставте URL-адресу. Якщо сторінка містить прямий файл або підтримуваний тип посилання, Seedr додає його до черги як завдання.
  5. Відкрийте завдання, щоб переглянути список файлів, перш ніж щось завершиться завантаженням.
  6. Позначте лише ті файли, які вам дійсно потрібні. Пропустіть решту.

Для посилань з кількома файлами Seedr розпізнає вміст і показує вам кожен файл всередині, перш ніж використовувати пропускну здатність. Ви залишаєте ті, що вам потрібні, і відкидаєте решту. Оригінали залишаються у вашому хмарному сховищі, доки ви їх не видалите.

Якщо ви віддаєте перевагу одному кліку, розширення Chrome та Firefox додають опцію «Надіслати в Seedr» до будь-якого посилання, на яке ви клацаєте правою кнопкою миші, тож вам ніколи не доведеться копіювати та вставляти.

Поради та особливі випадки

Кілька речей, які варто знати, перш ніж очікувати дива:

  • Сканери бачать лише те, що відображає сторінка. Якщо сайт генерує посилання через серверний API після натискання кнопки, жоден загальний сканер не знайде їх без відтворення цього кліку.
  • Сторінки, захищені входом, повертають HTML-код входу, а не вміст за ним. Зазвичай вам потрібен сесійний файл cookie або інструмент, специфічний для сайту.
  • Дуже великі сторінки з тисячами посилань можуть призвести до тайм-ауту або бути обрізаними.
  • Деякі хости змінюють свої URL-адреси файлів кожні кілька хвилин, тому посилання, яке було успішно відскановано, може бути недійсним до моменту його завантаження.
  • Обмеження розміру файлів залежать від вашого тарифного плану. Безкоштовні облікові записи мають менший ліміт, ніж Premium — перевірте, перш ніж ставити в чергу колекцію на 50 ГБ.

Якщо сканування сторінки не повертає нічого корисного, сторінка, ймовірно, завантажує свій реальний вміст за допомогою JavaScript після завантаження. У цьому випадку розширення браузера, яке читає активний DOM, є надійнішим, ніж статичний скрепер.

Як це вписується в решту вашого робочого процесу

Як тільки Seedr завантажує файли у ваше хмарне сховище, решта вашого робочого процесу вже налаштована.

  • Підключіть ваш диск Seedr через WebDAV, FTP або SFTP, і завантажені файли з'являться як локальна папка.
  • Відкрийте PDF або зображення безпосередньо у переглядачі Seedr, не завантажуючи його спочатку.
  • Клацніть правою кнопкою миші на відео та транслюйте його у браузерному плеєрі або транслюйте на телевізор.
  • Конвертуйте документ (DOCX в PDF, MP4 в MP3) прямою кнопкою миші, без другого інструменту.

Мета сканування сторінки на наявність посилань — припинити витрачати час на пошук. Розміщення пункту призначення, попереднього перегляду та наступного кроку в одному місці завершує роботу.

Підсумок

Припиніть клацати фальшиві кнопки завантаження. Вставте URL-адресу, дозвольте сканеру виконати роботу та залиште лише те, що вам потрібно.

Add link and go Statuses