1ステップでページ内のリンクをスキャンする

1つのファイルを取得するためにページを開いたのに、「ダウンロード」ボタンが10個、ポップアップタブが2つ、カウントダウンタイマーが見つかることがあります。本当のリンクはページのどこかに埋もれています。ページ内のリンクをスキャンするとは、ツールをURLに向け、広告の罠をクリックすることなく、実際のダウンロード可能なファイル(画像、動画、ドキュメント、アーカイブ)を抽出させることを意味します。

このガイドでは、リンクスキャンが存在する理由、一般的な方法、Seedr内でそれを行う方法、そして疑わしいページでツールを信頼する前に知っておくべき制限について説明します。

ページスキャンが実際にすること

ウェブページはHTMLです。そのHTML内には<a>タグ、<img>タグ、<video>タグ、そして時にはその場でリンクを構築するJavaScriptがあります。リンクスキャナーはページを読み込み、これらのタグをたどり、ダウンロード可能なリソースを指すすべてのURLを返します。

これが役立つ理由は、現代のダウンロードページが乱雑だからです。ファイルホストは、リダイレクトの背後に実際のリンクを隠しています。フォーラムは、引用ブロック内にダウンロードリンクを埋め込んでいます。ギャラリーサイトはサムネイルを生成しますが、高解像度ファイルをデータ属性に隠しています。各リンクを手動でコピーするのは時間がかかりますし、本物の隣にある偽の「今すぐダウンロード」ボタンは意図的に配置されています。

定期的にページをスキャンする人々は、いくつかのカテゴリーに分けられます。出版アーカイブからPDFのバッチを取得する研究者、ファンウィキからエピソードを収集するビデオ愛好家、そして各画像を個別にクリックせずに画像フォルダをダウンロードしようとする人々です。

一般的な方法

いくつかの方法があり、それぞれに実際のトレードオフがあります。

  • ブラウザの「ソースを表示」またはDevTools。インスペクターを開き、HTML内でhrefまたは.mp4を検索し、手動でリンクをコピーします。これは機能しますが、面倒であり、ページ読み込み後にJavaScriptによって生成されたものを見逃します。
  • DownThemAllやVideo DownloadHelperのようなブラウザ拡張機能。これらはライブDOMをスキャンし、見つけたすべてのリンクをリストアップします。高速ですが、アクセスするすべてのページで拡張機能を信頼する必要があり、多くは放棄されているか、広告でサポートされています。
  • wget --spider、curlをgrepでパイプ処理したもの、またはメディアサイト向けのyt-dlpなどのコマンドラインツール。強力でスクリプト可能です。欠点は、ターミナル、正規表現の知識が必要であり、見つけたリンクはどこかにダウンロードする必要があることです。
  • 専用のオンラインスクレイパー。URLを貼り付けると、リンクのリストが得られます。便利ですが、多くは動作が遅く、結果の数に制限があったり、独自のポップアップを表示したりします。プライバシーも問題です。スキャンするすべてのページを見られます。
  • 右クリックの「名前を付けてページを保存」はHTMLとアセットを保存しますが、選択できるクリーンなリンクのリストは提供しません。

これらのどれも間違いではありません。問題は、これをどれくらいの頻度で行うか、そして結果がどこに到達する必要があるかです。

Seedrで実行する

SeedrはURLをタスクとして扱います。リンクを貼り付けると、Seedrがページを取得し、見つかったファイルがクラウドに表示されます。ローカルダウンロードも手動コピーも不要です。

  1. Seedrにサインインし、「タスク」タブを開きます。
  2. 目的のリンクがあるページのURL(または直接ダウンロードリンク)をコピーします。
  3. 「Add link」をクリックするか、空の領域を右クリックして「Add link」を選択します。
  4. URLを貼り付けます。ページに直接ファイルまたはサポートされているリンクタイプが含まれている場合、Seedrはそれをタスクとしてキューに入れます。
  5. タスクを開き、フェッチが完了する前にファイルリストを確認します。
  6. 実際に必要なファイルのみをチェックします。残りはスキップします。

複数ファイルのリンクの場合、Seedrは帯域幅をコミットする前にコンテンツを解決し、内部のすべてのファイルを表示します。必要なものを保持し、残りは破棄します。オリジナルは削除するまでクラウドに残ります。

ワンクリックを好む場合は、ChromeおよびFirefox拡張機能が、右クリックした任意のリンクに「Send to Seedr」オプションを追加するため、コピー&ペーストする必要がありません。

ヒントと注意点

魔法を期待する前に知っておくべきいくつかのこと:

  • スキャナーはページが公開しているものしか見ません。サイトがボタンをクリックした後にサーバーサイドAPIを通じてリンクを生成する場合、そのクリックを再現しない限り、一般的なスキャナーではそれらを見つけることはできません。
  • ログインゲートされたページは、その背後にあるコンテンツではなく、ログインHTMLを返します。通常、セッションCookieまたはサイト固有のツールが必要です。
  • 数千のリンクを含む非常に大きなページは、タイムアウトしたり、切り詰められたりする可能性があります。
  • 一部のホストは数分ごとにファイルURLをローテーションするため、スキャン時には問題なかったリンクが、フェッチする頃には無効になっている場合があります。
  • ファイルサイズの制限はプランによって異なります。FreeアカウントはPremiumよりも上限が小さいです。50 GBのコレクションをキューに入れる前に確認してください。

ページスキャンで有用なものが何も返されない場合、そのページはおそらく読み込み後にJavaScriptを介して実際のコンテンツをロードしています。その場合、ライブDOMを読み取るブラウザ拡張機能は、静的スクレイパーよりも信頼性が高いです。

これがあなたのワークフローの残りの部分にどのように適合するか

Seedrがファイルをクラウドにプルすると、残りのワークフローはすでに設定されています。

  • WebDAV、FTP、またはSFTP経由でSeedrドライブをマウントすると、フェッチされたファイルがローカルフォルダとして表示されます。
  • PDFや画像を、最初にダウンロードすることなくSeedrのビューアで直接開きます。
  • ビデオを右クリックしてブラウザプレイヤーでストリーミングするか、テレビにキャストします。
  • ドキュメント(DOCXからPDF、MP4からMP3)を右クリックで直接出力に変換でき、別のツールは不要です。

ページ内のリンクをスキャンする目的は、探す部分に時間を無駄にしないことです。目的地、プレビュー、次のステップを1か所にまとめることで、作業が完了します。

まとめ

偽のダウンロードボタンをクリックするのはやめましょう。URLを貼り付け、スキャナーに作業を任せ、必要なものだけを保持してください。

Add link and go Statuses