Firecrawl - サイトをクロールアクション
サイトをクロールアクションは、Firecrawlでドメインのクロールを開始し、検出した各ページをスクレイピングします。
完了を待機
デフォルトでは、このアクションはクロールを送信し、ジョブのステータスがcompletedまたはfailedになるまで60秒ごとにポーリングします。代わりにジョブIDをすぐに返すには、Wait for completionでNoを選択し、後でGet crawl job statusアクションを使用して確認します。
入力
次の入力フィールドは最もよく使用されます。入力項目の完全なリストについては、FirecrawlのCrawl APIドキュメントを参照してください。
| 入力フィールド | 説明 |
|---|---|
| URL | クロールする絶対URLを入力します(例:https://docs.firecrawl.dev)。 |
| プロンプト | 任意です。クローラーオプションを生成するための自然言語を入力します。設定した明示的な項目は、生成された値より優先されます。 |
| 制限 | 任意です。クロールするページの最大数を入力します。 1ページにつき1クレジットを消費します。コネクターのデフォルトは10です。 Firecrawl APIのデフォルトは10000です。 Limitが残りのクレジット数を上回る場合、Firecrawlは402エラーを返します。 |
| パスを含める | 任意です。クロールに含めるパス名の正規表現パターンを入力します(例:blog/.*)。 |
| パスを除外する | 任意です。クロールから除外するパス名の正規表現パターンを入力します(例:admin/.*)。 |
| ドメイン全体をクロール | 任意です。子リンクだけでなく、同階層および親の内部リンクもたどるには、YesまたはNoを選択します。 |
| スクレイピングオプション | 任意です。 Only main contentやSkip TLS verificationなど、形式とスクレイピングオプションを設定します。これは、クロールがスクレイピングするすべてのページに適用されます。スクレイピングオプションでは、Scrape a pageアクションと同じオプションを使用します。 |
| 完了を待機 | 任意です。ジョブが完了して結果を返すまでポーリングするには、YesまたはNoを選択します。デフォルトはYesです。 |
| 最大ポーリング時間(分) | 任意です。ポーリングする最大分数を入力します。有効な値は1~60です。デフォルトは10です。このフィールドは、Wait for completionがYesの場合にのみ使用できます。 |
| カスタム出力フィールド | 任意です。デフォルト出力に含まれないページデータのデータピルを作成する項目を追加します。 |
出力
| 出力フィールド | 説明 |
|---|---|
| 成功 | リクエストが成功したかどうかを示すtrueまたはfalseのブール応答。 |
| Status | ジョブのステータス。オプションはscraping、completed、またはfailedです。 |
| 完了 | これまでにクロールされたページ数。 |
| 合計 | 検出されたページの合計数。 |
| 使用済みクレジット | ジョブが使用したクレジット数。 |
| Expires at | ジョブの結果の有効期限が切れる日時。 |
| データ | クロールされたページのデータ(1ページにつき1エントリ)。 |
| 作成日時 | ジョブが作成された日時。 |
| 完了日時 | ジョブが終了した日時。 |
| 次へ | クロールが完了していない場合、またはレスポンスが10 MBを超える場合に、次の結果チャンクを取得するためのURL。このURLから、Get crawl job statusアクションのSkip項目の値を抽出します。 |
最終更新日: