Firecrawl - ページをスクレイプアクション
Firecrawlで、Scrape a pageアクションは単一のURLをMarkdown、HTML、JSON、またはその他の形式にスクレイプします。 JSON形式は、プロンプト、schema、またはその両方を使用してページからデータを抽出します。
入力
次の入力フィールドは最もよく使用されます。入力フィールドの完全なリストについては、Firecrawl Scrape APIドキュメントを参照してください。
| 入力フィールド | 説明 |
|---|---|
| URL | スクレイプする絶対URLを入力します。例:https://docs.firecrawl.dev。 |
| 形式 | 任意です。返す出力形式を選択します。オプションはMarkdown、HTML、Screenshot、またはJSONです。デフォルトはMarkdownです。 JSONには、プロンプト、schema、またはその両方が必要です。 |
| JSONプロンプト | 任意です。 JSON抽出の自然言語による指示を入力します。このフィールドは、FormatsにJSONが含まれている場合にのみ使用できます。 |
| JSON抽出schema | 任意です。 JSON抽出用のJSON schemaを入力します。このフィールドは、FormatsにJSONが含まれている場合にのみ使用できます。スキーマはFirecrawlにのみ送信されます。抽出データのデータピルを取得するには、Custom output fieldsに一致するフィールドを追加します。 |
| メインコンテンツのみ | 任意です。出力からヘッダー、ナビゲーション、フッターを除外するには、YesまたはNoを選択します。デフォルトはYesです。 |
| TLS検証をスキップ | 任意です。 TLS証明書の検証をスキップするには、YesまたはNoを選択します。 Yesの場合、証明書が無効、期限切れ、または自己署名であっても、Firecrawlはターゲットサイトに接続します。デフォルトはYesです。 |
| base64画像を削除 | 任意です。 Markdown出力からbase64画像を取り除くには、YesまたはNoを選択します。デフォルトはYesです。 |
| 広告をブロック | 任意です。広告およびCookieポップアップのブロックを有効にするには、YesまたはNoを選択します。デフォルトはYesです。 |
| キャッシュに保存 | 任意です。ページをFirecrawlインデックスに保存するには、YesまたはNoを選択します。デフォルトはYesです。 |
| カスタム出力フィールド | 任意です。 JSON抽出フィールドや追加のページmetadataなど、デフォルト出力に含まれないデータ用のデータピルを作成するには、フィールドを追加します。 |
出力
出力フィールドは、選択したFormatsに基づいて動的に生成されます。以下はすべての形式に共通です。出力フィールドの完全なリストについては、Firecrawl Scrape APIドキュメントを参照してください。
| 出力フィールド | 説明 |
|---|---|
| 成功 | スクレイピングが正常に完了したかどうかを示す、trueまたはfalseのブール応答。 |
| メタデータ | タイトル、説明、ステータスコードなどのページのメタデータ。 |
| 警告 | スクレイプに関する警告メッセージ(ある場合)。 |
最終更新日: