Skip to main content
Référence pour toutes les options disponibles sur les points de terminaison de scraping, crawling, mapping et agent de Firecrawl.”

Scraping basique

Pour extraire une seule page et obtenir un contenu Markdown propre, utilisez le point de terminaison /scrape.

Extraction de PDF

Firecrawl prend en charge les PDF. Utilisez l’option parsers (par exemple parsers: ["pdf"]) lorsque vous voulez garantir l’analyse des PDF. Vous pouvez contrôler la stratégie d’analyse avec l’option mode :
  • auto (par défaut) — tente d’abord une extraction rapide basée sur le texte, puis bascule vers l’OCR si nécessaire.
  • fast — analyse basée uniquement sur le texte (texte intégré). La plus rapide, mais ignore les pages scannées ou très riches en images.
  • ocr — force l’analyse par OCR sur chaque page. À utiliser pour les documents numérisés ou lorsque auto classe mal une page.
{ type: "pdf" } et "pdf" utilisent tous les deux mode: "auto" par défaut.

Options de scraping

Lorsque vous utilisez le point de terminaison /scrape, vous pouvez personnaliser la requête à l’aide des options suivantes.

Formats (formats)

Le tableau formats contrôle les types de sortie que le scraper renvoie. Valeur par défaut : ["markdown"]. Formats de type chaîne de caractères : passez le nom directement (par ex. "markdown"). Formats objet : passez un objet avec type et des options supplémentaires.

Scraping mobile

Définissez mobile: true pour émuler un appareil mobile. Cela est utile lorsqu’un site responsive masque du contenu sur ordinateur ou affiche une mise en page différente sur les navigateurs mobiles. Pour les sites spécifiques à une région, combinez cette option avec location et une capture d’écran mobile afin de vérifier la mise en page affichée :
Si le site continue d’afficher une mise en page desktop malgré mobile: true, ajoutez un User-Agent mobile via headers :

Filtrage du contenu

Ces paramètres contrôlent quelles parties de la page apparaissent dans le résultat. Lorsque onlyMainContent vaut true (valeur par défaut), le boilerplate (navigation, pied de page, etc.) est supprimé. includeTags et excludeTags sont appliqués au DOM original de la page, et non au résultat après filtrage ; vos sélecteurs doivent donc cibler les éléments tels qu’ils apparaissent dans le HTML source. Si vous définissez onlyMainContent: false, le HTML complet de la page est utilisé comme point de départ pour le filtrage par balises.

Timing et cache

Analyse de PDF

Actions

Exécutez des actions de navigateur avant le scraping. C’est utile pour le contenu dynamique, la navigation ou les pages nécessitant une interaction de l’utilisateur. Vous pouvez inclure jusqu’à 50 actions par requête, et le temps d’attente cumulé de toutes les actions wait et de waitFor ne doit pas dépasser 60 secondes.

Notes sur l’exécution des actions

  • Write nécessite un click préalable pour placer le focus sur l’élément cible.
  • Scroll accepte un selector optionnel pour faire défiler un élément spécifique plutôt que la page.
  • Wait accepte soit milliseconds (délai fixe), soit selector (attendre jusqu’à ce que l’élément soit visible).
  • Les actions s’exécutent séquentiellement : chaque étape se termine avant que la suivante ne commence.
  • Les actions ne sont pas prises en charge pour les PDF. Si l’URL renvoie vers un PDF, la requête échouera.

Exemples d’actions avancées

Prendre une capture d’écran :
cURL
Clic sur plusieurs éléments :
cURL
Générer un PDF :
cURL
Exécuter JavaScript (par ex. extraire les données intégrées à la page) :
cURL
La valeur de retour de chaque action executeJavascript est enregistrée dans le tableau actions.javascriptReturns de la réponse.

Exemple d’extraction complète

La requête suivante combine plusieurs options d’extraction :
cURL
Cette requête renvoie du Markdown, du HTML, du HTML brut, des liens et une capture d’écran de la page entière. Elle limite le contenu à <h1>, <p>, <a> et .main-content tout en excluant #ad et #footer, attend 1 seconde avant l’extraction, définit un délai d’expiration de 15 secondes et active l’analyse des PDF. Consultez la référence complète de l’API Scrape pour plus de détails.

Extraction de JSON via formats

Utilisez l’objet de format JSON dans formats pour extraire une donnée structurée en un seul passage :

Endpoint de l’agent

Utilisez l’endpoint /v2/agent pour effectuer une extraction autonome de données sur plusieurs pages. L’agent fonctionne de manière asynchrone : vous démarrez un job, puis interrogez périodiquement l’API pour récupérer les résultats.

Options de l’agent

Vérifier l’état de l’agent

Envoyez des requêtes GET /v2/agent/{jobId} pour suivre l’avancement. Le champ status de la réponse vaudra "processing", "completed" ou "failed".
cURL
Les SDK Python et Node fournissent également une méthode pratique (firecrawl.agent()) qui lance la tâche et interroge automatiquement son état jusqu’à son achèvement.

Crawl de plusieurs pages

Pour crawler plusieurs pages, utilisez le point de terminaison /v2/crawl. Le crawl s’exécute de manière asynchrone et renvoie un ID de tâche. Utilisez le paramètre limit pour contrôler le nombre de pages explorées. S’il n’est pas indiqué, le crawl traitera jusqu’à 10 000 pages.
cURL

Réponse

Vérifier l’état d’une tâche de crawl

Utilisez l’ID de tâche pour vérifier l’état d’un crawl et récupérer ses résultats.
cURL
Si le contenu dépasse 10 Mo ou si la tâche de crawl est toujours en cours, la réponse peut inclure un paramètre next, c’est-à-dire l’URL de la page de résultats suivante.

Aperçu du prompt et des paramètres de crawl

Vous pouvez fournir un prompt en langage naturel pour permettre à Firecrawl de déduire les paramètres de crawl. Prévisualisez-les d’abord :
cURL

Options du crawler

Lorsque vous utilisez l’endpoint /v2/crawl, vous pouvez personnaliser le comportement du crawl à l’aide des options suivantes.

Filtrage des chemins

L’URL de départ est également vérifiée par rapport à includePaths. Si elle ne correspond à aucun motif, le crawl peut renvoyer 0 page.

Portée du crawl

Sitemap et déduplication

Options de scrape pour le crawl

Exemple de crawl

cURL
Le point de terminaison /v2/map identifie les URL associées à un site web donné.
cURL

Options de cartographie

Voici la référence de l’API : Documentation du point de terminaison « Map »

Autoriser Firecrawl

Autoriser Firecrawl à explorer votre site web

  • User Agent : Autorisez FirecrawlAgent dans votre pare-feu ou vos règles de sécurité.
  • Adresses IP : Firecrawl n’utilise pas un ensemble fixe d’adresses IP sortantes.

Autoriser votre application à appeler l’API Firecrawl

Si votre pare-feu bloque les requêtes sortantes de votre application vers des services externes, vous devez ajouter l’adresse IP du serveur de l’API Firecrawl à la liste d’autorisation afin que votre application puisse atteindre l’API Firecrawl (api.firecrawl.dev) :
  • Adresse IP : 35.245.250.27
Ajoutez cette adresse IP à la liste d’autorisation des connexions sortantes de votre pare-feu afin que votre backend puisse envoyer à Firecrawl des requêtes de scraping, de crawling, de mapping et des requêtes d’agent.