Scraping basique
/scrape.
Extraction de PDF
parsers (par exemple parsers: ["pdf"]) lorsque vous voulez garantir l’analyse des PDF. Vous pouvez contrôler la stratégie d’analyse avec l’option mode :
auto(par défaut) — tente d’abord une extraction rapide basée sur le texte, puis bascule vers l’OCR si nécessaire.fast— analyse basée uniquement sur le texte (texte intégré). La plus rapide, mais ignore les pages scannées ou très riches en images.ocr— force l’analyse par OCR sur chaque page. À utiliser pour les documents numérisés ou lorsqueautoclasse mal une page.
{ type: "pdf" } et "pdf" utilisent tous les deux mode: "auto" par défaut.
Options de scraping
/scrape, vous pouvez personnaliser la requête à l’aide des options suivantes.
Formats (formats)
formats contrôle les types de sortie que le scraper renvoie. Valeur par défaut : ["markdown"].
Formats de type chaîne de caractères : passez le nom directement (par ex. "markdown").
Formats objet : passez un objet avec
type et des options supplémentaires.
Scraping mobile
mobile: true pour émuler un appareil mobile. Cela est utile lorsqu’un site responsive masque du contenu sur ordinateur ou affiche une mise en page différente sur les navigateurs mobiles.
Pour les sites spécifiques à une région, combinez cette option avec location et une capture d’écran mobile afin de vérifier la mise en page affichée :
mobile: true, ajoutez un User-Agent mobile via headers :
Filtrage du contenu
onlyMainContent vaut true (valeur par défaut), le boilerplate (navigation, pied de page, etc.) est supprimé. includeTags et excludeTags sont appliqués au DOM original de la page, et non au résultat après filtrage ; vos sélecteurs doivent donc cibler les éléments tels qu’ils apparaissent dans le HTML source. Si vous définissez onlyMainContent: false, le HTML complet de la page est utilisé comme point de départ pour le filtrage par balises.
Timing et cache
Analyse de PDF
Actions
wait et de waitFor ne doit pas dépasser 60 secondes.
Notes sur l’exécution des actions
- Write nécessite un
clickpréalable pour placer le focus sur l’élément cible. - Scroll accepte un
selectoroptionnel pour faire défiler un élément spécifique plutôt que la page. - Wait accepte soit
milliseconds(délai fixe), soitselector(attendre jusqu’à ce que l’élément soit visible). - Les actions s’exécutent séquentiellement : chaque étape se termine avant que la suivante ne commence.
- Les actions ne sont pas prises en charge pour les PDF. Si l’URL renvoie vers un PDF, la requête échouera.
Exemples d’actions avancées
cURL
cURL
cURL
cURL
executeJavascript est enregistrée dans le tableau actions.javascriptReturns de la réponse.
Exemple d’extraction complète
cURL
<h1>, <p>, <a> et .main-content tout en excluant #ad et #footer, attend 1 seconde avant l’extraction, définit un délai d’expiration de 15 secondes et active l’analyse des PDF.
Consultez la référence complète de l’API Scrape pour plus de détails.
Extraction de JSON via formats
formats pour extraire une donnée structurée en un seul passage :
Endpoint de l’agent
/v2/agent pour effectuer une extraction autonome de données sur plusieurs pages. L’agent fonctionne de manière asynchrone : vous démarrez un job, puis interrogez périodiquement l’API pour récupérer les résultats.
Options de l’agent
Vérifier l’état de l’agent
GET /v2/agent/{jobId} pour suivre l’avancement. Le champ status de la réponse vaudra "processing", "completed" ou "failed".
cURL
firecrawl.agent()) qui lance la tâche et interroge automatiquement son état jusqu’à son achèvement.
Crawl de plusieurs pages
/v2/crawl. Le crawl s’exécute de manière asynchrone et renvoie un ID de tâche. Utilisez le paramètre limit pour contrôler le nombre de pages explorées. S’il n’est pas indiqué, le crawl traitera jusqu’à 10 000 pages.
cURL
Réponse
Vérifier l’état d’une tâche de crawl
cURL
next, c’est-à-dire l’URL de la page de résultats suivante.
Aperçu du prompt et des paramètres de crawl
prompt en langage naturel pour permettre à Firecrawl de déduire les paramètres de crawl. Prévisualisez-les d’abord :
cURL
Options du crawler
/v2/crawl, vous pouvez personnaliser le comportement du crawl à l’aide des options suivantes.
Filtrage des chemins
Portée du crawl
Sitemap et déduplication
Options de scrape pour le crawl
Exemple de crawl
cURL
Cartographie des liens d’un site web
/v2/map identifie les URL associées à un site web donné.
cURL
Options de cartographie
Voici la référence de l’API : Documentation du point de terminaison « Map »
Autoriser Firecrawl
Autoriser Firecrawl à explorer votre site web
- User Agent : Autorisez
FirecrawlAgentdans votre pare-feu ou vos règles de sécurité. - Adresses IP : Firecrawl n’utilise pas un ensemble fixe d’adresses IP sortantes.
Autoriser votre application à appeler l’API Firecrawl
api.firecrawl.dev) :
- Adresse IP :
35.245.250.27

