ScrapingBee
Visão geral
Section titled “Visão geral”ScrapingBee é uma API de web scraping que gerencia navegadores headless e rotação de proxies. Com a integração no SquadOS, seus agentes podem recuperar HTML, extrair dados estruturados e renderizar páginas com JavaScript, desde que você tenha autorização para acessar e processar o conteúdo.
- Site oficial: https://www.scrapingbee.com/
- Documentação na Composio: docs.composio.dev/toolkits/scrapingbee
Autenticação
Section titled “Autenticação”Esta ferramenta utiliza chave de API (API_KEY) para conectar.
Você vai precisar dos seguintes campos:
| Campo | Obrigatório | Descrição |
|---|---|---|
api_key | Sim | Chave de API privada da sua conta ScrapingBee, usada para autenticar todas as requisições. |
Como obter a credencial
Section titled “Como obter a credencial”- Acesse app.scrapingbee.com e crie uma conta ou faça login.
- Abra a página API Key da conta.
- Copie a chave exibida — esse é o valor a informar no fluxo hospedado de conexão.
Não cole a chave em prompts, mensagens, regras de extração, cookies ou headers encaminhados ao site de destino. Se houver suspeita de exposição, gere outra chave no painel e reconecte a conta.
Como conectar no SquadOS
Section titled “Como conectar no SquadOS”- Acesse Ferramentas no menu lateral (
/admin/tools). - Abra a aba Disponíveis e procure por
ScrapingBee. - Abra o painel Configurar ferramenta e clique em Ativar. A integração passa para Ativas com o estado Aguardando autenticação.
- Abra a ferramenta ativa e clique em Conectar agora.
- Na página segura hospedada pela Composio, informe a chave e conclua a conexão.
- De volta ao SquadOS, confirme a conta em Contas e use Editar ações para liberar somente as operações necessárias.
- No editor do agente, abra Ferramentas, clique em Adicionar Ferramenta, escolha
ScrapingBee, selecione a conta e as ações, salve e faça um teste controlado. (Detalhes em Ferramentas da Organização.)
Ações disponíveis
Section titled “Ações disponíveis”O catálogo atual da Composio contém 5 ações do ScrapingBee; os cinco identificadores estão documentados abaixo. Os parâmetros pertencem ao snapshot 20260410_00, enquanto o catálogo atual está em 20260615_00. Confirme o schema em Editar ações antes de salvar.
Extração de dados estruturados
Section titled “Extração de dados estruturados”SCRAPINGBEE_DATA_EXTRACTION
Extrai dados estruturados de uma página web usando seletores CSS ou XPath. Utiliza o recurso extract_rules do ScrapingBee.
Parâmetros de entrada
Section titled “Parâmetros de entrada”| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
url | string | Sim | URL da página web da qual extrair os dados. |
wait | integer | Não | Segundos a aguardar antes da extração (para conteúdo dinâmico). |
device | string | Não | Tipo de dispositivo a emular (desktop ou mobile). |
api_key | string | Sim | Sua chave de API do ScrapingBee. |
extractor | object | Sim | Objeto JSON definindo os campos a extrair e seus seletores CSS/XPath. Para seletores aninhados, use objeto com as chaves selector e type (opcional). Seletores inválidos ou desalinhados descartam campos silenciosamente sem erro — verifique cada seletor no DOM alvo antes de uso em larga escala. |
javascript | boolean | Não | Se deve renderizar JavaScript antes da extração. |
country_code | string | Não | Código de país de duas letras para geolocalização do proxy (ex.: us, de). |
premium_proxy | boolean | Não | Usar proxy premium para maior confiabilidade. |
block_resources | boolean | Não | Bloquear imagens, CSS e outros recursos para acelerar a extração. |
forward_headers | object | Não | Cabeçalhos HTTP customizados a encaminhar ao site alvo. Forneça como dicionário (ex.: {'Accept-Language': 'en-US'}). Os cabeçalhos serão prefixados com Spb- antes de serem encaminhados. |
| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
data | string | Sim | Dados retornados pela execução da ação. |
error | string | Não | Mensagem de erro caso a execução tenha falhado. |
successful | boolean | Sim | Indica se a ação foi executada com sucesso. |
Busca de HTML
Section titled “Busca de HTML”SCRAPINGBEE_HTML_FETCH
Obtém o HTML ou uma captura técnica retornada pela API HTML do ScrapingBee. Use quando precisar do markup ou de uma imagem da página após renderização opcional de JavaScript. Só aumente o nível de proxy quando o acesso for autorizado e a configuração básica não atender ao alvo; proxy não concede permissão nem deve ser usado para contornar CAPTCHA ou controle de acesso.
Parâmetros de entrada
Section titled “Parâmetros de entrada”| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
url | string | Sim | URL a raspar. |
wait | integer | Não | Milissegundos a aguardar antes de retornar o conteúdo. |
retry | integer | Não | Número de tentativas em caso de falha na requisição. |
device | string | Não | Tipo de dispositivo a emular (desktop ou mobile). |
cookies | string | Não | Cookies a enviar nas requisições (string de cabeçalho HTTP). |
wait_for | string | Não | Seletor CSS a aguardar antes de retornar o conteúdo. |
block_ads | boolean | Não | Bloquear anúncios e scripts de rastreamento. |
render_js | boolean | Não | Renderizar JavaScript antes de retornar o HTML. Necessário para páginas renderizadas no lado do cliente onde os dados dinâmicos estão ausentes no HTML bruto. |
js_snippet | string | Não | Trecho de JavaScript a executar antes de retornar o conteúdo. |
screenshot | boolean | Não | Retornar captura de tela como PNG codificado em base64. |
js_scenario | string | Não | Cenário JSON para ações customizadas no headless browser. |
country_code | string | Não | Código de país de duas letras para geolocalização (ex.: us). |
extract_rules | string | Não | Regras de extração (seletor CSS ou JSONPath). |
premium_proxy | boolean | Não | Usar proxy premium para raspagem. |
stealth_proxy | boolean | Não | Usar modo de proxy stealth (indetectável). |
block_resources | boolean | Não | Bloquear imagens e recursos CSS para acelerar a raspagem. |
screenshot_selector | string | Não | Seletor CSS do elemento a capturar. |
screenshot_full_page | boolean | Não | Capturar screenshot da página inteira em vez de apenas o viewport. |
| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
data | string | Sim | Dados retornados pela execução da ação. |
error | string | Não | Mensagem de erro caso a execução tenha falhado. |
successful | boolean | Sim | Indica se a ação foi executada com sucesso. |
Modo proxy
Section titled “Modo proxy”SCRAPINGBEE_SCRAPING_BEE_PROXY_MODE
Busca conteúdo web via Modo Proxy do ScrapingBee. Use quando precisar rotear requisições pelos proxies do ScrapingBee com renderização opcional de JavaScript e bloqueio de recursos.
Parâmetros de entrada
Section titled “Parâmetros de entrada”| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
url | string | Sim | URL alvo a raspar pelo Modo Proxy do ScrapingBee. |
cookies | object | Não | Cookies a enviar com a requisição como mapeamento chave-valor. |
headers | object | Não | Cabeçalhos HTTP adicionais a encaminhar ao site alvo. Cada cabeçalho será prefixado com Spb- quando forward_headers estiver habilitado. |
timeout | integer | Não | Timeout da requisição em milissegundos. |
block_ads | boolean | Não | Bloquear anúncios e scripts de rastreamento para acelerar a raspagem. |
render_js | boolean | Não | Habilitar renderização de JavaScript antes de retornar o conteúdo. |
session_id | integer | Não | Identificador de sessão (inteiro) para manter o mesmo IP em múltiplas requisições. Use o mesmo número para garantir IP consistente entre requisições. |
js_scenario | string | Não | Nome do cenário JavaScript customizado para interações avançadas. |
country_code | string | Não | Código de país de duas letras para proxy geolocalizado (ex.: us, fr). |
premium_proxy | boolean | Não | Usar proxies premium para maior confiabilidade. |
stealth_proxy | boolean | Não | Usar modo de proxy stealth para maior indetectabilidade. |
block_resources | boolean | Não | Bloquear imagens e recursos CSS para acelerar a raspagem. Relevante apenas quando render_js estiver habilitado. |
forward_headers | boolean | Não | Encaminhar os cabeçalhos originais da requisição ao site alvo. |
| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
data | string | Sim | Dados retornados pela execução da ação. |
error | string | Não | Mensagem de erro caso a execução tenha falhado. |
successful | boolean | Sim | Indica se a ação foi executada com sucesso. |
Proxy stealth
Section titled “Proxy stealth”SCRAPINGBEE_STEALTH_PROXY
Executa uma requisição pelo modo Stealth Proxy do ScrapingBee. Use somente em um alvo autorizado que exija esse nível de proxy e depois de avaliar o custo; não trate o modo como autorização para evitar controles do site.
Parâmetros de entrada
Section titled “Parâmetros de entrada”| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
url | string | Sim | URL da página a recuperar usando proxy stealth. |
wait | integer | Não | Tempo de espera em milissegundos antes de retornar a resposta. |
device | string | Não | Tipo de dispositivo a emular durante a renderização. Opções: desktop ou mobile. |
cookies | string | Não | Cookies customizados no formato separado por ponto-e-vírgula: nome1=valor1;nome2=valor2. |
js_render | boolean | Não | Renderizar JavaScript na página antes de retornar a resposta. |
country_code | string | Não | Código de país de duas letras para geolocalização do proxy (ex.: us, de). |
extract_rules | string | Não | Regras de extração em string JSON para dados estruturados. |
premium_proxy | boolean | Não | Usar proxies premium para maior confiabilidade. |
stealth_proxy | boolean | Não | Habilitar modo de proxy stealth. Use quando o site alvo bloqueia bots. |
block_resources | boolean | Não | Bloquear imagens, estilos e fontes para carregamento mais rápido. |
forward_headers | boolean | Não | Encaminhar os cabeçalhos originais da requisição do navegador. |
return_page_source | boolean | Não | Retornar o código-fonte bruto da página em vez do texto. |
| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
data | string | Sim | Dados retornados pela execução da ação. |
error | string | Não | Mensagem de erro caso a execução tenha falhado. |
successful | boolean | Sim | Indica se a ação foi executada com sucesso. |
Estatísticas de uso
Section titled “Estatísticas de uso”SCRAPINGBEE_USAGE_STATS
Recupera as estatísticas de uso da sua conta ScrapingBee. Use quando precisar monitorar créditos restantes e contagem de requisições.
| Nome | Tipo | Obrigatório | Descrição |
|---|---|---|---|
data | string | Sim | Dados retornados pela execução da ação. |
error | string | Não | Mensagem de erro caso a execução tenha falhado. |
successful | boolean | Sim | Indica se a ação foi executada com sucesso. |