Ir para o conteúdo

Conector WebCrawler no Jitterbit Studio

Resumo

O conector WebCrawler permite rastrear e extrair informações de sites e páginas específicas.

O conector WebCrawler fornece uma interface para criar uma conexão WebCrawler, a base usada para gerar instâncias de atividades WebCrawler. Essas atividades, uma vez configuradas, interagem com sites e páginas especificadas através da conexão.

Acessa-se o conector WebCrawler pela aba Endpoints e conectores do projeto da paleta de componentes de design (consulte Paleta de componentes de design).

Visão geral do conector

Este conector é usado para configurar primeiro uma conexão WebCrawler. Os tipos de atividade associados a essa conexão são então usados para criar instâncias de atividades destinadas a serem usadas como fontes (para fornecer dados em uma operação) ou destinos (para consumir dados em uma operação).

Em conjunto, uma conexão WebCrawler específica e suas atividades são chamadas de endpoint WebCrawler:

Tipos de atividade WebCrawler

  • Scrape Page: Extrai dados de uma página e é destinada a ser usada como destino em uma operação.

  • Extract URL: Extrai conteúdo de uma URL e é destinada a ser usada como destino em uma operação.

  • Crawl: Rastreia sites e é destinada a ser usada como destino em uma operação.

Os endpoints criados com este conector estão incluídos no relatório de uso de endpoints e contam para sua licença.

Pré-requisitos e versões de API suportadas

Este conector pode ser usado com agentes na nuvem e agentes privados.

Os agentes baixam automaticamente a versão mais recente deste conector quando necessário. Em agentes privados, você pode suspender essas atualizações com a política de organização Disable Auto Connector Update.

Solução de problemas

Se você tiver problemas com o conector WebCrawler, recomenda-se seguir estas etapas de solução de problemas:

  1. Clique no botão Test na configuração de conexão para garantir que a conexão seja bem-sucedida e para garantir que a versão mais recente do conector seja baixada no agente (a menos que esteja usando a política de organização Disable Auto Connector Update).

  2. Verifique os logs de operação para qualquer informação registrada durante a execução da operação.

  3. Ative o log de debug de operação (para agentes na nuvem ou para agentes privados) para gerar arquivos de log e dados adicionais.

  4. Se estiver usando agentes privados, você pode ativar o log detalhado do conector para este conector adicionando esta entrada de configuração de logger ao arquivo logback.xml do seu agente privado:

    <logger name="org.jitterbit.connector.web.crawler" level="DEBUG"/>
    

    Para mais informações sobre log detalhado do conector, consulte Log detalhado para conectores usando agentes privados Jitterbit.

  5. Se estiver usando agentes privados, você pode verificar os logs do agente para mais informações.

  6. Para considerações adicionais de solução de problemas, consulte Solução de problemas de operação.