Conector WebCrawler en Jitterbit Studio
Resumen
El conector WebCrawler permite rastrear y extraer información de sitios web y páginas específicas.
El conector WebCrawler proporciona una interfaz para crear una conexión WebCrawler, la base utilizada para generar instancias de actividades WebCrawler. Estas actividades, una vez configuradas, interactúan con sitios web y páginas especificadas a través de la conexión.
Se accede al conector WebCrawler desde la pestaña Puntos finales y conectores del proyecto de la paleta de componentes de diseño (consulta Paleta de componentes de diseño).
Descripción general del conector
Este conector se utiliza primero para configurar una conexión WebCrawler. Los tipos de actividad asociados con esa conexión se utilizan luego para crear instancias de actividades que se pretende utilizar como orígenes (para proporcionar datos en una operación) o destinos (para consumir datos en una operación).
En conjunto, una conexión WebCrawler específica y sus actividades se denominan punto final WebCrawler:

-
Scrape Page: Extrae una página y se pretende utilizar como destino en una operación.
-
Extract URL: Extrae contenido de una URL y se pretende utilizar como destino en una operación.
-
Crawl: Rastrea sitios web y se pretende utilizar como destino en una operación.
Los puntos finales creados con este conector se incluyen en reportes de uso de puntos finales y cuentan hacia tu licencia.
Requisitos previos y versiones de API compatibles
Este conector se puede utilizar con agentes en la nube y agentes privados.
Los agentes descargan automáticamente la versión más reciente de este conector cuando es necesario. En agentes privados, puedes suspender estas actualizaciones con la política de organización Disable Auto Connector Update.
Solución de problemas
Si experimentas problemas con el conector WebCrawler, se recomiendan estos pasos para la solución de problemas:
-
Haz clic en el botón Test en la configuración de conexión para asegurar que la conexión sea exitosa y para asegurar que la versión más reciente del conector se descargue en el agente (a menos que utilices la política de organización Disable Auto Connector Update).
-
Revisa los registros de operación para obtener cualquier información escrita durante la ejecución de la operación.
-
Habilita el registro de depuración de operación (para agentes en la nube o para agentes privados) para generar archivos de registro y datos adicionales.
-
Si utilizas agentes privados, puedes habilitar el registro detallado del conector para este conector agregando esta entrada de configuración de registrador al archivo
logback.xmlde tu agente privado:<logger name="org.jitterbit.connector.web.crawler" level="DEBUG"/>Para obtener más información sobre el registro detallado del conector, consulta Registro detallado para conectores usando agentes privados de Jitterbit.
-
Si utilizas agentes privados, puedes revisar los registros del agente para obtener más información.
-
Para consideraciones adicionales sobre la solución de problemas, consulta Solución de problemas de operación.