TL;DR
- Puedes enviar un rastreo completo de un sitio web con una única solicitud
POST /api/v1/crawla Nstproxy Crawl. La solicitud inicia un trabajo asíncrono; se requiere hacer polling y recuperación de resultados paginados después. - Un rastreo seguro de todo el sitio tiene límites, no es literalmente ilimitado. Establece
maxDepth,maxPages, incluye/excluye patrones de URL, manejo de consultas, formatos de salida y un tiempo de espera antes de que el rastreador siga enlaces. - Los límites de profundidad y de páginas resuelven problemas diferentes. La profundidad limita cuántos saltos de enlace realiza el rastreador; el conteo de páginas capta el trabajo total incluso cuando el gráfico de enlaces es amplio.
- La canonicalización y las trampas determinan la calidad de los datos. Las rutas de calendario, la navegación facetada, los parámetros de seguimiento, las redirecciones y los canónicos duplicados pueden consumir un rastreo mucho antes de que se alcancen páginas valiosas.
- Trata la finalización como un evento de calidad del conjunto de datos. Inspecciona los conteos completados, pendientes y fallidos; pagina cada página de resultados; deduplica; y verifica la cobertura contra un mapa del sitio o conjunto de URL conocido.
Un "sitio web completo" rara vez es una lista finita y limpia. Un dominio puede exponer millones de combinaciones de parámetros, enlaces de calendario, páginas de búsqueda, duplicados de locales y rutas de JavaScript. Por lo tanto, un rastreo útil necesita una URL de inicio más límites explícitos.
Nstproxy Crawl agrupa descubrimiento, recuperación de páginas, renderización, extracción, enrutamiento de proxy, estado de tareas y almacenamiento de artefactos detrás de una única API. Este tutorial envía un trabajo de sitio limitado, controla el alcance, hace polling del estado, recupera cada página de resultados y verifica si el conjunto de datos final es lo suficientemente completo para su uso previsto.
¿Qué Hace Nstproxy Crawl Con Una Solicitud?
Nstproxy Crawl comienza desde una URL, descubre enlaces del mismo sitio y procesa páginas elegibles de acuerdo con los límites en la solicitud. La presentación devuelve un identificador de tarea en lugar de mantener la conexión HTTP abierta hasta que se termine todo el sitio.
La frase "solicitud única de API" se aplica a la presentación de trabajos. Un cliente de producción debe llamar más tarde a los endpoints de estado y resultados de páginas. Este diseño asíncrono es apropiado porque un sitio completo puede tardar más que un tiempo de espera normal de solicitudes y puede producir un conjunto de datos paginados.
La actual documentación de Nstproxy Crawl identifica estos controles a nivel de sitio:
| Control | Propósito |
|---|---|
url | URL inicial donde comienza el descubrimiento |
formats | Artefactos de página solicitados, como Markdown o HTML |
maxDepth | Distancia máxima de enlace desde la semilla |
maxPages | Número máximo de páginas procesadas |
includeUrls | Patrones permitidos en el rastreo |
excludeUrls | Patrones eliminados del rastreo |
ignoreQuery | Reduce los duplicados de parámetros de consulta cuando está habilitado |
onlyMainContent | Se enfoca en la extracción del contenido principal de la página |
timeout | Límite de tiempo para el procesamiento de páginas |
El glosario de rastreadores de Nstproxy define el mecanismo de descubrimiento, mientras que su guía sobre raspado versus rastreo explica por qué el descubrimiento y la extracción son operaciones separadas dentro de un trabajo.
Por Qué Rastrear Un Sitio Web Completo Es Difícil
Rastrear un sitio completo es difícil porque los sitios web exponen gráficos, no directorios. Un rastreador debe decidir qué URLs descubiertas representan nuevo contenido, cuáles son duplicados y cuáles conducen a espacios infinitos o de bajo valor.
Las trampas más comunes son:
- calendarios con enlaces de “próximo mes” que nunca terminan;
- filtros de producto facetados cuyas combinaciones se multiplican;
- parámetros de sesión, referencia, seguimiento y clasificación;
- vistas de impresión y URL móviles alternativos;
- espejos de idioma y regionales;
- cadenas de redirección y etiquetas canónicas inconsistentes;
- enlaces del lado del cliente que aparecen solo después de la ejecución de JavaScript;
- páginas soft 404 que devuelven HTTP 200;
- archivos grandes y endpoints que no son páginas HTML.
Las reglas de Robots y el descubrimiento del mapa del sitio proporcionan señales importantes. El Protocolo de Exclusión de Robots estandariza el comportamiento de robots.txt, y el protocolo de Sitemap define el formato común de lista de URL en XML. Ninguna de las fuentes otorga permiso para recopilar datos; también debes respetar términos, límites de autenticación, derechos de autor, privacidad y la ley aplicable.
Prerrequisitos
Necesitas una cuenta de Nstproxy, una clave de API de Crawl, una URL pública de semilla autorizada y una definición clara de cobertura requerida. Decide si necesitas texto de página, enlaces, HTML, capturas de pantalla u otro artefacto soportado antes de la presentación.
Crea un pequeño plan de aceptación:
- familias de URL esperadas, como
/docs/o/products/; - familias excluidas, como
/account/,/cart/,/search/, y calendarios; - profundidad máxima y presupuesto de páginas;
- reglas esperadas de idioma y anfitrión canónico;
- verificaciones de contenido mínimo para páginas aceptadas;
- política de actualización y eliminación para almacenamiento posterior.
Comience con un valor bajo de maxPages contra una sección representativa. Un piloto acotado revela trampas URL sin consumir el presupuesto completo del trabajo.
Convierte una URL en un conjunto de datos del sitioUsa Nstproxy Crawl para descubrir, renderizar y devolver páginas dentro de límites explícitos. Iniciar un rastreo |
Markdown
JSON
{
"titulo": "...", "url": "..." } Captura de pantalla
|
Envía el rastreo completo del sitio web
Envía un trabajo asincrónico a la ruta de rastreo del sitio actual. Una sonda sin credenciales el 4 de septiembre de 2026 devolvió HTTP 401, confirmando que /api/v1/crawl está activa y requiere autenticación. La solicitud a continuación está alineada con la documentación, pero no pudo completarse sin una clave de cuenta.
curl --request POST \ --url 'https://api.nstproxy.com/api/v1/crawl' \ --header 'x-api-key: YOUR_NSTPROXY_API_KEY' \ --header 'Content-Type: application/json' \ --data '{ "url": "https://example.com/docs/", "formats": ["markdown", "html"], "maxDepth": 3, "maxPages": 50, "includeUrls": ["*example.com/docs/*"], "excludeUrls": ["*example.com/docs/archive/*"], "ignoreQuery": true, "onlyMainContent": true, "timeout": 60000 }'
La respuesta esperada contiene un ID de tarea y un estado de procesamiento. No copie un ID ilustrativo en solicitudes posteriores; siempre persista el identificador exacto devuelto por su envío.
Solicite solo los formatos que utilizará. Markdown es apropiado para la ingestión de LLM y RAG, mientras que HTML ayuda cuando su analizador necesita selectores o marcado semántico. Múltiples formatos aumentan el volumen de artefactos y el manejo posterior.
La visión general del lanzamiento de Crawl de Nstproxy describe el flujo de trabajo del producto en general, incluyendo el descubrimiento del sitio y salidas listas para LLM.
Controlar la Profundidad y el Alcance del Crawl
Controle el alcance combinando profundidad, conteo de páginas, patrones de ruta y normalización de consultas. Ninguna configuración única es suficiente.
Elija maxDepth según la arquitectura de información
La profundidad cero o uno es útil para validar la semilla y la navegación inmediata. Un centro de documentación puede necesitar dos o tres saltos para llegar a las páginas de tema. Una alta profundidad no garantiza cobertura si las páginas importantes son accesibles solo a través de sitemaps o búsqueda en JavaScript.
La profundidad también depende de la semilla elegida. Comenzar en la página de inicio del dominio puede desperdiciar saltos en páginas de marketing; comenzar en /docs/ otorga más relevancia al mismo presupuesto de profundidad.
Trate maxPages como un presupuesto estricto
El conteo de páginas evita que un amplio gráfico de enlaces se expanda indefinidamente. Establezca un presupuesto piloto por debajo de su corpus esperado, inspeccione la mezcla de URL descubiertas y luego aumente solo cuando las páginas valiosas dominen.
Si el trabajo alcanza maxPages, la finalización no significa que se cubriera todo el sitio previsto. Significa que el trabajo limitado se detuvo en su techo configurado.
Use reglas de inclusión antes de las reglas de exclusión
Una lista de permitidos como *example.com/docs/* es más fácil de razonar que docenas de exclusiones. Agregue exclusiones para los subárboles de bajo valor conocidos dentro de la sección permitida.
Pruebe el comportamiento de los patrones contra URL de muestra antes del lanzamiento. Una barra diagonal o patrón de host mal colocado puede excluir silenciosamente cada página o admitir subdominios no relacionados.
Normalice los parámetros de consulta con cuidado
Habilite ignoreQuery cuando los parámetros no cambien el contenido significativo, como valores de seguimiento y ordenación. No descarte las cadenas de consulta cuando seleccionen un local real, variante de producto, versión de documentación o estado de paginación que su conjunto de datos requiere.
La comparación de URL debe seguir reglas de análisis consistentes. el Estándar de URL de WHATWG documenta el comportamiento moderno de análisis de URL; evite dividir cadenas de forma ad hoc para hosts, rutas y consultas.
Consultar el Estado del Crawl
Consulta el estado del trabajo con el ID de tarea devuelto. Reemplace el marcador de posición a continuación con su verdadero identificador:
curl --request GET \ --url 'https://api.nstproxy.com/api/v1/crawl/YOUR_TASK_ID' \ --header 'x-api-key: YOUR_NSTPROXY_API_KEY'
Utilice retroceso exponencial acotado con jitter en lugar de sondear continuamente. Deténgase en un estado terminal documentado y aplique un plazo general en su aplicación.
Inspeccione el cuerpo de la respuesta, no solo el HTTP 200. El modelo actual de Nstproxy puede informar información de fallos a nivel de tarea dentro de un sobre HTTP exitoso. Registre total, completado, pendiente y fallado cuando estén presentes, junto con identificadores de solicitud y tarea no secretos.
No vuelva a enviar automáticamente todo un sitio porque algunas páginas fallan. Recupere los resultados a nivel de página, clasifique los fallos y reintente solo las URL elegibles. Los fallos de autenticación, los objetivos no permitidos, los errores de análisis y los tiempos de espera transitorios requieren respuestas diferentes.
Recuperar Cada Página Rastreadas
Recupere la primera página de resultados después de que el crawl alcance un estado utilizable:
curl --request GET \ --url 'https://api.nstproxy.com/api/v1/crawl/YOUR_TASK_ID/pages?limit=50' \ --header 'x-api-key: YOUR_NSTPROXY_API_KEY'
Si la respuesta contiene nextCursor, solicite la siguiente página y continúe hasta que no quede cursor. Detenerse después de la primera respuesta de la API es una razón común por la que un crawl completado parece contener solo parte del sitio.
Los artefactos grandes pueden llegar como tokens de referencia como markdownRef o htmlRef. Resuelva referencias a través del punto final de almacenamiento documentado; nunca construya o modifique tokens de almacenamiento usted mismo.
Persista al menos la URL solicitada, la URL final, la URL canónica cuando esté disponible, el estado, el título, el idioma, el hash del contenido, el tiempo de crawl y la referencia de salida. Mantenga la identidad de la página separada de los cursores de paginación, que son un estado de transporte en lugar de IDs de documento.
Verificar la Cobertura y la Calidad de los Datos
Un rastreo es exitoso cuando cubre el corpus requerido con contenido de página aceptable, no meramente cuando su estado dice completado. Compara el conjunto de resultados con el sitemap del sitio, un árbol de navegación conocido, o una muestra etiquetada manualmente.
Calcula:
- URLs esperadas descubiertas;
- URLs descubiertas procesadas;
- páginas con contenido significativo;
- páginas canónicas únicas;
- duplicados y redirecciones;
- fallos por razón;
- presupuesto de URLs consumido por cada familia de rutas.
Inspecciona una muestra estratificada de rutas superficiales y profundas. Verifica páginas dependientes de JavaScript, tablas, bloques de código, paginación, variantes regionales y conocidos soft 404s. Si el presupuesto de rastreo está dominado por rutas de bajo valor, ajusta las reglas de inclusión antes de aumentar maxPages.
Para el contexto de construir frente a comprar, la comparativa de rastreadores web de código abierto de Nstproxy cubre marcos de rastreadores que ofrecen más control de bajo nivel pero requieren que operes en programación, renderización, almacenamiento, proxies y monitoreo.
Manejar Fallos y Actualizaciones
Separa errores de envío, errores de tarea y fallos de calidad de página. Una solicitud inválida debería fallar antes de la creación del trabajo. Un trabajo válido aún puede contener tiempos de espera en el objetivo, denegaciones de acceso, fallos de analizador o contenido vacío. Una página técnicamente exitosa aún puede ser rechazada porque es un duplicado, tiene una localidad incorrecta o es una pantalla de consentimiento.
Para rastreos recurrentes, retiene hashes de contenido y compara URLs canónicas. Procesa nuevamente páginas cambiadas, añade nuevas páginas y elimina páginas eliminadas de índices posteriores. No añadas cada ejecución indefinidamente.
Usa una cadencia de actualización más lenta para archivos estables y una más rápida para changelogs, inventarios o políticas. Respeta los encabezados de caché y la capacidad objetivo donde sea apropiado. Si una fuente proporciona feeds de cambios o sellos de tiempo de modificación, úsalos para reducir la obtención innecesaria.
Rastreo Responsable de Sitios Completos
El acceso completo al sitio debe ser autorizado y proporcional. No uses la API para eludir autenticación, muros de pago, permisos o salvaguardas técnicas. Evita páginas privadas y minimiza datos personales o regulados.
Al aceptar semillas proporcionadas por el usuario, previene la falsificación de solicitudes del lado del servidor. Bloquea localhost, redes privadas y locales, puntos finales de metadatos en la nube, esquemas inseguros, puertos sospechosos y redirecciones fuera del alcance aprobado. La guía de SSRF de OWASP proporciona un modelo de amenaza práctico.
Mantén las claves de API en un almacenamiento secreto aprobado, nunca en registros o control de versiones. Los IDs de tarea y referencias de almacenamiento pueden proporcionar acceso a resultados, así que evita exponerlos a usuarios no autorizados.
Lista de Verificación para Rastreo Completo de Sitio
Antes del envío, verifica la URL de la semilla, el host permitido, las rutas de inclusión, exclusiones, política de consulta, profundidad máxima, presupuesto de páginas, formatos de salida y autorización legal. Durante el trabajo, monitorea el estado con sondeos limitados. Después de la finalización, pagina todos los resultados, resuelve artefactos requeridos, deduplica contenido canónico, revisa fallos y compara la cobertura con una fuente conocida.
Los precios de rastreo de Nstproxy deben ser revisados junto con el presupuesto de páginas y el tráfico de proxies para el flujo de trabajo elegido. Comienza con un piloto limitado y mide el costo por cada página única aceptada.
Un Envío, Límites Explícitos, Resultados Verificados
Una solicitud de API puede iniciar un flujo de trabajo completo del sitio, pero un buen rastreo aún depende de límites deliberados y verificación. maxDepth da forma a la navegación de enlaces, maxPages protege el presupuesto, los patrones de URL enfocan el descubrimiento, y la recuperación de resultados paginados convierte el trabajo en un conjunto de datos utilizable.
Usa el rastreo más pequeño y representativo primero. Una vez que la distribución de URLs, la calidad de la página, el manejo de fallos y las comprobaciones de cobertura sean correctas, aumenta los límites gradualmente.
Preguntas Frecuentes
Q: ¿Puedo rastrear un sitio web entero con una solicitud API?
Sí. Una solicitud POST puede enviar un rastreo de sitio Nstproxy limitado, pero el flujo de trabajo asíncrono aún requiere sondeos de estado posteriores y recuperación de resultados paginados.
Q: ¿Cuál es la diferencia entre maxDepth y maxPages?
maxDepth limita el número de saltos de enlace desde la URL de origen, mientras que maxPages establece un límite en el número total de páginas que procesa el trabajo, independientemente del ancho del gráfico.
Q: ¿Cómo evito que un rastreador web siga URLs infinitas?
Combina un límite estricto de páginas con patrones de ruta permitidos, exclusiones conocidas, normalización de consultas, deduplicación canónica y un rastreo piloto de bajo presupuesto. Los caminos de calendario y de navegación facetada merecen pruebas explícitas.
Q: ¿Cómo sé si se rastreó todo el sitio web?
Compara los resultados únicos aceptados con los sitemaps o un inventario de URLs conocido, inspecciona los fallos y la cobertura de la ruta, y asegúrate de que se recuperó cada página de resultado paginado.



