Envía una URL objetivo
Empieza con un sitio web, centro de documentación o categoría de producto.
Convierte cualquier sitio en datos limpios y estructurados — Markdown, HTML, JSON, enlaces y PDF — con un motor de rastreo impulsado por proxies. Creado para desarrolladores y equipos de IA que construyen pipelines RAG, investigación de mercado y productos de datos a escala.
Crawl empieza con una URL objetivo, descubre páginas accesibles, aplica reglas de renderizado y proxy, y devuelve salidas normalizadas para cada página del trabajo.
Encuentra todas las URL rastreables desde sitemaps, enlaces y reglas de subpáginas personalizadas.
Controla páginas máximas, profundidad y rutas excluidas antes de comenzar.
Renderiza páginas dinámicas y con mucho JS en un navegador real antes de extraer contenido.
Genera código listo para usar desde Playground y ejecuta trabajos de rastreo desde tu aplicación.
Revisa registros, inspecciona resultados y exporta datos limpios con un clic.
Mantén registros, créditos de suscripción y uso aislados por cuenta o equipo.
Usa proxies residenciales, datacenter o personalizados para llegar a páginas con más fiabilidad.
Devuelve Markdown, HTML, JSON, enlaces y PDF desde el mismo flujo de rastreo.
Diseñado para desarrolladores y equipos de datos que necesitan recopilación repetible de sitios completos sin mantener infraestructura de crawlers.
Empieza con un sitio web, centro de documentación o categoría de producto.
Define profundidad, páginas máximas, reglas de inclusión/exclusión y opciones de solicitud.
Activa el renderizado JavaScript y enruta el tráfico por Nstproxy o un proxy personalizado.
Recibe salidas limpias y estructuradas por página, listas para tu pipeline.
Empieza en Playground para probar parámetros y luego copia un ejemplo API que coincida con la misma configuración.
Prueba URL, renderizado JS, opciones de proxy y formatos de salida sin escribir código.
Copia fragmentos de Node.js, cURL o SDK generados a partir de la configuración actual.
Crawl usa primero créditos de suscripción y después créditos de recarga cuando hace falta.
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient
with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
crawl = client.submit_crawl_task(CrawlRequestDto(
url="https://docs.example.com/",
maxDepth=3,
maxPages=10,
formats=[Format.MARKDOWN],
onlyMainContent=True,
timeout=60000,
))
print("crawl task id:", crawl.id)Pay per use
Small Projects
High Volume
Usa Crawl cuando una URL debe convertirse en muchas páginas de datos limpios, estructurados y reutilizables.
Rastrea sitios de documentación y convierte cada página en Markdown limpio para flujos de IA y soporte.
Recopila categorías, detalles de productos, precios, disponibilidad y enlaces de sitios de comercio.
Supervisa sitios públicos y convierte páginas sin procesar en entradas de investigación repetibles.
Rastrea dominios para recopilar metadatos, enlaces internos, contenido y cobertura de rastreo.
Envía Markdown y JSON rastreados a flujos RAG, agentes, indexación y enriquecimiento.
Captura salidas HTML y PDF para revisión, registros, cumplimiento y auditorías repetibles.
Todo lo que necesitas saber sobre Crawl, precios e integración técnica.
¿Qué devuelve Crawl?
Crawl puede devolver Markdown, HTML, JSON, enlaces y PDF limpios para cada página procesada.
¿Puedo definir límites de rastreo?
¿Puedo rastrear sitios renderizados con JavaScript?
¿Puedo usar Nstproxy o mi propio proxy?
¿Cómo se cobra Crawl?
Convierte cualquier sitio en datos limpios y listos para LLM con el motor de rastreo con proxies de Nstproxy. Empieza gratis, sin mínimo mensual; paga solo por lo que rastreas.