Resumen
- Nstproxy ha lanzado dos nuevos productos: Proxy Manager y Crawl.
- Proxy Manager ayuda a los equipos a centralizar las operaciones de proxy, incluyendo enrutamiento, gestión de grupos, reglas de rotación y visibilidad de solicitudes.
- Crawl proporciona una API de recopilación de datos web gestionada que convierte URLs en Markdown, HTML, capturas de pantalla, PDFs y otros formatos utilizables.
- Los clientes existentes de Nstproxy pueden continuar utilizando sus productos de proxy actuales, cuentas, claves API y precios como antes.
Introducción
Nstproxy siempre se ha centrado en ayudar a los equipos a acceder a la web de manera confiable a través de infraestructuras de proxy. A medida que las operaciones se expanden, acceder a sitios web es solo una parte del desafío. Los equipos también necesitan mejores maneras de gestionar el tráfico de proxies a través de múltiples proyectos, monitorear el desempeño de las solicitudes y recopilar contenido web sin mantener una infraestructura compleja.
Para abordar estas necesidades, Nstproxy está introduciendo dos nuevos productos:
- Proxy Manager, una capa centralizada para gestionar operaciones de proxy.
- Crawl, una API gestionada para recopilar y procesar contenido web.
Junto con la red de proxies existente de Nstproxy, estas herramientas ayudan a los equipos a construir flujos de trabajo de datos web más completos.
El Flujo de Trabajo de Datos Web de Nstproxy
Diferentes equipos tienen diferentes requisitos al trabajar con datos web. Algunos necesitan acceso de proxy confiable a sitios web. Algunos necesitan un mejor control y visibilidad sobre las operaciones de proxy a gran escala. Otros necesitan contenido web listo para usar sin mantener sus propios sistemas de rastreo.
Nstproxy ahora admite estos diferentes flujos de trabajo:
- Proxy: Acceso confiable a recursos web
- Proxy Manager: Gestión centralizada del tráfico de proxy
- Crawl: Recopilación de contenido web a través de una API simple
Los productos pueden usarse de manera independiente o combinada, dependiendo de los requisitos de su flujo de trabajo.
Proxy Manager: Control Centralizado para Operaciones de Proxy
Ejecutar un pequeño flujo de trabajo de raspado es relativamente simple. Sin embargo, gestionar la infraestructura de proxy a través de múltiples proyectos, equipos y sitios web de destino se vuelve mucho más desafiante a medida que las operaciones se expanden.
Proxy Manager está diseñado para simplificar la capa operativa detrás del uso de proxies. En lugar de gestionar las credenciales de proxy, las reglas de enrutamiento, la lógica de rotación y el monitoreo de manera separada a través de diferentes scripts y aplicaciones, los equipos dirigen el tráfico a través de un punto final de enrutador centralizado. Proxy Manager maneja la capa de operaciones de proxy mientras que sus aplicaciones se centran en recopilar y procesar datos.

- Gestión centralizada de grupos de proxy. Crea y organiza grupos de proxy según el tipo de flujo de trabajo. Por ejemplo, proyectos de monitoreo de precios pueden usar grupos residenciales dedicados; y flujos de trabajo de seguimiento de SEO pueden usar configuraciones separadas. Diferentes equipos pueden gestionar sus propios entornos de tráfico sin afectar a los demás.
- Control flexible de enrutamiento y rotación. Configura estrategias de enrutamiento de tráfico y rotación en un solo lugar. Cuando cambian los requisitos de proxy, actualiza la configuración de Proxy Manager, no cada crawler y script que dependa de él.
- Registro y visibilidad de solicitudes. Proxy Manager registra cada solicitud con el dominio de destino, el código de respuesta, el estado y el tiempo. Cuando algo falla, los registros te indican si el problema provino del grupo de proxy, de un límite de tasa o de un cambio en el sitio de destino, sin necesidad de cruzar registros de múltiples sistemas.
- Gestión de acceso basada en equipos. Para organizaciones donde múltiples equipos comparten recursos de proxy, Proxy Manager proporciona puntos finales de enrutador separados por equipo. Los equipos acceden a los recursos que necesitan; los administradores mantienen el control sobre configuraciones y visibilidad de uso.
Proxy Manager está diseñado para equipos que ya ejecutan crawlers web, sistemas de raspado, herramientas de monitoreo SEO o flujos de trabajo de recopilación de datos y necesitan una mejor gestión de proxies sin reconstruir su infraestructura existente. Conectar flujos de trabajo existentes es un cambio en un único punto final de proxy: no se requieren cambios en la lógica de raspado.
# 1. Conexión directa de proxy (Se espera: error 503) curl -x "http://USER:PASS@gate.nstproxy.io:24125" "https://www.amazon.com/s?k=gaming" # 2. Enrutado a través de Proxy Manager (Se espera: éxito 200) curl -x "http://USER:PASS@gw-pm.nstproxy.io:24125" "https://www.amazon.com/s?k=gaming"
from urllib.request import ProxyHandler, Request, build_opener proxy = "http://USER:PASS@gw-pm.nstproxy.io:24125" opener = build_opener(ProxyHandler({"http": proxy, "https": proxy})) request = Request("https://www.amazon.com/s?k=gaming") with opener.open(request, timeout=30) as response: print(response.status)
const { HttpsProxyAgent } = require("https-proxy-agent"); const axios = require("axios");
const agent = new HttpsProxyAgent("http://USUARIO:CONTRASEÑA@gw-pm.nstproxy.io:24125"); axios .get("https://www.amazon.com/s?k=gaming", { httpsAgent: agent }) .then((res) => console.log(res.status)) .catch((err) => console.error(err));
No se requiere SDK: Proxy Manager habla HTTP/SOCKS5 estándar, por lo que cualquier cliente que ya soporte una configuración de proxy puede conectarse.
Cómo empezar a usar Proxy Manager
Los usuarios existentes pueden conectar sus flujos de trabajo actuales a Proxy Manager cambiando su configuración de proxy a un punto final de Router de Proxy Manager. No se requieren cambios importantes en la lógica de scraping existente. La guía rápida de Proxy Manager explica la configuración del Router y la configuración del pool paso a paso.
- Comienza a usar Proxy Manager →
- Aprende más sobre Nstproxy Proxy Manager: Documentación Técnica de Proxy Manager
Crawl: Colección Administrada de Contenido Web a través de una API Única
La mayoría de las API de crawling administradas alquilan su red. Crawl funciona en la propia infraestructura de Nstproxy: la misma red que ya atiende más de 1M de solicitudes al día. La capa de recolección y la capa de red son un solo sistema, no dos proveedores ensamblados. Una integración, una factura, un equipo al que llamar cuando cambie un sitio objetivo. Proxy Manager es para equipos que quieren poseer la infraestructura de recolección pero necesitan mejor herramientas operativas para ello. Crawl es para equipos que no quieren poseer la infraestructura en absoluto.
Envía una URL, y Crawl devuelve exactamente lo que tu pipeline necesita: Markdown, HTML, una captura de pantalla, un PDF: sin infraestructura detrás que tu equipo deba gestionar. Toma un equipo que construye una base de conocimiento RAG: en lugar de poner en marcha un scraper, un pool de navegadores sin cabeza, y un paso de limpieza solo para convertir páginas en texto utilizable, apuntan a Crawl en un conjunto de páginas de origen y obtienen Markdown limpio, listo para fragmentar e incrustar. Un Agente de IA que necesita verificar la página de precios de un competidor no necesita ningún código de scraping propio: llama a Crawl con la URL y recibe contenido que puede leer directamente.

- El contenido regresa listo para usar, no HTML en bruto que aún debes limpiar. Los encabezados, listas, tablas y enlaces permanecen intactos; la basura de navegación, banners de cookies y ruidos de anuncios ya se han eliminado, por lo que una base de conocimiento o un Agente pueden usarlo en el momento en que llega, sin paso de preprocesamiento intermedio.
- Una URL o todo un sitio, sin cuidar el trabajo. Pide una sola página y recibe una respuesta de inmediato, o apunta a Crawl en una URL de inicio y déjalo trabajar en un conjunto limitado de páginas: útil para extraer toda una sección de documentación o un blog para migración o reindexación, sin supervisar manualmente trabajos de larga duración.
- Las páginas que se defienden aún regresan limpias. Los sitios que renderizan contenido dinámicamente o que activamente se oponen al acceso automatizado no devuelven páginas rotas o callejones sin salida; y cuando un objetivo cambia la forma en que sirve contenido, eso se maneja de nuestra parte, no de la tuya.
- Registros visuales y datados, cuando solo el texto no es suficiente. Extrae una captura de pantalla o PDF para mantener un registro datado de una página de inicio, página de precios o creativo publicitario: útil para auditorías, cumplimiento o simplemente para demostrar cómo era una página en un día determinado.
- Ve hacia dónde van realmente el uso y el costo. Los responsables del presupuesto pueden ver qué proyectos y equipos están consumiendo ancho de banda y en qué, sin pedir a ingeniería que recoja registros.
curl -X POST "https://api.nstproxy.com/api/v1/crawl/scrape/submit-sync" \ -H "x-api-key: <API-KEY>" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com", "formats": ["markdown"]}'
import os from nstdata_ai_crawl import NstDataClient, ScrapeRequestDto, Format TOKEN = os.getenv("NSTDATA_API_TOKEN", "TU_TOKEN_API") with NstDataClient(TOKEN) as client: res = client.submit_scrape_task_sync( ScrapeRequestDto( url="https://example.com/", formats=[Format.MARKDOWN], timeout=60000, onlyMainContent=True, ) ) print(res.data.get_markdown())
import { NstDataClient, Format } from "@nstdata-ai/crawl"; const client = new NstDataClient(process.env.NSTDATA_API_TOKEN || "TU_TOKEN_API"); const res = await client.submitScrapeTaskSync({ url: "https://example.com/", formats: [Format.MARKDOWN], timeout: 60000, onlyMainContent: true, }); console.log(await res.data?.getMarkdown());
Crawl está diseñado para equipos de IA que construyen bases de conocimiento, desarrolladores que crean aplicaciones impulsadas por IA, equipos de investigación que recopilan contenido web a gran escala y equipos de producto que necesitan datos web integrados en sus flujos de trabajo sin poseer la infraestructura de recolección. Atribución de uso entre equipos y proyectos. Vea qué grupos, proyectos y equipos consumen ancho de banda y en qué lo están gastando. Los propietarios de presupuestos obtienen el desglose sin pedirle a ingeniería que extraiga registros.
Cómo empezar con Crawl
Crawl se puede probar de inmediato a través de la API. Comience con una solicitud de URL única, seleccione su formato de salida preferido: Markdown, HTML, captura de pantalla o PDF, y reciba contenido web procesado directamente de la API. Las nuevas cuentas reciben $1 en crédito de prueba gratuito sin necesidad de suscripción.
- Comience con Crawl →
- Conozca más sobre Nstproxy Crawl: Documento técnico de Nstproxy Crawl
Para clientes existentes de Nstproxy
Su cuenta, claves API, puntos finales de proxy y facturación permanecen sin cambios. Los productos de proxy que utiliza — residencial, ISP, móvil, centro de datos, IPv6, residencial ilimitado — son los mismos productos en la misma infraestructura con los mismos precios. Proxy Manager y Crawl son adiciones a la plataforma, no cambios a nada ya en uso.
¿Qué sigue?
Proxy Manager y Crawl ya están disponibles. Continuaremos mejorando ambos productos: más capacidades de monitoreo y gestión para Proxy Manager, características de extracción ampliadas para Crawl, y más integraciones en todo el ecosistema de Nstproxy, basadas en los comentarios de los equipos que los utilizan en producción. Estos dos productos completan la capa de recolección. Lo que viene a continuación es lo que sucede después de la recolección: convertir el contenido recopilado en datos estructurados y consultables. Proxy Manager y Crawl son la base para eso.
Si está utilizando alguno de los productos y tiene comentarios sobre lo que está funcionando o lo que falta, queremos escucharlo.
Comience a explorar Nstproxy Proxy Manager y Crawl
Descubra cómo Proxy Manager puede simplificar las operaciones de proxy y cómo Crawl puede ayudarlo a recopilar contenido web utilizable con menos infraestructura.



