Dale a tu agente de IA datos web en vivo (con MCP)
TL;DR
Un agente de IA necesita una herramienta web cuando su respuesta depende de información más reciente que el contexto de su modelo o específica de una página en vivo. MCP proporciona un límite de herramienta estándar; no hace que el contenido recuperado sea confiable por sí mismo.
Un servidor MCP de rastreo mínimo puede exponer una herramienta de solo lectura read_web_page(url) respaldada por Nstproxy Crawl. La herramienta obtiene una URL pública autorizada y devuelve Markdown limpio con su URL de origen.
El ejemplo funcional de Python a continuación utiliza la API MCPServer actual de MCP 2.x. Se instaló y se probó con un cliente MCP real en proceso, que descubrió read_web_page y su entrada url requerida.
Cursor puede registrar el servidor local en .cursor/mcp.json; la ruta actual de Claude Desktop es Configuración → Extensiones. Trate los tutoriales heredados copiados de FastMCP y claude_desktop_config.json como sensibles a la versión.
Mantenga al agente limitado. Valide URLs, restrinja hosts permitidos cuando sea posible, conserve citas de origen, almacene en caché lecturas repetidas y requiera aprobación antes de que una herramienta acceda a datos privados o sensibles.
Un modelo de IA no puede saber si una página de producto cambió esta mañana, si una página de estado se recuperó hace cinco minutos o si una política fue revisada después de su fecha límite de entrenamiento. Una herramienta web en vivo cierra esa brecha de evidencia al recuperar la página en el momento de la respuesta.
La arquitectura útil es deliberadamente pequeña: el anfitrión decide cuándo se necesita una página, MCP describe e invoca la herramienta, y una API de rastreo maneja la recuperación y extracción. Esta guía construye esa conexión con las interfaces actuales de MCP 2.x y Nstproxy Crawl, y luego lo adjunta a Claude Desktop o Cursor.
Nstproxy Crawl le da a un agente de IA una capa de recuperación de página gestionada que puede devolver Markdown limpio, metadatos de página, enlaces y otros artefactos configurados. El agente recibe contenido que puede leer sin operar trabajadores de navegador, reglas de extracción, colas o enrutamiento de proxies por sí mismo.
MCP proporciona el contrato de integración. Un servidor MCP publica herramientas nombradas con descripciones y esquemas de entrada tipificados; un anfitrión compatible lista esas herramientas y decide cuándo llamarlas. El especificación actual de MCP define el límite del protocolo, mientras que la documentación oficial de MCP Python SDK proporciona las APIs del servidor y del cliente utilizadas aquí.
Esta separación es importante operacionalmente. El modelo nunca debe recibir el token de Nstproxy. El servidor local lee el secreto de su entorno, envía la solicitud de la página y devuelve solo el contenido solicitado más su procedencia.
El anterior tutorial del servidor MCP de búsqueda web de Nstproxy demuestra un patrón de búsqueda y luego lectura mediante dos herramientas. Este artículo se centra en el primitivo de incorporación más seguro: una herramienta de URL de solo lectura que puede adjuntar a múltiples anfitriones y probar antes de agregar descubrimientos.
Por Qué los Agentes de IA Necesitan Datos Web en Vivo
Los agentes de IA necesitan datos web en vivo para frescura, especificidad de fuente y verificación. Un modelo estático puede explicar un concepto, pero no puede informar de manera confiable un registro de cambios actual, el estado de inventario, un parámetro de documentación o un incidente público sin recuperar evidencia.
Los casos de uso típicos limitados incluyen:
leer una página de documentación actual antes de generar código de integración;
comparar un conjunto aprobado de páginas de productos públicas;
verificar una página pública de estado o política;
recopilar evidencia reciente para un memorando de investigación;
actualizar un documento en una base de conocimiento RAG;
leer la página detrás de una URL proporcionada por el usuario antes de resumirla.
El acceso en vivo no elimina la necesidad de juicio. Las páginas pueden estar obsoletas, manipuladas, ser específicas de la región o hostiles a los agentes. El texto devuelto puede contener inyecciones de prompt que piden al modelo ignorar instrucciones o divulgar datos. Trate el contenido web como evidencia, nunca como autoridad sobre las reglas del anfitrión.
Para principios de diseño de herramientas más amplios, consulte la guía de Nstproxy sobre herramientas de agentes, seguridad y evaluación. Una herramienta web bien diseñada tiene un nombre estrecho, un contrato de entrada explícito, salida predecible, tiempo de espera, registro de auditoría y un comportamiento de falla claro.
Requisitos Previos y Verificación de Versión
Necesita Python 3.10 o superior, una cuenta de Nstproxy con un token de API de Crawl y un anfitrión compatible con MCP. Cree un entorno virtual e instale las versiones exactas verificadas para este artículo el 4 de septiembre de 2026:
Los números de versión hacen que el ejemplo sea reproducible. Consulte las notas de la versión oficial del SDK antes de actualizar: MCP 2.x reemplazó la clase y la ruta de importación anteriores de FastMCP con MCPServer. Un tutorial más antiguo puede fallar de inmediato incluso si el diseño subyacente sigue siendo sólido.
Exporta tu token de Crawl solo en el entorno del servidor:
exportNSTDATA_API_TOKEN="replace-with-your-token"
No commits el token en el archivo del servidor, configuración del proyecto, ni en un repositorio público. La recuperación de la página autenticada del ejemplo es una brecha de requisito en este artículo porque no se disponía de un token de cuenta durante la verificación; la importación del servidor MCP y la ida y vuelta de descubrimiento de herramientas se ejecutaron con éxito.
Brinda a Tu Agente un Contexto Web Fresco
Utiliza Nstproxy Crawl para convertir URLs públicas aprobadas en Markdown limpio para herramientas MCP.
El servidor a continuación expone una herramienta que acepta una URL pública HTTP(S) y devuelve Markdown etiquetado de origen. Guárdalo como `mcp_server.py`.
```python
import os
from mcp.server import MCPServer
from nstdata_ai_crawl import Format, NstDataClient, ScrapeRequestDto
server = MCPServer(
"nstproxy-live-web",
instructions="Recuperar páginas web públicas autorizadas como Markdown limpio.",
)
@server.tool()
def read_web_page(url: str) -> str:
"""Recuperar una página pública HTTP(S) autorizada y devolver Markdown."""
if not url.startswith(("https://", "http://")):
raise ValueError("La URL debe usar http:// o https://")
token = os.environ["NSTDATA_API_TOKEN"]
with NstDataClient(token) as client:
result = client.submit_scrape_task_sync(
ScrapeRequestDto(
url=url,
formats=[Format.MARKDOWN],
onlyMainContent=True,
timeout=60000,
)
)
if not result.success or not result.data:
message = result.errorMessage or result.errorCode or "error desconocido"
raise RuntimeError(f"la recuperación de la página falló: {message}")
markdown = result.data.get_markdown()
if not markdown:
raise RuntimeError("página recuperada pero no devolvió Markdown")
return f"Fuente: {url}\n\n{markdown}"
if __name__ == "__main__":
server.run(transport="stdio")
La función es intencionadamente sincrónica porque el método actual del SDK de Nstproxy espera el resultado de una única página. Para rastreos de sitios más largos, exponga una herramienta de envío y una herramienta de estado separada en lugar de mantener una llamada MCP abierta indefinidamente.
La verificación de esquema es solo un punto de partida. Un servidor de producción que acepte URL arbitrarias también debe bloquear localhost, rangos de IP privados, puntos finales de metadatos en la nube, puertos no estándar, reencaminamientos DNS y redirecciones a destinos no permitidos. Una lista de dominios aprobados es más segura que un recuperador de URL abierto.
Verifica la herramienta MCP antes de abrir Claude o Cursor
Verifica el contrato del servidor con un cliente en proceso antes de agregar la configuración del host. Guarda esto como test_server.py junto al servidor:
import asyncio
from mcp import Client
from mcp_server import server
asyncdefmain()->None:asyncwith Client(server)as client: tools =await client.list_tools()for tool in tools.tools:print(tool.name, tool.input_schema.get("required"))asyncio.run(main())
Ejecuta python test_server.py. El código exacto producido:
read_web_page ['url']
Este resultado prueba que el cliente MCP instalado puede conectarse al objeto servidor y descubrir el esquema de herramienta generado. No prueba que el token de Nstproxy sea válido, porque listar herramientas no llama a la API de Crawl.
También puedes inspeccionar el servidor utilizando las herramientas de desarrollo MCP oficiales descritas en la guía de inicio del SDK de MCP Python. Prueba esquemas inválidos, variables de entorno faltantes, Markdown vacío, tiempos de espera y errores del proveedor antes de dar acceso a un host.
Agrega el servidor MCP a Cursor
Cursor registra servidores MCP específicos del proyecto en .cursor/mcp.json y servidores globales en ~/.cursor/mcp.json. La documentación oficial de MCP de Cursor describe los transportes y ubicaciones de configuración admitidos.
Usa una ruta de intérprete y script absoluta para que Cursor no dependa de su directorio de trabajo:
Reinicia o recarga Cursor, abre el panel de herramientas disponibles y confirma que read_web_page aparece. Pregunta: “Usa read_web_page para resumir la página pública actual en https://example.com, y cita la URL de origen.” Revisa los argumentos de la herramienta antes de la aprobación.
El camino de incorporación actual de Claude Desktop es Configuración → Extensiones. Anthropic ahora recomienda extensiones de escritorio para servidores locales y Configuración → Conectores para servicios MCP remotos, en lugar de depender de instrucciones JSON manuales antiguas para cada instalación. Sigue la actual guía de MCP local de Claude Desktop.
Para el desarrollo local, abre Configuración → Extensiones → Configuración avanzada y utiliza los controles de desarrollador apropiados para tu compilación de Claude Desktop. Paqueta el servidor probado como una extensión de escritorio antes de distribuirlo a otros usuarios. Marca el campo del token como sensible para que Claude Desktop lo almacene a través del almacenamiento de credenciales protegido del sistema operativo.
Después de la instalación, inicia una nueva conversación, verifica que la herramienta esté en la lista y solicita una página pública conocida. Una lista de herramientas exitosa confirma el registro MCP; una respuesta de página exitosa confirma la credencial Nstproxy y la ruta de rastreo. Mantén esos como verificaciones de integración separadas.
Utiliza Datos Web en Vivo Sin Perder el Control
Un agente de producción debe elegir una URL de una fuente aprobada o de una solicitud de usuario, llamar a la herramienta, inspeccionar la etiqueta de la fuente devuelta y responder únicamente con contenido relevante a la pregunta. Requiere citas en la instrucción del agente y preserva la URL final si ocurren redirecciones.
Agrega estos controles antes de expandir el uso:
Política de dominio: permite solo hosts públicos aprobados o requiere confirmación para un nuevo host.
Seguridad de la red: rechaza direcciones locales y privadas antes y después de la resolución DNS y redirecciones.
Minimización de datos: solicita solo el formato de contenido que necesita la tarea.
Caché: evita obtener una página sin cambios repetidamente en una sesión.
Límites de tamaño: trunca o almacena resultados sobredimensionados en lugar de llenar el contexto del modelo.
Resistencia a inyecciones en el aviso: nunca dejes que el texto de la página sobreescriba la política del sistema o autorice otra herramienta.
Observabilidad: registra el nombre de la herramienta, la URL normalizada, la duración, el estado del resultado y el ID de solicitud no secreto.
Las pautas de seguridad de la especificación MCP enfatizan el control del usuario y la autorización clara en torno a las herramientas. La recuperación web es solo lectura desde la perspectiva del agente, pero aún transmite la URL de destino a un servicio de terceros y puede exponer URLs privadas si la entrada no está restringida.
Respeta los términos del sitio objetivo, las instrucciones de robots, los derechos de autor, la privacidad y la ley aplicable. Mantén el volumen de solicitudes vinculado a las tareas reales del usuario en lugar de convertir una herramienta de agente interactivo en un rastreador de volumen desatendido.
Lista de Verificación de Integración
Una secuencia de integración confiable separa el protocolo, las credenciales, la recuperación y la calidad de la respuesta:
fija y registra las versiones de paquete instaladas;
ejecuta la prueba de descubrimiento de herramientas MCP en proceso;
agrega el servidor local a un host;
confirma que el nombre de la herramienta y la entrada url aparecen;
invoca una página de prueba pública permitida;
verifica que se devuelvan la URL de la fuente y un Markdown significativo;
prueba un esquema no válido y un token faltante;
habilita controles de dominio, tamaño, tiempo de espera y registro;
evalúa si la respuesta final cita y sigue la evidencia recuperada.
Comienza con una herramienta de lectura. Agrega una herramienta de búsqueda solo cuando el descubrimiento sea un requisito real y agrega el rastreo del sitio como un flujo de trabajo asincrónico separado. Esto mantiene los costos, permisos y comportamientos de falla legibles tanto para el usuario como para el agente.
Dale a Tu Agente una Herramienta Web Verificable
Una integración útil de MCP de rastreo es un canal de evidencia estrecho, no un navegación sin restricciones. El servidor MCP 2.x actual arriba proporciona un contrato de herramienta probado, Nstproxy Crawl maneja la recuperación de páginas, y Claude Desktop o Cursor proporciona la experiencia del host.
Utiliza los precios de Nstproxy Crawl para elegir el modelo de uso apropiado, luego valida una página representativa de principio a fin con tu propio token. Solo expande el alcance de dominio o autonomía de la herramienta después de que los registros de auditoría y el comportamiento de aprobación estén funcionando.
Un servidor MCP de rastreo expone la recuperación web como herramientas tipadas que un host de IA compatible con MCP puede descubrir y llamar, mientras mantiene las credenciales de la API dentro del proceso del servidor.
Q: ¿Por qué un agente de IA necesita datos web en vivo?
Un agente de IA necesita datos web en vivo cuando una respuesta depende de información actual y específica de la fuente que no está garantizada que exista en los datos de entrenamiento del modelo o en el contexto de la conversación.
Q: ¿El servidor MCP expone el token Nstproxy al modelo?
No. El token es leído por el servidor local desde su entorno y se utiliza para la solicitud de la API de rastreo; la herramienta debería devolver solo contenido de la página, procedencia y detalles de error controlados.
Q: ¿Puede el mismo servidor MCP funcionar con Claude Desktop y Cursor?
Sí. Ambos soportan herramientas MCP, aunque sus flujos de instalación difieren: Cursor usa mcp.json, mientras que las versiones actuales de Claude Desktop gestionan servidores locales a través de Extensiones.
Ivy Lin
Sep. 4th 2026
110M+ IP reales con 99.9% de acceso exitoso
Respuesta media ultrarrapida ~0.5s para tareas de alta concurrencia
Desde solo $0.1/GB
Acceso inmediato a pools premium de proxies residenciales, datacenter, IPv6 e ISP.