Búsqueda Agencial: Arquitectura, Recuperación y Tutorial
TL;DR
La búsqueda agencial es un bucle iterativo en el que un modelo planifica consultas, descubre fuentes, recupera evidencia completa, evalúa brechas y busca de nuevo hasta que se cumple una regla de parada.
Los fragmentos de resultados de búsqueda son señales de descubrimiento, no evidencia suficiente; un sistema fiable necesita una capa de recuperación de páginas profunda que devuelva contenido completo y atribuible.
Nstproxy Crawl puede servir como esa capa de recuperación profunda convirtiendo URLs seleccionadas o sitios delimitados en artefactos de página antes del razonamiento del modelo.
La calidad de producción depende de la diversidad de las fuentes, frescura, verificaciones de aceptación de recuperación, controles de inyección de respuestas, citas, y presupuestos explícitos de tiempo, tokens y solicitudes.
Comienza con una pregunta de investigación estrecha y un pequeño presupuesto de recuperación, luego mide la corrección de las citas y la completitud de las respuestas antes de aumentar la autonomía.
¿Qué Es la Búsqueda Agencial?
La búsqueda agencial es un flujo de trabajo de búsqueda donde un sistema de IA decide qué buscar, evalúa lo que encontró y realiza una recuperación de seguimiento basada en preguntas no resueltas. A diferencia de un único pipeline de consulta y respuesta, forma un bucle de retroalimentación: planificar, buscar, obtener, extraer evidencia, razonar, identificar brechas y repetir.
La palabra "agencial" debería describir el flujo de control, no el marketing. Un sistema es significativamente agencial cuando la evidencia intermedia cambia la siguiente consulta o acción de recuperación. Si una aplicación envía una consulta a una API de búsqueda y resume los principales fragmentos, es generación aumentada por búsqueda, pero no es un agente de búsqueda profunda iterativa.
En la arquitectura a continuación, Nstproxy Crawl es la capa de recuperación de páginas profunda entre el descubrimiento de URL y el razonamiento basado en la evidencia.
Por Qué la Búsqueda Agencial Es Importante en 2026
La búsqueda agencial es importante porque muchas preguntas útiles no pueden ser respondidas desde una página de clasificación o un contexto de modelo. Las evaluaciones de proveedores necesitan documentación de productos, páginas de estado, registros de seguridad y experiencia del usuario. La investigación de inversiones necesita presentaciones, páginas de relaciones con inversores, noticias actuales y datos de mercado. La investigación técnica puede requerir documentación, notas de lanzamiento, código fuente, problemas y pruebas reproducibles.
Investigaciones recientes describen la búsqueda profunda como una integración de razonamiento autónomo, recuperación iterativa y síntesis en lugar de una sola búsqueda. La investigación sobre búsqueda con agentes de razonamiento es útil para entender el marco de retroalimentación. La guía de arquitectura de investigación profunda de Firecrawl separa de manera similar recuperación, orquestación y razonamiento. Sin embargo, los sistemas de producción necesitan controles más simples que los prototipos de investigación: herramientas delimitadas, evidencia auditable y criterios de parada claros.
Cómo Funciona la Búsqueda Agencial
Un sistema de búsqueda agencial práctico tiene cuatro capas separables.
Capa
Responsabilidad
Salida típica
Principal fallo
Orquestación
Planificar pasos, presupuestos, reintentos y parada
Acciones de búsqueda y recuperación
Bucles o paradas prematuras
Descubrimiento
Encontrar URLs candidatas y tipos de fuentes
URLs clasificadas y fragmentos
Sesgo de clasificación o fuentes faltantes
Recuperación profunda
Recuperar y normalizar páginas completas o documentos
Markdown, HTML, metadatos, artefactos
Bloques, conchas vacías, local incorrecto
Razonamiento
Comparar evidencia y componer respuesta
Afirmaciones, incertidumbre, citas
Alucination o uso indebido de fuentes
El Descubrimiento No Es Recuperación Profunda
Los servicios de descubrimiento se optimizan para encontrar URLs prometedoras. A menudo devuelven título, URL y un fragmento corto. Eso es suficiente para decidir qué recuperar, pero no es suficiente para respaldar afirmaciones detalladas. Los fragmentos pueden estar truncados, desactualizados o desconectados del contexto de la página.
La recuperación profunda abre la página seleccionada, ejecuta la renderización requerida, extrae el contenido principal y devuelve suficientes metadatos para verificar lo que se leyó. Mantener esto como una herramienta distinta permite al orquestador reintentar una página fallida, sustituir otra fuente, o refrescar la evidencia sin repetir toda la búsqueda.
El Razonamiento Debe Estar Limitado por la Evidencia
La capa de razonamiento debe recibir un conjunto limitado de fuentes con un origen explícito. Debe distinguir las afirmaciones de la fuente de la inferencia e identificar conflictos en lugar de mezclarlos en una sola oración confiada.
Una buena respuesta incluye menos afirmaciones con evidencia sólida en lugar de muchas afirmaciones respaldadas solo por similitud temática. La presencia de citas no es la corrección de citas: los evaluadores deben verificar que el pasaje citado realmente implique la afirmación.
Nstproxy Crawl como la Capa de Recuperación Profunda de Páginas
Nstproxy Crawl encaja en la posición de recuperación profunda entre el descubrimiento de URL y el razonamiento del modelo. La aplicación proporciona una URL pública seleccionada o una tarea de sitio delimitado; Crawl maneja la recuperación y devuelve artefactos de página documentados. El agente luego razona sobre la salida aceptada en lugar de sobre fragmentos de búsqueda.
Esta separación es útil porque las fallas de recuperación difieren de las fallas de razonamiento. Una página puede devolver una pantalla de consentimiento, una configuración regional incorrecta, un shell de JavaScript incompleto o un bloque suave. El adaptador de recuperación puede rechazar esos resultados antes de que ingresen al contexto del modelo.
Nstproxy Crawl también admite flujos de trabajo más allá del texto plano. Dependiendo del punto final y formato actuales, una tubería puede solicitar Markdown, HTML, enlaces, capturas de pantalla o PDFs. Los artefactos visuales ayudan cuando el significado depende del diseño, mientras que los enlaces pueden apoyar el descubrimiento de seguimiento limitado. Confirme formatos y campos de solicitud en la documentación en vivo o SDK antes de la implementación.
Tutorial: Construir una tubería de búsqueda agentica con Nstproxy Crawl
La siguiente arquitectura utiliza cualquier proveedor de búsqueda para el descubrimiento, Nstproxy Crawl para la recuperación profunda de páginas, y un LLM para la planificación y síntesis. Intencionalmente evita atar el sistema a un solo modelo o API de búsqueda.
Paso 1: Definir el contrato de investigación
Escribe la pregunta, los tipos de fuente requeridos, la ventana de frescura, el alcance geográfico y los criterios de finalización antes de ejecutar el agente. Por ejemplo:
{"question":"¿Qué cambió en la API del Proveedor X durante los últimos 90 días?","required_sources":["documentación oficial","registro de cambios oficial","página de estado o incidente oficial"],"max_search_rounds":3,"max_pages":12,"freshness_days":120}
Un contrato evita que el agente interprete “más búsqueda” como búsqueda ilimitada. También proporciona un estándar concreto para la evaluación.
Paso 2: Generar consultas orientadas a la fuente
El planificador debe producir consultas para tipos de fuente faltantes en lugar de sinónimos de la pregunta original. Las consultas de ejemplo podrían incluir el dominio del proveedor más “registro de cambios de API”, “cambios importantes” o “incidente”. Utilice filtros de dominio cuando se requiera evidencia autorizada de primera parte.
Almacene cada consulta y por qué se emitió. Si el agente no puede explicar qué brecha de evidencia aborda una consulta, no gaste la solicitud.
Paso 3: Deduplicar y priorizar URLs
Normalice el esquema, el uso de mayúsculas en el nombre del host, fragmentos, barras finales y parámetros de seguimiento conocidos. Prefiera páginas canónicas de primera parte para hechos de productos. Mantenga investigaciones primarias independientes o discusiones de usuarios creíbles cuando respondan a una pregunta diferente, como la experiencia operativa.
No recupere cada resultado de búsqueda. Califique a los candidatos por autoridad, relevancia, frescura, cobertura de tipo de fuente y duplicación. Una lista corta de fuentes diversas es generalmente mejor que diez páginas repitiendo el mismo anuncio.
Fije una versión probada en producción y mantenga la credencial de API en un gestor de secretos.
Paso 5: Implementar el adaptador de recuperación profunda
import os
from nstdata_ai_crawl import NstDataClient, ScrapeRequestDto, Format
client = NstDataClient(api_key=os.environ["NSTDATA_API_KEY"])defretrieve_page(url:str): request = ScrapeRequestDto( url=url, formats=[Format.MARKDOWN],)return client.scrape(request)
Este adaptador sigue los tipos documentados del SDK público pero requiere una credencial, por lo que es un ejemplo de brecha de requisito. Inspeccione el objeto de respuesta real en su entorno y mapee los estados de tarea documentados en lugar de asumir nombres de campo.
Paso 6: Agregar verificaciones de aceptación de recuperación
Una respuesta de transporte exitosa no es suficiente. Valide:
el host final es el esperado;
el idioma de la página coincide con el alcance de la investigación;
un título canónico o marcador requerido está presente;
el contenido excede un mínimo específico de tarea;
el resultado no es una página de inicio de sesión, muro de consentimiento o bloque suave;
el tiempo de recuperación y la URL de la fuente son almacenados;
los hashes de contenido duplicado son colapsados.
Las páginas rechazadas deben producir razones de fracaso estructuradas. El orquestador puede intentar de nuevo, cambiar las opciones de recuperación o elegir una fuente diferente.
Paso 7: Extraer evidencia, no solo resúmenes
Para cada página aceptada, pida al modelo o a un analista determinista que produzcan objetos de evidencia de tamaño reclamo.
{"claim":"La API eliminó el parámetro X.","source_url":"https://vendor.example/changelog","retrieved_at":"2026-08-31T00:00:00Z","evidence":"Pasaje de apoyo corto","confidence":"alta","source_type":"registro de cambios oficial"}
Mantenga los extractos breves y dentro de los límites de copyright. Almacene suficiente contexto circundante u offsets internamente para auditar la reclamación más tarde.
Recuperación de agentes de soporte con enrutamiento de proxy administrado
Utilice la infraestructura de proxy de Nstproxy cuando los flujos de trabajo de los agentes necesiten acceso a la red controlado y autorizado.
Paso 8: Deje que las Brechas de Evidencia Impulsen la Próxima Ronda
Después de cada ronda, el razonador debe presentar subpreguntas respondidas, subpreguntas no resueltas, evidencia conflictiva y tipos de fuentes faltantes. El planificador puede emitir otra consulta solo para una brecha registrada.
Una regla de detención útil finaliza cuando se cubren los tipos de fuentes requeridos y cada afirmación material tiene apoyo, o cuando se agota el presupuesto de ronda, página, token o tiempo. "El modelo siente que ha terminado" no es una regla operativa.
Paso 9: Componer con Citas a Nivel de Afirmación
Genere la respuesta final a partir de objetos de evidencia aceptados, no de resultados de búsqueda en bruto. Adjunte citas inmediatamente después de las afirmaciones respaldadas. Exprésese la incertidumbre cuando las fuentes son conflictivas o cuando solo hay evidencia secundaria disponible.
Realice una auditoría de citas que verifique tres cosas: la URL se resuelve, el contenido citado contiene la evidencia y la evidencia respalda la afirmación exacta. Una respuesta pulida con citas decorativas aún no pasa por esta verificación.
Cuándo rastrear un sitio en lugar de páginas individuales
Utilice rastreo de sitios con límites cuando los documentos relevantes estén distribuidos a través de un dominio conocido y el descubrimiento a través de búsqueda esté incompleto. Los portales de documentación, los archivos de changelog y los sitios de relaciones con inversores son ejemplos comunes.
Establezca límites de páginas explícitos, profundidad, patrones de inclusión, patrones de exclusión y manejo de parámetros de consulta. Comience con un mapa o un rastreo superficial cuando esté disponible. El rastreo sin límites puede entrar en calendarios, navegación por facetas, duplicados de localización o URL de sesión y desperdiciar el presupuesto de investigación.
Para preguntas de la web abierta, la recuperación de URL individuales generalmente funciona mejor. Los proveedores de búsqueda descubren candidatos a través de dominios; luego, Nstproxy Crawl recupera solo las páginas de alto valor.
Seguridad, Cumplimiento e Inyección de Prompts
La búsqueda agentica amplía la superficie de ataque porque las páginas externas influyen en las acciones subsiguientes del modelo. Trata todo el contenido recuperado como datos no confiables. Una página puede decirle al agente que ignore instrucciones, divulgque secretos o llame a otra herramienta. El orquestador debe evitar que el texto de la página cambie la política del sistema.
Utiliza listas de herramientas permitidas, presupuestos de solicitudes, controles de destino, bloqueo de redes privadas, aislamiento de credenciales y aprobación humana para acciones de alto impacto. No envíes secretos en URLs o formularios de páginas. Respeta los términos del sitio web, las expectativas de robots donde sea aplicable, los derechos de autor y las obligaciones de datos personales.
La investigación que involucra datos financieros, de salud, empleo o personales necesita una revisión más rigurosa. La capacidad de recuperación no autoriza la recolección o decisiones automatizadas.
Cómo Evaluar la Búsqueda Agentica
Evalúa el sistema en calidad de respuesta y calidad de evidencia, no por cuántas llamadas a herramientas realiza. Las métricas útiles incluyen:
corrección y completitud de las afirmaciones;
derivación de citas y calidad de fuentes;
cobertura de tipos de fuentes requeridas;
tasa de aceptación de recuperación;
tasa de páginas duplicadas;
cumplimiento de frescura;
latencia y costo por respuesta aceptada;
número de rondas de búsqueda innecesarias;
tasa de pruebas de resistencia a la inyección de prompts exitosas.
Crea un conjunto de evaluación estable con preguntas que requieran múltiples fuentes, hechos cambiantes y al menos un fallo en la recuperación. Vuelve a ejecutarlo cuando el modelo, proveedor de búsqueda, configuración del rastreador o prompt cambien.
Modos Comunes de Fallo
El primer fallo es la síntesis de fragmentos: el agente responde a partir de resúmenes de resultados sin abrir páginas. El segundo es la monocultura de fuentes, donde varios resultados repiten un comunicado de prensa. El tercero es la exploración descontrolada sin un presupuesto de parada.
Otros fallos comunes incluyen recuperar la localidad incorrecta, tratar un código de estado como éxito de contenido, y adjuntar una cita a una página relacionada pero que no apoya. La mayoría son problemas de canalización, no problemas de inteligencia del modelo.
La búsqueda agentica es un flujo de trabajo de evidencia iterativo, no un cuadro de búsqueda con una respuesta más larga. Los sistemas confiables separan descubrimiento, recuperación profunda, razonamiento y evaluación para que cada fallo pueda ser observado y corregido.
Comienza con un contrato de investigación estrecho, no más de unas pocas rondas de búsqueda y un pequeño presupuesto de páginas. Utiliza Nstproxy Crawl como la capa de recuperación profunda cuando necesites recolección de páginas gestionada o de sitios acotados, luego expande la autonomía solo después de que la corrección de citas y la aceptación de recuperación cumplan con tu objetivo.
P: ¿Cuál es la diferencia entre la búsqueda agentica y RAG?
La búsqueda agentica planifica y repite dinámicamente la recuperación basada en lagunas de evidencia, mientras que un sistema RAG básico generalmente recupera de un índice predefinido una vez por pregunta. La búsqueda agentica puede alimentar un almacenamiento RAG o consultar uno como fuente.
P: ¿La búsqueda agentica necesita un rastreador web?
La búsqueda agentica necesita recuperación de contenido completo, pero no cada pregunta requiere rastreo de sitio. Un rastreador es útil para dominios multi-páginas acotados; la recuperación de páginas individuales es mejor para URLs seleccionadas de la web abierta.
P: ¿Puede Nstproxy Crawl reemplazar una API de búsqueda?
No. Nstproxy Crawl está posicionado aquí como la capa de recuperación profunda de páginas después del descubrimiento. Una API de búsqueda encuentra URLs candidatas, mientras que Crawl recupera páginas seleccionadas o sitios acotados.
P: ¿Cuántas rondas de búsqueda debe usar un agente?
Utiliza las rondas mínimas que cubran los tipos de fuentes requeridas y resuelvan las lagunas materiales. Establece un máximo estricto basado en riesgo, latencia y costo; tres rondas son un experimento inicial razonable, no una regla universal.
P: ¿Cómo evito alucinaciones en la búsqueda agentica?
Requiere evidencia a nivel de afirmación, valida la salida de recuperación, preserva la procedencia, audita la derivación de citas y declara incertidumbre. Estos controles reducen las alucinaciones pero no garantizan que cada fuente o conclusión del modelo sea correcta.
Empieza tu prueba gratis hoy
110M+ IP reales con 99.9% de acceso exitoso
Acceso inmediato a pools premium de proxies residenciales, datacenter, IPv6 e ISP.
Respuesta media ultrarrapida ~0.5s para tareas de alta concurrencia