周一至周五 09:00 - 18:00(UTC+08:00) ©2026 NST LABS TECH LTD. 保留所有权利。
代理搜索指南:架构与教程
Kai Watanabe Scraping Infrastructure Evangelist
代理搜索:架构、检索与教程
TL;DR
Agentic search 是一个迭代循环,模型规划查询、发现来源、检索完整证据、评估差距,并再次搜索,直到满足停止规则。
搜索结果片段是发现信号,而不是充分的证据;一个可靠的系统需要一个深层页面检索层,返回完整的、可归属的内容。
Nstproxy Crawl 可以作为这个深层检索层,通过将选定的 URL 或有限站点转换为页面文档,在模型推理之前。
生产质量依赖于源的多样性、新鲜度、检索接受检查、提示注入控制、引用以及明确的时间、令牌和请求预算。
从一个狭窄的研究问题和小规模的检索预算开始,然后在增加自主性之前,测量引用的正确性和答案的完整性。
什么是 Agentic Search?
Agentic search 是一个搜索工作流,其中 AI 系统决定要查找什么,评估找到的内容,并根据未解决的问题进行后续检索。与单一的查询和回答管道不同,它形成一个反馈循环:规划、搜索、获取、提取证据、推理、识别差距并重复。
“Agentic”这个词应该描述控制流,而不是市场营销。当中间证据改变下一个查询或检索动作时,系统才是有意义的 agentic。如果一个应用程序向搜索 API 发送一个查询并总结顶部片段,它是增强搜索生成,但它不是一个深度迭代搜索代理。
在下面的架构中,Nstproxy Crawl 是 URL 发现和基于证据的推理之间的深层页面检索层。
为什么在 2026 年 Agentic Search 重要
Agentic search 之所以重要,是因为许多有用的问题无法通过一个排名页面或一个模型上下文来回答。供应商评估需要产品文档、状态页面、安全记录和用户体验。投资研究需要备案、投资者关系页面、当前新闻和市场数据。技术调查可能需要文档、发布说明、源代码、问题和可重现的测试。
最近的研究将深度搜索描述为自主推理、迭代检索和综合的整合,而不是单次查找。关于具备推理代理的搜索研究 对理解反馈循环框架很有用。Firecrawl 的深度研究架构指南 类似地将检索、编排和推理分开。但是,生产系统需要比研究原型更简单的控制:有限的工具、可审核的证据和明确的停止标准。
Agentic Search 是如何工作的
一个实用的 agentic search 系统有四个可分离的层次。
层 职责 典型输出 主要失败 编排 计划步骤、预算、重试和停止 搜索和获取行动 循环或过早停止 发现 查找候选 URL 和源类型 排名的 URL 和片段 排名偏见或缺失来源 深层检索 获取和规范化完整页面或文档 Markdown、HTML、元数据、文档 块、空壳、错误区域 推理 比较证据并撰写答案 主张、不确定性、引用 幻觉或源误用
发现不等于深层检索
发现服务优化用于寻找有前途的 URL。它们通常返回标题、URL 和简短片段。这足以决定获取什么,但不足以支持详细的主张。片段可能被截断、过时,或与页面上下文脱节。
深层检索打开选定页面,执行所需的渲染,提取主要内容,并返回足够的元数据以验证所阅读的内容。将其作为一个独立的工具可以让编排者重试失败的页面,更换其他来源,或在不重复整个搜索的情况下刷新证据。
推理必须是证据界定的 推理层应该接收一个有限来源集,并具有明确的来源。它应该区分源陈述与推断,并识别冲突,而不是将它们混合成一个自信的句子。
一个好的答案包含的主张较少,但拥有强有力的证据,而不是只由话题相似性支持的许多主张。引用的存在并不表示引用的正确性:评估者必须验证所引用的段落确实包含该主张。
Nstproxy Crawl 作为深层页面检索层 Nstproxy Crawl 位于 URL 发现和模型推理之间,适合深层检索职位。应用程序提供一个选定的公共 URL 或有限站点任务;Crawl 处理检索并返回记录的页面文档。然后代理根据接受的输出进行推理,而不是搜索片段。
这个分离是有用的,因为检索失败与推理失败不同。一个页面可以返回同意屏幕、错误的区域设置、不完整的JavaScript外壳或软屏蔽。检索适配器可以在结果进入模型上下文之前拒绝这些结果。
Nstproxy Crawl 还支持超出纯文本的工作流程。根据当前的端点和格式,管道可以请求 Markdown、HTML、链接、截图或 PDF。当意义依赖于布局时,视觉工件非常有帮助,而链接可以支持有限的后续发现。在实施之前,请在实时文档或 SDK 中确认格式和请求字段。
教程:使用 Nstproxy Crawl 构建代理搜索管道 以下架构使用任何搜索提供商进行发现,使用 Nstproxy Crawl 进行深度页面检索,并使用 LLM 进行计划和综合。它故意避免将系统绑定到一个模型或搜索 API。
步骤 1:定义研究契约 在运行代理之前,写下问题、所需的源类型、新鲜度窗口、地理范围和完成标准。例如:
{
"question" : "在过去的 90 天内,Vendor X 的 API 有哪些变化?" ,
"required_sources" : [
"官方文档" ,
"官方更改日志" ,
"官方状态或事件页面"
] ,
"max_search_rounds" : 3 ,
"max_pages" : 12 ,
"freshness_days" : 120
}
契约防止代理将“更多搜索”解释为无限搜索。它还为评估提供了具体标准。
步骤 2:生成源导向查询 规划者应针对缺失的源类型生成查询,而不是原始问题的同义词。示例查询可能包括供应商域加上“API 更改日志”、“重大变化”或“事件”。当需要权威的一方证据时,请使用域过滤器。
存储每个查询及其发出原因。如果代理无法解释某个查询解决了哪个证据缺口,请不要花费该请求。
步骤 3:去重和优先排序 URL 规范化方案、主机名大小写、片段、尾随斜杠和已知跟踪参数。对于产品事实,请优先考虑规范的一方页面。当它们回答不同问题(例如操作经验)时,请保留独立的主要研究或可信用户讨论。
不要检索每个搜索结果。根据权威性、相关性、新鲜度、源类型覆盖率和重复性对候选项进行评分。通常,多样化来源的短名单比重复同一公告的十个页面要好。
步骤 4:安装 Nstproxy Crawl SDK python -m pip install nstdata-ai-crawl
在生产环境中锁定已测试的版本,并将 API 凭证保存在秘密管理器中。
步骤 5:实现深度检索适配器 import os
from nstdata_ai_crawl import NstDataClient , ScrapeRequestDto , Format
client = NstDataClient ( api_key = os . environ [ "NSTDATA_API_KEY" ] )
def retrieve_page ( url : str ) :
request = ScrapeRequestDto (
url = url ,
formats = [ Format . MARKDOWN ] ,
)
return client . scrape ( request )
此适配器遵循公共 SDK 的文档类型,但需要凭证,因此它是一个先决条件间隙示例。在您的环境中检查实际响应对象并映射文档任务状态,而不是假设字段名称。
步骤 6:添加检索接受检查
最终主机是否符合预期;
页面语言是否与研究范围匹配;
是否存在规范标题或必需标记;
内容是否超过特定任务的最小值;
结果是否不是登录页面、同意墙或软屏蔽;
存储检索时间和源 URL;
合并重复内容哈希。
拒绝的页面应产生结构化失败原因。然后,调度者可以重试、更改检索选项或选择不同的来源。
步骤 7:提取证据,而不仅仅是摘要 对于每个接受的页面,请求模型或确定的解析器生成声明规模的证据对象。
{
"claim" : "API 移除了参数 X。" ,
"source_url" : "https://vendor.example/changelog" ,
"retrieved_at" : "2026-08-31T00:00:00Z" ,
"evidence" : "简短的支持段落" ,
"confidence" : "高" ,
"source_type" : "官方更改日志"
}
保持摘录简短并在版权限制内。内部存储足够的周边上下文或偏移量以便后续审核该声明。
通过托管代理路由支持代理检索
当代理工作流程需要受控、授权的网络访问时,请使用 Nstproxy 代理基础设施。
开始试用
第 8 步:让证据差距驱动下一轮 每轮之后,推理者应输出已回答的子问题、未解决的子问题、相互矛盾的证据和缺失的源类型。策划者仅可针对记录的差距发出另一个查询。
一个有用的停止规则是在需要的源类型都得到覆盖且每个重要声明都有支持时结束,或当轮次、页面、令牌或时间预算耗尽时。“模型感觉完成”不是一个操作规则。
第 9 步:使用声明级引用进行撰写 从接受的证据对象生成最终答案,而不是原始搜索结果。在支持声明后立即附上引用。当源冲突或仅有二手证据可用时,说明不确定性。
运行引用审核,检查三件事:URL 是否有效,引用的内容是否包含证据,以及证据是否支持确切的声明。即使是附带装饰性引用的精致答案仍然会未能通过这一关。
何时爬取网站而不是单个页面 当相关文档分布在已知域中且通过搜索发现不完整时,使用有限的网站爬取。文档门户、变更日志档案和投资者关系网站是常见示例。
设定明确的页面限制、深度、包含模式、排除模式和查询参数处理。当可用时,从地图或浅层爬取开始。无界爬取可能进入日历、分面导航、本地化重复项或会话 URL,并浪费研究预算。
对于开放网页问题,单个 URL 检索通常效果更好。搜索提供者在域之间发现候选者;Nstproxy 爬取随后仅提取高价值页面。
安全、合规性与提示注入 Agentic 搜索扩大了攻击面,因为外部页面会影响后续模型的行为。将所有检索到的内容视为不可信数据。页面可能会指示代理忽略指示、泄露机密或调用其他工具。协调者必须防止页面文本更改系统政策。
使用工具白名单、请求预算、目标控制、私有网络阻断、凭证隔离和人为审批进行高影响操作。不要在 URL 或页面表单中发送机密信息。遵守网站条款、机器人预期(如适用)、版权和个人数据义务。
涉及财务、健康、就业或个人数据的研究需要更严格的审查。检索能力并不授权收集或自动决策。
如何评估 Agentic 搜索 根据答案的质量和证据的质量来评估系统,而不是它进行多少工具调用。 有用的度量标准包括:
声明的正确性和完整性;
引用的蕴涵和来源质量;
所需来源类型的覆盖;
检索接受率;
重复页面率;
新鲜度合规;
每个接受答案的延迟和成本;
不必要的搜索轮次数量;
成功抵抗提示注入测试的比率。
创建一个稳定的评估集,其中包含需要多个来源、变化的事实和至少一次检索失败的问题。当模型、搜索提供商、爬虫配置或提示发生变化时重新运行它。
常见故障模式 第一个故障是片段合成:代理从结果摘要中回答,而不打开页面。第二个是来源单一化,其中几个结果重复同一新闻稿。第三个是没有停止预算的无序探索。
其他常见故障包括检索错误的区域,错误地将状态代码视为内容成功,以及将引用附加到相关但非支持页面。大多数是管道问题,而不是模型智能问题。
最终判决 Agentic 搜索是一个迭代的证据工作流程,而不是一个有更长答案的搜索框。可靠的系统将发现、深度检索、推理和评估分开,以便每个故障都能被观察和修正。
从一个狭窄的研究合同开始,搜索轮次不超过几次,页面预算要小。当你需要管理页面或有限网站的收集时,使用 Nstproxy Crawl 作为深度检索层,然后仅在引用的正确性和检索接受度满足目标之后再扩展自主性。
常见问题解答 Agentic 搜索根据证据缺口动态规划和重复检索,而基本的 RAG 系统通常针对每个问题从预定义索引检索一次。Agentic 搜索可以将数据提供给 RAG 存储库或将其作为来源查询。
Agentic 搜索需要完整内容的检索,但并非每个问题都需要爬取网站。对于有限的多页面域,爬虫是有用的;而针对选择的开放网络 URL,单个页面的检索更好。
问:Nstproxy Crawl 可以替代搜索 API 吗?
不可以。Nstproxy Crawl 在这里作为发现后的深页检索层。搜索 API 查找候选 URLs,而 Crawl 检索选定页面或有限的网站。
使用覆盖所需来源类型并解决材料差距的最少轮次。根据风险、延迟和成本设置一个硬性最大值;三轮是一个合理的起始实验,而不是普遍规则。
要求声明级别的证据,验证检索输出,保存来源,审计引用蕴涵,并声明不确定性。这些控制措施可以减少幻觉,但不能保证每个来源或模型结论都是正确的。
立即访问住宅、数据中心、IPv6 与 ISP 高质量代理池。 创建免费账号并立即试用 ->