提交目标 URL
从网站、文档中心或产品目录开始。
通过代理驱动的抓取引擎,将任意网站转为干净、结构化的数据:Markdown、HTML、JSON、链接和 PDF。专为构建 RAG 流程、市场研究与数据产品的开发者和 AI 团队打造。
Crawl 从目标 URL 开始,发现可访问页面,应用渲染与代理规则,然后为任务中的每个页面返回标准化输出。
从站点地图、页面链接和自定义子页面规则中发现所有可抓取 URL,不遗漏页面。
在抓取开始前控制最大页数、深度与排除路径。
在提取内容前,使用真实浏览器渲染动态、重度依赖 JS 的页面。
从 Playground 生成可直接使用的代码,并从你的应用中运行抓取任务。
查看抓取记录、检查结果,并一键导出干净数据。
按账户或团队隔离抓取记录、订阅额度和使用情况。
使用住宅、数据中心或自定义代理,更可靠地访问页面。
从同一抓取流程返回 Markdown、HTML、JSON、链接和 PDF。
面向需要可重复、全站数据采集的数据团队和开发者,无需维护爬虫基础设施。
从网站、文档中心或产品目录开始。
定义深度、最大页数、包含/排除规则与请求选项。
启用 JavaScript 渲染,并通过 Nstproxy 或自定义代理路由流量。
接收每个页面干净、结构化的输出,直接用于你的数据流程。
先在 Playground 中测试参数,再复制与相同抓取配置匹配的 API 示例。
无需写代码即可尝试 URL、JS 渲染、代理选项和输出格式。
复制根据当前设置生成的 Node.js、cURL 或 SDK 代码片段。
Crawl 会优先使用订阅额度,再在需要时使用充值额度。
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient
with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
crawl = client.submit_crawl_task(CrawlRequestDto(
url="https://docs.example.com/",
maxDepth=3,
maxPages=10,
formats=[Format.MARKDOWN],
onlyMainContent=True,
timeout=60000,
))
print("crawl task id:", crawl.id)Pay per use
Small Projects
High Volume
当一个 URL 需要变成大量干净、结构化、可复用的数据页面时,就使用 Crawl。
抓取文档网站,并将每个页面转为干净 Markdown,服务 AI 与支持工作流。
从电商网站采集分类页、商品详情、价格、库存和链接。
监测公开网站,并将原始页面转为可重复使用的研究输入。
抓取域名以收集元数据、内部链接、页面内容和抓取覆盖情况。
将抓取的 Markdown 和 JSON 输入 RAG、智能体、索引和数据增强工作流。
保存 HTML 和 PDF 输出,用于审查、记录、合规和可重复审计。
关于 Crawl、定价和技术集成,你需要了解的一切。
Crawl 会返回什么?
Crawl 可为每个已处理页面返回干净的 Markdown、HTML、JSON、链接和 PDF 输出。
我可以设置抓取边界吗?
我可以抓取 JavaScript 渲染的网站吗?
我可以使用 Nstproxy 或自己的代理吗?
Crawl 如何计费?
使用 Nstproxy 的代理驱动抓取引擎,将任意网站转为干净、可供 LLM 使用的数据。免费开始,无月度最低消费,只为实际抓取付费。