Gửi URL mục tiêu
Bắt đầu với website, trung tâm tài liệu hoặc danh mục sản phẩm.
Biến mọi website thành dữ liệu sạch, có cấu trúc — Markdown, HTML, JSON, liên kết và PDF — thông qua công cụ crawl dùng proxy. Dành cho nhà phát triển và đội ngũ AI xây dựng pipeline RAG, nghiên cứu thị trường và sản phẩm dữ liệu ở quy mô lớn.
Crawl bắt đầu với URL mục tiêu, phát hiện các trang có thể truy cập, áp dụng quy tắc render và proxy, rồi trả về đầu ra chuẩn hóa cho mọi trang trong tác vụ.
Tìm mọi URL có thể crawl từ sitemap, liên kết trang và quy tắc trang con tùy chỉnh.
Kiểm soát số trang tối đa, độ sâu và đường dẫn loại trừ trước khi bắt đầu.
Render các trang động, nhiều JS trong trình duyệt thật trước khi trích xuất nội dung.
Tạo mã sẵn dùng từ Playground và chạy tác vụ crawl từ ứng dụng của bạn.
Xem bản ghi crawl, kiểm tra kết quả và xuất dữ liệu sạch chỉ với một cú nhấp.
Tách biệt bản ghi crawl, tín dụng gói thuê bao và mức sử dụng theo tài khoản hoặc đội ngũ.
Dùng proxy residential, datacenter hoặc tùy chỉnh để truy cập trang ổn định hơn.
Trả về Markdown, HTML, JSON, liên kết và PDF trong cùng một quy trình crawl.
Được thiết kế cho nhà phát triển và đội dữ liệu cần thu thập dữ liệu toàn website có thể lặp lại mà không phải duy trì hạ tầng crawler.
Bắt đầu với website, trung tâm tài liệu hoặc danh mục sản phẩm.
Xác định độ sâu, số trang tối đa, quy tắc bao gồm/loại trừ và tùy chọn yêu cầu.
Bật render JavaScript và định tuyến lưu lượng qua Nstproxy hoặc proxy tùy chỉnh.
Nhận đầu ra sạch, có cấu trúc theo từng trang, sẵn sàng cho pipeline của bạn.
Bắt đầu từ Playground để thử tham số, sau đó sao chép ví dụ API khớp với cùng cấu hình crawl.
Thử URL, render JS, tùy chọn proxy và định dạng đầu ra mà không cần viết mã.
Sao chép đoạn Node.js, cURL hoặc SDK được tạo từ thiết lập hiện tại.
Crawl dùng tín dụng thuê bao trước, sau đó dùng tín dụng nạp thêm khi cần.
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient
with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
crawl = client.submit_crawl_task(CrawlRequestDto(
url="https://docs.example.com/",
maxDepth=3,
maxPages=10,
formats=[Format.MARKDOWN],
onlyMainContent=True,
timeout=60000,
))
print("crawl task id:", crawl.id)Pay per use
Small Projects
High Volume
Dùng Crawl khi một URL cần trở thành nhiều trang dữ liệu sạch, có cấu trúc và có thể tái sử dụng.
Crawl website tài liệu và chuyển mọi trang thành Markdown sạch cho AI và hỗ trợ.
Thu thập trang danh mục, chi tiết sản phẩm, giá, tình trạng còn hàng và liên kết từ website thương mại.
Theo dõi website công khai và biến trang thô thành đầu vào nghiên cứu có thể lặp lại.
Crawl tên miền để thu thập metadata, liên kết nội bộ, nội dung trang và phạm vi crawl.
Đưa Markdown và JSON đã crawl vào RAG, agent, lập chỉ mục và quy trình làm giàu dữ liệu.
Lưu đầu ra HTML và PDF cho rà soát, lưu hồ sơ, tuân thủ và kiểm toán có thể lặp lại.
Mọi điều bạn cần biết về Crawl, giá và tích hợp kỹ thuật.
Crawl trả về những gì?
Crawl có thể trả về Markdown, HTML, JSON, liên kết và PDF sạch cho mỗi trang đã xử lý.
Tôi có thể đặt phạm vi crawl không?
Tôi có thể crawl website render JavaScript không?
Tôi có thể dùng Nstproxy hoặc proxy riêng không?
Crawl được tính phí như thế nào?
Biến mọi website thành dữ liệu sạch, sẵn sàng cho LLM với công cụ crawl dùng proxy của Nstproxy. Bắt đầu miễn phí, không có mức tối thiểu hằng tháng, chỉ trả cho những gì bạn crawl.