🎉 Tất cả giá proxy đã giảm — Tiết kiệm tới36%mớiResidential Lite Proxies$0.50/GB

Crawl toàn bộ website thành dữ liệu sẵn sàng cho LLM chỉ với một yêu cầu API

Biến mọi website thành dữ liệu sạch, có cấu trúc — Markdown, HTML, JSON, liên kết và PDF — thông qua công cụ crawl dùng proxy. Dành cho nhà phát triển và đội ngũ AI xây dựng pipeline RAG, nghiên cứu thị trường và sản phẩm dữ liệu ở quy mô lớn.

  • Tỷ lệ thành công 99,8%
  • Đã xử lý hơn 10 triệu trang
  • Xuất Markdown/JSON/HTML/PDF
Miễn phí
Crawl // Từ website đến dữ liệu

Từ một URL đến bộ dữ liệu hoàn chỉnh, sẵn sàng cho LLM.

Crawl bắt đầu với URL mục tiêu, phát hiện các trang có thể truy cập, áp dụng quy tắc render và proxy, rồi trả về đầu ra chuẩn hóa cho mọi trang trong tác vụ.

  • Có thể mở rộng
  • Có thể kiểm soát
  • Có cấu trúc

Khám phá website

Tìm mọi URL có thể crawl từ sitemap, liên kết trang và quy tắc trang con tùy chỉnh.

Crawl đệ quy

Kiểm soát số trang tối đa, độ sâu và đường dẫn loại trừ trước khi bắt đầu.

Render JavaScript

Render các trang động, nhiều JS trong trình duyệt thật trước khi trích xuất nội dung.

Crawl API

Tạo mã sẵn dùng từ Playground và chạy tác vụ crawl từ ứng dụng của bạn.

Đầu ra dữ liệu

Xem bản ghi crawl, kiểm tra kết quả và xuất dữ liệu sạch chỉ với một cú nhấp.

Tách biệt theo đội ngũ

Tách biệt bản ghi crawl, tín dụng gói thuê bao và mức sử dụng theo tài khoản hoặc đội ngũ.

Truy cập qua proxy

Dùng proxy residential, datacenter hoặc tùy chỉnh để truy cập trang ổn định hơn.

Định dạng linh hoạt

Trả về Markdown, HTML, JSON, liên kết và PDF trong cùng một quy trình crawl.

Crawl hoạt động như thế nào

Được thiết kế cho nhà phát triển và đội dữ liệu cần thu thập dữ liệu toàn website có thể lặp lại mà không phải duy trì hạ tầng crawler.

01

Gửi URL mục tiêu

Bắt đầu với website, trung tâm tài liệu hoặc danh mục sản phẩm.

02

Đặt phạm vi crawl

Xác định độ sâu, số trang tối đa, quy tắc bao gồm/loại trừ và tùy chọn yêu cầu.

03

Render và định tuyến

Bật render JavaScript và định tuyến lưu lượng qua Nstproxy hoặc proxy tùy chỉnh.

04

Xuất dữ liệu trang

Nhận đầu ra sạch, có cấu trúc theo từng trang, sẵn sàng cho pipeline của bạn.

Dùng Crawl trực quan hoặc qua API.

Bắt đầu từ Playground để thử tham số, sau đó sao chép ví dụ API khớp với cùng cấu hình crawl.

Playground trước

Thử URL, render JS, tùy chọn proxy và định dạng đầu ra mà không cần viết mã.

Ví dụ sẵn sàng cho mã

Sao chép đoạn Node.js, cURL hoặc SDK được tạo từ thiết lập hiện tại.

Theo dõi mức sử dụng

Crawl dùng tín dụng thuê bao trước, sau đó dùng tín dụng nạp thêm khi cần.

Xem ví dụ
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient

with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
    crawl = client.submit_crawl_task(CrawlRequestDto(
        url="https://docs.example.com/",
        maxDepth=3,
        maxPages=10,
        formats=[Format.MARKDOWN],
        onlyMainContent=True,
        timeout=60000,
    ))

    print("crawl task id:", crawl.id)

Hạ tầng proxy đơn giản và hiệu quả chi phí

Pay per use

Free

$0

$1.80 / GB Residential
$1.20 / 1k URLs Crawl
Không có tín dụng đi kèm

Small Projects

Starter

$79/ tháng

$1.60 / GB Residential
$1.00 / 1k URLs Crawl
$79 tín dụng đi kèm
Đề xuất

Growth

$249/ tháng

$1.30 / GB Residential
$0.80 / 1k URLs Crawl
$0.15 / GB Proxy Manager
$249 tín dụng đi kèm

High Volume

Scale

$699/ tháng

$1.10 / GB Residential
$0.60 / 1k URLs Crawl
$0.10 / GB Proxy Manager
$699 tín dụng đi kèm

Xây dựng cho quy trình dữ liệu toàn website

Dùng Crawl khi một URL cần trở thành nhiều trang dữ liệu sạch, có cấu trúc và có thể tái sử dụng.

Từ tài liệu đến cơ sở tri thức

Crawl website tài liệu và chuyển mọi trang thành Markdown sạch cho AI và hỗ trợ.

Thu thập danh mục sản phẩm

Thu thập trang danh mục, chi tiết sản phẩm, giá, tình trạng còn hàng và liên kết từ website thương mại.

Nghiên cứu và giám sát

Theo dõi website công khai và biến trang thô thành đầu vào nghiên cứu có thể lặp lại.

Kiểm toán SEO và nội dung

Crawl tên miền để thu thập metadata, liên kết nội bộ, nội dung trang và phạm vi crawl.

Pipeline dữ liệu AI

Đưa Markdown và JSON đã crawl vào RAG, agent, lập chỉ mục và quy trình làm giàu dữ liệu.

Lưu trữ trang

Lưu đầu ra HTML và PDF cho rà soát, lưu hồ sơ, tuân thủ và kiểm toán có thể lặp lại.

Câu hỏi thường gặp

Mọi điều bạn cần biết về Crawl, giá và tích hợp kỹ thuật.

01

Crawl trả về những gì?

Crawl có thể trả về Markdown, HTML, JSON, liên kết và PDF sạch cho mỗi trang đã xử lý.

02

Tôi có thể đặt phạm vi crawl không?

03

Tôi có thể crawl website render JavaScript không?

04

Tôi có thể dùng Nstproxy hoặc proxy riêng không?

05

Crawl được tính phí như thế nào?

Nstproxy

Crawl

Biến mọi website thành dữ liệu sạch, sẵn sàng cho LLM với công cụ crawl dùng proxy của Nstproxy. Bắt đầu miễn phí, không có mức tối thiểu hằng tháng, chỉ trả cho những gì bạn crawl.

Logo Nstproxy©2026 NST LABS TECH LTD. Bảo lưu mọi quyền.