Укажите целевой URL
Начните с сайта, центра документации или категории товаров.
Превращайте любой сайт в чистые структурированные данные — Markdown, HTML, JSON, ссылки и PDF — с помощью краулера на базе прокси. Для разработчиков и AI-команд, создающих RAG-пайплайны, рыночную аналитику и data-продукты в масштабе.
Crawl начинает с целевого URL, находит доступные страницы, применяет правила рендеринга и прокси, затем возвращает нормализованные результаты для каждой страницы задачи.
Находите все доступные для сканирования URL из sitemap, ссылок и пользовательских правил подстраниц.
Управляйте количеством страниц, глубиной и исключенными путями до запуска задачи.
Рендерьте динамические страницы с тяжелым JS в настоящем браузере до извлечения контента.
Создавайте готовый код в Playground и запускайте задачи краулинга из своего приложения.
Просматривайте записи краулинга, проверяйте результаты и экспортируйте чистые данные одним кликом.
Изолируйте записи, подписочные кредиты и использование по аккаунту или команде.
Используйте residential, datacenter или собственные прокси для более надежного доступа к страницам.
Возвращайте Markdown, HTML, JSON, ссылки и PDF из одного процесса краулинга.
Создан для разработчиков и data-команд, которым нужен повторяемый сбор данных со всего сайта без поддержки инфраструктуры краулеров.
Начните с сайта, центра документации или категории товаров.
Определите глубину, лимит страниц, правила включения и исключения, а также параметры запроса.
Включите JavaScript-рендеринг и направьте трафик через Nstproxy или собственный прокси.
Получайте чистые структурированные результаты по страницам, готовые для вашего пайплайна.
Сначала проверьте параметры в Playground, затем скопируйте API-пример с той же конфигурацией краулинга.
Пробуйте URL, JS-рендеринг, опции прокси и форматы вывода без написания кода.
Копируйте фрагменты Node.js, cURL или SDK, созданные из текущих настроек.
Crawl сначала использует кредиты подписки, затем при необходимости кредиты пополнения.
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient
with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
crawl = client.submit_crawl_task(CrawlRequestDto(
url="https://docs.example.com/",
maxDepth=3,
maxPages=10,
formats=[Format.MARKDOWN],
onlyMainContent=True,
timeout=60000,
))
print("crawl task id:", crawl.id)Pay per use
Small Projects
High Volume
Используйте Crawl, когда один URL должен превратиться во множество чистых, структурированных и повторно используемых страниц данных.
Сканируйте сайты документации и превращайте каждую страницу в чистый Markdown для AI и поддержки.
Собирайте категории, карточки товаров, цены, наличие и ссылки на ecommerce-сайтах.
Отслеживайте публичные сайты и превращайте исходные страницы в повторяемые исследовательские данные.
Сканируйте домены для сбора метаданных, внутренних ссылок, контента и покрытия краулинга.
Передавайте собранные Markdown и JSON в RAG, агентов, индексацию и процессы обогащения.
Сохраняйте HTML и PDF для проверки, записей, соответствия требованиям и повторяемых аудитов.
Все, что нужно знать о Crawl, ценах и технической интеграции.
Что возвращает Crawl?
Crawl может возвращать чистые Markdown, HTML, JSON, ссылки и PDF для каждой обработанной страницы.
Можно ли задать границы краулинга?
Можно ли сканировать сайты с JavaScript-рендерингом?
Можно использовать Nstproxy или собственный прокси?
Как оплачивается Crawl?
Превращайте любой сайт в чистые данные для LLM с прокси-движком краулинга Nstproxy. Начните бесплатно: без месячного минимума, платите только за выполненный краулинг.