Cung cấp dữ liệu web trực tiếp cho AI Agent của bạn (với MCP)
TL;DR
Một tác nhân AI cần một công cụ web khi câu trả lời của nó phụ thuộc vào thông tin mới hơn bối cảnh mô hình của nó hoặc cụ thể cho một trang trực tiếp. MCP cung cấp một ranh giới công cụ tiêu chuẩn; nó không làm cho nội dung thu thập đáng tin cậy chỉ bằng chính nó.
Một máy chủ crawl MCP tối thiểu có thể mở ra một công cụ chỉ đọc read_web_page(url) dựa trên Nstproxy Crawl. Công cụ này sẽ lấy một URL công cộng đã được ủy quyền và trả về Markdown sạch với URL nguồn của nó.
Ví dụ Python làm việc bên dưới sử dụng API MCPServer 2.x hiện tại. Nó đã được cài đặt và thử nghiệm với một khách hàng MCP thực tế trong quá trình, đã phát hiện read_web_page và đầu vào url cần thiết của nó.
Con trỏ có thể đăng ký máy chủ cục bộ trong .cursor/mcp.json; đường dẫn hiện tại của Claude Desktop là Settings → Extensions. Đối xử với các hướng dẫn sao chép cũ FastMCP và claude_desktop_config.json như là nhạy cảm với phiên bản.
Giữ cho tác nhân được giới hạn. Xác thực URL, hạn chế các máy chủ cho phép khi có thể, duy trì trích dẫn nguồn, lưu tạm các lần đọc lặp lại và yêu cầu phê duyệt trước khi công cụ tiếp cận dữ liệu riêng tư hoặc nhạy cảm.
Một mô hình AI không thể biết liệu một trang sản phẩm có thay đổi sáng nay, một trang trạng thái đã được phục hồi cách đây năm phút, hoặc một chính sách đã được sửa đổi sau thời điểm ngắt huấn luyện của nó. Một công cụ web trực tiếp đóng lấp khoảng trống chứng cứ đó bằng cách truy xuất trang vào thời điểm trả lời.
Kiến trúc hữu ích có chủ ý nhỏ gọn: máy chủ quyết định khi nào cần một trang, MCP mô tả và gọi công cụ, và một API crawl xử lý việc truy xuất và trích xuất. Hướng dẫn này xây dựng kết nối đó với các giao diện MCP 2.x hiện tại và Nstproxy Crawl, sau đó gắn nó vào Claude Desktop hoặc Cursor.
Nstproxy Crawl cung cấp cho một tác nhân AI một lớp quản lý thu hồi trang có thể trả về Markdown đã được làm sạch, siêu dữ liệu trang, liên kết, và các vật phẩm cấu hình khác. Tác nhân nhận được nội dung mà nó có thể đọc mà không cần vận hành các công nhân trình duyệt, quy tắc trích xuất, hàng đợi, hay định tuyến proxy bản thân.
MCP cung cấp hợp đồng tích hợp. Một máy chủ MCP công bố các công cụ đã đặt tên với mô tả và lược đồ đầu vào có kiểu; một máy chủ tương thích liệt kê những công cụ đó và quyết định khi nào gọi chúng. tiêu chuẩn MCP hiện tại định nghĩa ranh giới giao thức, trong khi tài liệu SDK Python MCP chính thức cung cấp các API máy chủ và khách hàng được sử dụng ở đây.
Sự phân chia này có ý nghĩa trong hoạt động. Mô hình không bao giờ nên nhận được mã thông báo Nstproxy. Máy chủ cục bộ đọc bí mật từ môi trường của nó, gửi yêu cầu trang, và chỉ trả về nội dung đã yêu cầu cộng với nguồn gốc.
Hướng dẫn trước đó của Nstproxy về máy chủ MCP tìm kiếm web cho thấy một mẫu tìm kiếm-then-đọc hai công cụ. Bài viết này tập trung vào nguyên tắc tiếp cận an toàn hơn: một công cụ URL chỉ đọc mà bạn có thể gắn vào nhiều máy chủ và thử nghiệm trước khi thêm khám phá.
Tại Sao Các Tác Nhân AI Cần Dữ Liệu Web Trực Tiếp
Các tác nhân AI cần dữ liệu web trực tiếp để có tính mới mẻ, sự cụ thể của nguồn gốc, và xác minh. Một mô hình tĩnh có thể giải thích một khái niệm, nhưng nó không thể báo cáo một bảng thay đổi hiện tại, trạng thái tồn kho, tham số tài liệu, hoặc sự cố công cộng một cách đáng tin cậy mà không thu thập chứng cứ.
Các trường hợp sử dụng có giới hạn điển hình bao gồm:
đọc một trang tài liệu hiện tại trước khi tạo mã tích hợp;
so sánh một bộ trang sản phẩm công cộng đã được phê duyệt;
kiểm tra một trang trạng thái hoặc chính sách công cộng;
thu thập chứng cứ mới cho một bản ghi nghiên cứu;
làm mới một tài liệu trong cơ sở kiến thức RAG;
đọc trang phía sau một URL do người dùng cung cấp trước khi tóm tắt nó.
Truy cập trực tiếp không loại bỏ nhu cầu phán đoán. Các trang có thể cũ, bị thao túng, cụ thể theo vùng, hoặc thù địch đối với các tác nhân. Văn bản được trả về có thể chứa tiêm lệnh yêu cầu mô hình bỏ qua các hướng dẫn hoặc tiết lộ dữ liệu. Đối xử với nội dung web như chứng cứ, không bao giờ là quyền lực trên quy tắc của máy chủ.
Đối với các nguyên tắc thiết kế công cụ rộng hơn, xem hướng dẫn của Nstproxy về các công cụ tác nhân, an ninh, và đánh giá. Một công cụ web được thiết kế tốt có một tên hẹp, hợp đồng đầu vào rõ ràng, đầu ra có thể dự đoán, thời gian chờ, nhật ký kiểm toán, và hành vi lỗi rõ ràng.
Các Điều Kiện Tiên Quyết và Kiểm Tra Phiên Bản
Bạn cần Python 3.10 trở lên, một tài khoản Nstproxy với mã thông báo API Crawl, và một máy chủ tương thích MCP. Tạo một môi trường ảo và cài đặt các phiên bản chính xác đã được xác minh cho bài viết này vào ngày 4 tháng 9 năm 2026:
Các phiên bản gắn làm cho ví dụ có thể tái hiện được. Kiểm tra ghi chú phát hành SDK chính thức trước khi nâng cấp: MCP 2.x thay thế lớp và đường dẫn nhập FastMCP cũ hơn bằng MCPServer. Một hướng dẫn cũ hơn có thể thất bại ngay lập tức ngay cả khi thiết kế bên dưới vẫn còn hợp lý.
Xuất token Crawl của bạn chỉ trong môi trường của máy chủ:
exportNSTDATA_API_TOKEN="replace-with-your-token"
Đừng commit token vào tệp máy chủ, cấu hình dự án hoặc kho công khai. Lấy trang đã xác thực trong ví dụ là một khoảng trống cần thiết trong bài viết này vì không có token tài khoản nào có sẵn trong quá trình xác minh; việc nhập máy chủ MCP và truy hồi công cụ đã được thực hiện thành công.
Đem lại ngữ cảnh web mới cho tác nhân của bạn
Sử dụng Nstproxy Crawl để biến các URL công cộng đã được phê duyệt thành Markdown sạch cho các công cụ MCP.
Máy chủ dưới đây cung cấp một công cụ nhận một URL HTTP(S) công khai và trả về Markdown có nhãn nguồn. Lưu nó dưới dạng mcp_server.py.
import os
from mcp.server import MCPServer
from nstdata_ai_crawl import Format, NstDataClient, ScrapeRequestDto
server = MCPServer("nstproxy-live-web", instructions="Lấy các trang web công khai đã được xác thực dưới dạng Markdown sạch.",)@server.tool()defread_web_page(url:str)->str:"""Lấy một trang HTTP(S) công khai đã được xác thực và trả về Markdown."""ifnot url.startswith(("https://","http://")):raise ValueError("url phải sử dụng http:// hoặc https://") token = os.environ["NSTDATA_API_TOKEN"]with NstDataClient(token)as client: result = client.submit_scrape_task_sync( ScrapeRequestDto( url=url, formats=[Format.MARKDOWN], onlyMainContent=True, timeout=60000,))ifnot result.success ornot result.data: message = result.errorMessage or result.errorCode or"lỗi không xác định"raise RuntimeError(f"lấy trang thất bại: {message}") markdown = result.data.get_markdown()ifnot markdown:raise RuntimeError("trang đã được lấy nhưng không trả về Markdown")returnf"Nguồn: {url}\n\n{markdown}"if __name__ =="__main__": server.run(transport="stdio")
Hàm này cố ý đồng bộ vì phương pháp hiện tại của Nstproxy SDK chờ đợi kết quả của một trang duy nhất. Đối với các cuộc thu thập dữ liệu trang web dài hơn, hãy cung cấp một công cụ gửi và một công cụ trạng thái riêng thay vì giữ một cuộc gọi MCP mở vô thời hạn.
Kiểm tra sơ đồ chỉ là một điểm khởi đầu. Một máy chủ sản xuất chấp nhận các URL tùy ý cũng phải chặn localhost, các dải IP riêng, các điểm cuối siêu dữ liệu đám mây, các cổng không chuẩn, DNS rebinding và chuyển hướng đến các điểm đến không được phép. Một danh sách cho phép các miền được phê duyệt an toàn hơn một trình lấy URL mở.
Xác minh Công cụ MCP Trước Khi Mở Claude hoặc Cursor
Xác minh hợp đồng máy chủ với một khách hàng trong quy trình trước khi thêm cấu hình máy chủ. Lưu điều này dưới dạng test_server.py bên cạnh máy chủ:
import asyncio
from mcp import Client
from mcp_server import server
asyncdefmain()->None:asyncwith Client(server)as client: tools =await client.list_tools()for tool in tools.tools:print(tool.name, tool.input_schema.get("required"))asyncio.run(main())
Chạy python test_server.py. Đoạn mã chính xác được tạo ra:
read_web_page ['url']
Kết quả này chứng minh rằng khách hàng MCP đã cài đặt có thể kết nối với đối tượng máy chủ và khám phá sơ đồ công cụ được tạo ra. Nó không chứng minh rằng mã thông báo Nstproxy là hợp lệ, vì việc liệt kê các công cụ không gọi API Crawl.
Bạn cũng có thể kiểm tra máy chủ bằng cách sử dụng các công cụ phát triển MCP chính thức được mô tả trong hướng dẫn bắt đầu MCP Python SDK. Kiểm tra các sơ đồ không hợp lệ, biến môi trường bị thiếu, Markdown trống, thời gian chờ và lỗi nhà cung cấp trước khi cung cấp quyền truy cập cho một máy chủ.
Thêm Máy Chủ MCP vào Cursor
Cursor đăng ký các máy chủ MCP cụ thể cho dự án trong .cursor/mcp.json và các máy chủ toàn cầu trong ~/.cursor/mcp.json. Tài liệu hướng dẫn chính thức cho MCP Cursor mô tả các giao thức và vị trí cấu hình được hỗ trợ.
Sử dụng đường dẫn trình thông dịch và kịch bản tuyệt đối để Cursor không phụ thuộc vào thư mục làm việc của nó:
Khởi động lại hoặc tải lại Cursor, mở bảng công cụ có sẵn, và xác nhận rằng read_web_page xuất hiện. Hỏi: “Sử dụng read_web_page để tóm tắt trang công khai hiện tại tại https://example.com, và trích dẫn URL nguồn.” Xem xét các đối số công cụ trước khi phê duyệt.
Đường dẫn onboarding hiện tại của Claude Desktop là Cài đặt → Tiện ích mở rộng. Anthropic hiện nay khuyến nghị các tiện ích mở rộng trên máy tính để bàn cho các máy chủ cục bộ và Cài đặt → Kết nối cho các dịch vụ MCP từ xa, thay vì phụ thuộc vào các hướng dẫn JSON thủ công cũ cho mỗi lần cài đặt. Làm theo hướng dẫn MCP cục bộ Claude Desktop.
Để phát triển địa phương, hãy mở Cài đặt → Mở rộng → Cài đặt nâng cao và sử dụng các điều khiển nhà phát triển phù hợp với phiên bản Claude Desktop của bạn. Đóng gói máy chủ đã thử nghiệm dưới dạng mở rộng desktop trước khi phân phối nó đến người dùng khác. Đánh dấu trường mã thông báo là nhạy cảm để Claude Desktop lưu trữ nó thông qua kho lưu trữ thông tin xác thực được bảo vệ của hệ điều hành.
Sau khi cài đặt, bắt đầu một cuộc trò chuyện mới, xác minh rằng công cụ đã được liệt kê và yêu cầu một trang công khai đã biết. Việc danh sách công cụ thành công xác nhận đăng ký MCP; phản hồi trang thành công xác nhận thông tin xác thực Nstproxy và đường dẫn thu thập dữ liệu. Giữ những điều này như các kiểm tra thu nhận tách biệt.
Sử Dụng Dữ Liệu Web Trực Tuyến Mà Không Mất Kiểm Soát
Một tác nhân sản xuất nên chọn một URL từ nguồn được phê duyệt hoặc yêu cầu của người dùng, gọi công cụ, kiểm tra nhãn nguồn đã trả về và chỉ trả lời từ nội dung liên quan đến câu hỏi. Yêu cầu trích dẫn trong hướng dẫn của tác nhân và giữ lại URL cuối cùng nếu có chuyển hướng xảy ra.
Thêm những điều khiển này trước khi mở rộng việc sử dụng:
Chính sách miền: chỉ cho phép các máy chủ công khai được phê duyệt hoặc yêu cầu xác nhận cho một máy chủ mới.
An toàn mạng: từ chối các địa chỉ cục bộ và riêng tư trước và sau khi phân giải DNS và chuyển hướng.
Giảm thiểu dữ liệu: chỉ yêu cầu định dạng nội dung mà nhiệm vụ cần.
Lưu trữ: tránh lấy một trang không đổi nhiều lần trong một phiên.
Giới hạn kích thước: rút ngắn hoặc lưu trữ kết quả quá lớn thay vì làm đầy ngữ cảnh của mô hình.
Kháng tiêm lệnh nhắc: không bao giờ để văn bản trang ghi đè lên chính sách hệ thống hoặc ủy quyền cho một công cụ khác.
Khả năng quan sát: ghi lại tên công cụ, URL đã chuẩn hóa, thời gian, trạng thái kết quả và ID yêu cầu không bí mật.
Hướng dẫn bảo mật của thông số kỹ thuật MCP nhấn mạnh kiểm soát của người dùng và ủy quyền rõ ràng xung quanh các công cụ. Việc truy xuất web là chỉ đọc từ quan điểm của tác nhân, nhưng nó vẫn truyền URL mục tiêu đến một dịch vụ bên thứ ba và có thể tiết lộ URL riêng nếu đầu vào không được hạn chế.
Tôn trọng các điều khoản của trang mục tiêu, hướng dẫn robot, bản quyền, bảo mật, và pháp luật hiện hành. Giữ khối lượng yêu cầu gắn với các nhiệm vụ thực tế của người dùng thay vì biến một công cụ tác nhân tương tác thành một trình thu thập dữ liệu hàng loạt không có người giám sát.
Danh Sách Kiểm Tra Nhập Môn
Một trình tự nhập môn đáng tin cậy tách biệt giao thức, thông tin xác thực, thu thập dữ liệu và chất lượng câu trả lời:
ghim và ghi lại các phiên bản gói đã cài đặt;
chạy thử nghiệm phát hiện công cụ MCP trong quy trình;
thêm máy chủ cục bộ vào một máy chủ;
xác nhận tên công cụ và đầu vào url xuất hiện;
gọi một trang thử nghiệm công khai được phép;
xác minh URL nguồn và Markdown có ý nghĩa được trả về;
thử một sơ đồ không hợp lệ và mã thông báo bị thiếu;
kích hoạt các điều khiển miền, kích thước, thời gian chờ và ghi nhật ký;
đánh giá xem câu trả lời cuối cùng có trích dẫn và tuân theo chứng cứ đã thu thập hay không.
Bắt đầu với một công cụ đọc. Chỉ thêm một công cụ tìm kiếm khi việc phát hiện là một yêu cầu thực sự, và thêm việc thu thập trang web như một quy trình làm việc không đồng bộ tách biệt. Điều này giữ cho chi phí, quyền hạn và hành vi lỗi rõ ràng với cả người dùng và tác nhân.
Cung Cấp Công Cụ Web Có Thể Xác Minh Cho Tác Nhân Của Bạn
Một tích hợp MCP thu thập dữ liệu hữu ích là một kênh chứng cứ hẹp, không phải duyệt web không giới hạn. Máy chủ MCP 2.x hiện tại ở trên cung cấp hợp đồng công cụ đã được thử nghiệm, Nstproxy Crawl xử lý việc thu thập trang, và Claude Desktop hoặc Cursor cung cấp trải nghiệm máy chủ.
Sử dụng giá Nstproxy Crawl để chọn mô hình sử dụng phù hợp, sau đó xác thực một trang đại diện từ đầu đến cuối với mã thông báo của riêng bạn. Chỉ mở rộng phạm vi miền của công cụ hoặc quyền tự trị sau khi các nhật ký kiểm toán và hành vi phê duyệt đang hoạt động.
Máy chủ crawl MCP phơi bày việc truy xuất web như các công cụ có kiểu mà một máy chủ AI tương thích với MCP có thể khám phá và gọi, đồng thời giữ cho thông tin xác thực API bên trong quy trình của máy chủ.
Q: Tại sao một đại lý AI cần dữ liệu web trực tiếp?
Một đại lý AI cần dữ liệu web trực tiếp khi một câu trả lời phụ thuộc vào thông tin cụ thể của nguồn hiện tại mà không được đảm bảo có trong dữ liệu đào tạo hoặc ngữ cảnh trò chuyện của mô hình.
Q: Máy chủ MCP có phơi bày mã thông báo Nstproxy tới mô hình không?
Không. Mã thông báo được máy chủ cục bộ đọc từ môi trường của nó và được sử dụng cho yêu cầu API Crawl; công cụ chỉ nên trả về nội dung trang, nguồn gốc và chi tiết lỗi đã kiểm soát.
Q: Có cùng một máy chủ MCP có thể làm việc với Claude Desktop và Cursor không?
Có. Cả hai đều hỗ trợ các công cụ MCP, mặc dù quy trình cài đặt của chúng khác nhau: Cursor sử dụng mcp.json, trong khi các phiên bản Claude Desktop hiện tại quản lý các máy chủ cục bộ thông qua Extensions.
Ivy Lin
Sep. 4th 2026
110M+ IP that voi ti le truy cap thanh cong 99.9%
Phan hoi trung binh ~0.5s cho tac vu dong thoi cao
Chi tu $0.1/GB
Truy cap ngay cac pool proxy residential, datacenter, IPv6 va ISP cao cap.