>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
TypeScript

如何将数千个现成解析器连接到你的 LLM

Apify MCP Server

在实际项目中使用语言模型时,你很快就会遇到同样的问题。模型在推理和编写代码方面表现出色,但它看不见任何东西。它需要来自外部世界的新鲜数据:社交网络的最新帖子、地图上的公司联系方式、市场上的产品卡片,或者最新的搜索引擎结果。

通常在这种情况下,开发者开始为函数调用编写自定义工具,围绕 Playwright 构建包装器,或通过 Cheerio 组装管道。维护这些脚本几周后,你会发现一半的时间都花在了与验证码、布局和过时的选择器斗争上。

Apify 团队通过模型上下文协议解决了这个问题,发布了 apify-mcp-server 项目。本质上,他们将整个现成云爬虫目录转变为了一个统一的工具调用接口,供 AI 代理使用。

它是什么以及为什么你需要它

该仓库包含一个 MCP 服务器实现,连接本地或云客户端(Claude Desktop、Cursor、VS Code、ChatGPT)与 Apify 平台。该平台运行数千个名为 Actor 的现成脚本。每个这样的 Actor 都可以从特定网站获取结构化数据:Google Maps、Facebook、Instagram、在线商店,或者简单地为 RAG 爬取网站。

MCP Clients

无需为你的模型手动描述数十个 API 的模式,你只需连接一个端点。助手本身会在目录中搜索正确的爬虫,读取其 JSON 模式,验证输入参数,然后启动数据收集。

工具调用是如何工作的

服务器的主要特性是动态工具发现。你无需预先硬编码每个所需解析器的配置。

默认情况下,服务器为代理提供一组基本操作:

  1. search-actors 通过文本查询在目录中找到合适的爬虫。
  2. fetch-actor-details 获取找到的脚本的输入参数模式和文档。
  3. call-actor 在 Apify 基础设施上启动任务执行。
  4. get-dataset-items 以分页支持的方式批量获取准备好的结构化结果。
  5. apify--rag-web-browser 作为快速网络搜索和 RAG 内容解析工具内置。

如果你问 Claude:

相关项目