自托管的MCP提取器,用于代理网页研究和提取
master-fetch,由 Dondai1234 开发,是一个模型上下文协议服务器,允许 AI 代理本地访问实时网络内容以进行模型上下文和研究。它获取页面并返回清理后的文本和搜索结果,同时处理 JavaScript 密集型网站和反机器人墙。该应用程序突出了零配置、无密钥操作和设备上的文档处理。开发人员和 AI 高级用户获得了一个私有的自托管检索管道,用于本地化、文档摄取和代理驱动的研究工作流程。
你实际上可以用它来做什么任务?
master-fetch 作为一个检索引擎,为下游模型提供可读的源材料,专注于 ai-text-localization 和研究任务。典型的结果包括提取翻译文档、抓取网页以获取本地化字符串,以及为模型提示映射网站内容。实用任务类型:
- 获取和清理 HTML 以供模型输入
- 通过网站地图进行全站爬取
- 将 PDF 和图像转换为文本以供摄取
获取的输出有多可靠和干净?
该工具通过使用 Trafilatura 和 lxml 来去除广告和模板,生成干净、适合模型的文本,并且可以输出适合提示上下文的 Markdown 或纯文本。对于图像密集的文档,它应用基于本地 ONNX 的 OCR 管道来提取字符。该项目还包括一个本地神经重排序步骤,重新排序搜索结果,帮助优先考虑最相关的检索页面供代理使用。
你应该期待什么输入和操作限制?
接受的输入包括 URL、用于深度爬取的网站地图,以及上传的 PDF 或图像用于 OCR。安装需要一个 Python 3.10+ 环境和该软件包(pip install hound-mcp),并且隐秘获取可以选择使用本地 Chrome 或 Chromium 二进制文件。该服务器与 MCP 主机集成,如 Claude Desktop、Cursor 和 OpenCode,其搜索依赖于本地抓取和路由逻辑,无需外部 API 密钥。
它是否适合开发者工作流程而不会增加大量开销?
该设计针对开发者和 AI 高级用户,他们可以自托管并将 MCP 端点集成到代理堆栈中。开发者实现了 HTTP、浏览器渲染和隐秘模式之间的自动升级,以增加从受保护网站成功检索的次数,社区也注意到其自动升级的优势。由于该服务完全在本地运行,优先考虑数据保管的团队可以将其纳入现有的内部管道以生成模型上下文。
谁应该采用它,谁应该寻找其他选择
master-fetch 是一个面向开发者的选择,适合构建代理驱动的研究或本地化管道并能够操作自托管服务器的团队。它适合那些优先考虑对获取材料的控制并能够维护基于 Python 的服务的团体。没有内部工程能力的组织或那些更喜欢托管的即用型抓取服务的组织应该考虑去除托管责任的替代方案。