news 2026/8/29 11:58:58

wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单

wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单

【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl & research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo

wigolo 是一个本地优先的 AI Agent 网络工具集:无需 API 密钥、不经过云端、每次查询成本为 $0。它把 search(多引擎搜索)、fetch(网页抓取)、crawl(站点爬虫)、extract(结构化数据提取)等 10 大工具打包成一套 MCP 服务器,直接接入 Claude Code、Cursor、Codex、Gemini CLI 等编码代理,让你的 AI 助手拥有"看遍全网"的能力。

为什么 AI Agent 需要这样一套网络工具

写代码时,AI 代理经常需要"上网办事":查官方文档、读 API 参考、跟踪版本变更。传统做法是给代理接一个按量计费的云搜索 API——要注册账号、要 API key、查询越多账单越高,数据还会经过第三方。

wigolo 的思路是把昂贵部分搬到你自己的硬件上:重排模型和向量嵌入全部在本地运行,搜索走公共引擎直连适配器,所有缓存都存在~/.wigolo/目录里。结果就是:查询无限量,数据不出本机

10大工具一览:一张清单看懂 wigolo

工具一句话说明
🔎search多引擎网页搜索:18 个直连引擎适配器 + 排序融合 + 本地 ML 重排,返回带评分的证据和引用
📄fetch抓取单个 URL:先走普通 HTTP,遇到反爬验证或 SPA 空壳自动升级到无头浏览器;支持 PDF、截图、点击/输入等页面操作
🕸️crawl多页爬虫:BFS/DFS/sitemap/map 四种策略,遵守 robots.txt,按域名限速,自动去重
🧩extract从页面提取结构化数据:表格、元数据、JSON-LD、品牌信息、自定义 JSON Schema
💾cache查询本地已见内容的持久缓存,支持关键词 + 语义混合检索、统计、变更检测
🧲find_similar找相似页面:本地向量索引 + 关键词 + 实时网络三路融合排序
🧠research深度研究:拆解问题 → 并行子查询 → 交叉验证来源 → 生成带引用的报告
🤖agent自主采集循环:规划 → 搜索 → 抓取 → 提取 → 综合,全程步骤留痕
🔁diff对比页面新旧版本,输出 git 风格补丁或结构化差异
⏱️watch注册页面变更监控任务,定期复查并可推送到 webhook

所有工具在任何接入方式(MCP、REST、SDK、命令行)下参数名完全一致,完整参数表见 docs/tools.md。

核心四件套详解

search:多引擎搜索 + 可解释评分

search是 wigolo 的主力工具。它把查询并行分发给多个搜索引擎,用倒数排名融合(RRF)合并结果,再由本地运行的 ML 重排模型精排。

对新手最友好的两点:

  • 返回"证据"而非裸链接:每条结果附带逐字摘录、精确到字节偏移的来源位置、引用 ID,代理可以直接引用而不会张冠李戴;
  • 评分可解释:每个结果都有evidence_score拆解(词法、语义、时效、引擎共识等分量),弱结果还会被打分器主动标记为垃圾。

传一个查询数组还能并行搜多个变体,一次调用获得更宽的覆盖面。

fetch:会"自动升级"的网页抓取器

抓取网页最大的坑是 JS 渲染和反爬验证。fetch采用分级路由:先用最便宜的普通 HTTP,观测到挑战页或 SPA 空壳等真实信号后才升级到无头浏览器,并按域名记住学习结果(哪个站点需要什么级别),而不是靠域名猜。

它还支持只取某个标题下的章节、PDF 解析、复用已登录会话,以及actions参数执行点击、输入、滚动、截图等浏览器操作。遇到挡不过去的墙,它会返回明确标注的blocked_by_challenge失败,而不是把验证壳当内容骗你。

crawl:礼貌而克制的站点爬虫

crawl把整个文档站点灌进本地缓存,供后续cachefind_similar反复查询。四种策略按需选择:bfs(广度优先,默认)、dfs(深度优先)、sitemap(sitemap 驱动,最适合文档站)、map(只发现 URL 不抓内容,最快)。

默认遵守 robots.txt、按域名限速、用 ETag 增量复核——定位是"文档索引器"而非批量采集器。

extract:不用 LLM 的结构化数据提取

extract提供六种模式:structured(表格、键值对、JSON-LD 全都要)、tables(只取表格)、metadata(标题/描述/OG 标签)、schema(按你给的 JSON Schema 匹配页面字段)、selector(CSS 选择器)、brand(logo、配色、字体)。全部纯确定性代码,不需要 LLM;即使配置了 LLM,其补全的字段也会与原文核对,幻觉值一律返回null

其余六大工具:缓存、相似、研究、自主与监控

  • cache:所有被 search/fetch/crawl 触达的页面都会落盘。cache工具让你对本地已见内容做秒级关键词/语义检索——重复提问零成本,这是 wigolo "本地记忆"的核心。
  • find_similar:给一个 URL 或概念,融合本地嵌入索引、关键词和实时网络三路信号找相似页面,先crawl预热缓存后效果最好。
  • research:把一个研究问题拆成子查询并行搜索,交叉验证来源后输出结构化简报(含逐条论断的来源、跨源印证、信息缺口)。
  • agent:给它一句自然语言目标,它自主规划查询、并行抓取、按时间预算执行并综合成结果,每一步都有日志。
  • diff:对比缓存版本与实时页面的变化,支持行/词/章节三种粒度。
  • watch:注册定时复查任务,页面变了就产出 diff 并可推送 webhook(webhook 目标有 SSRF 防护)。

最快上手:一条命令接入你的 AI 编码代理

npx wigolo init --agents=claude-code,cursor

要求 Node ≥ 20 和约 1.5 GB 磁盘空间。init会下载浏览器引擎和本地模型、跑健康检查,并一步把指定代理的 MCP 配置写好。其他接入方式:

  • 任何 MCP 客户端:在配置里注册npx -y wigolo即可;
  • REST APIwigolo serve启动后,POST /v1/{tool}覆盖全部 10 个工具,详见 docs/rest-api.md;
  • SDK:TypeScript(wigolo-sdk)和 Python(pip install wigolo)都有嵌入式本地模式,自动发现或拉起守护进程;
  • LangChain / CrewAI / LlamaIndex / Vercel AI SDK:官方集成包 packages/ 开箱即用。

命令行党也可以直接wigolo search "…" --json单发查询,或用wigolo shell进入交互式管道。

成本对比:为什么是 $0/查询

按量计费的云 API 成本随查询次数线性上涨,而 AI 代理恰恰是"爆发式提问"的——一个任务里连续发几十次查询很常见。wigolo 的重排和嵌入跑在你的硬件上,没有单次查询成本要回收,因此没有计费器

隐私同样默认拉满:缓存、向量、模型、配置全部在~/.wigolo/,除非你主动为research/agent配置 LLM 做综合写作,否则没有任何数据离开本机。

相关资料速查

  • 工具完整参数参考:docs/tools.md
  • 安装与全渠道指南(npm / Docker / Homebrew / 二进制):docs/installation.md
  • 环境变量与配置详解:docs/configuration.md
  • 工具源码入口:src/tools/(search.tsfetch.tscrawl.tsextract.ts等 10 个文件)
  • 可运行示例(含 REST curl、SDK、n8n、webhook):examples/

10 个工具覆盖"搜索 → 抓取 → 爬取 → 提取 → 缓存 → 研究 → 监控"的完整链路,全部 $0/查询。跑一条npx wigolo init,你的 AI 代理今天就拥有免费的本地网络层。

【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl & research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/29 11:57:11

告别手动搬运:三步实现参考文献的智能识别与论文全文一键打包

1. 科研效率革命:为什么我们需要智能参考文献工具 写论文最头疼的事情之一,就是处理参考文献。我至今记得研究生时期,为了找齐50篇参考文献,整整花了两天时间手动搜索、下载、重命名文件。直到后来发现自动化工具,才意…

作者头像 李华
网站建设 2026/8/29 11:55:58

Agent工具调用失败处理指南:从异常分类到容错兜底

最近有同学投稿,说自己去宇树科技一面时被问了一道题:Agent 调用工具失败如何处理。他当时下意识回答“重试、加日志、换成更稳定的接口”,结果面试官明显不满意,后面又追着问了好几个场景,越问越深,最后直…

作者头像 李华
网站建设 2026/8/29 11:55:12

Scrapling网络爬虫实战指南:从单页请求到整站采集的避坑教程

Scrapling网络爬虫实战指南:从单页请求到整站采集的避坑教程 【免费下载链接】Scrapling 🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! 项目地址: https://gitcode.com/GitHub_Tre…

作者头像 李华
网站建设 2026/8/29 11:54:35

C++多线程编程:互斥锁与RAII锁管理器的原理与实践

1. 项目概述:为什么我们需要锁?写C多线程程序,最刺激也最头疼的时刻,往往不是设计出精妙的并发算法,而是程序运行到一半,数据莫名其妙地“坏”了。你精心维护的一个全局计数器,在两个线程同时“…

作者头像 李华
网站建设 2026/8/29 11:54:30

用Python和FastAPI构建个人健康管理系统:从数据库到可视化看板

“We Got Better at Keeping You Alive. Not at Keeping You Healthy” 这句话来自国外医疗领域的讨论,大意是:我们的医学技术越来越擅长把人从死亡线上拉回来,但对于如何让人长期保持健康,做得还远远不够。如果把这句评论投射到信…

作者头像 李华