一个把网页抽成结构化数据的开源工具:lightfeed/extractor

先说结论:如果你最近在做信息采集、竞品监控、内容聚合,这个项目值得收藏。它把“抓网页 + 结构化抽取”这两件麻烦事合在了一起。

这是什么

lightfeed/extractor 是一个 TypeScript 开源库。核心思路很直接:

  • 用 Playwright 处理真实网页(包括需要交互的页面)
  • 再用 LLM 按你给的 Schema 抽取结构化数据

它不是那种“只跑通 Demo”的玩具,文档里把 URL 清洗、JSON 恢复、token 控制这些生产里会踩的坑都考虑到了。

为什么我觉得值得发

我最近看到不少“AI 爬虫”项目,很多只停在概念层。这个项目相对务实,几个点比较实用:

  • 支持多模型(OpenAI/Gemini/Anthropic/Ollama 等)
  • 支持本地、无服务器、远程浏览器场景
  • 结果导向是结构化输出,不是只吐一段总结文本

如果你要做“每天稳定采集一批页面数据”,这种路线比纯提示词脚本更靠谱。

适合谁

  • 做数据采集/竞品监控的开发者
  • 在搭建 AI 工作流、RAG 前置清洗链路的人
  • 想把“网页内容 -> JSON”做成可复用模块的小团队

我自己的判断

优点:

  • 工程取向明显,离“能上线”更近
  • 与现有 LangChain 生态兼容,接入成本不高

限制:

  • 本质上还是 LLM 抽取,复杂页面上会有不稳定情况
  • 需要你自己定义好 Schema;Schema 设计差,结果也会飘
  • 如果目标站点反爬强,仍然要配代理和风控策略

链接

讨论

如果你已经在做网页抽取,你现在最头疼的是哪一步:页面可达性、字段准确率,还是成本控制?