先说结论:如果你最近在做信息采集、竞品监控、内容聚合,这个项目值得收藏。它把“抓网页 + 结构化抽取”这两件麻烦事合在了一起。
这是什么
lightfeed/extractor 是一个 TypeScript 开源库。核心思路很直接:
- 用 Playwright 处理真实网页(包括需要交互的页面)
- 再用 LLM 按你给的 Schema 抽取结构化数据
它不是那种“只跑通 Demo”的玩具,文档里把 URL 清洗、JSON 恢复、token 控制这些生产里会踩的坑都考虑到了。
为什么我觉得值得发
我最近看到不少“AI 爬虫”项目,很多只停在概念层。这个项目相对务实,几个点比较实用:
- 支持多模型(OpenAI/Gemini/Anthropic/Ollama 等)
- 支持本地、无服务器、远程浏览器场景
- 结果导向是结构化输出,不是只吐一段总结文本
如果你要做“每天稳定采集一批页面数据”,这种路线比纯提示词脚本更靠谱。
适合谁
- 做数据采集/竞品监控的开发者
- 在搭建 AI 工作流、RAG 前置清洗链路的人
- 想把“网页内容 -> JSON”做成可复用模块的小团队
我自己的判断
优点:
- 工程取向明显,离“能上线”更近
- 与现有 LangChain 生态兼容,接入成本不高
限制:
- 本质上还是 LLM 抽取,复杂页面上会有不稳定情况
- 需要你自己定义好 Schema;Schema 设计差,结果也会飘
- 如果目标站点反爬强,仍然要配代理和风控策略
链接
- 项目主页:GitHub - lightfeed/extractor: Using LLMs and AI browser automation to robustly extract web data · GitHub
- NPM:https://www.npmjs.com/package/@lightfeed/extractor
讨论
如果你已经在做网页抽取,你现在最头疼的是哪一步:页面可达性、字段准确率,还是成本控制?