ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

webclaw垂直提取器大全:Reddit/GitHub/YouTube/npm等30+网站一键变结构化JSON

webclaw垂直提取器大全:Reddit/GitHub/YouTube/npm等30+网站一键变结构化JSON webclaw垂直提取器大全Reddit/GitHub/YouTube/npm等30网站一键变结构化JSON【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclawwebclaw是一个用 Rust 编写的快速网页内容提取工具提供 CLI、REST API 和 MCP 服务器三种使用方式。它的杀手级功能之一就是垂直提取器Vertical Extractors丢一个 URL 进去直接返回针对 Reddit、GitHub、YouTube、npm、Stack Overflow 等 30 多个网站定制的结构化 JSON——帖子正文、嵌套评论树、视频时长、包下载量全部变成字段无需自己写选择器。为什么垂直提取器比通用 Markdown 更强普通爬虫包括 webclaw 自身的通用抓取返回的是 Markdown但很多场景你需要的是字段 要抓 Reddit 帖子 → 需要{ url, post, comments }的嵌套评论树带分数、作者、时间戳 要分析 npm 包 → 需要最新版本、依赖树、每周下载量、License 要采集 YouTube → 需要视频 ID、频道、播放量、时长、字幕轨道 URL垂直提取器把解析 HTML 的脏活封装好你只管调用。而且设计上优先走官方 JSON APIReddit、Hacker News、PyPI、npm、GitHub、HuggingFace 都有没有 API 的站点才回退到 HTML 解析稳定性和反爬友好度都更好——这一思路直接写在源码注释里extractors/mod.rs。30 垂直提取器完整清单webclaw 内置 30 个垂直提取器模块extractors/ 目录其中多个是通用型任意 Shopify 店铺、任意 WooCommerce 站点、任意带 Schema.org Product JSON-LD 的商品页实际覆盖的网站数量远超 30 个。提取器支持网站你能拿到的结构化数据redditReddit 帖子页帖子 嵌套评论树分数、作者、时间戳hackernewsHacker News帖子 嵌套评论树stackoverflowStack Overflow问题 答案、标签、投票、被采纳答案dev_todev.to文章正文 Markdown、标签、反应数、阅读时长substack_postSubstack正文、作者、出版物、付费墙状态linkedin_postLinkedIn 帖子正文、作者、配图走公开 embed 端点instagram_post/instagram_profileInstagram完整文案、作者、主页 12 条最新帖子数据github_repoGitHub 仓库Stars、Forks、Topics、License、默认分支github_prGitHub PR标题、状态、标签、新增/删除行数github_issueGitHub Issue状态、作者、标签、里程碑、评论数github_releaseGitHub ReleaseTag、发布说明、资产及下载次数npmnpm 包版本清单、依赖、每周下载量、LicensepypiPyPI 包最新版本、依赖、License、发布历史crates_iocrates.io最新版本、依赖、下载量、Licensedocker_hubDocker HubPull 数、Star 数、是否官方镜像huggingface_modelHuggingFace 模型下载量、License、pipeline 标签、文件列表huggingface_datasetHuggingFace 数据集下载量、License、语言、任务分类arxivArXiv 论文标题、作者、摘要、分类、PDF 地址youtube_videoYouTube 视频视频 ID、频道、播放量、时长、字幕轨道amazon_product亚马逊商品标题、品牌、价格、库存、评分、ASINebay_listingeBay 商品标题、价格、成色、卖家、运费、竞价信息etsy_listingEtsy 商品标题、价格、店铺、评分、图片shopify_product任意 Shopify 店铺商品标题、供应商、变体价格与库存shopify_collection任意 Shopify 店铺合集元数据 首屏商品列表woocommerce_product任意 WooCommerce 站点走 Store REST API 的商品数据ecommerce_product任意电商商品页解析 Schema.org JSON-LD价格、库存、评分trustpilot_reviewsTrustpilot综合评分、星级分布、近期评论、AI 摘要chronopostChronopost 物流当前状态、里程碑、完整扫描事件历史 完整目录随时可用webclaw extractors查看REST API 的/v1/extractors端点返回同样数据方便程序动态发现。三步上手从 URL 到结构化 JSON第 1 步安装 webclawgit clone https://gitcode.com/gh_mirrors/web/webclaw也可以走 Homebrew、Dockerdocker run --rm ghcr.io/0xmassi/webclaw url或预编译二进制详见 README.md。第 2 步列出所有垂直提取器webclaw extractors每个条目包含稳定的name用于第 3 步调用、人类可读标签、一行说明以及它声明的 URL 模式。第 3 步按名称运行提取器webclaw vertical reddit https://www.reddit.com/r/rust/comments/abc123/my_post/返回的就是带类型的 JSON字段与目标站点一一对应--raw可输出单行紧凑格式。CLI 命令定义见 main.rs。不用记名字自动检测兜底REST API 的/v1/scrape路由在调用方没指定垂直时会走 dispatch_by_url()按目录顺序依次询问每个提取器的matches()第一个认领该 URL 的提取器胜出。比如reddit提取器会拦截任何/r/*/comments/*的链接见 reddit.rs然后自动转到old.reddit.com抓取服务端渲染的稳定 HTML。高频提取器实测返回字段速览以 youtube_video.rs 为例一个视频 URL 换回video id · 标题 · 频道 · 播放量 · 时长 · 上传日期 · 缩略图 · 关键词 · 字幕轨道 URL再比如substack_post正文 HTML、副标题、作者、付费墙状态API 限流时自动回退 OG JSON-LD 解析️shopify_product通过任意 Shopify 店铺的公开/products/{handle}.json端点拿到变体级价格与库存⭐trustpilot_reviews综合评分 星级分布 官方 AI 摘要做竞品口碑监控很顺手适合什么场景场景用法给 LLM / RAG 喂结构化数据垂直 JSON 字段直接入库省去二次解析竞品监控批量抓商品页价格、评分、库存变化社区情报分析Reddit / HN / SO 评论树一次性拿全开发者生态统计npm / PyPI / crates.io / Docker Hub 元数据批量采集学术论文管道ArXiv HuggingFace 数据集/模型元数据入库源码与文档索引提取器目录与自动分发逻辑crates/webclaw-fetch/src/extractors/mod.rs单个提取器实现参考reddit.rs、youtube_video.rs、npm.rsCLI 命令extractors/verticalcrates/webclaw-cli/src/main.rs快速上手与输出格式说明README.md小结webclaw 的垂直提取器把每个网站解析方式都不同的痛苦收敛成了 30 个开箱即用的模块一条命令、一份类型化 JSON本地运行、无需 API Key少数强反爬站点如亚马逊需云端支持。做 RAG 管道、竞品监控还是社区分析它都能让你把精力花在数据本身而不是写 XPath 上。【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表