ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

OpenCLI Internet Archive Adapter 实战:馆藏全文搜索、元数据查询与 Wayback Machine 快照回溯

OpenCLI Internet Archive Adapter 实战:馆藏全文搜索、元数据查询与 Wayback Machine 快照回溯 OpenCLI Internet Archive Adapter 实战馆藏全文搜索、元数据查询与 Wayback Machine 快照回溯【免费下载链接】OpenCLIMake Any Website into CLI Use your logged-in browser by AI agent.项目地址: https://gitcode.com/gh_mirrors/ope/OpenCLI导读archive是 OpenCLI 中面向 Internet Archivearchive.org的公开只读适配器提供 4 条命令馆藏全文搜索、单条目元数据查询、Wayback Machine 最近快照定位与 CDX 快照历史列举。本指南将带你完整掌握每条命令的参数、输出列、API 底层调用链与错误语义并解释identifier、snapshot_url在命令间的可往返round-trip设计方便你将其直接接入 AI Agent 的工作流完成资料考古、文献溯源与网页历史取证等任务。适配器概览公开模式、免浏览器、纯 API根据文档定义archive适配器的基本属性如下模式 Public公开Strategy.PUBLIC域名archive.org前置条件无需浏览器不依赖任何登录态全部基于 archive.org 公开 APIAdvanced Search、Metadata、Wayback Available、CDX。从源码 clis/archive/search.js 等文件的注册声明可见四个命令统一满足strategy: Strategy.PUBLIC、browser: false、access: read、domain: archive.org。测试 clis/archive/archive.test.js 也逐一断言了这组契约。因此该适配器非常适合在无头headless环境下由 Agent 直接调用不需要 Cookie、登录或浏览器会话。命令总览如下命令说明opencli archive search query跨图书、电影、音频、软件、网页等 mediatype 的馆藏全文搜索opencli archive item identifier按 identifier 获取单个馆藏条目的元数据opencli archive wayback url查询某个 URL 最近的 Wayback Machine 快照opencli archive snapshots url通过 CDX API 列出某个 URL 随时间变化的快照历史search跨馆藏全文搜索基本用法# 全 mediatype 搜索默认按下载量排序 opencli archive search machine learning --limit 10 # 限定 mediatype opencli archive search newton principia --mediatype texts --limit 5 opencli archive search moon landing --mediatype movies --sort date --limit 5 # JSON 输出 opencli archive search machine learning -f json参数表参数说明query位置参数必填全文查询词匹配 title、description、creator、subject 字段--mediatype取值texts/movies/audio/software/image/web/data/collection--sortdownloads默认/date/addeddate/week/title--limit最大返回条数1–100默认 20输出列rank, identifier, title, creator, date, mediatype, downloads, url其中identifier可直接往返进入opencli archive item identifierurl形如https://archive.org/details/identifier。源码级实现细节从 clis/archive/search.js 可以看到三组内部常量SORT_OPTIONS [downloads, date, addeddate, week, title]SORT_ALIAS { added: addeddate, published: date }——即你传--sort added会被自动归一化为addeddate传--sort published会归一化为date这是文档未展开、源码补充的能力MEDIATYPES [texts, movies, audio, software, image, web, data, collection]。参数校验search.js非常严格sort 与 mediatype 不在白名单内直接抛ArgumentErrorlimit必须为正整数且 ≤ 100否则在发起网络请求之前就失败——测试 archive.test.js 验证了这些零请求即报错的行为。带 mediatype 时查询词会被构造成布尔查询(${query}) AND mediatype:${args.mediatype}search.js例如(machine learning) AND mediatype:texts。请求端点为https://archive.org/advancedsearch.php携带outputjson、rowslimit、sort[]sort desc并显式声明fl[]字段列表identifier、title、creator、date、mediatype、downloadssearch.js。响应处理方面search.js若response.docs不是数组则抛CommandExecutionError空结果映射为EmptyResultError测试见 archive.test.js每一行都校验identifier必须匹配/^[A-Za-z0-9._-]$/防止输出脏数据creator是数组时用,拼接date截取前 10 位YYYY-MM-DDdownloads强制转为数值。item按 identifier 获取条目元数据基本用法opencli archive item open-syllabus opencli archive item FinalFantasy2_356参数与输出参数说明identifier位置参数必填馆藏条目标识符仅允许字母、数字、.、_、-输出单行identifier, title, creator, date, mediatype, collection, description, file_count, url。源码级实现细节实现位于 clis/archive/item.js。identifier 在发起请求前即被校验非空 正则/^[A-Za-z0-9._-]$/item.js非法输入如空串、../secret直接抛ArgumentError测试见 archive.test.js。请求端点为https://archive.org/metadata/identifieritem.js。关键处理逻辑Metadata 端点对缺失或暗藏dark条目返回空对象{}此时映射为EmptyResultErroritem.js测试见 archive.test.js响应中的metadata.identifier必须与请求的 identifier 完全一致否则判定为畸形响应抛CommandExecutionErroritem.js防止出现张冠李戴的数据creator、collection数组用,拼接description数组用空格拼接file_count取自响应files数组的长度item.js。wayback定位最近的网页快照基本用法# 默认返回最近一次快照 opencli archive wayback wikipedia.org # 靠近指定时间点 opencli archive wayback wikipedia.org --timestamp 2015 opencli archive wayback wikipedia.org --timestamp 2015-03-01参数与输出参数说明url位置参数必填要查询的 URL带不带协议头均可--timestamp目标时间戳格式YYYY[MM[DD[hh[mm[ss]]]]]或 ISO 日期缺省时取最近的快照输出单行original_url, requested_timestamp, snapshot_timestamp, snapshot_url, status。其中snapshot_url可直接往返进入普通浏览器抓取形如https://web.archive.org/web/timestamp/url。源码级实现细节实现位于 clis/archive/wayback.js。时间戳归一化函数normalizeTimestampwayback.js会先剥离所有非数字字符再校验结果匹配/^\d{4,14}$/长度必须为 414 位且若非 4 位则长度必须为偶数。因此2015、201503、20150301、2015-03-01、2015-03-01T03:04:05都是合法输入统一被归一化为纯数字串如20150301030405。非法输入如202在请求前即抛ArgumentError。请求端点为https://archive.org/wayback/available仅在有--timestamp时追加该参数wayback.js。响应取自archived_snapshots.closest节点若closest缺失或available为 false映射为EmptyResultError若快照缺url或timestamp不是 14 位数字抛CommandExecutionErrorwayback.js输出行的requested_timestamp即你传入归一化后的目标时间snapshot_timestamp是命中快照的真实时间。测试 archive.test.js 覆盖了 ISO 时间归一化、无快照 vs 畸形快照的区分等场景。snapshots通过 CDX API 回溯快照历史基本用法# 默认最近 20 条快照 opencli archive snapshots wikipedia.org --limit 20 # 限定时间范围 opencli archive snapshots wikipedia.org --from 2010 --to 2015 --limit 50参数与输出参数说明url位置参数必填要查询的 URL带不带协议头均可--from最早时间戳纯数字YYYY[MM[DD[hh[mm[ss]]]]]--to最晚时间戳格式同上--limit最大快照条数1–1000默认 20输出行timestamp, snapshot_url, status, mimetype, original_url。每条snapshot_url都是指向https://web.archive.org/web/timestamp/original的 Wayback Machine 直接永久链接permalink。源码级实现细节含 HTTP/HTTPS 陷阱实现位于 clis/archive/snapshots.js。这里有一个文档明确标注的坑CDX 端点仅通过 HTTP 提供HTTPS 端点在实践中返回 503。源码正是这么做的——请求 URL 硬编码为http://web.archive.org/cdx/search/cdxsnapshots.js测试 archive.test.js 也断言了url.protocol http:。其他实现要点limit上限 1000、必须为正整数from/to必须是纯数字时间戳/^\d{4,14}$/带-的 ISO 形式在此命令不被接受snapshots.js测试见 archive.test.jsCDX 返回数组的数组结构首行是表头urlkey, timestamp, original, mimetype, statuscode等后续行是数据。源码按列名建索引requireCdxColumn缺失必需列时抛CommandExecutionErrorsnapshots.js仅返回表头而无数据行时映射为EmptyResultErrorsnapshots.js每行要求timestamp为 14 位数字且original非空同时statuscode、mimetype不得为空否则抛CommandExecutionErrorsnapshots.js。错误语义与可观测性三层 Typed Error 设计四个命令共用了 OpenCLI 统一的错误体系来自jackwener/opencli/errors这使 Agent 可以精确区分失败原因并采取不同策略错误类型含义典型触发场景ArgumentError参数非法请求前即失败mediatype/sort 不在白名单、limit 越界、identifier 含非法字符、时间戳格式错误EmptyResultErrorAPI 正常返回但结果为空搜索无命中、条目无公开元数据、URL 无快照、CDX 无数据行CommandExecutionError网络失败 / HTTP 非 2xx / 响应畸形fetch 异常、HTTP 503、JSON 解析失败、identifier 身份不匹配、CDX 缺列测试 archive.test.js 用大量用例验证了这三类错误的精确区分例如畸形 search 载荷不得输出空 identifierarchive.test.js、区分无快照与畸形快照archive.test.js。Agent 集成时可据此决定是修正入参、继续下一步还是切换数据源。Agent 实战串联一条完整的资料考古链路结合命令间的 round-trip 设计可以将四条命令串成一条自动化链路opencli archive search 卡尔·萨根 宇宙 --mediatype texts -f json全文检索找到候选馆藏取结果中的identifier执行opencli archive item identifier获取完整元数据描述、所属 collection、文件数对候选网页执行opencli archive snapshots url --from 2010 --to 2015了解该网页在历史上的抓取密度执行opencli archive wayback url --timestamp 目标时间拿到离目标时间最近的快照snapshot_url交由浏览器或其他下载器直接抓取。由于所有命令均为browser: false的公开只读调用不占用浏览器会话Agent 可以无风险地批量执行并将 JSON 输出-f json直接交给下游解析。该适配器在仓库中的完整实现位于 clis/archive/文档见 docs/adapters/browser/archive.md测试见 clis/archive/archive.test.js可继续深入阅读。【免费下载链接】OpenCLIMake Any Website into CLI Use your logged-in browser by AI agent.项目地址: https://gitcode.com/gh_mirrors/ope/OpenCLI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表