ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Instagram 数据爬取教程:一条命令拿到粉丝数与帖子标签,无需登录

Instagram 数据爬取教程:一条命令拿到粉丝数与帖子标签,无需登录 Instagram 数据爬取教程一条命令拿到粉丝数与帖子标签无需登录【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl如果你需要持续记录 Instagram 主页的数据instagram-profilecrawl 是一个现成的工具在命令行传入账号名它会自动打开浏览器采集目标主页的粉丝数、关注数、帖子点赞数、评论数和话题标签并写成结构化文件。一条命令、无需登录、自动落盘交付物是每账号一份 JSON 快照和一份按时间累积的 stats.csv可直接接进你的分析流程。动手前先看清能采什么、输出什么采集的数据输出到哪里粉丝数、关注数、帖子数、简介、头像profiles/目录下每账号一份 JSON每篇帖子的文案、点赞、评论、标签、地点、图片链接同一份 JSON 文件评论过帖子的用户名profiles/下的*_commenters.txt按评论频次排序粉丝增长记录stats.csv由 log_stats.py 生成帖子图片images/用户名/由 extract_image.py 下载一句话你报账号名它驱动浏览器去访问把结构化结果写进磁盘。采集逻辑在 util/extractor.py 和 util/extractor_posts.py想深入再看这两个文件。三步拿到第一个结果第 1 步克隆仓库并安装依赖目标本机有一份可运行的项目。# 克隆项目并安装 python 依赖selenium、requests 等 git clone https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl cd instagram-profilecrawl pip install -r requirements.txt怎么算成功终端无报错项目目录里能看到util和assets两个文件夹。第 2 步准备浏览器驱动目标驱动真实浏览器的 chromedriver 就位。从 Chromedriver 官方站下载与你系统匹配的版本改名为chromedriver_linux、chromedriver_windows或chromedriver_osx按你的系统选放进项目assets/目录util/chromedriver.py 会从这里自动加载。怎么算成功ls assets/能看到带系统后缀的 chromedriver 文件。第 3 步跑第一次爬取目标生成第一个 JSON 文件。# 把账号名作为参数传入一次可传多个 python3.7 crawl_profile.py instagram怎么算成功终端出现 Finished 后ls profiles/能看到带时间戳的账号 JSON 和*_commenters.txt。最常调的三个开关帖子量与采集速度都在 util/settings.py是类属性运行前在脚本里赋值即可不用改源码参数作用何时调limit_amount单账号最多采集的帖子数默认 1000大号想覆盖更多历史帖子时调大sleep_time_between_post_scroll每次滚动加载帖子的间隔秒默认 14.5弱网、日志出现 breaking in 4 停更时调大sleep_time_between_comment_loading加载评论的间隔秒默认 1.5评论加载不稳定或超时提醒间隔直接决定页面请求节奏采得太快更容易触发平台风控中途卡住先把间隔调大再改代码。想要更多三种玩法登录、定时、自动出报表玩法一用登录账号采集关注者列表症状默认只拿得到公开主页数据想抓关注者名单或已关注的私密账号需要登录。操作把.env.example复制为.env填入IG_USERNAME和IG_PASSWORD再在运行前给Settings.scrape_follower True默认False。结果运行后 JSON 的 followers 字段会附带名单建议用小号并保持低频。玩法二crontab 定时无人值守症状想让机器每天自动抓一次人不用碰。操作crontab -e加两条计划统计任务排在爬取之后几分钟命令见第 3 节# 每天 03:00 爬取03:05 写入 stats.csv 0 3 * * * cd /path/to/instagram-profilecrawl python3 crawl_profile.py target_user crawl_log.txt 21 5 3 * * * cd /path/to/instagram-profilecrawl python3 log_stats.py -u target_user stats_log.txt 21结果每天profiles/多一份新 JSONstats.csv多一行。树莓派等无图形界面的 ARM 设备改用 quickstart_templates/crawl_profile_pi.py它基于 Firefox 加虚拟显示装好pyvirtualdisplay即可跑。玩法三自动出增长报表症状JSON 是单次快照想看粉丝数随时间怎么变需要汇总。操作每次爬取完成后执行# -u 指定账号不传则统计 profiles 下全部账号 python3 log_stats.py -u target_user结果stats.csv追加时间、粉丝、关注、帖子数、点赞、评论一行并把该 JSON 移入profiles/done/防止重复计数。想本地备份帖子图片再跑python3.7 extract_image.py profiles图片落在images/用户名/。报错了看这张表症状可能原因解决一启动就报 chromedriver 相关异常驱动缺失或与浏览器版本不匹配下载匹配版本放入assets/并带系统后缀中途卡住日志出现 breaking in 4间隔太短页面还没加载完把sleep_time_between_post_scroll从 14.5 加到 25登录后仍抓不到关注者开关没开或账号未关注目标确认Settings.scrape_follower True且登录账号已关注特定账号报 404 / 无私密页账号是私密主页私密账号需登录账号已关注它才能访问下一步做什么手动翻页抄数的活儿到此结束一条命令出结构化数据crontab 接管时间维度stats.csv就是你现成的增长曲线。过一遍 util/settings.py 的全部开关按需打开评论、点赞用户等字段看 quickstart_templates/ 下的模板学习在代码里定制爬取逻辑把stats.csv接到你的图表工具画出第一张增长曲线现在就去跑第 3 节那条命令今晚拿到你的第一个 JSON。【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表