大众点评爬虫怎么用写给新手的 8 分钟上手笔记【免费下载链接】dianping_spider大众点评爬虫全站可爬解决动态字体加密非OCR。持续更新项目地址: https://gitcode.com/gh_mirrors/di/dianping_spider上周五晚上十点半同事小周还在工位上一个一个复制粘贴店铺数据。老板要一份「周边 5 公里自助餐」的分析报告他手动翻了 20 页搜索结果手机和电脑来回切换还撞上了大众点评的动态字体加密——页面显示的「人均 158 元」复制出来全是一堆乱码数字。如果你也遇到过类似的场景那这篇笔记就是为你写的。dianping_spider 是一个专注大众点评数据采集的开源爬虫内置动态字体加密破解非 OCR可爬搜索页、详情页和评论页配合 Cookie 池和 IP 代理实现全站稳定采集。接下来我会用最直白的方式带你从零跑到第一次成功出数据。一、三分钟看懂这个项目先来一轮快问快答帮你快速建立全局认知。它是什么一个用 Python 3 写的大众点评爬虫程序核心亮点是破解了点评的动态字体反爬不需要 OCR 识别直接拿到正确文字。由于大众点评反爬极严项目内置了 Cookie 池、IP 代理、请求频率控制等防封手段。它能做什么按「搜索 → 详情 → 评论」三个模块采集数据结果写入 MongoDB搜索模块店铺 id、店名、评论总数、人均价格、地址、评分、标签详情模块地址、电话、营业时间、评分明细评论模块用户打分、评论内容、点赞数、回复数、发布时间它适合谁做竞品分析的市场人员、做用户研究的分析师、想练手反爬破解的 Python 开发者。项目把 30 多个配置参数都做成了可选项大部分保持默认就能跑新手也能按图索骥。二、三步走从零到第一次成功运行别被「参数多」吓到跟着这三步走十分钟内就能看到数据落库。第 1 步克隆代码并安装依赖git clone https://gitcode.com/gh_mirrors/di/dianping_spider cd dianping_spider pip install -r requirements.txt下载慢的话可以加清华镜像源pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple第 2 步改两个配置文件打开config.ini找到[detail]段把关键词和城市换成你想要的[detail] keyword 自助餐 location_id 8 need_pages 2再打开require.ini决定这次要采什么数据[shop_review] need True more_detail True need_pages 3第 3 步运行主程序python main.py看到控制台滚动日志最后提示数据保存完成就说明跑通了。默认数据落在 MongoDB 里打开mongosh或 Compass 就能看到采集结果。如果你想跳过搜索、只采某一家店的详情或评论main.py也支持命令行定制python main.py --normal 0 --detail 1 --review 0 --shop_id k30YbaScPKFS0hfP --need_more False三、关键配置速查照着抄就行以下是最常用的参数清单标注了默认值与含义先跑通再优化。config.ini 核心参数参数默认值含义use_cookie_poolFalse是否启用 Cookie 池开启后读取 cookies.txt 轮换Cookie示例值浏览器登录后复制的 Cookie注意大写方便直接粘贴uuid / tcv示例值加密接口凭证获取方法见 docs/json.mdsave_modemongo保存方式目前仅支持 mongomongo_path空MongoDB 地址本地默认端口可不填requests_times1,2;3,5;10,50每请求 N 次休息 M 秒用分号分隔多组keyword自助餐搜索关键词location_id8城市代码如上海 1、北京 2、广州 4need_pages5搜索页数建议新手先设 1~2use_proxyFalse是否使用 IP 代理require.ini 爬取策略参数默认值含义shop_phone.needTrue是否采店铺电话shop_phone.need_detailFalse电话是否要完整号码否则末两位打码shop_review.needFalse是否采评论shop_review.more_detailFalse是否采更多评论否则只有 10 条精选shop_review.need_pages4评论页数每页 30 条shop_location.needFalse是否采经纬度常用城市代码速查上海 1、北京 2、杭州 3、广州 4、南京 5、苏州 6、深圳 7、成都 8、重庆 9、大连 19。完整城市列表见 docs/location.md。四、避坑锦囊新手最常踩的 5 个坑我整理了 docs/problems.md 里出现频率最高的几个问题帮你提前排雷。坑 1复制 Cookie 复制不完整浏览器超长的 Cookie 会被折叠成省略号导致报UnicodeEncodeError。对策展开完整 Cookie 后再复制别漏字符。坑 2一运行就弹人机验证链接这是触发验证码了。对策点开日志里的链接手动过一下验证非代理模式下更常见注意控制请求频率。坑 3日志提示「详情页请求被 ban」说明频率太高被临时限制。对策调大requests_times比如改成1,5;3,10;10,50然后等解封也可以先用代理。坑 4uuid / tcv 填错加密接口会一直报「替换 tsv 和 uuid」。对策按 docs/json.md 的截图步骤从浏览器 Network 面板重新复制这两个参数。坑 5程序跑完却没数据多半是 MongoDB 没启动或mongo_path没配。对策浏览器访问127.0.0.1:27017看到提示文字即代表服务正常。五、真实应用场景帮朋友分析城市自助餐竞争格局朋友小吴准备在大连开一家自助餐厅想知道哪条街竞争最激烈、同行口碑如何。我们用它跑了一次完整流程。第一步config.ini里把keyword设为「自助餐」location_id设为 19大连need_pages设为 3。第二步require.ini打开评论采集。第三步python main.py跑完MongoDB 里已经躺着 30 家店的搜索结果、详情和上千条评论。搜索结果页给出了店名、人均、评分、地址一眼就能看出商圈分布详情页补全了电话、营业时间和评分维度评论数据包含打分、内容和点赞数后续做情感分析完全够用最后把评论导出来做词云高频词集中在「食材新鲜」「环境好」「排队久」正好帮小吴确定了差异化方向——这比手动翻 50 个页面高效太多。六、延伸学习入口跑通只是起点想深入可以按这几条线走官方文档docs/ 目录下有 7 篇说明覆盖 Cookie 池cookie_pool.md、代理配置proxy.md、加密接口json.md、数据规约data.md、常见问题problems.md源码入口function/ 是搜索、详情、评论三个采集模块utils/ 是配置、请求、存储等基础设施浏览器插件js/ 目录提供了一个油猴脚本配合使用体验更佳定制采集需要单店详情或评论时参考 main.py 的--normal 0系列命令行参数七、写在最后数据采集这件事最难的不是写代码而是处理那些看不见的反爬细节。dianping_spider 已经帮你把最硬的骨头——动态字体加密——啃下来了剩下的就是把配置填对、把频率控制好。现在就打开终端clone 下来跑一遍让第一份数据落库你会发现自己离「用数据做决策」只差这一小步。【免费下载链接】dianping_spider大众点评爬虫全站可爬解决动态字体加密非OCR。持续更新项目地址: https://gitcode.com/gh_mirrors/di/dianping_spider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考