---
title: nginx屏蔽垃圾无效蜘蛛
description: 屏蔽蜘蛛的爬取有两种方法,，一种是通过Robots协议，这个属于君子协定不具备绝对效力，另外一种就是通过服务器端的禁止了。
author: chaihongjun
category: operations
published: 2016-05-31
url: https://chaihongjun.me/operations/5.html
---

# nginx屏蔽垃圾无效蜘蛛

屏蔽蜘蛛的爬取有两种方法,，一种是通过Robots协议，这个属于君子协定不具备绝对效力，另外一种就是通过服务器端的禁止了。

![nginx屏蔽垃圾无效蜘蛛](https://chaihongjun.me/public/uploads/images/20240930/1727687849114673.jpg)

Robots协议：Robots协议（也称为爬虫协议、机器人协议等）的全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取，比如：
MDBLOCK0
Robots不是蜘蛛严格遵守，所以针对流氓蜘蛛需要使用第二种方法。

UA屏蔽：

服务器环境为Cenots+nginx,以此为例说明，在nginx的独立域名配置文件如下：
MDBLOCK1
#禁止Scrapy等工具的抓取agent_deny.conf的具体内容如下：
MDBLOCK2
如果有其他的User-agent想封锁，直接添加即可。

---

> 本文首发于 [chaihongjun.me | 柴宏俊 web 技术学习笔记](https://chaihongjun.me/operations/5.html)，采用 CC BY-NC-ND 4.0 协议，转载请保留出处与链接。
