spider-ads请问这是什么蜘蛛
发布网友
发布时间:2022-12-24 16:18
我来回答
共1个回答
热心网友
时间:2023-10-09 13:29
Baispider是百度搜索引擎的一个自动程序,它的作用是访问互联网上的网页,建立索引数据库,使用户能在百度搜索引擎中搜索到您网站上的网页。
百度各个产品使用不同的user-agent:
产品名称
对应user-agent
无线搜索 Baispider
图片搜索 Baispider-image
视频搜索 Baispider-video
新闻搜索 Baispider-news
百度搜藏 Baispider-favo
百度联盟 Baispider-cpro
商务搜索 Baispider-ads
网页以及其他搜索 Baispider
另外还有一种比较特殊的+Transcoder,这个其实不是蜘蛛,是用户通过手机百度访问网站时,百度对网站进行了抓取后转码的工具。
如何判断是否伪造百度蜘蛛?
在linux平台下,您可以使用host ip命令反解ip来判断是否来自Baispider的抓取。Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名,非 *.baidu.com 或 *..jp 即为冒充。
host 123.125.66.120
120.66.125.123.in-addr.arpa domain name pointer
spider-123-125-66-120.crawl.baidu.com.
host 119.63.195.254
254.195.63.119.in-addr.arpa domain name pointer
BaiModer-119-63-195-254.crawl..jp.
在windows平台或者IBM OS/2平台下,您可以使用nslookup ip命令反解ip来 判断是否来自Baispider的抓取。打开命令处理器 输入nslookup xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baispider的抓取,Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名,非 *.baidu.com 或 *..jp 即为冒充。
在mac os平台下,您可以使用dig 命令反解ip来 判断是否来自Baispider的抓取。打开命令处理器 输入dig xxx.xxx.xxx.xxx(IP地 址)就能解析ip,来判断是否来自Baispider的抓取,Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名,非 *.baidu.com 或 *..jp 即为冒充。
如何禁止百度蜘蛛抓取网站?
您可以根据各产品不同的user-agent设置不同的抓取规则,如果您想完全禁止百度所有的产品收录,可以直接对Baispider设置禁止抓取。
以下robots实现禁止所有来自百度的抓取:
User-agent: Baispider
Disallow: /
以下robots实现禁止所有来自百度的抓取但允许图片搜索抓取/image/目录:
User-agent: Baispider
Disallow: /
User-agent: Baispider-image
Allow: /image/
请注意:Baispider-cpro抓取的网页并不会建入索引,只是执行与客户约定的操作,所以不遵守robots协议,如果Baispider-cpro给您造成了困扰,请联系union1@.com。
如何禁止百度保存网站快照?
Baispider遵守互联网meta robots协议。您可以利用网页meta的设置,使百度显示只对该网页建索引,但并不在搜索结果中显示该网页的快照。禁止快照代码在这里。
和robots的更新一样,因为搜索引擎索引数据库的更新需要时间,所以虽然您已经在网页中通过meta禁止了百度在搜索结果中显示该网页的快照,但百度搜索引擎数据库中如果已经建立了网页索引信息,可能需要二至四周才会在线上生效