spider-ads请问这是什么蜘蛛

发布网友发布时间：2022-12-24 16:18

共1个回答

热心网友时间：2023-10-09 13:29

Baispider是百度搜索引擎的一个自动程序，它的作用是访问互联网上的网页，建立索引数据库，使用户能在百度搜索引擎中搜索到您网站上的网页。
百度各个产品使用不同的user-agent：

产品名称
对应user-agent

无线搜索 Baispider
图片搜索 Baispider-image
视频搜索 Baispider-video
新闻搜索 Baispider-news
百度搜藏 Baispider-favo
百度联盟 Baispider-cpro
商务搜索 Baispider-ads
网页以及其他搜索 Baispider
另外还有一种比较特殊的+Transcoder，这个其实不是蜘蛛，是用户通过手机百度访问网站时，百度对网站进行了抓取后转码的工具。
如何判断是否伪造百度蜘蛛？
在linux平台下，您可以使用host ip命令反解ip来判断是否来自Baispider的抓取。Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名，非 *.baidu.com 或 *..jp 即为冒充。
host 123.125.66.120
120.66.125.123.in-addr.arpa domain name pointer
spider-123-125-66-120.crawl.baidu.com.
host 119.63.195.254
254.195.63.119.in-addr.arpa domain name pointer
BaiModer-119-63-195-254.crawl..jp.
在windows平台或者IBM OS/2平台下，您可以使用nslookup ip命令反解ip来判断是否来自Baispider的抓取。打开命令处理器输入nslookup xxx.xxx.xxx.xxx（IP地址）就能解析ip，来判断是否来自Baispider的抓取，Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名，非 *.baidu.com 或 *..jp 即为冒充。
在mac os平台下，您可以使用dig 命令反解ip来判断是否来自Baispider的抓取。打开命令处理器输入dig xxx.xxx.xxx.xxx（IP地址）就能解析ip，来判断是否来自Baispider的抓取，Baispider的hostname以 *.baidu.com 或 *..jp 的格式命名，非 *.baidu.com 或 *..jp 即为冒充。
如何禁止百度蜘蛛抓取网站？
您可以根据各产品不同的user-agent设置不同的抓取规则，如果您想完全禁止百度所有的产品收录，可以直接对Baispider设置禁止抓取。
以下robots实现禁止所有来自百度的抓取：
User-agent: Baispider
Disallow: /

以下robots实现禁止所有来自百度的抓取但允许图片搜索抓取/image/目录：
User-agent: Baispider
Disallow: /
User-agent: Baispider-image
Allow: /image/
请注意：Baispider-cpro抓取的网页并不会建入索引，只是执行与客户约定的操作，所以不遵守robots协议，如果Baispider-cpro给您造成了困扰，请联系union1@.com。
如何禁止百度保存网站快照？
Baispider遵守互联网meta robots协议。您可以利用网页meta的设置，使百度显示只对该网页建索引，但并不在搜索结果中显示该网页的快照。禁止快照代码在这里。
和robots的更新一样，因为搜索引擎索引数据库的更新需要时间，所以虽然您已经在网页中通过meta禁止了百度在搜索结果中显示该网页的快照，但百度搜索引擎数据库中如果已经建立了网页索引信息，可能需要二至四周才会在线上生效