最近分析客户的网站日志发现一个奇怪的现象:一直以为是没有蜘蛛爬行,大家看看日志:
#Software: Microsoft Internet Information Services 6.0
#Version: 1.0
#Date: 2011-06-30 00:06:54
#Fields: time cs-method cs-uri-stem c-ip sc-status sc-bytes cs-bytes
00:06:53 GET /ch/NewsView.asp 119.128.39.201 200 17036 591
00:06:53 GET /ch/NewsView.asp 119.128.39.201 200 16805 591
00:06:56 GET /ch/HitCount.asp 119.128.39.201 200 151 636
00:06:56 GET /ch/HitCount.asp 119.128.39.201 200 170 623
00:06:56 GET /ch/HitCount.asp 119.128.39.201 200 170 623
00:06:58 GET /ch/HitCount.asp 119.128.39.201 200 151 636
00:06:58 GET /favicon.ico 119.128.39.201 404 1445 289
00:07:05 GET /favicon.ico 119.128.39.201 404 1445 289
00:14:08 GET /robots.txt 61.135.249.207 200 315 155
00:14:08 GET /gsls.mp3 218.75.103.10 404 0 167
00:14:08 GET /tech.asp 61.135.249.207 404 1445 305
00:15:04 GET /tech.asp 61.135.249.207 404 1445 361
00:15:40 GET /robots.txt 220.181.125.43 304 247 124
00:15:58 GET /gsls.mp3 218.75.103.10 404 0 167
00:16:01 GET /tech.asp 61.135.249.207 404 1445 361
但是仔细分析发现并不是这样,www.gdhaoyou.com还有www.dgmengxing.com这2个网站很都是相同的结果,没有显示到底是百度蜘蛛还是google蜘蛛,所以很麻烦,其实这个原因就是虚拟主机为了节约CPU资源,不开启logfile日志功能,这个非常的不爽,所以我把供应商狠狠的批驳了一顿,要求开通日志来路分析功能就可以了!
很多的主机商不开通怎么办?那么只能人工分析IP了下面提供网上搜集来的蜘蛛IP段:
各类蜘蛛IP收集,不一定完全准确。
序号 IP 注释
1 202.106.186.* 163蜘蛛
2 202.108.36.* 163蜘蛛
3 202.108.44.* 163蜘蛛
4 202.108.45.* 163蜘蛛
5 202.108.5.* 163蜘蛛
6 202.108.9.* 163蜘蛛
7 220.181.12.* 163蜘蛛
8 220.181.13.* 163蜘蛛
9 220.181.14.* 163蜘蛛
10 220.181.15.* 163蜘蛛
11 220.181.28.* 163蜘蛛
12 220.181.31.* 163蜘蛛
13 222.185.245.* 163蜘蛛
14 202.165.100.* 3721蜘蛛
15 220.181.19.* 百度蜘蛛
16 159.226.50.* 百度蜘蛛
17 202.108.11.* 百度蜘蛛
18 202.108.22.* 百度蜘蛛
19 202.108.23.* 百度蜘蛛
20 202.108.249.* 百度蜘蛛
21 202.108.250.* 百度蜘蛛
22 61.135.145.* 百度蜘蛛
23 61.135.146.* 百度蜘蛛
24 64.124.85.* become.com
25 61.151.243.* china蜘蛛
26 202.165.96.* gais.cs.ccu.edu.tw
27 216.239.33.* google蜘蛛
28 216.239.35.* google蜘蛛
29 216.239.37.* google蜘蛛
30 216.239.39.* google蜘蛛
31 216.239.51.* google蜘蛛
32 216.239.53.* google蜘蛛
33 216.239.55.* google蜘蛛
34 216.239.57.* google蜘蛛
35 216.239.59.* google蜘蛛
36 64.233.161.* google蜘蛛
37 64.233.189.* google蜘蛛
38 66.102.11.* google蜘蛛
39 66.102.7.* google蜘蛛
40 66.102.9.* google蜘蛛
41 66.249.64.* google蜘蛛
42 66.249.65.* google蜘蛛
43 66.249.66.* google蜘蛛
44 66.249.71.* google蜘蛛
45 66.249.72.* google蜘蛛
46 72.14.207.* google蜘蛛
47 61.135.152.* iask蜘蛛
48 65.54.188.* msn蜘蛛
49 65.54.225.* msn蜘蛛
50 65.54.226.* msn蜘蛛
51 65.54.228.* msn蜘蛛
52 65.54.229.* msn蜘蛛
53 207.46.98.* msn蜘蛛
54 207.68.157.* msn蜘蛛
55 194.224.199.* noxtrumbot
56 220.181.8.* Outfox
57 221.239.209.* Outfox
58 217.212.224.* psbot
59 219.133.40.* QQ蜘蛛
60 202.96.170.* QQ蜘蛛
61 202.104.129.* QQ蜘蛛
62 61.135.157.* QQ蜘蛛
63 219.142.118.* sina蜘蛛
64 219.142.78.* sina蜘蛛
65 61.135.132.* sohu蜘蛛
66 220.181.26.* sohu蜘蛛
220.181.19.*
67 61.135.158.* tom蜘蛛
68 66.196.90.* yahoo蜘蛛
69 66.196.91.* yahoo蜘蛛
70 68.142.249.* yahoo蜘蛛
71 68.142.250.* yahoo蜘蛛
72 68.142.251.* yahoo蜘蛛
73 202.165.102.* yahoo中国蜘蛛
74 202.160.178.* yahoo中国蜘蛛
75 202.160.179.* yahoo中国蜘蛛
76 202.160.180.* yahoo中国蜘蛛
77 202.160.181.* yahoo中国蜘蛛
78 202.160.183.* yahoo中国蜘蛛
79 72.30.101.* yahoo蜘蛛
80 72.30.102.* yahoo蜘蛛
81 72.30.103.* yahoo蜘蛛
82 72.30.104.* yahoo蜘蛛
83 72.30.107.* yahoo蜘蛛
84 72.30.110.* yahoo蜘蛛
85 72.30.111.* yahoo蜘蛛
86 72.30.128.* yahoo蜘蛛
87 72.30.129.* yahoo蜘蛛
88 72.30.131.* yahoo蜘蛛
89 72.30.133.* yahoo蜘蛛
90 72.30.134.* yahoo蜘蛛
91 72.30.135.* yahoo蜘蛛
92 72.30.216.* yahoo蜘蛛
93 72.30.226.* yahoo蜘蛛
94 72.30.252.* yahoo蜘蛛
95 72.30.97.* yahoo蜘蛛
96 72.30.98.* yahoo蜘蛛
97 72.30.99.* yahoo蜘蛛
98 74.6.74.* yahoo蜘蛛
99 202.108.4.* 中搜蜘蛛
100 202.108.4.* 中搜蜘蛛
101 202.108.33.* 中搜蜘蛛
102 202.96.51.* 中搜蜘蛛
103 219.142.53.* 中搜蜘蛛
还有人提出了:百度蜘蛛是根据网站权重来指派固定的蜘蛛IP来爬行,我觉着这个也有可能,但是我觉着也不合理,一个网站由不更新到更新,用户在变动,蜘蛛应该也在变动,或者说蜘蛛会采用就近原则进行。不过这个我会慢慢研究出结果的!
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。