绝对掌控_第十一章数据海洋和爬虫在线无广告版阅读-锦绣文学

庞大浩繁的数据海洋时就存在一个问题了，世界这么大，我该如何找到目标，比如我想找感冒药相关的数据信息，我该怎么办？

    正是这种需求催生了搜索引擎，搜索引擎可以帮助你快速找到目标，它就像一个找路指南一样，你只要告诉它想去哪，这个目的地大概什么特征，它就会帮助你找到无数个可能合适的目的地，并且把对方的URL提供给你。

    搜索引擎每天的访问量都是海量的，每一秒同时并发的搜索请求都是数以十万计的，在这么多请求面前，如果来一个请求它搜一遍互联网，这肯定是不现实的，不仅速度慢效率低，而且仅仅这类搜索请求就足让整个国际互联网陷入拥堵状态。

    为了解决这个问题，搜索引擎就有了它特有的工作模式，它先尽可能多的将数据海洋里的信息全部找出来，然后存储在自己的服务器群组中，一旦有了搜索请求，它只要在自己的服务器里进行检索就行了。

    而帮助搜索引擎完成找这个动作的就是爬虫。

    因为国际互联网中的信息节点都是相互关联的，是网状联系的，每个节点上都会有很多个URL。所以爬虫的工作模式就是遍历，当它开始工作时，它会以一个信息节点为起点，然后挨个访寻与这个节点相连的所有节点，当下一层节点还有URL链接时，它就不断访问下去，直到将所有URL遍历一次才算完。

    因为整个互联网的网状结构，使它具备网状互通性，所以等爬虫将所有URL遍历了，一般来说它就已经将整个国际互联网所有链接全部访问了一遍，这注定是一个比环球旅行更加令人叹为观止的行为。

    而莫回既然想弄这个股神1.0，他想要搜集海量数据，那么他要做的事情其实和搜索引擎要做的事情很像，只不过搜索引擎是所有信息都要搜集，而莫回只需要关注股票相关的信息就行了。

    这样的话，莫回的爬虫就必须在具备遍历能力的同时，还得具备筛选的能力。

    遍历的能力解释起来很简单，就是你不能走回头路和冤枉路，游历过的URL就犯不着再走第二遍了。一条新的URL被发现，首先需要判断这条URL是否已经走过，其次需要判断这条URL被安排在什么次序去走。一个是重复性问题，一个是最优化问题，这就需要独特的遍历算法来解决。

    而筛选功能就是通用爬虫和专用爬虫之间的主要区别，莫回的爬虫需要具备一定的识-->>

本章未完，点击下一页继续阅读

绝对掌控 第十一章 数据海洋和爬虫(2/3)

绝对掌控第十一章数据海洋和爬虫(2/3)