当前位置:首页>科技>爬虫系统实战一个爬虫管理系统的需求规格说明书
发布时间:2026-07-25阅读(0)
我也不知道为什么突然想注册一个头条号,也不知道第一篇文章发点啥,没有很强的专业领域,最近在做一个公司的爬虫管理系统,并且要用这个项目过CMMI的认证。就简单写一下。

之前体验过神采和八爪鱼等很多爬虫系统,各有特点,公司主要是做舆情监测的,因此需要一套需要适合各种网站,几乎所有新闻类的爬虫,并且要根据内容的发布时间进行筛选,还要随时监测爬虫系统的运行情况,这部分算是需求分析吧。

产品的功能框架
1.1 编写目的
1. 本文档是爬虫管理系统需求分析说明书供设计人员使用,作为系统设计的依据。产品经理跟进产品执行实现程度的依据。外部人员产品理解或执行的依据。
2. 作为项目验收标准之一。
3. 软件维护的参考资料。
1.2 文档范围
本文档是项目的软件需求规格说明书,是技术文档。
本文档使用对象为:
l 项目需求人员
l 项目经理
l 软件工程组
l 软件相关组成员
l 用户
未经项目负责人书面许可,该文档不得提供给上述规定对象以外的人员阅读或使用。
1.3 术语定义
缩写、术语
解 释
爬虫
一种能自动获取网页内容并可以按照指定规则提取相应内容的程序
Handler
主要用于异步消息的处理:当发出一个消息之后,首先进入一个消息队列,发送消息的函数即刻返回,而另外一个部分在消息队列中逐一将消息取出,然后对消息进行处理,也就是发送消息和接收消息不是同步的处理。 这种机制通常用来处理相对耗时比较长的操作。
分布式架构
分布式架构是 的应用和工具,目前成熟的 包括J2EE, CORBA和.NET(Dcom)
舆情
舆情是“舆论情况”的简称,是指在一定的社会空间内,围绕中介性社会事件的发生、发展和变化,作为主体的民众对作为客体的社会管理者、企业、个人及其他各类组织及其政治、社会、道德等方面的取向产生和持有的社会态度。它是较多群众关于社会中各种现象、问题所表达的信念、态度、意见和情绪等等表现的总和。

爬虫的采集方式
采集方式主要分为录和搜两个部分,录就是站点的录入,人工找到需要录入的网站,按照产品流程进行任务创建,后期就可以根据任务设置的更新时间,定期采集更新新闻内容。搜的方式就是在人工找不到的情况下,通过不断扩充的关键词库,在站内搜索或搜索引擎中搜索,将搜索到的内容进行分类,添加到对应站点下。
比较难解决的问题是,对于很多网站来说,文章的内容和字段都不是很统一,比如作者,发布时间,等。需要前期做一些调研,且像搜狐,新浪等大网站下面的板块非常的多,每个板块还都是相对独立的,因此需要采用不同的采集方式。需要对其分别进行管理。
我们采用的解决方案是将每个一级域名作为一个项目,比如sohu.com就作为一个项目,搜狐下面的二级域名就会有很多,每个二级都可以成为这个项目中的一个站点,系统用自动识别的方式将所有二级域名找到,我们再对每个站点进行配置解析规则和爬虫任务。当然这部分需要算法的介入。

列表页分页规则的解析流程
还有一个需要考虑的问题就是文章的分页,一般的网站都会有一个列表页,就是文章的列表。只要找到列表页,并且对列表页进行监测,就可以知道网站的文章会不会有更新,抓的也会相对来说全一些。但是列表页可能会有很多页,需要找到相应的分页按钮,但是各个网站分页的方式也都不相同,比如用AJax、JSON,都不一样。就需要人工进行识别,并且把识别好的相同类型的采集方式应用到其他列表页上,这个算是人工 机器的解决方案吧。
其他的任务涉及到的问题还有很多,还有任务监测部分,任务创建及内容解析规则配置的部分,以后想到了再补充吧。
本文原创,未经许可,禁止转载。
Copyright © 2024 有趣生活 All Rights Reserve吉ICP备19000289号-5 TXT地图HTML地图XML地图