火车采集器怎么处理数据 火车采集器数据处理介绍

火车采集器怎么处理数据 火车采集器数据处理介绍,第1张

对从内容页面提取的数据进行进一步处理,可以同时添加多个 *** 作,按照从上到下的顺序来执行。

也就是说,上个步骤的结果会作为下个步骤的参数。

1)提取内容为空:如果提取内容为空,则使用正则匹配从原始页面中再次提取

2)内容替换/排除:将采集到的内容进行字符串替换,如需排除,则替换为空字符串即可

3)html标签过滤:过滤指定html标签,比如<a,<font

4)字符截取:通过开始和结束字符串对内容进行截取

5)纯正则替换:通过强大的正则表达式进行复杂的替换。

6)数据转换:包括将结果简转繁、将结果繁转简、自动转化为拼音和时间修正转化

7)智能提取:包括提取第一张、智能提取时间、智能提取邮箱、智能提取手机号码、智能提取电话号码

8)高级功能:包括自动摘要、自动分词、>

欢迎分享,转载请注明来源:内存溢出

原文地址: http://outofmemory.cn/yw/13400230.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2023-07-29
下一篇 2023-07-29

发表评论

登录后才能评论

评论列表(0条)

保存