亚洲VA一级无码观看网站_亚洲无卡无码在线观看

基于Heritrix的網(wǎng)絡(luò)爬蟲實(shí)現(xiàn)。

網(wǎng)絡(luò)爬蟲, 是一種可以根據(jù)網(wǎng)頁之間的鏈接關(guān)系, 在Internet中自動(dòng)抓取網(wǎng)頁的程序, 它可以有條理的, 自動(dòng)的遍歷萬維網(wǎng)信息空間。它通過HTTP協(xié)議來訪問網(wǎng)頁, 同時(shí), 通過跟蹤鏈接來遍歷整個(gè)Web空間。本系統(tǒng)的網(wǎng)絡(luò)爬蟲, 基于Heritrix實(shí)現(xiàn)。Heritrix是一個(gè)由Java開發(fā)的、開源的Web網(wǎng)絡(luò)爬蟲框架。

本系統(tǒng)的網(wǎng)絡(luò)爬蟲為要包括:網(wǎng)頁分類器 (根據(jù)主題策略將網(wǎng)頁分為主題相關(guān)和主題不相關(guān)兩類) 、信息提取器 (以主題相關(guān)網(wǎng)頁作為提取對(duì)象, 提取文本信息和鏈接信息) 和網(wǎng)頁抓取器 (抓取“篩選”過的網(wǎng)頁) 。

本文地址：http://www.khwajamoinuddinchishty.com//article/22843.html

分享到：QQ空間新浪微博騰訊微博人人網(wǎng)微信開心網(wǎng)百度貼吧豆瓣網(wǎng)

偷偷鲁视频成人免费视频_丁香五月缴情伊人_欧美精品一区二区久久不卡_亚洲手机在线观看看片

行業(yè)動(dòng)態(tài)基于Heritrix的網(wǎng)絡(luò)爬蟲實(shí)現(xiàn)