<form id="n155d"></form>

        <address id="n155d"><listing id="n155d"><meter id="n155d"></meter></listing></address>

              行業動態基于Heritrix的網絡爬蟲實現

                      基于Heritrix的網絡爬蟲實現。

                      網絡爬蟲, 是一種可以根據網頁之間的鏈接關系, 在Internet中自動抓取網頁的程序, 它可以有條理的, 自動的遍歷萬維網信息空間。它通過HTTP協議來訪問網頁, 同時, 通過跟蹤鏈接來遍歷整個Web空間。本系統的網絡爬蟲, 基于Heritrix實現。Heritrix是一個由Java開發的、開源的Web網絡爬蟲框架。

                      本系統的網絡爬蟲為要包括:網頁分類器 (根據主題策略將網頁分為主題相關和主題不相關兩類) 、信息提取器 (以主題相關網頁作為提取對象, 提取文本信息和鏈接信息) 和網頁抓取器 (抓取“篩選”過的網頁) 。

              本文地址:http://www.sdxrc.com/article/22843.html
              相關文章:
              最新文章:
              何时开卖彩票