色播五月综合_国产精品视频中文字幕91_欧美日韩一区二区在线免费观看_久久久久久成人

基于網絡爬蟲的就業數據分析

來源:職稱論文發表指導網 作者:田編輯 發布時間:
掃碼咨詢
   摘要:要: 隨著網絡信息量的爆炸式增長,大數據時代的來臨,利用網絡爬蟲對大數據進行分析處理有非常重要的意義。本文 以 BOSS 直聘網站為例,在 Python3.7 和 MySQL Server8.0 的基礎上,設

  要: 隨著網絡信息量的爆炸式增長,大數據時代的來臨,利用網絡爬蟲對大數據進行分析處理有非常重要的意義。本文 以 BOSS 直聘網站為例,在 Python3.7 和 MySQL Server8.0 的基礎上,設計并實現了一個關于就業信息的數據采集存儲系統。 并且通過對采集到的就業數據信息做出多個方面的分析,利用這些數據分析結果為大多數人在就業選擇以及未來規劃的時 候提供一個有據可依的參照,起到一個指導就業的作用。

  關鍵詞: 網絡爬蟲; 就業信息; 數據分析; 就業指導

  0 引 言

  隨著人工智能的概念逐步的深入展開,人工智能 因其高效性和實用性受到越來越多的重視。作為人 工智能的重要組成部分,大數據也開始在社會生產中 發揮巨大作用,同時還帶動了社會生活質量的全面提 升,并提供了以往不曾有過的便利性。在國內對高等 教育改革正邁向更深層次的時候,各校的畢業生規模 也逐年增加。臨近畢業時,或多或少都會存在許多迷 茫。而在招聘、應聘的過程中,互聯網作為當下承載 海量招聘信息的重要載體,則給畢業生的擇業提供了 一條便捷途徑。只是互聯網的信息檢索中卻會面臨 許多用戶并不需要的信息,只有通過人工篩選、再經 總結對比后,才能得到最終想要的信息。

基于網絡爬蟲的就業數據分析

  1爬蟲的設計

  1.1 系統需求及分析 網絡爬蟲系統的開發是否成功取決于確保系統 能夠實現用戶定制功能,達到預期設計目的。因此, 在網絡爬蟲系統開發之前,就需要對該系統需求加 以詳盡分析,從而對整體的設計有一個清晰的思路。 時下,普遍適用的爬蟲系統都是模塊化的,模塊化的 程序設計有利于代碼塊的測試與維護,而且也進一 步增加了代碼的適用性。在此基礎上,只要對各個 模塊進行組合,就能夠構建出一個完整的爬蟲系統。 本次研究即以 BOSS 直聘為例,開展模塊化的編程 設計。因為研究旨在通過爬蟲系統對當前就業做出 科學分析,故而針對此需求就要從 BOSS 直聘網站 中獲取全部的崗位信息,以及從每個崗位中獲得包 括各崗位名稱、工作地點、薪水、公司規模性質、工作 要求在內的各種關鍵信息。至此,在接下來的功能、 模塊設計中,就具備了較強的針對性。

  1.2 爬蟲模塊設計

  1.2.1 爬蟲整體設計思路 爬蟲系統的設計思路為: 首先,需要獲得所有包括崗位信息網頁的源碼; 其次,在每一頁的網頁源碼 中尋找出與需求相匹配的信息,此時就需要連接爬 蟲系統和數據庫,將每次成功匹配到的信息均存入 數據庫中,直至所有網頁檢索完畢。在數據爬取的 整個過程中,針對 BOSS 直聘的高度反爬,還要在各 個模塊中引入適當的反扒策略,以此保證數據爬取 的連續性。研究可得整體設計框架如圖 1 所示

  1.2.2 爬蟲的網頁抓取模塊 網頁抓取模塊作為爬蟲系統中最重要的部分, 也是起始的模塊。但是從實際爬取的情況來看,針 對同一個 IP 在短時間內的多次爬取,會被網站屏蔽 IP 地址,因此在這里采用代理 IP 池的技術去訪問。 為了避免被對方發現,還需要加入 User-Agent 將自 己偽裝成代理服務器。通過構造代理 IP 池以及由 眾多用戶代理組成的代理池,每次隨機選擇訪問 IP 與用戶代理的搭配,據此而將自己偽裝成來自不同 IP 的用戶訪問,大大降低了被反爬蟲的概率。接下 來采用 Requsets 庫 的 API 去解析當前第一層的 URL。如: resp = requests.get( url, headers = headers, proxies = proxies,timeout = 5)

  2 數據分析

  2.1 數據處理

  通過設計好的網絡爬蟲系統,從 BOSS 直聘網 站上爬取了上海地區 13 萬多的崗位招聘信息數據, 從招聘崗位、工資待遇、工作地點、工作要求、公司性 質這幾方面的信息,對上海地區的就業數據做出研 究與分析,對廣大擇業人員可起到一個初步指導的 作用。 通過 Navicat Premium 將數據庫導出成 Excel 文 件,在 Python 中通過 pandas 庫對數據進行處理,首 先將所有的數據通過 read_excel 的 API 讀取到處理 環境下,將每一列的數據分別提取出來構造出 job、 salary、requirements、situation 四個列表,通過遍歷整 個 requirements,檢索每一個元素的字段,可以統計 出上海市每個地區大約能夠提供多少個工作崗位; 同理,用上述的方法,可以統計出上海地區提供的工 作崗位對學歷的要求,以及公司規模的情況。對于 就業數據分析來說,至關重要的就是薪資分析,將提 取出來的 salary 列表,對每一個元素采用正則表達 式匹配前兩個數字,也就是這份工作的薪水上下限, 求一個平均值,遍歷整個列表,對薪水分布進行統 計。同時,通過定位以及包含字符段的方法,可以將 每個地區的工作以及相對應的薪水提取出來,再通 過前文對全上海各地區的工作崗位統計,對上海各 地區的平均薪資做出分析。在此基礎上,各行各業 的薪資水平也能夠根據各行業的崗位數以及對應的 平均薪資計算得出。

  2.2 數據分析結果

  隨著應屆畢業生的人數每年不斷上升,帶給社 會的就業壓力也隨即增大,在這種就業形勢競爭激 烈的就業市場里面如何做出最佳的選擇即已成為研 究的熱點與焦點。

  3 結束語

  本文通過 Python 加上 MySQL Server 的配置,創 建了一個基于 BOSS 直聘網站的網絡爬蟲數據收集 分析系統,該系統能夠登錄到 BOSS 直聘,并獲取頁 面信息,分析頁面中的 URL,同時對篩選構造后的 URL 再一次進行數據篩選,將用戶獲取到的數據存 儲到數據庫,在此基礎上將對數據進行深層次的挖 掘,也就是運用一系列的數據分析手段,獲得關于上 海各地區、各崗位的薪資待遇、招聘需求等一系列重 要信息,為廣大的就業人員提供有益的借鑒與參考。

  參考文獻

  [1]徐遠超,劉江華,劉麗珍,等. 基于 Web 的網絡爬蟲的設計與 實現[J]. 微計算機信息,2007,23( 21) : 119-121.

  [2]郭麗蓉. 基于 Python 的網絡爬蟲程序設計[J]. 電子技術與軟件 工程,2017( 23) : 248-249.

  [3]周中華,張惠然,謝江. 基于 Python 的新浪微博數據爬蟲[J]. 計算機應用,2014,34( 11) : 3131-3134

  作者項博良,唐淳淳,錢 前,曹健東

聲明:

①文獻來自知網、維普、萬方等檢索數據庫,說明本文獻已經發表見刊,恭喜作者.

②如果您是作者且不想本平臺展示文獻信息,可聯系學術顧問予以刪除.

《道路交通事故責任鑒定標準相關要點分析》
主站蜘蛛池模板: 国产日韩欧美亚洲一区| 日韩精品无码一区二区三区| 91久久精品国产91性色| 国产精品久久久久久久久久东京| 国产成一区二区| 国产在线高清精品| 无码人妻aⅴ一区二区三区日本| 欧美日韩福利在线| 五月天在线免费视频| 日韩av在线播放不卡| 欧美亚洲日本在线观看| 欧美一区二区中文字幕| 草莓视频一区| 午夜精品视频在线观看一区二区| 视频在线一区二区三区| 日韩在线视频观看正片免费网站| 久久超碰亚洲| 久久艹在线视频| 久久99精品久久久久久久久久| 久久99久久精品国产| 91麻豆国产精品| 久久躁狠狠躁夜夜爽| 成人h视频在线观看| 久久久精品在线视频| 国产精品第一页在线| 丝袜一区二区三区| 亚洲乱码一区二区三区| 日韩在线免费视频V| 久久国产精品网站| 久久国产精品高清| 99久久99| 国产日韩欧美黄色| 国产精品综合网站| 亚洲日本欧美在线| 午夜精品久久久久久久男人的天堂 | 岛国一区二区三区高清视频| 宅男在线精品国产免费观看| 91精品视频播放| 久久视频在线观看中文字幕| 久久久久国产精品视频| 久久韩国免费视频|