Python網路爬蟲實戰

課程介紹

   網路爬蟲,也叫網路蜘蛛,原意是指一種用來自動瀏覽全球資訊網的網路機器人。隨著大數據時代來臨,網頁資料擷取的需求急遽增長,因網頁資料擷取與網路爬蟲的技術許多重疊,因此經常通稱為爬蟲。藉著爬蟲技術,短時間內取得最新的輿情資訊已是業界掌握市場脈動的必備手段之一。


課程目標

   本課程將帶領學員從零開始,透過資料科學領域最夯同時也是最通用的Python語言開啟網頁資料擷取的大門,雖然短短兩天的時間,但保證讓你能獨立完成爬網的任務。


適合對象

  • 基礎Python程式語言能力者。
  • 資料科學家、資料工程師。
  • 公司各部門與各階層決策人員。
  • 對於此議題有興趣者。

  • 課程資訊

  • 課程時間:2019/06/29(六)-06/30(日)
  • 課程地址:台北市內湖區內湖路一段356號5樓
  • 課程天數:2天;上午 9:00 至下午5:00
  • 課程定價:原價10,800元整 (含上課講義、16小時研習證明與午餐)
    • 早鳥(6月15日前)/舊生:7,000元/人
    • 兩人以上團體:6,500元/人
    • 三人以上團體:6,000元/人

    講師介紹

    AsiaAnalytics專業講師:湯明軒 Andrew

  • 經歷:
    • 艾西斯資訊有限公司 資料科學團隊主管
    • 中華電信 Hadoop Clusters 專案團隊
    • 三立電視 線上影劇推薦系統 專案團隊
    • 析客數據有限公司 負責人
    • 中強光電股份有限公司 巨量資料技術研發工程師
    • 中華R軟體學會 秘書長&理事
  • 專攻領域:
    • 資料科學、網頁爬蟲、Python、R語言、機器學習
  • 教學經驗:
    • TQC Python證照輔導班 課程講師
    • 資策會課程講師
    • 金融研訓院課程講師

    課程大綱

    課程主題 詳細內容 時數

    爬蟲必備Python基礎

  • List與Dict資料結構
  • 流程控制與迴圈
  • 資料匯出
  • 3

    基礎爬蟲技巧

  • GET/POST傳送請求
  • 開發人員工具之監聽應用
  • Python擷取網頁原始碼
  • UrlEncode與UrlDecode
  • 2

    爬蟲資料處理

  • HTML與JSON資料結構
  • CSSSelector網頁原始碼解析
  • 開發人員工具HTML解析應用
  • 網頁資料萃取及表格化
  • 2

    實戰演練(一)

  • 批踢踢推文擷取
  • 中央社及蘋果日報擷取
  • PCHome商品資料擷取
  • 2

    進階爬蟲技巧

  • Headers及Cookie偽裝
  • Selenium 模擬瀏覽器行為
  • Javascript控制網頁元件
  • 2

    實戰演練(二)

  • 會員(自動)登入案例實作
  • 批踢踢多頁面擷取案例實作
  • Instagram照片下載
  • Facebook文章擷取
  • 3

    ※時間、流程會依現場上課狀況調整,以上僅供參考用。

    注意事項:
    • 本課程需自備筆電。(建議系統:Mac、Linux、Win10)
    • 本課程採預先報名制,達開課人數始開課,將於開課前二週通知學員。
    • 本課程為小班制教學,人數有限,請及早報名以免向隅。


    台灣析數資訊股份有限公司

    AsiaAnalytics Taiwan Ltd.


    114台北市內湖路一段356號5樓[Google Map]

    5F, No. 356, Sec. 1, Neihu Rd., Neihu Dist., Taipei City 11493, Taiwan (R.O.C.)

    TEL:+886 2 1234 5678 FAX: +886 2 1234 5679

    e-mail:[email protected]

    關於析數 | 連絡析數 | 資料分析同樂會社團 | 訂閱析數電子報

    | 關於我們 About | 聯絡我們 Contact | 隱私權政策 Privacy | 使用條款 Terms | 網站地圖 Site Map