R網路爬蟲與文字探勘入門實作

課程介紹

   網路爬蟲,也叫網路蜘蛛,原意是指一種用來自動瀏覽全球資訊網的網路機器人。隨著大數據時代來臨,網頁資料擷取的需求急遽增長,因網頁資料擷取與網路爬蟲的技術許多重疊,因此經常通稱為爬蟲。藉著爬蟲技術,短時間內取得最新的輿情資訊已是業界掌握市場脈動的必備手段之一。


課程目標

   本課程將帶領學員從零開始,透過資料科學領域最夯同時也是最簡單的R語言開啟網頁資料擷取的大門,提供許多實戰案例及現場指導實作,讓學員於學習過程中不只獲得技能也獲得成就感。不過,獲得文字資料只是進行探勘分析的前置作業,為了讓學員能對完整解決方案有進一步的瞭解,此課程也包含文字資料探勘的入門內容,讓學員能從爬蟲到分析一網打盡。


為何學習爬蟲

  • 爬蟲為數據蒐集的一種手段,是做數據分析的必備技能之一。
  • 爬蟲能快速大量的擷取網路上你感興趣的內容資訊。
  • 爬蟲是入門程式語言最容易學習的方向。
  • 網路爬蟲工程師為目前資料科學產業的常見職缺之一。

  • 適合對象

  • 無程式經驗者。
  • 資料科學家、資料工程師。
  • 公司各部門與各階層決策人員。
  • 對於此議題有興趣者。

  • 課程資訊

  • 課程時間:2018/5/19(六)-05/20(日)
  • 課程地址:台北市內湖區內湖路一段356號5樓
  • 課程天數:2天;上午 9:00 至下午5:00 (中午休息1小時)
  • 課程定價:原價10,800元整 (含上課講義、16小時研習證明與午餐)
    • 早鳥(5月4日前)/舊生:6,800元/人
    • 兩人以上團體:6,000元/人
    • 四人以上團體:5,500元/人
    • ※以上優惠不合併使用 ※

    講師介紹

    AsiaAnalytics特聘專業講師:湯明軒 Andrew

       創辦資料科學公司,專精R、Python語言及網路爬蟲,在機器學習、推薦系統、自然語言處理、Hadoop巨量資料等領域皆有涉略及專案經驗。超過500小時的資料科學授課經驗,擅長從零開始由淺入深的實作教學。


    課程大綱

    課程主題 詳細內容 時數

    R語言從0到1

  • 向量與資料框架
  • 流程控制與迴圈
  • UTF-8與BIG5編碼轉換
  • 資料檔案讀取與匯出
  • 2

    如何與網頁對話

  • GET傳送請求
  • POST傳送請求
  • DevTools網頁監聽工具應用
  • 2

    網頁原始碼解析

  • 網頁架構理解
  • CSS Selector運用
  • DevTools 網頁元素定位技巧
  • 2

    初階實戰練習

  • Yahoo電影排行
  • 批踢踢留言擷取
  • 1

    進階爬蟲技巧

  • 偽裝Headers、Cookies
  • 會員登入並保留Session
  • 1

    進階實戰練習

  • Instagram照片擷取
  • Facebook Graph API運用
  • 多頁面資料擷取
  • 3

    文字資料探勘入門(中文)

  • 中文斷詞套件運用
  • 文件詞項量化
  • 詞頻計算與文字雲
  • 計算文件或詞項相似度
  • 3

    ※時間、流程會依現場上課狀況調整,以上僅供參考用。



    台灣析數資訊股份有限公司

    AsiaAnalytics Taiwan Ltd.


    114台北市內湖路一段356號5樓[Google Map]

    5F, No. 356, Sec. 1, Neihu Rd., Neihu Dist., Taipei City 11493, Taiwan (R.O.C.)

    TEL:+886 2 1234 5678 FAX: +886 2 1234 5679

    e-mail:[email protected]

    關於析數 | 連絡析數 | 資料分析同樂會社團 | 訂閱析數電子報

    | 關於我們 About | 聯絡我們 Contact | 隱私權政策 Privacy | 使用條款 Terms | 網站地圖 Site Map