崑山科技大學資訊工程學系 第115學年度 第1學期 | Python 爬蟲實務應用
技術涵蓋 HTTP/requests、BeautifulSoup、正規表達式、Selenium、API(JSON/XML)、pandas、matplotlib/Plotly、Gradio 與 AI 輔助工具,帶著大家走過「問題定義 → 網路資料蒐集 → 資料清理 → 資料整理 → 資料分析 → 資料視覺化 → 結果解讀」的完整資料專案流程。
吳彥霖
Contact Me:tom.yenlinwu@gmail.com
LinkedIn:yenlinwu
課程非完全零基礎的入門教材,適合已具備 Python 基礎程式經驗,想學習如何用 Python 進行網路資料擷取、清理、分析與視覺化的學生或自學者。
| 週次 | 日期 | 主題 | 工具/技術 | 教材 |
|---|---|---|---|---|
| W1 | 09/15 | 網路爬蟲概論與開發環境建置 | VS Code · Python 3 | Week_01 |
| W2 | 09/22 | Python 網路爬蟲程式設計基礎 | 虛擬環境 · pd.read_html 爬取資料表 | Week_02 |
| W3 | 09/29 | HTTP 通訊協定與網頁資料請求 | HTTP · requests | 尚未發布 |
| W4 | 10/06 | HTML 網頁結構解析與資料擷取 | BeautifulSoup · read_html | 尚未發布 |
| W5 | 10/13 | 正規表達式與文字資料擷取 | 正規表達式 re | 尚未發布 |
| W6 | 10/20 | 分頁爬取、資料儲存與爬蟲規範 | 分頁 · SQLite · robots.txt | 尚未發布 |
| W7 | 10/27 | AI 輔助程式開發與產出驗證 | Codeium/Windsurf · AI 輔助編程 | 尚未發布 |
| W8 | 11/03 | 動態網頁爬取與 API 資料擷取 | Selenium/Playwright · JSON · XML | 尚未發布 |
| W9 | 11/10 | 期中評量:專題啟動與階段成果發表 | Take Home 發表 · 專題提案 | 尚未發布 |
| W10 | 11/17 | 資料清理與前處理 | pandas | 尚未發布 |
| W11 | 11/24 | 資料整理與轉換 | pandas(groupby · merge) | 尚未發布 |
| W12 | 12/01 | 探索式資料分析 | 敘述統計 · 趨勢/異常 | 尚未發布 |
| W13 | 12/08 | 資料視覺化與結果解讀 | matplotlib | 尚未發布 |
| W14 | 12/15 | 文字資料探勘 | 斷詞 · 詞頻 · 文字雲 | 尚未發布 |
| W15 | 12/22 | 互動式資料視覺化與應用建置 | Plotly · Gradio · Hugging Face Spaces | 尚未發布 |
| W16 | 12/29 | AI 輔助應用開發:Replit Agent | Replit Agent · 雲端 agent | 尚未發布 |
| W17 | 01/05 | AI 輔助應用開發:Bolt.new 與課程問題回顧 | Bolt.new · AI 全端生成 | 尚未發布 |
| W18 | 01/12 | 期末專題成果發表 | 成果發表 · 課程總結 | 尚未發布 |
Q : 這份教材適合完全沒學過 Python 的人嗎?
A : 教材假設學習者已具備 Python 基礎程式經驗,非從零開始的入門教學;若完全沒有寫過 Python,建議先修習 Python 入門課程,再搭配本教材銜接爬蟲與資料分析應用。
Q : 需要先安裝哪些工具?
A : 開發環境為 VS Code 搭配本機 Python 環境;環境建置手順請參閱 Week_01。
[1] 洪錦魁, Python 網路爬蟲:大數據擷取、清洗、儲存與分析—王者歸來(第二版),深智數位。
[2] Using Python to Access Web Data, Coursera.
[3] Vibe Coding Fundamentals, Coursera.
本教材採用 CC BY-NC-SA 4.0 授權:可自由分享、重製、改作,但僅限非商業用途,且需標示來源並以相同授權方式分享後續作品。範例程式碼之著作權歸屬與資料來源之使用規範,請另見各週教材資料夾內之說明。