数据挖掘入门 · 课程总览
欢迎来到数据挖掘学习站。目标:从"看得懂数据"到"挖得出规律"——学完五门课,你要能独立跑通一次完整的数据挖掘流程:拿数据 → 清洗 → 建模 → 得出三条能讲给店长听的建议。
本站是 Web 基础学习站的姊妹站,风格不变:中文、每课都有可复制即跑的代码和记忆锚点。前置知识只有一样建议先修:老站的《数据库与 SQL》——数据库负责把数据"存好、查出来",数据挖掘负责从数据里"挖出规律"。没学过也没关系,会复制粘贴就能跟上。
学前准备
只需要在你的电脑上装好 Python 3,再装两个库(第一课会手把手带一遍):
bash
pip install pandas scikit-learn所有课程用到的数据都直接写在页面里,复制粘贴就能跑,不需要去任何网站下载数据集。
课程目录
- 数据挖掘概述与流程 —— 什么是挖掘、六类经典任务、业界通用的 CRISP-DM 流程
- 数据获取与清洗 —— pandas 读数据三板斧,缺失值 / 重复值 / 异常值逐个处理
- 分类与聚类 —— 有答案照着学的 KNN 与决策树,没答案自己分堆的 K-Means
- 关联规则 —— 购物篮分析:支持度、置信度、提升度,手写迷你 Apriori
- 实战小项目:奶茶店会员流失分析 —— 把前四课串成一次端到端实战
- 学习进度表 —— 能真的打勾的清单:勾选存在你自己浏览器里,刷新不丢
学完本站的验收标准
- [ ] 能解释"报表回答发生了什么,挖掘回答接下来会怎样"这句话的含义
- [ ] 能报出数据挖掘六类经典任务里至少四类,并各举一个身边的例子
- [ ] 能用 pandas 把一份"脏数据"清洗到能建模的程度,并说清每一步为什么这么做
- [ ] 能说清监督学习与无监督学习的分界线,报出分类和聚类各一个典型算法
- [ ] 能手算一条关联规则的支持度、置信度、提升度,并判断它算不算一条好规则
- [ ] 独立完成实战小项目,产出的不是一堆截图,而是三条能落地的业务建议
学完之后
你已经同时握着两把刷子:一把 Web 攻防(姊妹站教的)、一把数据(本站教的)。它们还能拼到一起——用数据挖掘的眼光去分析网站访问日志里的扫描行为,就是"安全数据分析"这个方向每天都在做的事。