视频课程 编程

Python分类模型实战:从逻辑回归到K近邻 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:65个 总时长:7小时29分 课程介绍: Python分类模型实战:从逻辑回归到K近邻 你手头有一堆客户数据,每一行记录了某个用户的行为特征,最后一列写着这个人最终有没有购买产品。老板让你预测一个新用户会不会下单,你第一反应是什么?是凭直觉拍脑袋,还是翻遍Excel表手动比对?数据多的时候,靠人脑根本看不过来。这时候,分类模型就派上用场了——它能从历史数据里"学"到规律,然后对新数据做出判断。这门课讲的就是怎么用Python构建这种分类模型,而且不是只讲一种,是三种:逻辑回归、线性判别分析和K近邻算法。学完之后,你会对"分类"这件事有一个踏踏实实的掌握,从拿到数据到做出预测的每一步都清楚是怎么回事。 一、机器学习的基础认知 课程一开始会帮你建立起对机器学习的基本框架。老师会讲清楚什么是机器学习,它和传统编程有什么区别,能解决什么类型的问题。还会把构建一个机器学习模型的完整流程梳理出来:从理解业务问题,到数据准备,到建模,到评估,到部署。这套流程不只适用于分类,几乎所有机器学习项目都遵循这个思路。所以即使你以后想做预测房价或者推荐系统,这个框架也能用得上。 二、统计学基础补课 这一步听起来好像很枯燥,但其实是必经之路。逻辑回归里到处是统计学概念,比如P值、系数显著性,这些东西如果你不知道均值、中位数、标准差、方差是什么,根本没法理解。课程会用简单易懂的方式过一遍这些基础:数据有哪些类型、图形化展示数据长什么样、集中趋势怎么度量、离散程度怎么衡量。每个知识点后面都配有练习题,让你确认自己真的懂了,而不是左耳进右耳出。 三、Python环境搭建与速成 不会Python?没关系,课程的前四章会带你从零开始。先是安装Anaconda,它把Python、Jupyter Notebook和常用的数据科学库一次性装好,省得你自己一个个折腾。装完之后会有一个紧凑的Python速成部分,覆盖数据科学够用的内容:基本语法、字符串、列表、元组、字典。不是那种大部头的Python教程,而是精选和后续操作直接相关的内容。如果你已经会Python,完全可以跳过这部分,不会听天书。 四、Python核心库实战 有了Python基础,还要会用工具。课程会带你熟悉三个核心库:NumPy负责数值计算,Pandas负责数据处理,Seaborn负责可视化。这三个是数据科学的标配,几乎每个项目都要用。老师会通过实际的数据文件演示这些库的基本操作,让你对它们的功能有个直观感受,知道什么情况下该调用哪个库。 五、数据预处理:最容易被忽略的硬功夫 如果说这门课有一个"超值"的部分,那就是数据预处理。很多初学者都以为机器学习的核心在于算法,其实不然——数据预处理往往占整个项目时间的六七成。课程用相当长的篇幅来讲这块内容,包括:理解业务背景和数据字典、导入数据到Python、用可视化做探索性分析、处理缺失值、处理异常值、识别数据中的季节性、对变量做变换、创建哑变量处理分类数据。每一小节都有对应的练习题,比如用电影集合数据练手,从原始数据一步步做到干净可用。这部分学完之后,你会明白"原始数据"和"能喂给模型的数据"之间有多大的距离,以及怎么弥补这个距离。 六、逻辑回归:课程的核心 终于到正题了。课程会先讲清楚分类问题是什么,为什么线性回归不能直接用来做分类——因为它预测出来的是连续值,而分类需要的是离散的"是"或"否"。然后正式引入逻辑回归:它的数学直觉是什么,S型曲线在做什么,为什么它天然适合分类。有了理论之后,紧接着就在Python里实现一个简单模型,观察输出结果,理解每个系数的含义。之后扩展到多变量情形,训练包含多个预测变量的模型。这里会涉及P值的概念,怎么根据P值判断变量是否显著。接下来是模型评估的重头戏:混淆矩阵。它把模型的预测结果分成四类,真正例、假正例、真负例、假负例,从中可以算出准确率、精确率、召回率等指标。还会讲ROC曲线和AUC值,这是衡量模型综合表现的重要工具。每个步骤都配有动手练习题,确保你不止看了,还要会做。 七、线性判别分析与K近邻 三种分类模型,除了逻辑回归,课程还讲了另外两种。线性判别分析(LDA)的思路和逻辑回归不同,它更像是找到一条能最好地区分不同类别的"分割线",背后的数学思想是把高维数据投影到低维空间,同时保持类别之间的可分性。Python实现部分会一步一步演示。K近邻(KNN)的思路更直觉:看一个新数据点周围最近的K个邻居是什么类别,多数投票决定它的类别。这个方法简单但很有效,在很多场景下表现都不错。课程会演示怎么在Python里调参、训练、预测。学到这,你手里就有了三种不同的分类武器,知道每个的适用场景和优缺点。 八、测试集与训练集的划分 模型训好了,怎么知道它在真实环境里好不好使?直接拿训练数据去评估是不靠谱的,因为模型已经把训练数据"背"下来了。你需要把数据分成两半:一半训练,一半测试,用模型没见过的数据来检验效果。这个知识点单独成章,里面讲清楚了怎么划分、划分比例怎么选、随机种子为什么重要、为什么不能偷懒用全部数据去训练和测试。 九、结果解读与最终的总结 三种模型都跑过了,谁更好?课程最后会带你把这三个模型的性能放在一起比较,综合各种指标选出最适合业务场景的模型。还会有一个最终的综合性练习,让你在一个完整的项目里走一遍全流程:理解问题、预处理数据、尝试多种模型、评估结果、给出建议。学到这里,你已经不是纸上谈兵了,而是真的能动手做一个完整的分类项目。 十、附录:线性回归补充 虽然课程主题是分类,但考虑到很多学习者的实际需求,附录里塞进了线性回归的内容。回归和分类是一对兄弟概念,学会了分类再学回归会很快。附录从普通最小二乘法讲起,讨论R方、残差标准误、F统计量、分类变量的处理,最后用贷款数据演示完整的线性回归建模流程。这部分对做预测任务的人来说非常实用。 整门课大约七个半小时,六十五个视频,节奏紧凑但不仓促。配套的资料也很齐全:每个章节有PDF讲义,每个工具有参考手册,每个模型有数据文件和Notebook代码。每讲完一个知识点就有练习题,帮你巩固理解。课程适合数据科学的初学者和有一定Python基础但没接触过分类建模的人,也适合工作里需要做预测分析但一直没系统学过方法论的从业者。统计学部分门槛低,只要肯花时间都跟得上。唯一的要求是你愿意动手敲代码、看输出、思考数据为什么长这样。七个半小时,看起来不长,但信息密度很大,学完你会真真切切地"会"做分类这件事。