Python从0到数据分析处理与可视化 全系列化教学(终极保姆级)

📅 发布时间:2026/9/23 10:35:13
Python从0到数据分析处理与可视化 全系列化教学(终极保姆级)
现未编写完全可免费观看已经写了的地方进行学习此教程适合从来没有接触过大数据甚至是从来没有接触过编程的小白对大数据了解学习基础速成从Python数据处理开始因为大数据正式内容是分布式计算MapReduce和spark之类整体的数据处理来讲和这个处理操作逻辑上几乎一样直接学习Hadoop的MapReduce和spark对于小白来讲比较难懂所以从Python数据分析处理入手先了解对数据分析与处理的操作逻辑如果还有看不懂可以评论区里提问对教学的任何知识点提问都在写在评论区24小时内回答每天晚更新教学关注作者收藏文章都可跟踪后续教程想要转载的可以转载我本教学的 环境配置教学转载文章下方必须要有我文章链接谢谢本教学是基于 Python 3.x 版本的教学环境配置python做数据分析处理与可视化推荐 jupyter notebook 编辑如后续要学习做爬虫项目框架等编程操作则推荐PyCharm为你们后续发展考虑本文章会从 两种编辑器进行教学还会教学一个万能(几乎所有系统都可以这么操作)编辑安装PyCharm 安装部署官网Uninstall Feedback - PyCharm (jetbrains.com)下滑到community是免费社区版学习推荐这个版本Windows判断自己电脑处理器是否为ARM架构方法在cmd中输入 systeminfo如果是ARM则 有ARM字的显示如果不是ARM则 没有ARM字的显示下载完后点击下载的exe文件然后下一步点击浏览选择自己准备好的文件夹非常不推荐放系统盘时间长了影响电脑性能设置好后点击下一步全选然后下一步自定义程序快捷方式名然后下一步等待安装选否然后下一步点击生成的快捷键如果有以下窗口选Do not import settings 然后 点击 ok如果有其他的IDEA可能会以下窗口成功进去后界面如下个性皮肤设置下载中文插件点击plugns后在右边放大镜位置输入Chinese然后选中图标是汉的包点击 install 下载并安装等待下载安装完成后还需点击 Restart IDE 重启 PyCharm 使其生效重启进来后中文就设置成功了选中创建欢迎脚本可以进去后直接测试项目是否创建成功然后在位置旁边点击浏览到你要指定的项目存放位置默认是系统盘位置非常建议改到其他盘里面解释器类型可以选项目venv类型然后选中你要python编译器版本点击创建后他会自己安装并搭建好python编译器然后等待编译器安装完毕点击终端开始安装后续编程需要的依赖项输入 pip install pandas等待安装完毕输入 pip install matplotlib等待安装完毕输入 pip install numpy等待安装完毕选中刚刚的程序文件在代码区点击然后使用 ctrl a 全选然后按 Backspace 键删除所有代码然后输入import pandas as pdimport numpy as npimport matplotlib.pyplot as plt然后看有没有报红且根据语句提示来看 模块是否导入成功到此 PyCharm目前需要的所有安装配置都部署完毕Jupyter notebook 安装部署官网Download Anaconda Distribution | Anaconda镜像Index of /anaconda/archive/ | 清华大学开源软件镜像站 | Tsinghua Open Source Mirror点击弹窗的 Skip registration 键点击下面Windows的下载图标上面那个Windows绿色键也可以点也是一样的下载完成后点击程序打开点击弹窗的next然后点击 i Agree然后继续点击 next指定准备好的文件夹 (准备的文件必须是空文件夹且路径中不能出现中文否则会报错)然后点击 next全选然后点击 install 安装等待安装好后继续点击 next 一个小时以内的安装时间一般都是正常点击 next继续 next然后点击 finish然后它会启动软件等待软件打开成功刚安装第一次打开等待时间较长这个窗口点击 No,dont to show again然后点击 ok下滑找到 jupyter notebook点击 install等待安装完毕安装完成后 install 会变成 lauch然后先别急着启动点击 Windows 的菜单搜索栏输入 anaconda prompt 这是 anaconda 的命令行工具和 window 的 cmd 一个性质 搜索到该程序文件并打开在命令行使用 jupyter notebook 指令启动 web页面编辑器之后看到的页面是这样的上面显示的目录是此目录Desktop 这些是 桌面等目录的英文名且这个界面初始默认的目录路径是取的 C:\Users\Administrator 这个用户目录因为在 C 盘上面 代码库存放位置也在 C 盘那么很明显默认目录不修改的话时间长了会影响的电脑的运行所以下面开始修改默认目录操作在命令行界面输入 jupyter notebook --generate-config 指令回车键执行此指令是让 jupyter notebook 生成配置文件的命令执行后会生成一个配置文件然后会返回配置文件的路径我这个是二次设定所以有 y/N 选择第一次设定时没有此选择项根据返回的路径找到该配置文件使用 ctrl F 弹出搜索拦输入 notebook_dir 点击查找下一个会跳到该行到准备好的目录位置点击上方路径框 使用 ctrl C 复制删掉此行的 # 在 ‘’ 中输入你准备好的目录路径在单引号 中粘贴你准备好的目录路径这里的 \\a 是因为 \a 会被识别为 \x07 字符所以要多加个 \ 做转义符一般的都没人记得哪些 打法 会被误识别所以初始设置时 目录路径可以 就使用原复制好的比如 F:\anaconda\jupyter notebook ku然后点上方的 X 会弹出窗口选择保存然后再到 Anaconda prompt 输入 jupyter notebook 执行会报以下错误这里和原输入路径 F:\anaconda\jupyter notebook ku 对比明显 \a 被误识别为了 \x07 (确定好被误识别的是哪个字母后第二次设置时就在那个或者几个字母前 加 \ 做转义)这个时候就重新使用 jupyter notebook --generate-config 重新刷配置文件覆盖原文件然后打开该文件进行编辑重复之前的操作到此行修改路径在误识别的地方加上 \ 做转义然后重复之前的操作进行保存然后到 anaconda prompt 输入 jupyter notebook 执行就可以看到此界面因为我准备的目录里面是空的所以打开的网页就和我的那个目录一样是空的默认目录设置好后可以教你如何使用了这个web界面的编辑器了点击 new 然后 点击 Python 3 创建 py 文件 进行编辑Jupyter notebook 基础使用教学Jupyter notebook 基础介绍和快捷键操作教学1 是 代码文件名 点击一下就可以修改2 是代码区写代码的3是显示当前代码区是第几次运行Jupyter 的特色就是这个打印变量值时可以用print也可以在末尾调用一遍这个变量不用print的调用变量打印只限在末尾调用时会生效比如下面第二张图一个代码文件的界面分多个单元格各个单元格可以单独执行就像在一个界面同时编辑多个py文件一样但是这些单元格公用同一个变量存储区其他区也给此变量赋值后该变量的原值就会被覆Jupyter 中还有一个特色这个单元格编辑是多元化状态这个区域选择代码可编辑 python 程序Markdown 是将单元格转换为 Mardown 编辑Mardown 是一个轻量的文本标签编辑器常用于给其他 Python单元格的程序进行标签介绍让界面结构化更完整看起来更舒适完美补上了单界面多单元格程序带来的杂乱感报错时找错更加容易标题选项是Markdown的分支会把当前单元格程序化为二级标题但是不能改成其他Markdown标签Jupyter 这些基础操作教完后会对Markdown编辑进行教学 Jupyter 主要就 Markdown 和 Python 编辑其他选项都是工具点击使用的在这个web编辑器界面终端的下载指令直接在单元格执行不同的是pip前要加 ! 才会识别 pip 是指令在编辑模式中 点击 Esc 可进入命令模式在命令模式按 Enter 可进入编辑模式在命令模式下按 ↑ 或 K 可选中上方单元格在命令模式下按 ↓ 或 J 可选中下方单元格按 Shift Enter 运行当前单元格并选中下一个单元格在任意模式中按 Ctrl Enter 可运行当前单元格在任意模式中按 Alt Enter 可运行当前单元格并在下面插入一个新单元格在编辑模式中 按 Ctrl Home 可跳转到单元格开头 (看这个图时注意光标位置)在编辑模式中 按 Ctrl End 可跳转到单元格结尾 (看这个图时注意光标位置)在编辑模式中光标放函数或变量中再按 Shift Tab 可显示函数或变量的提示信息再点一下 ^ 可看全部信息在编辑模式中按 Ctrl Shift - 分割单元格会从光标位置开始分割在编辑模式中按 Ctrl D 删除当前行会删除当前光标所在行在编辑模式中按 Ctrl Z 撤销上一步操作可以一直撤销到初始的样子就是文件刚打开的样子如果该代码在某一步退出保存再重新打开后初始的模型会被刷新覆盖在命令模式中按 Y 可以将当前单元格转换为代码单元格下面示例图的单元格是 Markdown 单元格命令模式选中后按 Y在命令模式中按 M 将单元格内容转换为Markdown形式在命令模式中按 H 显示快捷键帮助在程序执行时可以在命令模式中按 I I (这是字母AI的I连按两次)中断Notebook内核无需选中某单元格因为中断内核会断该文件所有执行中的程序即可中断程序的运行在程序执行时可以在命令模式中按 0 0 可重启Notebook内核连续按两次零重启内核被断掉的程序不会报错且被断掉的单元格的序列号为空单元格前的序列号也会更新重新从1开始 这里会讲一下这个重启内核的执行原理如果看着烧脑不舒服可以不看后面经验上来了就能懂这里这个原理重启是记忆刷新然后重启内核这一刻的文件状态会被做为重启之后的初始数据但是底层缓存为空也是说这个时候直接在一个空单元格中调用之前的变量会报错没有此变量这个时候Ctrl Z 返回上一步暂时无用因为初始数据刷新了当前就是初始数据在命令模式中选择你要显示行号的单元格然后按 L 可显示/隐藏行号在命令模式中 按 Shift ↑ / ↓ 可扩大选中上/下方单元格在命令模式中按 A 可在上方插入新单元格在命令模式中按 B 可在下方插入新单元格在命令模式中按 X 可剪切选中的单元格在命令模式中按 V 可粘贴到选中单元格的下方单元格在命令模式中按 C 复制选中的单元格在命令模式中按 Shift V 粘贴到选中单元格的上方单元格在命令模式中按 D D 可删除选中的单元格Shift M合并选中的单元格Markdown 标签编辑教学 标签类型语言的主要结构就是 标签 加 内容单标签的内容跟在标签后面有上标签加下标签的这种标签组的内容插在标签组的中间所有都是这种就两结构看起来复杂的其实结构也无非就是这两种结构的各种嵌套把一个 a 结构或编程中的方法的应用 当做内容放 b 结构中 这种操作就是嵌套a中可以嵌套bb中还可以嵌套 c、d、e、f这种还可以说a中嵌 b、c、d、e、f Markdown 语法(这个Markdown自己内置的这个语法的符号喊做标签也是没毛病的都是一个作用)Markdown是一种轻量级标记语言它允许人们使用易读易写的纯文本格式编写文档然后转换成有效的XHTML或者HTML文档。以下是一些常用的Markdown标签及其功能一、标题语法 Markdown 语法符 和内容之间需用空格分隔# 一级标题## 二级标题### 三级标题#### 四级标题##### 五级标题###### 六级标题二、斜体语法 Markdown 除了标题以外的与 语法符 和内容 之间没有空格分隔 *斜体文本* 或 _斜体文本_**粗体文本** 或 __粗体文本__***加粗斜体文本*** 或 ___加粗斜体文本___三、水平分隔线在标准的Markdown语法中分割线通常使用三个以上的连字符---或星号***来创建但是它们的颜色通常是浏览器或渲染器默认的样式Markdown本身不支持直接定义分割线的颜色或样式如果觉得这个分割线颜色太浅了可以使用HTML的--- 或 *** 或 ___四、~~删除线~~五、使用三个或更多的反引号 包围代码块可以指定语言以获得语法高亮。六、引用链接链接引用 []()执行后会展示替代的文本点击文本即可跳转七、表格语法使用 | 和 - 做Markdown表格每两个管道符 || 中视为格|1| 为 一个 格 |1|2| 为两个格第一个 - 才会被识别为表格 表头和内容的分割标识每行的格的数量一样 且 表头下有一行 |-| 分割标识符 一旦分割标识后分割标识符下面 || 中任意字符都是内容Markdown 使用的 HTML标签Markdown的 HTMl 标签使用比原完整的 HTMl 更简单 绝大部分没有了 繁琐的各个标签中间的必要结构要求 (但是比如表格这个标签整体要表现一个完整的表格那么最基础的thead、tbody这类指定表头表内容的基础标签还是要有的再简化的话至少tr这个指定哪几个数据为一行的这种基础标签还是要有的) 不需要必须写htmlbody等标签任何标签都可以单独提出来独立使用也可以像完整HTML一样的编写 HTML所有的标签都是 头标签 内容 尾标签( /头标签字符 ) 内容可能是另一个标签应用也可能是一个文本字符一、标题标签h1这是一个标签/h1h2这是一个标签/h1h3这是一个标签/h3二、正文标签p这是一个段落/pp这也是一个段落/pu带下划线文本/u二、正文标签p这是一个段落/pp这也是一个段落/pu带下划线文本/u三、style 样式属性strle是css用于定义文本字符串的视觉表现font 样式属性参数1.font-family设置文本的字体族2.color设置文本的颜色3.font-size设置文本的大小4.font-weight设置文本的粗细5.font-style设置文本的风格如斜体1.background-color设置文本的背景颜色 (padding是文本背景的内部空间距离大小设置)2.text-align设置文本的水平对齐方式3.margin设置元素周围的空白区域外边距4.padding设置元素内部的空白区域内边距5.border设置元素的边框样式、宽度和颜色。目前此扩展部分暂时到此更多Mardown的HTML内容可在MDN提供的MDN Web Docs中查看font-family - CSS: Cascading Style Sheets | MDN (mozilla.org)python 基于数据处理与分析基础教学计算机程序基本的执行模式扩展看不懂可以跳过计算机基础层面程序工作可以归纳为两种基本工作一个存储另一个就是判断比如说一个python程序代码 a2print(a1)程序运行时Python解释器首先会为程序分配内存空间。在程序运行期间操作系统会为Python解释器提供一块内存空间来存储所有的数据和变量在这段代码中会有两个主要的内存分配1.堆Heap存储程序运行时的数据对象比如整数 22.栈Stack存储变量名及其对应的引用指向堆中对象的指针比如变量 a在堆中创建一个整数对象 2在栈中创建一个变量 a并将其指向堆中整数对象 2 的地址读取栈中变量 a 的引用这个引用指向堆中的整数对象 2创建一个新的整数对象 1 并存储在堆中执行整数加法操作即将整数对象 2 和整数对象 1 相加得到新的整数对象 3计算表达式 a 1得到整数对象 3将整数对象 3 转换为字符串形式如果需要将 3 送到控制台能让外面的人看见信息是控制台的功能会把传过来的东西显示到屏幕上解读翻译程序的底层就像一个只会认字很笨管理员内存区就好像一栋宿舍楼程序执行时开学了学校来了一个a同学 管理员把a同学带到宿舍楼根据a同学给信息表给a同学分配了一个寝室并把信息表贴在寝室门上a现在状态是2管理员回去后上级给管理员派发了一个print活动文章并明确要求是带a且参加print活动前让a状态1然后管理员去宿舍楼找a管理员一看这么多门分不清a在哪一个里面管理员只能按照老习惯的顺序固定顺序开始用手上拿着a的信息表和经过的每个门上的信息表做对比终于到a的门前了管理员看着门上的信息表能对上了就敲门含a出来a出来后管理员根据指示用带过来的1药剂给a来了一针a状态1管理员对照文章看a已经1了对上要求了可以去print活动区了然后把a带到print活动区参与print活动展示然后大家都知道了a状态为3 至于管理员怎么判断哪条路可以来到宿舍楼的用的操作和到宿舍楼后找a的寝室门一样的操作任何程序在底层硬件中就这两种工作存储和判断后续会为什么是这两种操作这两种操作是怎么用硬件实现万变不离其宗从这个层面去理解分析可以降低复杂的代码分析理解难度看不懂的可以发评论区我对此内容进行相应的优化想跳过这个的也可以不会影响你学后面的内容Python 语法在python在变量的数据类型会根据变量的值自动设置对应数据类型不需要声明Python包括常见的数据类型整数、浮点数、字符串、列表、元组、字典等其他数据类型就是根据代码赋值的类对象来确定比如 df pd.DataFrame() 这个语句调用了DataFrame对象赋给df变量这个df的类型就是DataFrame类型有时候代码中调用某些函数处理后类型也会变出现了变量类型不那么z明显不好判断时可以使用 type()()中插入变量然后打印返回值查看变量数据类型代码语句结束判断和代码块区分用换行和缩进表示换行表示这句话说完了下级代码块的缩进格数大于上级代码块根全局代码块没有缩进条件和循环语句结尾要加冒号Python 基础运算----------------------------------------------------待更新----------------------------------------------------------