Week10:无监督学习与序列模型进阶专题

📅 发布时间:2026/9/27 4:22:30
Week10:无监督学习与序列模型进阶专题
摘要本周继续学习李宏毅《机器学习》第 18、19、20 讲内容围绕无监督学习与序列模型进阶展开。前两讲主要讨论无监督学习的基本思路包括聚类、降维、生成模型等方向重点理解模型如何从无标签数据中学习数据分布与结构信息第 20 讲进入序列模型进阶在 RNN 基础上学习门控循环网络与指针网络解决长序列依赖和输出位置依赖问题。通过本周学习进一步补齐无标签数据建模与复杂序列预测任务的知识链路。一、无监督学习概述聚类与降维1.1 无监督学习的基本特点监督学习依赖人工标注标签训练模型无监督学习则直接处理无标签数据目标不是预测给定标签而是学习数据本身的结构、分布、相似性或规律。常见无监督学习任务包括• 聚类将相似样本自动归为同一类• 降维将高维数据压缩到低维空间保留重要信息• 生成模型学习数据分布并生成新样本• 异常检测找出与多数数据差异较大的样本。1.2 聚类 Clustering聚类的目标是把数据划分为若干类别同一类内样本相似不同类间样本差异明显。课程中介绍的典型聚类方法包括1. K-Means 聚类 预先设定类别数 K 随机初始化 K 个聚类中心 将每个样本分配到最近中心所在类别 更新类别中心重复迭代直到收敛。2. 层次聚类 Hierarchical Clustering 不预先指定类别数 通过计算样本或类别之间的相似度逐步合并相似类别 最终形成树形聚类结构。3. DBSCAN 基于密度的聚类方法 不需要预先指定类别数 能发现任意形状的簇并识别噪声点。聚类的关键问题包括• 如何定义样本之间的相似度或距离• 如何确定合适的类别数• 如何处理不同密度、不同形状的数据分布。1.3 降维 Dimensionality Reduction高维数据往往存在冗余信息直接训练模型不仅计算成本高还可能影响效果。降维的目标是在保留重要信息的前提下将数据映射到低维空间。课程中提到的典型降维方法包括1. 主成分分析 PCA 寻找数据方差最大的投影方向 将高维数据投影到若干主成分上 是线性降维方法。2. t-SNE 主要用于数据可视化 更关注保留局部结构 适合将高维数据映射到二维或三维进行观察。降维常用于数据可视化、数据预处理、减少计算量等场景。二、无监督学习生成模型2.1 生成模型的基本思想生成模型关注的是数据本身的分布目标是学习样本是如何产生的而不仅仅是区分不同类别。判别模型关心 “这张图属于哪一类”生成模型关心 “这类图一般长什么样”。生成模型的典型应用包括• 图像生成• 文本生成• 数据增强• 异常检测。2.2 生成模型的常见类型课程中介绍了多种生成模型思路包括1. 高斯混合模型 GMM 假设数据由多个高斯分布混合生成 每个分量对应一种数据模式 可用于聚类、密度估计和异常检测。2. 变分自编码器 VAE 由编码器 Encoder 和解码器 Decoder 组成 编码器将输入映射到潜在空间 解码器从潜在空间重构输入 通过训练让潜在空间具有较好的分布性质。3. 生成对抗网络 GAN 包含生成器 Generator 和判别器 Discriminator 生成器负责生成样本 判别器负责判断样本是真实还是生成 二者通过对抗训练共同提升。4. 自回归生成模型 Autoregressive Model 假设数据可以按顺序逐步生成 每个位置的生成依赖前面已经生成的内容 常用于文本、语音、图像等序列生成任务。2.3 生成模型的评价难点生成模型不容易像分类任务那样直接用准确率评价常见评价思路包括• 人工判断生成样本质量• 使用生成样本训练分类器间接衡量生成数据的有效性• 计算生成样本与真实样本在特征空间中的分布差异。三、Gated RNN门控循环网络3.1 标准 RNN 的局限RNN 能够处理序列数据但在长序列中容易出现梯度消失或梯度爆炸导致模型难以保存很早之前的信息。门控循环网络的提出就是为了让模型更有选择地• 记住重要信息• 遗忘无用信息• 更新当前状态• 控制信息流动。3.2 LSTM 的基本结构LSTM 是典型的门控循环网络包含三个门结构1. 遗忘门 Forget Gate 决定从细胞状态中丢弃哪些信息 帮助模型忘记不再重要的历史信息。2. 输入门 Input Gate 决定哪些新信息需要存入细胞状态 控制当前输入对状态的更新程度。3. 输出门 Output Gate 决定细胞状态中哪些信息需要输出 控制当前隐藏状态的内容。LSTM 通过细胞状态长期保存信息缓解标准 RNN 的长序列依赖问题。3.3 GRU 的基本思想GRU 是 LSTM 的简化版本将部分门结构合并通常包括• 更新门 Update Gate• 重置门 Reset Gate。GRU 参数更少训练效率更高在很多任务中也能取得较好效果。3.4 门控循环网络的应用门控循环网络常用于处理时序依赖较强的任务例如• 语音识别• 文本生成• 机器翻译• 时间序列预测• 对话系统。四、Pointer Network指针网络4.1 从 Seq2Seq 到 Pointer Network传统 Seq2Seq 模型在输出时通常从固定词表中选择结果但某些任务的输出不是固定词表而是输入序列中的某个位置或某些位置。例如• 从句子中抽取关键信息• 解决组合优化问题• 选择输入中的特定元素。这时模型需要学会 “指向” 输入中的位置而不是只从固定词表里生成结果。4.2 Pointer Network 的基本思路Pointer Network 使用注意力机制来决定当前步骤应该关注输入序列中的哪个位置。核心过程包括1. 编码器处理输入序列得到每个位置的表示2. 解码器在每一步维护当前状态3. 解码器将当前状态与输入各位置表示做匹配4. 通过注意力权重选择一个或多个输入位置作为输出。4.3 Pointer Network 的适用场景课程中提到的典型应用包括• 组合优化问题如 TSP• 信息抽取• 句法分析中的某些结构预测• 输出依赖输入位置的任务。4.4 Pointer Network 与传统 Seq2Seq 的区别模型 输出方式 适用场景Seq2Seq 从固定词表生成 机器翻译、文本摘要等Pointer Network 指向输入中的位置 抽取、组合优化、位置选择任务本周拓展思考1. 无监督学习与监督学习最大的区别在于是否有标签无监督学习更关注数据本身的结构和分布适合标签缺失或难以大量标注的场景。2. 聚类和降维都属于无监督学习但目标不同聚类关注样本划分降维关注数据表示。3. 生成模型不是简单分类而是学习数据分布因此可以生成新样本但评价难度通常高于分类任务。4. 标准 RNN 处理长序列时存在信息遗忘问题LSTM 和 GRU 通过门控机制增强信息记忆能力。5. Pointer Network 不局限于固定词表输出能够指向输入中的位置更适合处理输出依赖输入位置的任务。总结本周学习了李宏毅《机器学习》第 18、19、20 讲内容重点覆盖无监督学习中的聚类、降维、生成模型以及序列模型进阶中的 Gated RNN 和 Pointer Network。无监督学习让模型能够从无标签数据中学习结构与分布生成模型进一步实现数据生成Gated RNN 通过门控机制缓解长序列依赖问题Pointer Network 则通过注意力机制实现对输入位置的选择。