【零基础学AI】第 2 章课后练习与答案
第 2 章课后练习与答案下面是一组为教学而构造的虚构邮件数据。它只用来理解特征、标签、训练和推理不能作为真实垃圾邮件过滤规则。建议先做完前四部分再查看答案。 关于《AI 零基础 36 讲》课后训练与正式讲解配套学习本篇是《AI 零基础 36 讲》的配套课后训练与对应章节的正式讲解一起使用。整个系列面向初学者从日常 AI使用逐步进入编程、模型训练和大模型应用开发。✍️先独立作答再核对答案训练围绕本章知识安排概念判断、结果分析或动手任务并提供参考答案与解释。建议先读完对应的正式文章再独立作答遇到困难时回看相关例子最后核对答案。代码题请亲手运行观察程序输出确认自己能解释结果、发现错误并完成修复。做完一道题也要弄清答案为什么成立。训练数据编号发件人是否在联系人中链接数量是否出现催促用语是否索要密码或验证码标签1是0否否正常邮件2否3是否垃圾邮件3否1是是垃圾邮件4是1否否正常邮件5否0否否正常邮件6否4否否垃圾邮件7是2是否正常邮件8否1否是垃圾邮件第一部分 找出特征和标签回答下面三个问题。每一行代表什么。哪四列是特征。模型希望预测的标签是什么。第二部分 写下自己的分类办法观察八封训练邮件写一个你认为可行的分类办法。可以参考下面的形式也可以自己改。如果邮件索要密码或验证码预测为垃圾邮件。 如果发件人不在联系人中并且链接较多预测为垃圾邮件。 其他情况预测为正常邮件。这只是人工写下的规则。机器学习模型通常会计算各项特征对预测概率的影响不一定生成同样的条件句。第三部分 给新邮件做预测不要查看参考标签。先根据训练数据和自己的办法填写最后一列。新邮件发件人是否在联系人中链接数量是否出现催促用语是否索要密码或验证码你的预测A否2是否待填写B是0否否待填写C否0否否待填写D是1是是待填写第四部分 检查陌生样本教学数据为四封新邮件设置了下面的参考标签。新邮件参考标签补充信息A垃圾邮件陌生发件人发送带两个跳转链接的限时促销B正常邮件联系人发送的课程资料C垃圾邮件邮件没有链接要求收件人拨打可疑号码D正常邮件联系人发送的账户安全提醒比较你的预测和参考标签再回答下面三个问题。哪封邮件最容易判断错。现有特征遗漏了什么线索。哪条人工规则需要修改。第五部分 给训练数据补一个例子把邮件 D 加入训练数据。它来自联系人出现催促用语也提醒用户检查账户安全但没有在邮件正文中要求提交密码或验证码。重新观察数据后判断“只要语气催促就是垃圾邮件”这条规则是否还可靠。再想一想真实系统若只统计催促词会把哪些正常邮件误判。参考答案第一部分答案每一行代表一封已经确认类别的历史邮件。发件人是否在联系人中、链接数量、是否出现催促用语、是否索要密码或验证码是四项特征。标签是“正常邮件”或“垃圾邮件”。第三部分参考预测按照训练数据里较明显的规律A 可以预测为垃圾邮件B 可以预测为正常邮件。C 很可能被简单规则预测为正常邮件D 很可能被“索要密码或验证码”这项特征预测为垃圾邮件。第四部分答案C 和 D 最能暴露现有特征的不足。C 没有链接也没有直接索要密码或验证码现有特征没有记录电话号码、正文语义和发件域名。模型缺少这些信息容易把它判成正常邮件。D 来自联系人邮件本身是正常的安全提醒。表格把“安全提醒”和“在邮件中索要敏感信息”压成了过于简单的字段可能导致误判。更好的数据要把实际动作和上下文记录得更清楚。第五部分答案“只要语气催促就是垃圾邮件”不可靠。缴费提醒、考试通知、账户安全警告和工作安排都可能带有时间要求。催促用语可以作为一条线索不能单独承担最终判断。自我检查完成后试着不用看正文回答下面五个问题。样本、特征和标签分别是什么训练阶段为什么需要标签评估数据为什么不能提前参加训练推理阶段通常能看到哪些信息数据缺少一类场景时可能发生什么五个问题能够说清楚并能指出 C 或 D 判断困难的原因就可以进入第 3 章。