Skip to Content
基于scikit-learn和PyTorch的实践机器学习
book

基于scikit-learn和PyTorch的实践机器学习

by Aurélien Géron
October 2025
Intermediate to advanced
878 pages
12h 53m
Chinese
O'Reilly Media, Inc.
Content preview from 基于scikit-learn和PyTorch的实践机器学习

第 8 章 非监督学习技术 无监督学习技术

本作品已使用人工智能进行翻译。欢迎您提供反馈和意见:translation-feedback@oreilly.com

图灵奖获得者、Meta 首席人工智能科学家 Yann LeCun 有一句名言:"如果智能是一块蛋糕,那么无监督学习就是蛋糕,有监督学习就是蛋糕上的糖霜,而强化学习则是蛋糕上的樱桃"(NeurIPS 2016)。换句话说,无监督学习潜力巨大,而我们才刚刚开始涉足。事实上,绝大多数可用数据都是无标签的:我们有输入特征X,但没有标签Y。

假设你想创建一个系统,给制造生产线上的每件物品拍几张照片,然后检测出哪些物品有缺陷。您可以非常容易地创建一个自动拍照的系统,这样每天就可以获得成千上万张照片。这样,您就可以在几周内建立一个相当大的数据集。但是,等等,这里没有标签!如果你想训练一个普通的二元分类器来预测一个物品是否有缺陷,你就需要给每张图片贴上 "缺陷 "或 "正常 "的标签。这通常需要人类专家坐下来手动查看所有图片。这是一项耗时长、成本高且繁琐的工作,因此通常只能对一小部分可用图片进行标注。因此,标注的数据集会相当小,分类器的性能也会令人失望。此外,每当公司对产品进行任何改动时,整个过程都需要从头开始。如果算法可以直接利用未标注的数据,而不需要人类对每张图片进行标注,那岂不是更好?这就是无监督学习。

在第 7 章中,我们介绍了最常见的无监督学习任务:降维。在本章中,我们将介绍更多的无监督任务:

聚类

聚类的目的是将相似的实例归为一组。聚类是数据分析、客户细分、推荐系统、搜索引擎、图像细分、半监督学习、降维等方面的绝佳工具。

异常检测(也称离群点检测)

聚类的目的是学习 "正常 "数据的样子,然后利用它来检测异常实例。这些实例被称为异常值或离群值, ,而正常实例被称为离群值。 异常检测在各种应用中都很有用,例如欺诈检测、检测制造过程中的缺陷产品、识别时间序列中的新趋势,或者在训练另一个模型之前从数据集中移除异常值,这样可以显著提高生成模型的性能。

密度估计

这个 就是估计产生数据集的随机过程的概率密度函数(PDF) 。1密度估计通常用于异常检测:位于密度极低区域的实例很可能是异常的。它还可用于数据分析和可视化。

准备吃蛋糕了吗?我们将从k-means 和 DBSCAN 这两种聚类算法开始,然后讨论高斯混合模型,看看它们如何用于密度估计、聚类和异常检测。

聚类算法:k-means 和 DBSCAN

在享受登山乐趣时,您偶然发现了一种从未见过的植物。你环顾四周,又发现了几株。它们并不完全相同,但却足够相似,让您知道它们很可能属于同一物种(或至少同一属)。你可能需要植物学家来告诉你这是什么物种,但你肯定不需要专家来识别外观相似的物体群。这就是所谓的聚类(clustering): 它的任务是识别相似的实例,并将它们分配到簇或相似实例组中。

就像在分类 中一样,每个实例都会被分配到一个组中。不过,与分类不同的是,聚类是一项无监督任务,没有标签,因此算法需要自己找出如何对实例进行分组。请看图 8-1:左边是虹膜数据集(第 4 章中介绍过),其中每个实例的种类(即其类别)都用不同的马克笔表示。这是一个标记数据集,非常适合使用逻辑回归、SVM 或随机森林分类器等分类算法。右边是相同的数据集,但没有标签,因此不能再使用分类算法。这就是聚类算法的用武之地:许多聚类算法都能轻松检测到左下方的聚类。用我们的眼睛也很容易看到,但右上方的聚类是由两个不同的子聚类组成的,这就不那么明显了。尽管如此,该数据集还有两个额外的特征(萼片长度和宽度)没有在这里体现出来,而聚类算法可以很好地利用所有特征,因此事实上它们可以很好地识别出三个聚类(例如,使用高斯混合模型,150 ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

AirBnbBlueOriginElectronic ArtsHomeDepotNasdaqRakutenTata Consultancy Services

QuotationMarkO’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.
Julian F.
Head of Cybersecurity
QuotationMarkI wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.
Addison B.
Field Engineer
QuotationMarkI’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.
Amir M.
Data Platform Tech Lead
QuotationMarkI'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.
Mark W.
Embedded Software Engineer

You might also like

编写整洁的Python代码(第2版)

编写整洁的Python代码(第2版)

Posts & Telecom Press, Mariano Anaya
生成式人工智能可视化

生成式人工智能可视化

Priyanka Vergadia, Valliappa Lakshmanan
AI工程

AI工程

Chip Huyen

Publisher Resources

ISBN: 0642572270117