第3章 从大数据中学习
前两章介绍了大数据革命下智能机器的背景,并概述了大数据是如何推动人工智能快速发展的,同时还强调了为通用知识表示构建统一词汇表的必要性,以及本体如何满足这一需求并构建语义世界观。
人类追求的知识源于信息,而信息又来源于我们产生的海量数据。知识帮助补充和增强人类能力的机器进行合理决策。前面已经介绍了RDF如何为知识资产提供语义骨架,顺带介绍了OWL的基础和RDFS的查询语言SPARQL。
本章将基于Spark的机器学习库介绍部分机器学习的基本概念,并深入研究一些算法。作为一种通用的大数据计算引擎与算法框架,Spark是目前最流行的用于算法实现的计算框架之一。Spark非常适合大数据生态系统,具有简单的编程接口,并且非常有效地利用了分布式和弹性计算框架的强大功能。虽然本章不假设读者具有任何统计学和数学背景,但假如读者具有一定的编程背景,那将有助于理解代码片段,并可尝试使用示例进行试验。
本章将介绍机器学习中各种监督和无监督学习算法,在深入研究之前,将介绍以下内容:回归分析、数据聚类、K均值、数据降维、奇异值分解和主成分分析(PCA)。
最后将概述Spark编程模型和其机器学习库——Spark MLlib。有了这些背景知识后,本章最后将实现一个推荐系统。
3.1 监督学习和无监督学习
机器学习广义上可分为两类:监督学习和无监督学习。顾名思义,这种分类基于历史数据的可用性及其完整性。简单地说,监督算法依赖于趋势数据,或者真实数据。真实数据用于对模型进行泛化,对新的数据点进行预测。
现在让我们通过图3-1所示的例子来理解这个概念。
图3-1 简单训练数据:输入(独立)和目标(依赖)变量
考虑变量y的值依赖于x的值,y随x的变化而成比例变化(想象一个因子的增减成比例地改变另一个因子)。 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access