何为统计学习
统计学习(statistical learning),也称统计机器学习,是计算机基于数据构建概率统计模型,并利用模型对数据进行预测与分析的一门学科。简单来说,就是让计算机从已有数据中发现规律,再用这种规律处理尚未见过的数据。
统计学习以数据为研究对象。其基本假设是:同类数据并非杂乱无章,而是具有一定的统计规律。
统计学习的基本方法可以概括为:
从给定的有限训练数据(training data)出发,假设数据是独立同分布产生的;确定所有候选模型构成的假设空间(hypothesis space),按照一定的评价准则(evaluation criterion)选择最优模型,并通过具体的算法求解,最后使用得到的模型对未知的测试数据(test data)进行预测或分析。
因此,一种统计学习方法由三个基本要素组成:
\[ 统计学习方法 = 模型(model) + 策略(strategy) + 算法(algorithm) \]
- 模型:对数据潜在统计规律的一种表达形式。
- 策略:按照什么标准评价和选择模型。
- 算法:怎样通过计算找到满足评价标准的最优模型。
统计学习的分类
统计学习或机器学习一般包括监督学习、无监督学习、强化学习。有时还包括半监督学习、主动学习。
监督学习
监督学习(supervised learning)是指从标注数据中学习预测模型。每个训练样本都由输入 \(x_i\) 和与之对应的输出 \(y_i\) 组成,模型需要学习从输入到输出的统计规律,并对新的输入进行预测。