一套房子可以同时有面积、房龄、位置等许多变量。变量一多,图画不出来,分类规律也容易被淹没。Carolina Bento 的这篇教程用带类别标签的房产数据演示 Linear Discriminant Analysis(LDA,线性判别分析):把多项特征压成少数综合坐标,同时让不同类别尽量分开、同类样本尽量聚拢。
关键在于,LDA 不只是“少看几个变量”。它会利用已知标签,寻找类别间差异大、类别内差异小的投影方向。这里很容易和 PCA(主成分分析)混淆:PCA 不看标签,只保留整体变化最大的方向;LDA 追求的则是更清楚的分类边界。因此,变化最大不等于最适合分类。若数据只有 K 类,经典 LDA 最多得到 K−1 条有效判别轴;二分类房产数据无论原始变量多少,主要判别方向都只有一条。
这篇文章的价值是把抽象方法放进真实分类场景,也提醒读者 LDA 假设数据近似线性可分、各类服从正态分布并共享协方差矩阵。供稿未披露房产数据的具体字段、类别设置或效果数字,因此它更适合作为操作思路的入门演示,而非性能结论。