当前位置:首页 » 编程语言 » python对角化

python对角化

发布时间: 2024-12-26 07:29:52

python怎么数据进行pca

基本步骤:

  1. 对数据进行归一化处理(代码中并非这么做的,而是直接减去均值)

  2. 计算归一化后的数据集的协方差矩阵

  3. 计算协方差矩阵的特征值和特征向量

  4. 保留最重要的k个特征(通常k要小于n),也可以自己制定,也可以选择一个阈值,然后通过前k个特征值之和减去后面n-k个特征值之和大于这个阈值,则选择这个k

  5. 找出k个特征值对应的特征向量

  6. 将m * n的数据集乘以k个n维的特征向量的特征向量(n * k),得到最后降维的数据。

其实PCA的本质就是对角化协方差矩阵。有必要解释下为什么将特征值按从大到小排序后再选。首先,要明白特征值表示的是什么?在线性代数里面我们求过无数次了,那么它具体有什么意义呢?对一个n*n的对称矩阵进行分解,我们可以求出它的特征值和特征向量,就会产生n个n维的正交基,每个正交基会对应一个特征值。然后把矩阵投影到这N个基上,此时特征值的模就表示矩阵在该基的投影长度。

特征值越大,说明矩阵在对应的特征向量上的方差越大,样本点越离散,越容易区分,信息量也就越多。因此,特征值最大的对应的特征向量方向上所包含的信息量就越多,如果某几个特征值很小,那么就说明在该方向的信息量非常少,我们就可以删除小特征值对应方向的数据,只保留大特征值方向对应的数据,这样做以后数据量减小,但有用的信息量都保留下来了。PCA就是这个原理。

热点内容
手游编程培训 发布:2025-03-11 09:43:38 浏览:510
php获取浏览器 发布:2025-03-11 09:03:31 浏览:877
安卓常驻后台需要什么权限 发布:2025-03-11 08:58:26 浏览:181
绿源电动车威牛是什么配置 发布:2025-03-11 08:47:34 浏览:10
wps加密文件密码忘记 发布:2025-03-11 08:36:49 浏览:47
可编程渲染管线 发布:2025-03-11 08:35:23 浏览:455
一般人手机设置密码会是什么 发布:2025-03-11 08:27:19 浏览:416
缓存电视剧软件 发布:2025-03-11 08:26:26 浏览:135
安卓怎么下载ios14 发布:2025-03-11 08:25:50 浏览:567
软件调试源码 发布:2025-03-11 08:24:59 浏览:489