正确选择聚类算法的建议-德赢Vwin官网网

聚类算法十分容易上手，但是选择恰当的聚类算法并不是一件容易的事。

数据聚类是搭建一个正确数据模型的重要步骤。数据分析应当根据数据的共同点整理信息。然而主要问题是，什么通用性参数可以给出最佳结果，以及什么才能称为“最佳”。

本文适用于菜鸟数据科学家或想提升聚类算法能力的专家。下文包括最广泛使用的聚类算法及其概况。根据每种方法的特殊性，本文针对其应用提出了建议。

四种基本算法以及如何选择

聚类模型可以分为四种常见的算法类别。尽管零零散散的聚类算法不少于100种，但是其中大部分的流行程度以及应用领域相对有限。

基于整个数据集对象间距离计算的聚类方法，称为基于连通性的聚类（connectivity-based）或层次聚类。根据算法的“方向”，它可以组合或反过来分解信息——聚集和分解的名称正是源于这种方向的区别。最流行和合理的类型是聚集型，你可以从输入所有数据开始，然后将这些数据点组合成越来越大的簇，直到达到极限。

层次聚类的一个典型案例是植物的分类。数据集的“树”从具体物种开始，以一些植物王国结束，每个植物王国都由更小的簇组成（门、类、阶等）。

层次聚类算法将返回树状图数据，该树状图展示了信息的结构，而不是集群上的具体分类。这样的特点既有好处，也有一些问题：算法会变得很复杂，且不适用于几乎没有层次的数据集。这种算法的性能也较差：由于存在大量的迭代，因此整个处理过程浪费了很多不必要的时间。最重要的是，这种分层算法并不能得到精确的结构。

同时，从预设的类别一直分解到所有的数据点，类别的个数不会对最终结果产生实质性影响，也不会影响预设的距离度量，该距离度量粗略测量和近似估计得到的。

根据我的经验，由于简单易操作，基于质心的聚类（Centroid-based）是最常出现的模型。该模型旨在将数据集的每个对象划分为特定的类别。簇数（k）是随机选择的，这可能是该方法的最大问题。由于与k最近邻居（kNN）相似，该k均值算法在机器学习中特别受欢迎。（附链接：https://www.kaggle.com/chavesfm/tuning-parameters-for-k-nearest-neighbors-iris）

计算过程包括多个步骤。首先，输入数据集的目标类别数。聚类的中心应当尽可能分散，这有助于提高结果的准确性。

其次，该算法找到数据集的每个对象与每个聚类中心之间的距离。最小坐标距离（若使用图形表示）确定了将对象移动到哪个群集。

之后，将根据类别中所有点的坐标平均值重新计算聚类的中心。重复算法的上一步，但是计算中要使用簇的新中心点。除非达到某些条件，否则此类迭代将继续。例如，当簇的中心距上次迭代没有移动或移动不明显时，聚类将结束。

尽管数学和代码都很简单，但k均值仍有一些缺点，因此我们无法在所有情景中使用它。缺点包括：

因为优先级设置在集群的中心，而不是边界，所以每个集群的边界容易被疏忽。

无法创建数据集结构，其对象可以按等量的方式分类到多个群集中。

需要猜测最佳类别数（k），或者需要进行初步计算以指定此量规。

相比之下，期望最大化算法可以避免那些复杂情况，同时提供更高的准确性。简而言之，它计算每个数据集点与我们指定的所有聚类的关联概率。用于该聚类模型的主要工具是高斯混合模型（GMM）–假设数据集的点服从高斯分布。（链接：https://www.encyclopedia.com/science-and-technology/mathematics/mathematics/normal-distribution#3）

k-means算法可以算是EM原理的简化版本。它们都需要手动输入簇数，这是此类方法要面对的主要问题。除此之外，计算原理（对于GMM或k均值）很简单：簇的近似范围是在每次新迭代中逐渐更新的。

与基于质心的模型不同，EM算法允许对两个或多个聚类的点进行分类-它仅展示每个事件的可能性，你可以使用该事件进行进一步的分析。更重要的是，每个聚类的边界组成了不同度量的椭球体。这与k均值聚类不同，k均值聚类方法用圆形表示。但是，该算法对于不服从高斯分布的数据集根本不起作用。这也是该方法的主要缺点：它更适用于理论问题，而不是实际的测量或观察。

最后，基于数据密度的聚类成为数据科学家心中的最爱。（链接：http://www.mastersindatascience.org/careers/data-scientist/）这个名字已经包括了模型的要点——将数据集划分为聚类，计数器会输入ε参数，即“邻居”距离。因此，如果目标点位于半径为ε的圆（球）内，则它属于该集群。

具有噪声的基于密度的聚类方法（DBSCAN）将逐步检查每个对象，将其状态更改为“已查看”，将其划分到具体的类别或噪声中，直到最终处理整个数据集。用DBSCAN确定的簇可以具有任意形状，因此非常精确。此外，该算法无需人为地设定簇数 —— 算法可以自动决定。

尽管如此，DBSCAN也有一些缺点。如果数据集由可变密度簇组成，则该方法的结果较差；如果对象的位置太近，并且无法轻易估算出ε参数，那么这也不是一个很好的选择。

总而言之，我们并不能说选择了错误的算法，只能说其中有些算法会更适合特定的数据集结构。为了采用最佳的（看起来更恰当的）算法，你需要全面了解它们的优缺点。

例如，如果某些算法不符合数据集规范，则可以从一开始就将其排除在外。为避免繁琐的工作，你可以花一些时间来记住这些信息，而无需反复试验并从自己的错误中学习。

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表德赢Vwin官网网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

聚类算法

聚类算法

+关注

关注
2

文章
118

浏览量
12126
机器学习

机器学习

+关注

关注
66

文章
8406

浏览量
132556

加密算法的选择对于加密安全有多重要？

加密算法的选择对于加密安全至关重要，因为它直接影响到数据保护的有效性和可靠性。以下是几个关键点来说明加密算法选择的重要性：加密强度：加密算法

发表于 12-17 15:59 •64次阅读

大带宽服务器托管选择建议

大带宽服务器托管是指将具有高速网络连接传输速率的服务器，放置在专业的数据中心内进行管理和维护。主机推荐小编为您整理发布大带宽服务器托管的一些关键信息及选择建议。

发表于 10-29 11:44 •136次阅读

MOS管如何正确选择？

在现代电子电路中，MOS管(金属氧化物半导体场效应晶体管)因其低功耗、高输入阻抗和易于集成等优点，被广泛应用于各种电子设备中。然而，正确选择MOS管对于确保电路的性能和可靠性至关重要。本文将详细介绍

发表于 10-09 14:18 •355次阅读

人员轨迹分析算法有哪些？

时段等。这些信息可以对城市规划、交通管理、公共安全等方面具有重要的指导意义。而为了实现人员轨迹分析，我们需要使用一些专门的算法和技术。下面是几种常用的人员轨迹分析算法： 1. 基于密度的聚类

发表于 09-26 10:42 •371次阅读

选择正确的LP8860-Q1 EEPROM版本

德赢Vwin官网网站提供《选择正确的LP8860-Q1 EEPROM版本.pdf》资料免费下载

发表于 09-20 09:10 •0次下载

为MCU扩展选择正确的多路复用器

德赢Vwin官网网站提供《为MCU扩展选择正确的多路复用器.pdf》资料免费下载

发表于 09-18 11:52 •0次下载

选择正确的德州仪器 (TI) 信号开关应用说明

德赢Vwin官网网站提供《选择正确的德州仪器 (TI) 信号开关应用说明.pdf》资料免费下载

发表于 09-12 10:14 •0次下载

如何正确选择步进电机驱动器

步进电机驱动器是步进电机系统中的重要组成部分，它负责将控制信号转换为步进电机所需的电流和电压，以驱动电机进行精确的角度或线性位移。正确选择步进电机驱动器对于保证步进电机系统的正常运行、提高控制精度

发表于 06-05 18:04 •2256次阅读

如何正确选择一体成型插件电感规格尺寸

如何正确选择一体成型插件电感规格尺寸gujing 编辑：谷景电子一体成型插件电感是应用特别普遍的一款电感元件，它在电子电路中的是其他电子元器件没有办法取代的。要充分发挥一体成型插件电感的作用，正确

发表于 05-06 16:27 •461次阅读

谷景教你如何正确选择铁氧体磁芯电感的规格

谷景教你如何正确选择铁氧体磁芯电感的规格编辑：谷景电子我们都知道在电感方案的应用中，选型工作至关重要。近年来随着电子设备功能的不断增强与完善，电磁兼容性成为了电路设计中不可忽视的问题。铁氧体磁芯

发表于 04-24 16:14 •435次阅读

选择正确的功率因数校正(PFC)拓扑

德赢Vwin官网网站提供《选择正确的功率因数校正(PFC)拓扑.pdf》资料免费下载

发表于 03-18 14:35 •0次下载

如何选择合适的线路板TG值？捷多邦为您提供专业的建议

如何选择合适的线路板TG值？捷多邦为您提供专业的建议

发表于 03-01 10:50 •529次阅读

BUCK电路元件的耐压值该如何正确选择？

BUCK电路元件的耐压值该如何正确选择？选择BUCK电路元件的耐压值是设计和应用电路的重要一环。耐压值的选取直接影响到电路的可靠性、性能和寿命。在进行正确的耐压值

发表于 01-31 16:11 •1000次阅读

如何正确选择DS监控阈值？

Vds 时，我 CAN 确认中断是否由外部 LED 提供服务。该负载会造成阈值设置为 0.25 的过流状态。当阈值更改为 0.50 且负载相同时，我们不会创建过流状态，因为 Vds 没有超过阈值。我的问题是如何正确选择 DS 监控阈值？

发表于 01-29 08:15

浪涌保护元件怎么选择才正确

浪涌保护元件怎么选择才正确浪涌保护元件的正确选择是确保电气设备免受过电压和电流浪涌的损害。在选择浪涌保护元件时，需要考虑以下几个因素：设

发表于 01-03 11:43 •761次阅读

搜索历史

正确选择聚类算法的建议

评论

加密算法的选择对于加密安全有多重要？

大带宽服务器托管选择建议

MOS管如何正确选择？

人员轨迹分析算法有哪些？

选择正确的LP8860-Q1 EEPROM版本

为MCU扩展选择正确的多路复用器

选择正确的德州仪器 (TI) 信号开关应用说明

如何正确选择步进电机驱动器

如何正确选择一体成型插件电感规格尺寸

谷景教你如何正确选择铁氧体磁芯电感的规格

选择正确的功率因数校正(PFC)拓扑

如何选择合适的线路板TG值？捷多邦为您提供专业的建议

BUCK电路元件的耐压值该如何正确选择？

如何正确选择DS监控阈值？

浪涌保护元件怎么选择才正确