0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

聚类分析的简单案例

倩倩 来源:网络整理 2018-02-23 10:00 次阅读

基本概念

聚类就是一种寻找数据之间一种内在结构的技术。聚类把全体数据实例组织成一些相似组,而这些相似组被称作聚类。处于相同聚类中的数据实例彼此相同,处于不同聚类中的实例彼此不同。聚类技术通常又被称为无监督学习,因为与监督学习不同,在聚类中那些表示数据类别的分类或者分组信息是没有的。

通过上述表述,我们可以把聚类定义为将数据集中在某些方面具有相似性的数据成员进行分类组织的过程。因此,聚类就是一些数据实例的集合,这个集合中的元素彼此相似,但是它们都与其他聚类中的元素不同。在聚类的相关文献中,一个数据实例有时又被称为对象,因为现实世界中的一个对象可以用数据实例来描述。同时,它有时也被称作数据点(Data Point),因为我们可以用r 维空间的一个点来表示数据实例,其中r 表示数据的属性个数。下图显示了一个二维数据集聚类过程,从该图中可以清楚地看到数据聚类过程。虽然通过目测可以十分清晰地发现隐藏在二维或者三维的数据集中的聚类,但是随着数据集维数的不断增加,就很难通过目测来观察甚至是不可能。

聚类分析的简单案例

SAS聚类分析案例

1 问题背景

考虑下面案例,一个棒球管理员希望根据队员们的兴趣相似性将他们进行分组。显然,在该例子中,没有响应变量。管理者希望能够方便地识别出队员的分组情况。同时,他也希望了解不同组之间队员之间的差异性。

该案例的数据集是在SAMPSIO库中的DMABASE数据集。下面是数据集中的主要的变量的描述信息:

聚类分析的简单案例

在这个案例中,设置TEAM,POSITION,LEAGUE,DIVISION和SALARY变量的模型角色为rejected,设置SALARY变量的模型角色为rejected是由于它的信息已经存储在LOGSALAR中。在聚类分析和自组织映射图中是不需要目标变量的。如果需要在一个目标变量上识别分组,可以考虑预测建模技术或者定义一个分类目标。

2 聚类方法概述

聚类分析经常和有监督分类相混淆,有监督分类是为定义的分类响应变量预测分组或者类别关系。而聚类分析,从另一方面考虑,它是一种无监督分类技术。它能够在所有输入变量的基础上识别出数据集中的分组和类别信息。这些组、簇,赋予不同的数字。然而,聚类数目不能用来评价类别之间的近似关系。自组织映射图尝试创建聚类,并且在一个图上用图形化的方式绘制出聚类信息,在此处我们并没有考虑。

1) 建立初始数据流

聚类分析的简单案例

2) 设置输入数据源结点

打开输入数据源结点

从SAMPSIO库中选择DMABASE数据集

设置NAME变量的模型角色为id,TEAM,POSIOTION,LEAGUE,DIVISION和SALARY变量的模型角色为rejected

探索变量的分布和描述性统计信息

选择区间变量选项卡,可以观察到只有LOGSALAR和SALARY变量有缺失值。选择类别变量选项卡,可以观察到没有缺失值。在本例中,没有涉及到任何类别变量。

关闭输入数据源结点,并保存信息。

3) 设置替代结点

虽然并不是总是要处理缺失值,但是有时候缺失值的数量会影响聚类结点产生的聚类解决方案。为了产生初始聚类,聚类结点往往需要一些完整的观测值。当缺失值太多的时候,需要用替代结点来处理。虽然这并不是必须的,但是在本例中使用到了。

4) 设置聚类结点

打开聚类结点,激活变量选项卡。K-means聚类对输入数据是敏感的。一般情况下,考虑对数据集进行标准化处理。

在变量选项卡,选择标准偏差单选框

选择聚类选项卡

观察到默认选择聚类数目的方法是自动的

关闭聚类结点

聚类分析的简单案例

5) 聚类结果

在聚类结点处运行流程图,查看聚类结果。

聚类分析的简单案例

6) 限定聚类数目

打开聚类结点

选择聚类选项卡

在聚类数目选择部分,点击选择标准按钮

输入最大聚类数目为10

点击ok,关闭聚类结点

聚类分析的简单案例

7)结果解释

我们可以定义每个类别的信息,结合背景识别每个类型的特征。选择箭头按钮,

聚类分析的简单案例

选择三维聚类图的某一类别,

聚类分析的简单案例

在工具栏选择刷新输入均值图图标,

聚类分析的简单案例

点击该图标,可以查看该类别的规范化均值图

同理,可以根据该方法对其他类别进行解释。

8)运用Insight结点

Insight结点可以用来比较不同属性之间的异常。打开insight结点,选择整个数据集,关闭结点。

从insight结点处运行。

变量_SEGMNT_标识类别,distance标识观测值到所在类别中心的距离。运用insight窗口的analyze工具评估和比较聚类结果。

首先把_SEGMNT_的度量方式从interval转换成nominal。

聚类分析的简单案例

聚类分析的简单案例

聚类分析的简单案例

聚类应用

在商业上,聚类分析被用来发现不同的客户群,并且通过购买模式刻画不同的客户群的特征。聚类分析是细分市场的有效工具,同时也可用于研究消费者行为,寻找新的潜在市场、选择实验的市场,并作为多元分析的预处理。在生物上,聚类分析被用来动植物分类和对基因进行分类,获取对种群固有结构的认识。在地理上,聚类能够帮助在地球中被观察的数据库商趋于的相似性。在保险行业上,聚类分析通过一个高的平均消费来鉴定汽车保险单持有者的分组,同时根据住宅类型,价值,地理位置来鉴定一个城市的房产分组。在因特网应用上,聚类分析被用来在网上进行文档归类来修复信息。在电子商务上,聚类分析在电子商务中网站建设数据挖掘中也是很重要的一个方面,通过分组聚类出具有相似浏览行为的客户,并分析客户的共同特征,可以更好的帮助电子商务的用户了解自己的客户,向客户提供更合适的服务。

聚类分析应用——市场细分

聚类是将数据分类到不同的类或者簇这样的一个过程,所以同一个簇中的对象有很大的相似性,而不同簇间的对象有很大的相异性。

从统计学的观点看,聚类分析是通过数据建模简化数据的一种方法。传统的统计聚类分析方法包括系统聚类法、分解法、加入法、动态聚类法、有序样品聚类、有重叠聚类和模糊聚类等。

机器学习的角度讲,簇相当于隐藏模式。聚类是搜索簇的无监督学习过程。与分类不同,无监督学习不依赖预先定义的类或带类标记的训练实例,需要由聚类学习算法自动确定标记,而分类学习的实例或数据对象有类别标记。聚类是观察式学习,而不是示例式的学习。

从实际应用的角度看,聚类分析是数据挖掘的主要任务之一。而且聚类能够作为一个独立的工具获得数据的分布状况,观察每一簇数据的特征,集中对特定的聚簇集合作进一步地分析。聚类分析还可以作为其他算法(如分类和定性归纳算法)的预处理步骤。

聚类分析的核心思想就是物以类聚,人以群分。在市场细分领域,消费同一种类的商品或服务时,不同的客户有不同的消费特点,通过研究这些特点,企业可以制定出不同的营销组合,从而获取最大的消费者剩余,这就是客户细分的主要目的。在销售片区划分中,只有合理地将企业所拥有的子市场归成几个大的片区,才能有效地制定符合片区特点的市场营销战略和策略。金融领域,对基金或者股票进行分类,以选择分类投资风险。

下面以一个汽车销售的案例来介绍聚类分析在市场细分中的应用。

聚类分析的简单案例

商业目标

业务理解:数据名称《汽车销售.csv》。该案例所用的数据是一份关于汽车的数据,该数据文件包含销售值、订价以及各种品牌和型号的车辆的物理规格。订价和物理规格可以从 edmunds.com 和制造商处获得。定价为美国本土售价。如下:

聚类分析的简单案例

业务目标:对市场进行准确定位,为汽车的设计和市场份额预测提供参考。

数据挖掘目标:通过聚类的方式对现有的车型进行分类。

数据准备

通过数据探索对数据的质量和字段的分布进行了解,并排除有问题的行或者列优化数据质量。

聚类分析的简单案例

第一步,我们使用统计节点审核数据的质量,从审核结果中我们发现存在缺失的数据,如下图所示:

聚类分析的简单案例

第二步,对缺失的数据进行处理,我们选择使用缺失填充节点删除这些记录。配置如下:

聚类分析的简单案例

建模

我们选择层次聚类进行分析,尝试根据各种汽车的销售量、价格、引擎、马力、轴距、车宽、车长、制动、排量、油耗等指标对其分类。

因为层次聚类不能自动确定分类数量,因此需要我们以自定义的方式规定最后聚类的类别数。层次聚类节点配置如下(默认配置):

聚类分析的简单案例

可以使用交互表或者右击层次聚类节点查看聚类的结果,如下图所示:

聚类分析的简单案例

再使用饼图查看每个类的大小,结果如下:

聚类分析的简单案例

从图中可见,分成的三个类样本数差异太大,cluster_0和cluster_1包含的样本数都只有1,这样的分类是没有意义的,因此需要重新分类。我们尝试在层次聚类节点的配置中指定新的聚类方法:完全。新的聚类样本数分布如下:

聚类分析的简单案例

cluster_0、 cluster_1、cluster_2的样本数分别为:50、9、93。

聚类分析的简单案例

执行后输出树状/冰柱图,可以从上往下看,一开始是一大类,往下走就分成了两类,越往下分的类越多,最后细分到每一个记录是一类,如下所示:

聚类分析的简单案例

我们可以再使用条形图查看每类的销售量、平均价格,如下图所示:

聚类分析的简单案例

每类总销量分布图

聚类分析的简单案例

每类平均销量分布图

聚类分析的简单案例

每类平均价格分布图

我们再看一下每类的销售额分布情况。首先,我们需要使用Java代码段节点或者派生节点生成销售额字段,配置如下:

再使用饼图查看销售额分布情况,cluster_0、 cluster_1、cluster_2的市场份额分别为:32.39%、0.53%和67.08%,如下图所示:

聚类分析的简单案例

案例小结

通过这个案例,大家可以发现聚类分析确实很简单。进行聚类计算后,主要通过图形化探索的方式评估聚类合理性,以及在确定聚类后,分析每类的特征。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 聚类分析
    +关注

    关注

    0

    文章

    16

    浏览量

    7407
收藏 人收藏

    评论

    相关推荐

    电动机的安装形式有哪些?简单分析

    形式及其简单分析: 卧式安装(B3) 定义 :电动机水平安装,轴向朝上或朝下。 优点 :结构简单,易于维护,适用于大多数工业应用。 缺点 :可能需要额外的支撑结构来保证稳定性。 立式安装(B5) 定义 :电动机垂直安装,轴
    的头像 发表于 10-25 10:50 592次阅读

    发电机的主要工作原理是什么?简单分析

    发电机是一种将机械能转换为电能的设备。它的工作原理基于电磁感应现象,即当导体在磁场中移动时,会在导体中产生电动势(电压)。以下是对发电机工作原理的简单分析: 基本组成部分:发电机主要由转子(或称为
    的头像 发表于 10-24 11:49 311次阅读

    变频电机的主要构造原理是什么?简单分析

    电子技术和控制策略等多个方面。以下是对变频电机主要构造原理的简单分析: 电机设计 变频电机的设计与传统电机有所不同,主要体现在以下几个方面: a. 绝缘材料:由于变频电机在运行过程中会经历高频电压和电流,因此需要
    的头像 发表于 10-24 10:49 218次阅读

    汽车发电机的工作原理是什么?简单分析

    汽车发电机的工作原理主要基于电磁感应原理,其主要目的是为汽车的电气系统提供稳定的电力。以下是汽车发电机工作原理的简单分析: 永磁体:汽车发电机通常使用永磁体作为磁场源。永磁体产生一个稳定的磁场,为
    的头像 发表于 10-24 09:26 299次阅读

    单相电机正反转原理是什么?简单分析

    改变电机的旋转方向。以下是对单相电机正反转原理的简单分析: 单相电机的基本结构 单相电机主要由定子和转子两部分组成。定子是电机的固定部分,通常由硅钢片叠成,内部绕有线圈。转子是电机的旋转部分,通常由硅钢片叠成
    的头像 发表于 10-23 10:17 376次阅读

    Keysight 频谱分析仪(信号分析仪)

    深入测量,以解决频谱分析(信号分析)的棘手问题,还是在制造阶段进行快速、简单的测量,您都需要一台值得信赖的频谱分析仪(信号分析仪)来获得可靠
    的头像 发表于 09-12 08:10 381次阅读
    Keysight 频谱<b class='flag-5'>分析</b>仪(信号<b class='flag-5'>分析</b>仪)

    步进电机的简单介绍

    步进电机的命名,参数,转速简单介绍
    的头像 发表于 04-17 21:40 931次阅读

    一个简单温度报警电路分析

    下面所示的是一个简单温度报警电路被配置为在热敏电阻跟踪的温度下降或升高超过一定水平时发出警报(声音或通过闭合继电器触点)。
    的头像 发表于 02-25 14:40 889次阅读
    一个<b class='flag-5'>简单</b>温度报警电路<b class='flag-5'>分析</b>

    QT串口通信的简单使用

    QT串口通信是上位机和下位机通信常用的通信方式, 也是学习QT必须学会的基础知识, 这篇就简单介绍一下QT串口通信的简单使用.
    的头像 发表于 01-15 09:27 1824次阅读
    QT串口通信的<b class='flag-5'>简单</b>使用

    利用拉曼光谱对用于制药的带状薄膜进行实时定量分析

    作为Otto H. York化学与材料工程系新泽西工程颗粒中心的创办负责人,他的研究和创新改善了用于制药、食品、电子和能源工业等领域的颗粒特性。除了工程微粒外,他和他的同事们还专注于模式识别和聚类分析
    的头像 发表于 01-15 06:34 255次阅读
    利用拉曼光谱对用于制药的带状薄膜进行实时定量<b class='flag-5'>分析</b>

    数字前端电路:简单的边沿检测电路分析

    这个电路的原理很简单。当din上升沿或下降沿到来时,din_re_fe_p产生一个脉冲。后续电路看到这个脉冲,就知道din上升沿或下降沿发生了。
    的头像 发表于 12-14 15:20 1061次阅读
    数字前端电路:<b class='flag-5'>简单</b>的边沿检测电路<b class='flag-5'>分析</b>

    CanEasy多场景应用,让汽车总线测试更简单

    CanEasy是一个基于Windows的总线工具,用于分析和测试CAN、CAN FD和LIN以及汽车以太网系统。通过高度自动化和简单的配置模拟总线流量,CanEasy可用于分析真实网络、模拟虚拟系统
    的头像 发表于 12-11 09:46 1008次阅读
    CanEasy多场景应用,让汽车总线测试更<b class='flag-5'>简单</b>

    使用Raspberry Pi Pico实现简单的逻辑分析

    逻辑分析仪是一种电子仪器,可捕获并显示来自数字系统或数字电路的多个信号。逻辑分析仪可以将捕获的数据转换为时序图、协议解码、状态机跟踪、操作码,或者可以将操作码与源级软件相关联。逻辑分析仪具有先进的触发功能,当用户需要查看数字系统
    的头像 发表于 12-11 09:33 1435次阅读
    使用Raspberry Pi Pico实现<b class='flag-5'>简单</b>的逻辑<b class='flag-5'>分析</b>仪

    两种timing分析模式—GBA与PBA简单梳理

    今天想来聊一聊STA相关的内容。GBA和PBA是在做STA分析的时候的两种分析模式
    的头像 发表于 12-06 15:00 1146次阅读

    利用拉曼光谱对制药应用的条状薄膜进行实时定量分析

    、食品、电子和能源行业应用的颗粒特性。除了工程颗粒之外,他和他的同事还专注于模式识别和聚类分析。 图1:由于FNB的存在,非诺贝特(FNB)条带膜和纯FNB粉末出现了1092 cm -1和1148 cm -1处的拉曼线,而由于基材的原因没有出现明显的拉曼线。数据由 Guluzar Gor
    的头像 发表于 12-01 10:27 253次阅读
    利用拉曼光谱对制药应用的条状薄膜进行实时定量<b class='flag-5'>分析</b>