聚类算法评价指标——基于DBI指数的k-means算法（python代码）

文章目录

1 DBI指数介绍
2 优点
3 定义值
4 这篇博文公式挺多挺费事的，觉得有用的话可以点击收藏关注~~点赞是我更新的无限动力！！
5 python代码实现

参考文章：
https://blog.csdn.net/a841454735/article/details/80237257
http://blog.sina.com.cn/s/blog_65c8baf901016flh.html

1 DBI指数介绍

Davies-Bouldin指数（DBI）（戴维森堡丁指数），又称为分类适确性指标，是由大卫L·Davies和唐纳德·Bouldin提出的一种评估聚类算法优劣的指标。

属于内部指标，内部指标是利用数据集的固有特征和量值来评价一个聚类算法的结果。

2 优点

基于DBI指数的k-means算法无需指定K的值，而是给出K的范围，由算法自动确定最适合的K值。

3 定义值

3.1 $S_i$ ：表示第i类中，数据点的分散程度

$S_i=\{\frac{1}{T_i}\sum_{j=1}^{T_i}|X_j-A_i|^q\}^{\frac{1}{q}}$

$X_j$ ：第i类中第j个数据点
$A_i$ ：第i类的中心数据点

当q=1：表示各点到中心距离的均值
当q=2：表示各点到中心距离的标准差
【用来衡量离散程度】

3.2 $M_{ij}$ ：表示第i类与第j类的距离

$M_{ij}=\sum_{k=1}^{N}|a_{ki}-a_{kj}|^p\}^{\frac{1}{p}}$

$a_{ki}$ ：表示第i类的中心点的第k个属性的值

当p=1：表示各点到中心距离的均值
当p=2：表示各点到中心距离的标准差
【用来衡量离散程度】

3.3 $R_{ij}$ ：表示第i类和第j类的相似度

$R_{ij}=\frac{S_i+S_j}{M_{ij}}$

3.4 $\overline{R}$ ：DBI指数，越小分类效果越好

先计算 $R_i$ ，i=1,2,3…N
即求类i与其他类的最大相似值。

$R_i=max(R_{i1},R_{i2}, ...R_{ij}, ...R_{iN}) ，i≠j$

再计算每个类的最大相似度的均值，得到 $\overline{R}$ ，即DBI指数。
$=\overline{R}=\frac{1}{N}\sum_{i=1}^{N}R_i$

分类个数的不同（N不同），会导致 $\overline{R}$ 不同， $\overline{R}$ 值越小，分类效果越好。

4 这篇博文公式挺多挺费事的，觉得有用的话可以点击收藏关注~~点赞是我更新的无限动力！！

python_71">5 python代码实现

代码来自参考博文里面的博主写的~

python">def vectorDistance(v1, v2):
    """
    this function calculates de euclidean distance between two
    vectors.
    """
    sum = 0
    for i in range(len(v1)):
        sum += (v1[i] - v2[i]) ** 2
    return sum ** 0.5


def compute_Si(i, x, clusters, nc):
    norm_c = nc
    s = 0
    for t in x[i]:
        s += vectorDistance(t, clusters)
    return s / norm_c


def compute_Rij(i, j, x, clusters, nc):
    Mij = vectorDistance(clusters[i], clusters[j])
    Rij = (compute_Si(i, x, clusters[i], nc) + compute_Si(j, x, clusters[j], nc)) / Mij
    return Rij


def compute_Di(i, x, clusters, nc):
    list_r = []
    for j in range(nc):
        if i != j:
            temp = compute_Rij(i, j, x, clusters, nc)
            list_r.append(temp)
    return max(list_r)


def compute_DB_index(x, clusters, nc):
    sigma_R = 0.0
    for i in range(nc):
        sigma_R = sigma_R + compute_Di(i, x, clusters, nc)
    DB_index = float(sigma_R) / float(nc)
    return DB_index

聚类算法评价指标——基于DBI指数的k-means算法（python代码）

文章目录

1 DBI指数介绍

2 优点

3 定义值

3.1 $S_i$ ：表示第i类中，数据点的分散程度

3.2 $M_{ij}$ ：表示第i类与第j类的距离

3.3 $R_{ij}$ ：表示第i类和第j类的相似度

3.4 $\overline{R}$ ：DBI指数，越小分类效果越好

4 这篇博文公式挺多挺费事的，觉得有用的话可以点击收藏关注~~点赞是我更新的无限动力！！

python_71">5 python代码实现

相关文章

stm32内部低速rtc_stm32f103ZE单片机RTC时钟采用内部时钟例程

Windows系统下，python安装netCDF4步骤

python中with open_Python，open和with open的区别

遗传算法（GA）学习 || 原理、本质、代码、例题

python编程命令_使用Python编写命令行工具有什么好的库？

cc2530期末试卷_完整版ZigBee期末试题

桌面上出现一个.accelerate 文件夹，如何解决？

python炒股学习软件_要炒股，学Python-LSTM学习

聚类算法评价指标——基于DBI指数的k-means算法（python代码）

文章目录

1 DBI指数介绍

2 优点

3 定义值

3.1 S i S_i Si​：表示第i类中，数据点的分散程度

3.2 M i j M_{ij} Mij​：表示第i类与第j类的距离

3.3 R i j R_{ij} Rij​：表示第i类和第j类的相似度

3.4 R ‾ \overline{R} R：DBI指数，越小分类效果越好

4 这篇博文公式挺多挺费事的，觉得有用的话可以点击收藏关注~~点赞是我更新的无限动力！！

python_71">5 python代码实现

相关文章

3.1 $S_i$ ：表示第i类中，数据点的分散程度

3.2 $M_{ij}$ ：表示第i类与第j类的距离

3.3 $R_{ij}$ ：表示第i类和第j类的相似度

3.4 $\overline{R}$ ：DBI指数，越小分类效果越好