正在加载中...

算法教程

查看算法原理、公式、操作流程和结果说明。

当前目录 29 个算法 · 已发布 197 篇教程
No.002 可在线阅读

主成分分析(PCA)系统

主成分分析(Principal Component Analysis, PCA)是一种通过线性变换实现信息压缩与结构提取的多变量统计方法。其核心思想是在尽可能保留原始信息的前提下,将多个相关指标重构为少数互不相关的综合变量,并以此完成降维、排序和解释分析。在多指标评价场景中,P…

PDF 配套资料 Word 配套资料
No.015 教程整理中

多模型-聚类与降维系统

集成多种聚类与降维方法,用于发现样本分组结构、压缩高维特征并辅助可视化,适合探索性分析和建模前处理。

暂无 PDF 状态 暂无 Word 状态
单篇教程整理中 算法详情
No.064 可在线阅读

LDA-主题模型

LDA-主题模型 模块的真实实现位于 core/ldacalculator.py。该模块不是自写 Gibbs 采样器,而是先用 CountVectorizer 构造文档-词项矩阵,再调用 sklearn.decomposition.LatentDirichletAllocati…

PDF 配套资料 Word 配套资料
No.066 可在线阅读

NMF_Topic-NMF 主题模型

NMFTopic-NMF 主题模型 的真实实现位于 core/nmfrunner.py 与 core/textprep.py。该模块的核心不是概率主题模型,而是:

PDF 配套资料 Word 配套资料
No.072 可在线阅读

Top2Vec-主题模型

这个目录虽然命名为 Top2Vec-主题模型,但真实核心实现并不是官方 top2vec 包。项目里的主流程写在:

PDF 配套资料 Word 配套资料
No.114 可在线阅读

BIRCH-BIRCH

BIRCH(Balanced Iterative Reducing and Clustering using Hierarchies)原本是一类基于聚类特征(Clustering Feature, CF)树的层次聚类方法,适用于大规模数据的逐步压缩与聚类分析。本项目中的 BIR…

PDF 配套资料 Word 配套资料
No.115 可在线阅读

DBSCAN-密度聚类

DBSCAN(Density-Based Spatial Clustering of Applications with Noise)是一种典型的基于密度的聚类方法,其基本思想是:在给定邻域半径与最小样本数阈值的条件下,将高密度区域扩展为聚类,并将无法归入任何高密度区域的样本识…

PDF 配套资料 Word 配套资料
No.116 可在线阅读

FCM-模糊 C 均值

FCM(Fuzzy C-Means)是一类典型的模糊聚类方法。与 K-Means 等硬划分算法不同,FCM 不直接把每个样本唯一分配到某一个簇,而是为每个样本分配对所有簇的隶属度,从而更适合处理簇间边界模糊、样本过渡性较强的数据结构。

PDF 配套资料 Word 配套资料
No.117 可在线阅读

GMM-高斯混合模型

高斯混合模型(Gaussian Mixture Model, GMM)是一类典型的概率式软聚类方法。它假定样本总体由若干个高斯分布成分混合生成,每个样本同时对多个成分具有不同的后验归属概率,因此比 K-Means 这类硬划分方法更适合描述椭球状簇结构和簇间边界不清晰的数据。

PDF 配套资料 Word 配套资料
No.118 可在线阅读

HDBSCAN-HDBSCAN

HDBSCAN(Hierarchical Density-Based Spatial Clustering of Applications with Noise)可以看作 DBSCAN 的层次化扩展。它不再依赖单一固定密度阈值,而是通过互可达距离构造层次聚类结构,再从层次树中选…

PDF 配套资料 Word 配套资料
No.119 可在线阅读

Hierarchical-层次聚类

层次聚类(Hierarchical Clustering)是一类通过递归合并或递归拆分来构建簇层次结构的聚类方法。与 K-Means、GMM 等“先设定簇结构再优化”的方法不同,层次聚类会先生成完整的树状层次关系,然后再按照目标簇数或距离阈值进行切割,因此特别适合用于观察样本之…

PDF 配套资料 Word 配套资料
No.120 可在线阅读

ISODATA-ISODATA

ISODATA(Iterative Self-Organizing Data Analysis Technique)通常被理解为一种在 K-Means 基础上引入簇分裂与簇合并机制的自适应聚类方法。与固定簇数的传统 K-Means 不同,ISODATA 会在迭代过程中根据簇内离…

PDF 配套资料 Word 配套资料
No.121 可在线阅读

Isomap-Isomap

Isomap(Isometric Mapping)是一类典型的非线性流形降维方法。它的基本思想不是直接在原始高维欧氏距离上做线性投影,而是先在样本邻域图上估计测地距离,再对测地距离矩阵执行经典多维尺度分析(Classical MDS),从而在低维空间中尽可能保持流形上的几何结构。

PDF 配套资料 Word 配套资料
No.122 可在线阅读

KMeans-K-均值聚类

K-Means 是最常用的原型聚类方法之一,其核心思想是:给定簇数 K,通过迭代地执行“样本归属分配”和“簇中心更新”,使簇内平方和最小。与 DBSCAN、HDBSCAN 等基于密度的方法不同,K-Means 需要用户预先给定聚类数,更适合发现近似球状、规模相对均衡的簇结构。

PDF 配套资料 Word 配套资料
No.123 可在线阅读

KMedoids-K-中心点

K-Medoids 是一类与 K-Means 密切相关的划分式聚类方法。二者都需要预先给定聚类数 K,也都通过“样本分配 + 中心更新”的方式迭代优化;但 K-Medoids 的中心不是簇均值,而是簇内某个真实样本点(medoid,中心点)。因此,当数据中存在异常值或距离度量不…

PDF 配套资料 Word 配套资料
No.124 可在线阅读

KPCA-核主成分

核主成分分析(Kernel PCA, KPCA)是在 PCA 基础上引入核技巧得到的非线性降维方法。它的核心思想是:先通过核函数把样本隐式映射到高维特征空间,再在该特征空间中执行类似 PCA 的特征分解,从而提取能够刻画非线性结构的低维表示。

PDF 配套资料 Word 配套资料
No.125 可在线阅读

LLE-局部线性嵌入

局部线性嵌入(Locally Linear Embedding, LLE)是一类经典的流形学习方法。它的核心思想是:高维样本虽然整体分布可能是非线性的,但在每个样本的局部邻域内往往仍近似服从线性结构。LLE 先在原空间中用邻域重构权重刻画这种局部线性关系,再在低维空间中尽量保持…

PDF 配套资料 Word 配套资料
No.126 可在线阅读

MDS-多维尺度

多维尺度分析(Multi-Dimensional Scaling, MDS)是一类根据样本之间的相似性或距离关系来构造低维表示的方法。其目标不是直接对原始特征做线性投影,而是在低维空间中寻找一组坐标,使低维空间中的样本间距离尽可能逼近原始空间中的距离关系。

PDF 配套资料 Word 配套资料
No.127 可在线阅读

MeanShift-MeanShift

Mean Shift 是一种典型的基于密度峰值搜索的聚类方法。它不要求用户预先指定聚类数,而是通过在特征空间中不断把样本向局部密度更高的位置平移,最终收敛到若干密度峰,并以这些峰作为簇中心。

PDF 配套资料 Word 配套资料
No.128 可在线阅读

NMF-非负矩阵分解

非负矩阵分解(Non-negative Matrix Factorization, NMF)是一类把非负数据矩阵分解为两个低秩非负矩阵乘积的方法。与 PCA、SVD 等允许正负抵消的分解不同,NMF 在分解过程中要求各因子均保持非负,因此往往更容易得到“部分加和式”的可解释结果…

PDF 配套资料 Word 配套资料
飞书图文教程合集

适合连续阅读,作为本站在线教程的补充入口。

打开飞书教程