Sign inSign up

841973620/dli-s-ds-04-v1

By 841973620

Updated 4 months ago

加速聚类算法以实现最高性能

Image
Machine learning & AI
Data science
0

92

841973620/dli-s-ds-04-v1 repository overview

聚类是机器学习中的一种基础技术,用于揭示数据中的隐藏模式和结构,而无需依赖标注的实例。从客户细分和欺诈检测到图像组织和文档分类,集群驱动了许多实际应用。随着数据规模和复杂度的增长——尤其是在大型语言模型(LLM)训练等现代工作流程中——高效且有效的聚类变得至关重要。本课程将实践介绍常见聚类算法,如K-Means、DBSCAN和HDBSCAN,并探讨它们在实际中的应用,包括它们在预处理、数据压缩和LLM标记分组中的作用。学生将获得聚类工作流程的理论和实践理解,并学习如何将其应用于多样化数据集。本课程将利用可扩展的GPU加速工具,使大规模数据的聚类成为可能,使学生能够在多个领域构建更快、更稳健的模型。

通过学习本课程,您将能够:

  • 理解聚类的核心原则,并区分K-Means、DBSCAN和HDBSCAN等常见算法
  • 基于数据特征如尺度、维度和噪声,评估不同聚类方法的优势和局限性
  • 将聚类算法应用于客户细分、图像分析、异常检测和自然语言处理等领域的真实数据集
  • 利用RAPIDS、cuML和UMAP等工具实现可扩展、GPU加速的聚类工作流,适用于大型或高维数据集



运行:

docker run -it --rm --name task --gpus all -p 80:80 docker.841973620.net:8888/dli/s-ds-04-v1:cuda12.2-task

Tag summary

Content type

Image

Digest

sha256:5fe985a77

Size

7 GB

Last updated

4 months ago

docker pull 841973620/dli-s-ds-04-v1:cuda12.2-task-minimal