Spark实现K-means客户分群实战练习

本文介绍了使用K-means聚类算法对客户消费数据进行分群分析的完整流程。首先通过Python脚本将Excel数据转换为CSV格式并上传至HDFS,随后使用Scala编写Spark应用程序,调用MLl...
1个月前
210

Flume与Kafka集成实战:从场景到优化

Flume与Kafka的集成是大数据采集层的标准实践。常见场景包括日志汇聚、多源入Kafka、Kafka数据分发、离线与实时双链路优化重点在于批处理大小、Channel选型、并行度配置和生产者参数调优...
1个月前
230