Kafka消息可靠性:从生产到消费的全链路不丢不重 本文通过一个外卖订单的类比,系统性地分析了Kafka消息系统中消息丢失和重复消费的问题根源。文章指出消息可靠性需要贯穿生产者、Broker和消费者三个环节,并提出了"At-Least-Onc... 国内服务器 3个月前360
大数据处理技术:Hadoop与Spark核心原理解析 本文深入解析Hadoop与Spark两大核心大数据处理技术。Hadoop作为基础架构,包含HDFS分布式存储、MapReduce批处理计算和YARN资源调度三大组件,采用"一次写入多... 国内服务器 3个月前300
RabbitMQ初级 RabbitMQ消息队列简介及简单模式实现 摘要: 本文介绍了消息队列(MQ)的优势(应用解耦、异步提速、削峰填谷)和劣势(系统可用性降低、复杂度提高、一致性问题),并说明了MQ适用的场景。随后详细展... 国内服务器 3个月前330
基于Spark的南昌房价数据分析系统的设计与实现 本文设计并实现了一个基于Spark的南昌房价数据分析系统,该系统利用Spark的分布式计算能力处理大规模房价数据,结合回归分析、时间序列分析等方法构建预测模型,分析房价波动规律及影响因素。系统包含数据... 国内服务器 3个月前400
大数据领域Doris与Spark的协同工作模式 能力维度DorisSpark实时查询速度毫秒级(强)秒级(弱)离线ETL复杂度简单处理(弱)复杂处理(强)高并发支持支持(强)不支持(弱)生态对接能力有限(主要对接存储)丰富(对接所有大数据组件)结论... 国内服务器 3个月前340
大数据新视界 — Hive 基于 MapReduce 的执行原理(上)(23 / 30) 本文仿若一盏璀璨明灯,深度照亮 Hive 基于 MapReduce 执行原理的幽秘路径。凭借丰富且典型的案例、精妙且可操作的代码,佐以精美的可视化呈现,深入挖掘架构精髓、细致剖析任务流程、全面揭示优化... 国内服务器 3个月前400
Flink从入门到上天系列第五篇:Flink集群化部署模式 在一些应用场景中,对于集群资源分配和占用的方式,可能会有特定的需求。Flink为各种场景提供了不同的部署模式,主要有以下三种:它们的区别主要在于:集群的生命周期以及:以及应用的main方法到底在哪里执... 国内服务器 3个月前480
借助 Kafka 提升大数据平台的实时响应能力 Kafka是一个分布式流处理平台发布/订阅:像消息队列一样,生产者发消息,消费者收消息;持久化存储:消息会被持久化到磁盘,不会丢(除非手动删除);流处理:支持实时处理消息(比如用Kafka Strea... 国内服务器 3个月前390
笔记11:数据中台:不是数据仓库,是业务能力复用的引擎 数据中台不是一场颠覆性的革命,而是一次从“项目制”向“产品化”的思维进化。它要求ITBP从一个需求接单员,转变为一个数据产品的产品经理——理解市场(业务)、定义产品、运营产品、并不断从客户反馈中迭代。 国内服务器 3个月前390
RabbitMQ – 虚拟主机(VHost)的使用:实现业务隔离 虚拟主机是 RabbitMQ 中的一个逻辑隔离单元,可以理解为“消息队列的命名空间”🏗️。交换机(Exchanges)队列(Queues)绑定关系(Bindings)用户权限(Permissions... 国内服务器 3个月前350