)
第 1 章 Kafka 概述1.1 定义Kafka 是一个分布式的基于发布/订阅模式的消息队列Message Queue主要应用于大数据实时处理领域。1.2 消息队列1.2.1 传统消息队列的应用场景MQ传统应用场景之异步处理1.2.2 使用消息队列的好处1解耦允许你独立的扩展或修改两边的处理过程只要确保它们遵守同样的接口约束。2可恢复性系统的一部分组件失效时不会影响到整个系统。消息队列降低了进程间的耦合度所以即使一个处理消息的进程挂掉加入队列中的消息仍然可以在系统恢复后被处理。3缓冲 有助于控制和优化数据流经过系统的速度解决生产消息和消费消息的处理速度不一致的情况。4灵活性 峰值处理能力在访问量剧增的情况下应用仍然需要继续发挥作用但是这样的突发流量并不常见。如果为以能处理这类峰值访问为标准来投入资源随时待命无疑是巨大的浪费。使用消息队列能够使关键组件顶住突发的访问压力而不会因为突发的超负荷的请求而完全崩溃。5异步通信很多时候用户不想也不需要立即处理消息。消息队列提供了异步处理机制允许用户把一个消息放入队列但并不立即处理它。想向队列中放入多少消息就放多少然后在需要的时候再去处理它们。1.2.3 消息队列的两种模式1点对点模式一对一消费者主动拉取数据消息收到后消息清除 消息生产者生产消息发送到Queue中然后消息消费者从Queue中取出并且消费消息。 消息被消费以后queue 中不再有存储所以消息消费者不可能消费到已经被消费的消息。Queue 支持存在多个消费者但是对一个消息而言只会有一个消费者可以消费。2发布/订阅模式一对多消费者消费数据之后不会清除消息 消息生产者发布将消息发布到 topic 中同时有多个消息消费者订阅消费该消息。和点对点方式不同发布到 topic 的消息会被所有订阅者消费。发布订阅1消息队列主动推送消费者消费速度不一样会造成有的资源浪费有点处理不过来2主动拉取维护着长轮询策略如队列没有数据也要取访问队列kafka又是基于发布订阅模式主动拉取数据维护着长轮询策略缺点如队列没有数据也要取访问队列1.3 Kafka 基础架构1Producer 消息生产者就是向 kafka broker 发消息的客户端2Consumer 消息消费者向 kafka broker 取消息的客户端3Consumer Group CG消费者组由多个 consumer 组成。消费者组内每个消费者负责消费不同分区的数据一个分区只能由一个组内消费者消费消费者组之间互不影响。所有的消费者都属于某个消费者组即消费者组是逻辑上的一个订阅者。4Broker 一台 kafka 服务器就是一个 broker。一个集群由多个 broker 组成。一个 broker可以容纳多个 topic。5Topic 可以理解为一个队列生产者和消费者面向的都是一个 topic6Partition为了实现扩展性一个非常大的 topic 可以分布到多个 broker即服务器上一个 topic 可以分为多个 partition每个 partition 是一个有序的队列7Replica副本为保证集群中的某个节点发生故障时该节点上的 partition 数据不丢失且 kafka 仍然能够继续工作kafka 提供了副本机制一个 topic 的每个分区都有若干个副本一个 leader 和若干个 follower。8leader每个分区多个副本的“主”生产者发送数据的对象以及消费者消费数据的对象都是 leader。9follower每个分区多个副本中的“从”实时从 leader 中同步数据保持和 leader 数据的同步。leader 发生故障时某个 follower 会成为新的 leader。