新加坡出行巨头 Grab 的实时数据流平台面临扩容困难、成本高昂及运维复杂等挑战。通过引入云原生方案 AutoMQ,成功实现了计算与存储分离,不仅将吞吐量提升三倍,还将分区重平衡时间从数小时缩短至一分钟,为大规模数据流处理提供了新的解决思路。
智能速览
计算与存储分离架构,解决了独立扩容难题。
分区重新分配时间从6小时缩短至1分钟以内。
单核CPU吞吐量实现3倍增长。
100%兼容Kafka,实现架构平滑迁移。
整体成本效益提升3倍。
精华内容
面对传统 Kafka 在弹性、成本和运维上的瓶颈,如何构建一个更高效、更经济的流数据平台?
平台核心痛点
Grab 的数据流平台早期面临四大挑战。计算资源扩容困难,尤其在分区迁移时易引发资源激增。磁盘无法独立扩容,导致运维复杂。基于峰值的过度配置造成资源浪费,而高风险的分区再平衡则会在维护时导致长时间延迟,影响用户体验。
云原生新架构
为解决上述问题,团队引入了 AutoMQ。其核心是计算与存储分离的共享存储架构,利用固定大小的 EBS 作为 WAL 实现低延迟写入,并将数据持久化于 S3,充分利用云的弹性与成本优势。由于 100% 兼容 Kafka,整个过程无需大规模改造,实现了平滑切换。
关键能力突破
新架构带来了显著优势。集群扩容无需在 Broker 间迁移数据,数秒即可完成。存储可按需扩展至 S3,告别了手动扩容磁盘的繁琐。写入延迟通过 EBS WAL 和 Direct I/O 技术优化至毫秒级,满足了延迟敏感型场景的需求。
实际收益量化
引入 AutoMQ 后,平台性能与成本效益得到双重提升。单核 CPU 吞吐量提升了 3 倍,整体成本效益提高了 3 倍。最显著的是,分区重新分配的耗时从过去的 6 小时缩短至 1 分钟以内,且扩容操作对生产者和消费者的延迟影响微乎其微,集群稳定性大幅增强。
Grab 与 AutoMQ 的合作案例,为大规模流数据平台的技术演进提供了一个范本。它证明了通过拥抱云原生架构,可以在保障性能与稳定性的同时,显著提升资源利用率和成本效益。未来,结合自动扩缩容等特性,其潜力将进一步释放。你的数据平台是否也面临类似的挑战?