CarbonData 支持哪些计算引擎?与 Spark 集成是最主流的方式吗?引言:从一个真实的架构选型困境出发在电商用户画像构建项目中,数据团队面临着一个关键决策:如何为每日处理数十亿用户行为事件ecommerce_user_profiles的系统选择底层存储和计算引擎。他们的技术栈横跨多个领域:批处理:使用 Spark 进行 T+1 的离线特征计算。交互式查询:分析师通过 Presto 探索数据。流处理:Flink 实时管道处理 Kafka 中的点击流。他们评估了 Apache CarbonData,并提出了一个核心问题:“CarbonData 能否无缝融入我们现有的多引擎生态?还是说我们必须将所有工作负载都迁移到 Spark 上?”这个问题触及了 CarbonData 生态集成的核心。本文将系统性地剖析 CarbonData 2.3.x 对Spark、Presto、Hive、Flink等主流计算引擎的支持现状、深度、性能差异及生产实践建议。我们将揭示为何Spark 是其“亲儿子”,而其他引擎则是通过标准化接口实现的“兼容模式”,并帮助你做出符合自身业务场景的正确架构选型。