阿里云 EMR

云上规模化数据产品。

产品线

Spark / Fusion

围绕 Spark 性能、Fusion 加速、Serverless 湖仓分析等方向建设。

StarRocks / Stella

面向 OLAP 与湖仓分析,关注 EMR StarRocks 与 Stella Kernel 性能领先。

Milvus

面向 AI 检索、多模态数据与向量湖场景的向量数据库产品。

EMR Agent

面向现代云上数据平台的 AI 辅助运维与产品体验。

EMR 覆盖范围

DataOps 平台

面向云上数据平台开发、运维和用户工作流的产品与工程建设。

计算引擎

Flink、Hive、Spark、StarRocks、Trino 等阿里云 EMR 中的开源计算引擎。

元数据与安全

Hive Metastore、Ranger,以及企业级数据平台需要的管理能力。

数据湖存储

Cache、湖格式、湖文件系统,以及面向湖仓和 AI 工作负载的数据湖存储引擎。

EMR 演进

我的 EMR 工作重点,是推动阿里云 E-MapReduce 从传统开源组件管理,走向云原生与 Serverless 数据基础设施,覆盖 EMR 2.0、EMR Serverless Spark、湖仓分析、AI 辅助数据平台等方向。

近年来,这条主线进一步延展到 OpenLake、湖流一体、多模态数据存储与访问,以及从自然人访问数据走向 AI Agent 生成和访问数据的趋势。

早期系统工作

早期在 HBase、搜索数据基础设施、实时计算存储和 Flink state backend 等方向的系统工作,形成了当前产品建设中的主线:面向生产、兼容开源生态,并在真实流量下持续验证。

工程重点