Spark / Fusion
围绕 Spark 性能、Fusion 加速、Serverless 湖仓分析等方向建设。
阿里云 EMR
围绕 Spark 性能、Fusion 加速、Serverless 湖仓分析等方向建设。
面向 OLAP 与湖仓分析,关注 EMR StarRocks 与 Stella Kernel 性能领先。
面向 AI 检索、多模态数据与向量湖场景的向量数据库产品。
面向现代云上数据平台的 AI 辅助运维与产品体验。
面向云上数据平台开发、运维和用户工作流的产品与工程建设。
Flink、Hive、Spark、StarRocks、Trino 等阿里云 EMR 中的开源计算引擎。
Hive Metastore、Ranger,以及企业级数据平台需要的管理能力。
Cache、湖格式、湖文件系统,以及面向湖仓和 AI 工作负载的数据湖存储引擎。
我的 EMR 工作重点,是推动阿里云 E-MapReduce 从传统开源组件管理,走向云原生与 Serverless 数据基础设施,覆盖 EMR 2.0、EMR Serverless Spark、湖仓分析、AI 辅助数据平台等方向。
近年来,这条主线进一步延展到 OpenLake、湖流一体、多模态数据存储与访问,以及从自然人访问数据走向 AI Agent 生成和访问数据的趋势。
早期在 HBase、搜索数据基础设施、实时计算存储和 Flink state backend 等方向的系统工作,形成了当前产品建设中的主线:面向生产、兼容开源生态,并在真实流量下持续验证。