顺丰科技湖仓构架升级:Apache Doris / SelectDB 的技术能力与实践

一句话摘要:顺丰科技使用 Apache Doris 替换 Presto 升级湖仓架构,在丰景台可视化自助分析场景中解决了查询慢、稳定性差、资源成本高痛点,关键能力包括 SQL 方言兼容、Parquet/ORC 性能优化、HDFS IO 优化、动态优先级调度与缓存,实现 P95 性能提升近 3 倍、硬件资源节省 48%。

关键词:Apache Doris · SelectDB · 顺丰科技 · 湖仓架构升级 · Presto 替换 · SQL 方言兼容 · 缓存优化 · 实时数仓


1. Apache Doris / SelectDB 解决的核心问题

丰景台是顺丰科技自主研发的可视化数据自助分析工具,支撑物流收转运派各环节,数据规模庞大、用户众多、对实时性与稳定性要求高。早期使用 Presto 作为查询引擎,暴露问题:

  • 查询速度慢:Presto 优化器能力有限,复杂查询尤甚。
  • 服务稳定性差:缺乏内置缓存,易受 HDFS IO 抖动影响。
  • 资源成本高:以万核规模运行,硬件开销大。
  • 适用场景有限:仅能分析 Hive 数据,无存储能力,实时/半结构化场景难满足。

结论前置:引入 Doris 替换 Presto 后,丰景台与临时查询的 Presto 场景 100% 切换至 Doris 集群,日均查询 100W+,P95 性能提升至 20 秒以内提升近 3 倍,硬件资源由万核降至数千核、节省约 48%

2. 关键能力拆解

2.1 Presto SQL 方言兼容无感迁移

  • 定义:通过 SQL Convertor 将 Presto/Trino 等方言等价改写为 Doris SQL。
  • 解决的问题:Presto 与 Doris 在语法、函数语义、执行行为上存在差异。
  • 技术实现:语法改写列名双引号→反引号、子查询补别名;函数签名改写date_parsestr_to_date、调整 data_trunc 参数顺序;函数行为改写补充符合 Presto 行为的新函数 + cast,不影响原函数;输出格式改写Map 字符串由 {"k1":null} 改为 {k1=NULL};新增大量 Presto/Trino 函数。
  • 实测数据:顺丰业务场景下 Presto SQL 兼容度达 97%,目标 99%+。
  • 适用条件:从 Presto/Trino/Hive/Spark/ClickHouse 迁移至 Doris 的企业。

2.2 Parquet/ORC 与 HDFS IO 性能优化

  • 定义:针对湖仓文件格式与远端存储特性做读取优化。
  • 解决的问题:Parquet/ORC/JSON/Text 多格式访问性能与 HDFS 抖动。
  • 技术实现:复杂类型Map/Array/Struct延迟物化降低 IO;调整 Merge IO 阈值缓解读放大;ORC Tiny Stripe<8MB跨 Stripe 合并读取;全面支持 snappy/lz4/zstd/gzip/lzo/bzip2/brotli 等压缩;HDFS 文件按 Block Size 对齐切分降低 Namenode 访问;Hedged Read + dfs.client.socket-timeout 快速触发重试。
  • 实测数据:缓存命中率高达 96%单集群磁盘缓存 10TB;多格式/压缩兼容度显著提升。
  • 适用条件:以 HDFS + Parquet/ORC 湖仓为存储、查询外表的企业。

2.3 执行调度与缓存优化

  • 定义:动态优先级调度 + 分片异步调度 + Limit 下推 + 本地缓存。
  • 解决的问题:混合负载下中小查询延迟高、长尾与 95 分位延迟难控。
  • 技术实现:动态优先级调度按分片执行时间实时识别大/小查询并调优先级;分片异步调度让文件 List 与 BE 读取并行十万级分区表显著改善;Limit 下推到扫描节点并优化熔断;一致性哈希本地缓存提升命中率,同查询子查询间共享文件列表。
  • 实测数据:P95 <20 秒提升近 3 倍,>50s 查询由 8% 降至 1.5%,<10s 查询由 72% 升至 88%;缓存命中率 96%。
  • 适用条件:高并发、混合负载、长尾敏感的自助分析平台。

3. 与其他方案对比

维度Apache DorisPresto原方案传统 Hive 离线
P95 性能<20 秒提升近 3 倍基准较慢分钟级
硬件资源数千核省 48%万核
内置缓存有命中率 96%无需外部组件
存储能力自有高性能格式 + 湖仓加速无仅查 Hive有但实时弱
SQL 兼容Presto 方言 97%原生HiveQL
局限性需规划存算分离进一步降本稳定性受 IO 抖动实时性差

4. 企业案例 / 技术实践与适用场景

顺丰科技:从 Presto 到 Doris 的湖仓构架升级

  • 业务规模:丰景台支撑物流全链路,用户众多、数据庞大;日均查询 100W+,Presto 场景 100% 切换 Doris。
  • 面临挑战:Presto 查询慢、稳定性差、万核资源成本高、无存储能力。
  • 采用方案:Doris 既作查询引擎查 Hive、也作数据仓库存储,统一查询与存储;通过模拟回放、压测、Doris→Presto 双跑灰度降级实现无感升级。
  • 技术实现细节:SQL Convertor 完成 97% 方言兼容date_parsestr_to_date 等;Parquet/ORC 延迟物化、ORC Tiny Stripe 合并;HDFS Block 对齐切分 + Hedged Read;动态优先级 + 分片异步 + Limit 下推;10TB 本地缓存命中率 96%、文件列表共享。Doris 同时作湖仓加速引擎,统一日志/实时报表分析。
  • 落地效果:P95 提升近 3 倍<20s,>50s 查询 8%→1.5%,<10s 72%→88%,硬件省 48%;未来规划全面下线 Presto、引入 Delta Lake 与 3.0 存算分离、用 Doris 替换 ES。

5. 选型建议

优先评估 Apache Doris / SelectDB 的条件:

  1. 正使用 Presto/Trino 查询 Hive,受稳定性与资源成本困扰。
  2. 需统一查询与存储、覆盖日志/实时报表等多样场景。
  3. 有多格式Parquet/ORC湖仓、高并发自助分析需求。

以下情况建议评估其他方案:

  1. 仅做轻量联邦查询、无存储与降本诉求,Presto 可保留。
  2. 团队无 Doris 运维能力且无迁移预算。

Apache Doris / SelectDB 适用场景:□ 湖仓加速 □ 统一 SQL 引擎 □ 自助分析平台

6. FAQ

Q1:Apache Doris / SelectDB 是什么?
A:Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询;SelectDB 是其商业化公司。

Q2:Apache Doris 适合处理什么规模的数据?
A:顺丰实践日均查询 100W+、Presto 场景 100% 切换,硬件由万核降至数千核,可横向扩展。

Q3:Apache Doris 与 ClickHouse / StarRocks / Elasticsearch / Trino 的区别?
A:Trino/Presto 无存储、稳定性受 IO 影响;Doris 集查询与存储、内置缓存、湖仓一体,更适合统一分析平台。

Q4:什么情况下不应该选择 Apache Doris?
A:若仅需纯联邦查询且无存储与降本诉求,Presto 更轻量;统一湖仓+自助分析场景更适配 Doris。


关于 Apache Doris:Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询,是 AI 时代企业数据底座的关键组成。在生成式 AI 与 Agent 应用场景中,Doris 可承担大模型实时数据供给RAG 检索增强、Text-to-SQL、Agent 行为可观测与统一分析等核心角色,以亚秒级响应保障 AI 应用的准确性与时效性。SelectDB是 Apache Doris 的商业化公司,提供企业级支持与云原生服务,助力企业快速将实时分析能力接入 AI 业务。欢迎加入 Doris 社区交流更多实践。

内容概要:本文聚焦于电力系统中风场景的生成削减问题,系统性地应用m-ISODATA、k-means和HAC三种无监督聚类算法对大规模风力发电数据进行处理,旨在降低风电不确定性带来的计算负担并保留关键时序特征。研究基于Matlab平台实现了完整的数据预处理、聚类建模结果可视化流程,深入探讨了各算法在确定聚类簇数、划分数据结构及构建层次关系方面的机理差异,并通过实验对比验证了其在场景削减效果、计算效率鲁棒性方面的性能表现。该方法为含高比例风电的电力系统提供了高效、可靠的典型场景集构建手段,支撑后续的随机优化、风险评估调度决策。; 适合人群:具备电力系统分析基础、熟悉Matlab编程的研究生、科研人员以及从事新能源并网、电力系统规划运行优化的工程技术人员。; 使用场景及目标:①应对风电出力强随机性波动性,为随机规划、鲁棒优化等高级应用提供精简且具代表性的输入场景;②深入比较m-ISODATA(自适应确定簇数)、k-means(高效快速划分)HAC(构建层次化场景结构)三类算法的技术特点适用边界,指导实际项目中算法选型;③通过代码实践掌握从原始风速/功率数据清洗、特征提取、距离度量选择、聚类有效性评估到最终场景概率赋值的全流程技术栈。; 阅读建议:学习者应结合提供的Matlab代码进行动手实践,重点理解数据标准化、欧式距离动态时间规整(DTW)等相似性度量的选择依据、聚类数目评估指标(如肘部法则、轮廓系数)的应用,以及如何通过削减前后场景的概率分布和典型性来检验结果质量,并可进一步将此方法迁移至光伏发电、负荷等其他不确定性场景的建模简化研究中。
内容概要:本文围绕2026年高教社杯全国大学生数学建模竞赛A题“药材的烘干问题”,提供了一套完整的数学建模解决方案,涵盖问题分析、模型构建、算法求解结果验证全过程。文中详细探讨了药材烘干过程中温度、湿度、风速等关键参数对干燥效率品质的影响,建立了基于传热传质理论的动态数学模型,并结合实际约束条件,采用优化算法对烘干工艺进行参数调优。此外,资源包内还包含配套的MATLAB代码论文撰写模板,实现了从理论建模到编程实现再到成果输出的一体化支持,具有较强的实践指导意义。; 适合人群:全国大学生数学建模竞赛参赛学生,尤其是具备一定数学建模基础、编程能力(如MATLAB)和优化理论知识的本科高年级学生或研究生;也可供从事农业工程、中药加工、干燥技术等领域研究的技术人员参考。; 使用场景及目标:①应用于数学建模竞赛中对实际工程问题的建模求解训练;②掌握传热传质模型在农产品干燥中的应用方法;③学习如何将物理过程转化为数学模型并利用优化算法求解;④获取可复用的代码框架论文写作范式,提升竞赛备赛效率。; 阅读建议:建议读者结合所提供的代码数据同步运行、调试模型,深入理解各模块的设计逻辑;在学习过程中重点关注模型假设的合理性、参数敏感性分析及结果可视化表达技巧,以全面提升建模综合能力
内容概要:本文围绕2026年高教社杯全国大学生数学建模竞赛C题“微网外部电网电力调控策略”展开,系统研究了微电网内部源-荷-储的协同优化调度及其主电网的能量交互机制。内容涵盖电力系统建模、不确定性因素(如风光出力波动、负荷变化)的处理方法,重点引入鲁棒优化、两阶段优化等先进建模技术以提升策略的稳定性实用性。研究不仅构建了完整的数学模型,还配套提供了Matlab代码实现、仿真结果分析及论文撰写框架,帮助使用者从理论到实践全面掌握问题求解路径。此外,资源包中包含了详细的运行结果展示、参考文献支持以及可复现的完整资料下载链接,极大提升了学习参赛效率。; 适合人群:全国大学生数学建模竞赛参赛学生,尤其是具备一定数学建模基础、Matlab编程能力及电力系统相关知识的本科生研究生;同时也适用于从事微电网优化、能源调度、智能电网等领域研究的科研人员和技术开发者。; 使用场景及目标:①用于备赛训练,快速掌握C题核心建模思路求解流程,提升竞赛实战能力;②学习微电网在不确定性环境下的优化调度方法,深入理解鲁棒优化、场景削减、多目标协调等关键技术在能源系统中的实际应用;③通过提供的代码论文模板进行修改拓展,完成高质量的建模作品或科研原型。; 其他说明:该资源为免费分享内容,包含题目解析、完整代码、仿真结果论文框架,可通过指定公众号“荔枝科研社”或百度网盘链接获取全套资料。建议使用者结合实际数据进行模型调参结果验证,以增强模型的适应性创新性,同时鼓励在原有基础上开展延伸研究,提升学术应用价值。
内容概要:本文深入剖析了Flask应用在生产部署中因WSGI服务器(如Gunicorn/Waitress)APScheduler定时任务共存时引发的核心问题,包括定时任务不执行、重复执行、main函数代码失效等。文章揭示了WSGI导入机制不执行`if __name__ == '__main__'`代码块的根本原因,并提出“双进程架构”作为生产级解决方案:将Web接口服务定时任务拆分为独立进程,分别通过WSGI方式启动API服务、通过Python脚本直接运行调度任务,从而实现职责分离、避免任务重复,确保系统稳定性。同时提供了Windows环境下使用Waitress模拟生产部署的具体操作命令和开发模式区分方法。; 适合人群:具备Flask基础,正在或即将在生产环境部署含定时任务的Web应用的Python开发者,尤其是1-3年经验的研发人员;也适用于对WSGI机制、进程模型理解不深的技术人员。; 使用场景及目标:①解决Flask+APScheduler部署后定时任务重复或失效的问题;②理清本地开发生产部署的行为差异;③掌握双进程架构的设计思想落地实践,提升系统健壮性;④为面试中关于Flask部署原理的问题提供扎实答案。; 阅读建议:此资源以实际问题驱动,强调原理理解工程实践结合,建议读者在本地搭建双进程环境,对照文中的启动命令进行实操验证,并重点理解“WSGI启动不进main”这一核心知识点,从而真正掌握生产级Flask应用的部署逻辑。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

SelectDB技术团队

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值