Apache 软件基金会(ASF)官方维护的容器镜像仓库(Sponsored OSS)。涵盖 Superset、Spark、Airflow、Doris、Flink、Hadoop 等 400+ 开源项目,适用于大数据、数据可视化、工作流编排与实时分析等场景。 https://www.apache.org
开源数据可视化与 BI 平台,支持多数据源连接、拖拽式图表构建、SQL 实验室、告警与仪表盘分享。适合自助式数据分析、报表与可视化大屏。
统一大数据处理引擎,支持批处理、流处理、机器学习与图计算。提供 DataFrame/SQL、Streaming、MLlib 等 API,适合 ETL、实时计算与数据湖分析。
以代码定义、调度和监控工作流的平台。支持 DAG 编排、任务依赖、重试与监控,与多种数据源与执行器集成,适合 ETL、数据管道与运维自动化。
实时 OLAP 分析数据库,基于 MPP 架构,支持高并发查询、实时导入与 MySQL 协议兼容。适合实时报表、即席查询与日志分析。















使用 Superset 连接 Doris、Hive、MySQL 等数据源,构建仪表盘与自助分析能力。
组合 Spark、Flink 进行批处理与流处理,配合 Airflow 编排数据管道,Doris 提供实时查询。
使用 SeaTunnel、NiFi、DolphinScheduler 进行数据同步、ETL 与任务调度。
机房里 Nginx、MySQL、Redis、Kafka 各跑各的:有人盯 `ss`,有人刷厂商控制台,有人半夜被业务方电话叫醒才发现接口已经超时。想把可用性收拢到一处,常见路径是每台机装 Agent、配 Prometheus exporter,再串 Alertmanager 和钉钉脚本——规则散在 YAML 与 Wiki 里,交接时对账很慢。
Apache Kafka 是 Apache 软件基金会 维护的开源 分布式事件流平台(最初由 LinkedIn 开发并开源)。它把事件按 主题(topic) 落盘保存,生产者写入、消费者按消费组独立拉取;同一条流既能给实时告警用,也能给离线数仓、审计回放用——不是「取走就没」的一次性队列,而是可重放的日志型存储。能力覆盖高吞吐写入、分区扩展、多订阅者并存,以及对接 Kafka Connect(外部系统进出)、Kafka Streams(JVM 流处理)等生态;全球大量组织用它支撑日志收集、事件驱动微服务、CDC 缓冲与实时分析前置层。集群跑在你自己的 Docker / 机器上,段文件与元数据落在本地卷里——本机或内网客户端连上就能收发,不必把核心事件流绑死在某一家公有云 MQ。
运营要周报大盘、产品要漏斗转化、老板要「打开浏览器就能看数」——很多团队会先把报表绑在商业 SaaS BI 上:按席位 / 按查询量计费,看板一多成本就上去;数据还得出境或落到第三方租户里,合规与安全评审往往过不了。退回 Excel / 本地透视表?又慢、难协作、版本满天飞,更谈不上统一口径与权限。于是「自己服务器上跑一套开源 BI」成了常见诉求。
业务看板要秒级刷新、运营要按用户/订单做多维下钻,用传统行存库扛聚合又慢又贵;把整仓扔公有云分析服务,又担心成本与数据出境——很多团队会把目光投向可自托管的实时数仓,Apache Doris 正是为此而生。
Apache IoTDB(Database for the Internet of Things)是一款专为物联网场景设计的原生时序数据库,具备高性能的数据管理与分析能力,可灵活部署于边缘设备与云端环境。其轻量级架构设计确保了在资源受限的边缘节点也能高效运行,同时通过与Apache Hadoop、Spark、Flink等大数据生态工具的深度集成,满足工业物联网领域中大规模数据存储、高速数据写入及复杂数据分析的核心需求。
apache/* 镜像由 ASF 各项目官方维护,与上游源码、发布节奏保持一致,适用于生产环境与社区支持。第三方(如 Bitnami)可能增加预配置、集成或加固,部署更便捷但版本节奏可能不同。选择时需权衡:官方镜像更贴近上游,第三方镜像可能集成更多运维便利。
Superset 面向数据可视化与 BI,连接多种数据源后拖拽构建图表与仪表盘。Spark 面向大数据计算,处理批/流数据、ML 与图计算。Airflow 面向工作流编排,用 Python 定义 DAG,调度 ETL、数据管道等任务。三者可组合:Airflow 调度 Spark 作业,结果入库后由 Superset 展示。
Doris 与 StarRocks 同源,均支持 MySQL 协议、实时导入与 MPP 查询。ClickHouse 更侧重列存与聚合查询。Doris 在实时更新、物化视图、多表 Join 方面有优势,适合实时报表与即席分析;ClickHouse 在超大数据量聚合场景表现优异。可根据查询模式、实时性需求与生态集成情况选择。
建议:1) 关注各项目的安全公告与 Release Notes;2) 定期拉取最新 tag 或稳定版;3) 在 CI/CD 中集成漏洞扫描(Trivy、Docker Scout);4) 生产环境固定版本号,在测试环境验证后再升级。ASF 项目通常通过邮件列表与 GitHub 发布安全信息。
可按用途筛选:数据可视化选 superset;批流计算选 spark、flink;调度选 airflow、dolphinscheduler;OLAP 选 doris、druid;API 网关选 apisix;分布式追踪选 skywalking-oap-server、skywalking-ui。也可在 [Docker Hub apache 组织](https://hub.docker.com/u/apache) 或 [ASF 项目目录](https://www.apache.org/) 浏览完整列表。