DataHub 本地跑通全流程:10 分钟从容器启动到看到血缘图
【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub
DataHub 本地部署其实没那么玄乎——装好 CLI、一条命令拉起服务栈、再灌一份演示数据,10 分钟后你就能在浏览器里点开一张表,看到它的上下游血缘。假设你的数据散落在 5 个平台、没人说得清谁在消费哪张表,这篇文章带你亲手把这套元数据平台在本地跑起来。
🐳 第 1 分钟:把 CLI 装进终端
前置只需要 Docker Desktop 和 Python 3.10+,装好即可,本文不展开。
CLI 是整个流程的遥控器,安装它才能一键起服务、灌数据:
pip install --upgrade acryl-datahub跑完执行datahub version能看到版本号,说明 DataHub CLI 安装成功。后面所有命令都靠它。
📦 第 5 分钟:一条命令拉起的完整服务栈
datahub docker quickstart这一条命令会拉镜像、建网络、起 MySQL、Kafka、OpenSearch,再部署 GMS 后端和前端,一条都不用你碰。跑完最后一行出现✔ DataHub is now running,终端还会贴心地告诉你账号密码。
上图是 DataHub 的整体架构:左侧各数据源把元数据推/拉到平台,右侧通过 GraphQL、REST、Kafka 输出给下游。完整 Compose 配置在 docker/quickstart/ 目录下,官方入门文档同步在 docs/quickstart.md。
🧭 第 15 分钟:灌入演示数据,让目录"活"起来
浏览器打开 http://localhost:9002,用默认账号密码登录——都是datahub。
但空的目录没意思,先让 CLI 记住这个实例:
datahub init --username datahub --password datahub再加载官方演示数据,一次灌入约 1050 个实体,横跨 Snowflake、Looker、PowerBI、Tableau,带血缘、标签、术语和数据产品:
datahub datapack load showcase-ecommerce跑完终端显示 ingestion 成功,浏览器里整个目录瞬间被填满。这个数据包的加载逻辑就写在 metadata-ingestion/src/datahub/cli/ 里,好奇可以翻翻。
加载演示数据后先看哪三个页面
- 全局搜索:搜个表名,回车,比翻 5 个平台快得多。
- 数据集详情页:点开任意一张表,Schema、Owner、标签一览无余。
- 血缘图(Lineage):同一页面切到 Lineage 标签,上游是谁、下游谁在消费,一张图说清——这就是开头那个痛点的解法。
🔧 卡住了怎么办
跑不通别慌,90% 的问题出在这两处:
- 端口被占:前端 9002、GMS 8080 被占时,设环境变量
DATAHUB_MAPPED_FRONTEND_PORT=9003后重新执行 quickstart。 - 资源不够:容器起不来就先给 Docker 加内存到 8GB 以上,再清理一下:
docker system prune datahub docker checkcheck会告诉你哪个容器没就绪,照日志修即可。到这里你的本地 DataHub 已经跑通全流程,下一步就可以把演示数据换成真实平台的连接配置,让这个目录替你团队干活了。
【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考