面向开发者的数据工具全景指南

查看原文 HN 讨论

文章摘要

(注:原文因反爬返回 403,本文主要依据 HN 讨论中透露的内容整理。)

这是一篇面向软件开发者的数据工具生态”入门全景图”,试图帮不熟悉数据工程的开发者梳理清楚整条数据管线上各类工具的定位与取舍。评论区多位数据领域从业者评价它是”一篇写得不错的全能型入门读物(good all-round primer)”,即便是资深从业者也能有所收获。

从讨论可以还原出文章覆盖的主要脉络:首先是数据摄取(ingestion)与 ETL/ELT 的概念——文章大量使用”Land(落地)”这一术语来描述把原始数据先着陆到某处,对应”奖章架构(medallion architecture)”中的 bronze(青铜)原始层,再经清洗进入 silver、gold 层。其次是存储层的核心区分:数据仓库(data warehouse)是一种 OLAP 数据库,针对按列的分析型访问做了优化;而数据湖(data lake)则存放更原始、更灵活的数据。文章还讨论了数据格式,例如提到 Apache Avro 同时支持二进制和 JSON 两种编码,以及列式格式 Parquet 等。此外覆盖了元数据目录(metadata catalog)这一类别,列举了 Hive Metastore、AWS Glue Data Catalog 以及 Databricks 的 Unity Catalog 等主流方案。整体而言,文章是一份把”数据湖 / 数据仓库 / 格式 / 目录 / 摄取工具”等概念串起来的地图式指南,适合作为开发者进入数据工程领域的第一站。

HN 评论精华

评论区一半是从业者的补充推荐,一半是对”入门指南只是罗列工具”的批评。