skip에서 partition overwrite로: business_date 재처리를 Iceberg로 다시 표현하기
이전 글에서는 같은 source_hash가 다시 들어왔을 때 기존 successful run을 재사용하는 idempotency를 다뤘다.
하지만 재처리에는 두 종류가 있다.
1. 같은 입력이 다시 들어온 경우
-> skip이 맞다.
이전 글에서는 같은 `source_hash`가 다시 들어왔을 때 기존 successful run을 재사용하는 idempotency를 다뤘다. 하지만 재처리에는 두 종류가 있다.
skip에서 partition overwrite로: business_date 재처리를 Iceberg로 다시 표현하기
이전 글에서는 같은 source_hash가 다시 들어왔을 때 기존 successful run을 재사용하는 idempotency를 다뤘다.
하지만 재처리에는 두 종류가 있다.
1. 같은 입력이 다시 들어온 경우
-> skip이 맞다.

작은 데이터 파이프라인도 한 번만 실행된다고 가정하면 금방 거짓말이 된다.

데이터 플랫폼에서 중요한 질문은 "gold 숫자를 만들었는가"에서 끝나지 않는다. 운영 중에는 오히려 이런 질문이 더 자주 나온다.

데이터 파이프라인에서 source schema가 바뀌는 순간은 애매하다. 무조건 무시하면 운영자는 입력 구조가 바뀐 사실을 모른다. 반대로 모든 schema 변화를 실패로 처리하면, 정상적인 컬럼 추가까지 daily run을…

현실의 데이터 소스는 한 가지 모양으로 오지 않는다. 같은 의미의 값도 어떤 파일에서는 `생산수량`, 다른 파일에서는 `units`, 또 다른 파일에서는 `made`로 올 수 있다. 온도도 어떤 곳은 섭씨, 어떤 곳은 화씨일 수…

Python으로 만든 batch transform을 Spark DataFrame으로 다시 쓰는 일은 문법 번역처럼 보인다.

This is Part 4 of a 15-part Apache Iceberg Masterclass. Part 3 covered metadata-driven performance....