Stage 3 · Ray Data 파이프라인 — block/샤딩 · batch 변환
대용량 데이터 전처리를 Ray Data로 분산 파이프라인화합니다. 'DB shard = Ray Data block'이라는 멘탈 모델을 세우고, repartition·split·map_batches로 병렬도를 제어하며 수 GB CSV/Parquet를 로컬에서 처리하는 전략을 익힙니다.
개발 학습 기록과 기술 지식을 체계적으로 관리하는 개인 위키입니다.
'sharding' 태그가 포함된 1개의 포스트