Stage 5 · Ray Train 분산 학습 — 데이터 샤딩 · 체크포인트
PyTorch 모델을 노트북에서 N개 워커로 분산 학습합니다. TorchTrainer와 ScalingConfig로 워커 수를 정하고, 각 워커가 데이터의 서로 다른 '샤드'를 받는 원리(get_dataset_shard·DistributedSampler), 그리고 체크포인트 저장·복원을 실습합니다.
개발 학습 기록과 기술 지식을 체계적으로 관리하는 개인 위키입니다.
'ddp' 태그가 포함된 1개의 포스트