
93
4
장
데이터 검증
4.3
데이터 인식
이전 절에서는 데이터의 요약 통계와 스키마를 생성하는 방법을 배웠습니다. 이는 데이터를 설
명해주지만, 잠재적인 문제를 발견하지는 못합니다. 다음 몇 개 절에서는
TFDV
가 데이터에서
문제를 발견하는 데 어떻게 도움이 되는지 설명하겠습니다.
4.3.1
데이터셋 비교
학습 데이터셋과 검증 데이터셋이 있다고 가정해 보겠습니다. 머신러닝 모델을 학습하기 전에
학습 데이터셋에 대한 검증 데이터셋의 대표성을 확인하려고 합니다. 검증 데이터는 학습 데이
터 스키마를 준수하나요? 피처 열 또는 피처값의 유의미한 수가 누락되었나요?
TFDV
를 사용
하면 신속하게 답을 확인할 수 있습니다.
다음과 같이 두 데이터셋을 로드한 후 시각화할 수 있습니다. 주피터 노트북에서 다음 코드를
실행하면 데이터셋 통계를 쉽게 비교할 수 있습니다.
train_stats = tfdv.generate_statistics_from_tfrecord(
data_location=train_tfrecord_filename)
val_stats = tfdv.generate_statistics_from_tfrecord(
data_location=val_tfrecord_filename)
tfdv.visualize_statistics(lhs_statistics=val_stats, ...