90
살아 움직이는 머신러닝 파이프라인 설계
숫자 피처에서
TFDV
는 모든 피처에 대해 다음을 계산합니다.
●
전체 데이터 레코드 개수
●
누락 데이터 레코드 개수
●
데이터 레코드 전체에서 피처의 평균과 표준 편차
●
데이터 레코드에서 피처의 최솟값과 최댓값
●
데이터 레코드에서 피처의
0
값의 비율
또한 각 피처의 히스토그램을 생성합니다.
범주형 피처에서
TFDV
는 다음을 제공합니다.
●
전체 데이터 레코드 개수
●
누락 데이터 레코드의 백분율
●
고유 레코드 개수
●
피처의 모든 레코드의 평균 문자열 길이
●
각 범주에서 각 레이블의 샘플 수와 순위를 결정
잠시 후, 이런 통계로 무언가를 실행하는 방법을 배울 것입니다.
4.2.3
데이터에서 스키마 생성
요약 통계를 생성한 다음에는 데이터셋의 스키마를 생성해야 합니다. 데이터 스키마는 데이터
셋의 표현을 설명하는 형식입니다. 스키마는 데이터셋에 필요한 피처와 각 피처의 기반이 되는
데이터 타입(
float
,
integer
,
byte
등)을 정의합니다. 또한 스키마는 데이터의 범위(예: 피처
에 허용된 최솟값, 최댓값, 누락 레코드의 임곗값 개요 )를 정의해야 합니다.
그런 다음 데이터셋의 스키마 정의를 사용하여 향후 데이터셋이 이전 학습 데이터셋과 일치하
는지 확인할 수 있습니다.
TFDV
에서 생성한 스키마는 다른 워크플로에서도 활용할 수 있습니
다. 예를 들어, 데이터셋을 전처리할 때 사용하여 머신러닝 모델 학습을 위한 데이터로 변환할
수도 있습니다.
다음과 같이 단일 함수 호출로 ...