359
14
장
머신러닝을 위한 데이터 개인 정보 보호
이터를 처리할 때 이미지에서 얼굴을 삭제하거나 텍스트에서 이름을 삭제하는 등 많은 개인 정
보를 제거할 수 있습니다. 그러나 때로는 이런 작업이 데이터의 효용을 줄이거나 정확한 모델
을 학습할 수 없게 합니다. 그리고 인종과 성별 데이터를 수집하지 않으면 모델이 특정 그룹에
편향되는지를 알 수 없습니다.
사용자가 수집되는 데이터를 제어할 수도 있습니다. 즉, 데이터 수집 동의는 단순한 옵트인 또
는 옵트아웃 선택보다 더 세부적으로 이루어질 수 있으며, 제품 사용자는 수집 대상 데이터를
정확하게 지정할 수 있습니다. 따라서 설계 문제가 발생합니다. 더 적은 데이터를 제공하는 사
용자가 더 많은 데이터를 제공하는 사용자보다 더 정확한 예측을 받아야 할까요? 머신러닝 파
이프라인으로 동의를 어떻게 추적할까요? 모델에서 단일 피처가 개인 정보에 미치는 영향을
어떻게 측정할까요? 이 모든 질문은 머신러닝 커뮤니티에서 더 많은 논의가 필요한 질문입니다.
14.1.3
비공개를 유지해야 하는 데이터 식별
머신러닝 파이프라인에서 데이터는 사람으로부터 수집할 때가 많으며, 그중 일부 데이터에는
개인 정보를 보호하는 머신러닝이 더 필요합니다. 개인 식별 정보 (
PII
)는 이름, 이메일 주소,
집 주소, 주민등록번호 등 한 사람을 직접 식별할 수 있는 데이터이며 비공개로 유지해야 합니
다.
PII
는 사용자에게 해당 데이터를 직접 요청할 때뿐만 아니라 피드백 주석이나 고객 서비스
데이터와 같은 자유 텍스트로 ...