147
3
데이터 윤리
3.2
아마도 여러분이 이 일을 하는 이유는 결과물이 어딘가에 사용되기를 바라기 때문일 것입니다.
그렇지 않다면 시간 낭비일 뿐이겠죠. 여러분의 결과물이 어디선가 사용될 것이라는 가정으로
부터 출발해보죠. 데이터를 수집하고 모델을 개발하면서 많은 결정을 내리게 됩니다. 데이터를
어떤 수준으로 집계하여 저장할까요? 어떤 손실 함수를 사용할까요? 어떤 학습용 및 검증용 데
이터셋을 사용하면 좋을까요? 구현의 단순성, 추론 속도, 모델의 정확도 등 어디에 중점을 둬
야 할까요? 모델이 영역 밖 데이터를 어떻게 처리해야 할까요? 미세 조정을 할 수 있을까요?
아니면 시간에 따라 처음부터 새로 모델을 학습시켜야만 할까요?
이는 알고리즘에 국한된 질문이 아닙니다. 데이터 제품 설계와 관련 있는 질문이죠. 그러나 제
품 관리자, 경영진, 판사, 언론인, 의사 등 여러분이 만든 모델이 포함된 시스템을 개발하고 사
용하는 누구라도 여러분이 내린 결정을 잘 이해할 수 없음은 물론, 의도와는 다른 방향으로 변
경해나갈 수도 있습니다.
가령 두 연구는 아마존의 얼굴 인식 소프트웨어가 정확하지 않고 (
https
://
oreil
.
ly
/
bL5D9
), 인종적으로 편향된 결과 (
https
://
oreil
.
ly
/
cDYqz
)를 만든다는 사실을 밝혀냈습
니다. 이에 대해 아마존은 편향된 결과를 어떤 방향으로 개선할지는 설명하지 않고, 연구원들
이 기본 매개변수를 변경했어야 했다고 해명했습니다. 게다가 아마존은 해당