
from Scratch
407
이렇게 학습된 벡터를 사용하는 애플리케이션도 비슷하게 편향된 유사성을
지닐 수 있다. 애플리케이션의 종류에 따라 이는 문제가 될 수도 있고 안 될 수
도 있다. 이런 경우에 특정 편향을 ‘제거’하는 기법들이 다양하게 존재하지만, 모
든 편향을 제거하는 것은 아마 불가능할 것이다. 하지만 그러한 방법이 있음은
알아둘 필요가 있다.
또한
26
.
4
절 ‘나쁜 데이터 제품 만들기’의 ‘사진’ 예제와 같이, 모델을 대표성이
없는 데이터를 사용하여 학습한다면 해당 모델의 실제 성능이 안 좋을 가능성이
매우 높으며, 불쾌하거나 난처한 방식으로 동작할 수도 있다.
다른 관점으로 보면 여러분의 알고리즘은 우리 세상에 실제로 존재하는 편향
을 담고 있을 수도 있다. 예를 들어 여러분이 만든 가석방 모델이 완벽하게 재범
을 일으키는 범죄자를 예측할 수 있다고 해보자. 만약 재범이 현실 세계의 어떠
한 편향적인 영향의 결과라면 여러분의 모델은 그러한 편향을 지속시킬 뿐일 수
도 있다.
26.10
데이터 보호
여러분은 데이텀 사용자에 대해 많은 것을 알고 있다. 그들이 어떤 기술을 좋아하
는지, 데이터 과학자인 친구가 누구인지, 어디에서 일하는지, 얼마나 버는지, 사
이트에서 얼마나 많은 시간을 보내는지, 어떤 채용 공고를 클릭했는지 등