208
Part V -
복잡성과 리스크 관리하기
데이터 의존성
인공지능은 태생적으로 데이터 품질에 의해 성능이 좌우된다
는 리스크를 가진다. 스
타트업은 데이터를 기반으로 회사를 운영해야 하며 데이터 누적이 중단되지 않도
록 주의를 기울여야 한다. 인공지능으로 문제를 해결하기 위해서는 적합한 데이
터가 필요하다. 프로젝트 성격에 맞지 않는 데이터를 사용하면 좋은 결과를 기대
하기 어렵다. 물론 처음부터 고품질의 데이터로 시작할 수는 없다. 프로젝트를 진
행하면서 각 단계에 적절한 데이터를 활용할 수 있도록 미리 계획하는 것이 중요
하다. 선제 계획을 통해 최신화된 데이터를 준비하고 활용할 수 있으며 최적의 인
사이트를 도출해낼 수 있다.
인공지능의 성능은 데이터와 함께 발전했다. 알고리즘 훈련에 필요한 데이터를
수집하고 분류해 라벨링하는 것은 어렵고 지루하다. 실제 일상을 반영하는 포괄
적인 데이터를 활용할 경우 더 그렇다. 캠페인에 부정적 영향을 미치는 데이터는
없는지 지속적으로 확인해야 한다.
인공지능은 태생적으로 데이터 품질에 의해 성능이 좌우된다는 리스크를 가진다.
예를 들어, 제품을 업데이트할 때마다 데이터에 결함이 생기지는 않는지 세심하
게 살펴봐야 한다. 업데이트는 예상치 못한 리스크를 가져오기 마련이다. 잘못된
데이터로 알고리즘이 손상되는 일을 방지하려면
QA
프로세스를 강화해야 한다.
다양한 경로에서 데이터를 수집한다면 알고리즘이 학습을 시작하기 전에 각 경로
의 검수가 선행돼야 한다. 챗봇의 경우 의미가 없거나 악의적 의도를