84
2부MLOps적용방법
한다. 디버깅과 같은 목적으로 실험을 정확히 재현하기 위해서는 유사-랜덤 수준을 통제해야
한다. 즉, 생성기의 ‘씨드
seed
’를 제어해야 한다. 다시 말해, 동일한 씨드로 초기화한 동일한 제
어기는 유사-랜덤 숫자 중 동일한 순서에 존재하는 값을 반환한다.
데이터
Data
반복 가능성을 달성하려면 동일한 데이터를 사용해야 한다. 버전 데이터에 필요한 저장소 용량
이 갱신 주기와 수량에 따라 모자랄 수 있어, 반복 가능성을 달성하기가 까다로울 수 있다. 또
한 데이터를 분기 처리하기 위한 도구는 코드를 분기 처리하는 도구만큼 풍부하지 않다.
설정
Setting
이건 당연히 전제되어야 한다. 모든 처리를 동일하게 설정한 상태에서 재현 가능해야 한다.
결과
Result
개발자들은 병합 도구를 활용하여 텍스트 파일의 여러 버전을 비교하고 병합하지만, 데이터 과
학자는 (혼동 행렬
Confusion
Matrix
부터 부분 의존성 도식까지) 모델에 대한 심층 분석 결과를 비교
해야 한다.
구현
Implementation
동일한 모델에서 다소 다르게 구현되는 경우, 완전히 다른 모델을 생성할 수도 있고, 어떤 호출
에 대해서는 다른 예측 결과를 반환할 수 있다. 또한 모델이 복잡할수록 이러한 불일치가 발생
할 가능성이 더 크다. 반면, 모델 하나를 사용하여 대량으로 데이터 세트에 대한 스코어링을 수
행할 경우,
API
를 라이브로 한 번 호출하여 스코어링할 때보다 다양한 제약조건을 확인할 수
있어, 때로는 서로 다른 구현이 동일한 모델을