학습 데이터 구축 사업에서 가장 흔한 사고는 라벨링이 절반쯤 진행됐을 때 가이드라인이 바뀌는 것입니다. 바뀐 기준으로 이미 작업한 데이터를 다시 보게 되고, 일정과 예산이 같이 무너집니다. 저희가 맡은 프로젝트에서도 초기에 이런 일을 겪었고, 지금은 절차를 바꿔 막고 있습니다.
왜 첫 가이드는 틀리는가
가이드라인은 보통 대표적인 사례를 보고 씁니다. 그런데 작업자가 실제로 헷갈리는 것은 대표 사례가 아니라 경계 사례입니다. 두 범주에 걸치는 답안, 판독이 안 되는 이미지, 기준에 없는 새 유형이 본작업에서 쏟아지고, 그때마다 기준을 덧붙이게 됩니다.
파일럿을 먼저 돌리는 이유
본작업 전에 작은 파일럿을 돌리면 경계 사례가 먼저 모입니다. 파일럿의 목적은 데이터를 만드는 것이 아니라 가이드라인을 고칠 거리를 찾는 것입니다. 그래서 파일럿에서는 작업자에게 “애매했던 것”을 기록하게 하고, 그 기록을 모아 가이드라인 2판을 씁니다. 이 한 번의 개정으로 본작업 중 개정 횟수가 크게 줄어듭니다.
일치도로 기준의 모호함을 잰다
같은 자료를 두 명이 독립적으로 라벨링하게 하고 일치도를 봅니다. 일치도가 낮은 범주는 작업자 문제가 아니라 기준이 모호한 범주입니다. 작업자를 교육하기 전에 기준을 고쳐야 합니다. 이중 검수는 품질 확인 수단이면서 동시에 가이드라인 진단 도구입니다.
가이드라인 개정은 실패가 아닙니다. 다만 개정 시점이 본작업 전이냐 도중이냐가 비용을 결정합니다.
실무 체크리스트
- 파일럿 규모는 본작업의 몇 퍼센트 수준으로 잡되, 유형이 골고루 들어가게 뽑습니다.
- 경계 사례는 가이드라인 본문이 아니라 별도 부록에 사례집으로 모읍니다. 본문은 짧게 유지합니다.
- 개정할 때마다 버전 번호를 붙이고, 어떤 데이터가 어떤 버전으로 작업됐는지 기록합니다.
- 재작업이 필요한 범주만 골라 다시 봅니다. 전량 재검수는 마지막 수단입니다.


