MHResearch

서·논술형 자동채점,
사람 채점자와 얼마나 일치해야 쓸 수 있나

일치도 0.8만으로는 도입 여부를 정할 수 없습니다.
어떤 문항에서, 어떤 점수대에서 어긋나는지가 결정합니다.

서·논술형 답안을 AI로 채점하겠다는 제안을 받으면 발주 기관이 가장 먼저 묻는 질문은 하나입니다. “사람 채점자와 얼마나 일치합니까?” 그리고 대개 하나의 숫자로 답이 돌아옵니다. 가중 카파 0.82, 상관계수 0.87 같은 식입니다. 이 숫자는 필요하지만 충분하지 않습니다. 채점 데이터를 다뤄 본 경험에서 반복해서 확인한 것은, 평균 일치도가 같아도 도입할 수 있는 문항과 도입하면 안 되는 문항이 갈린다는 사실입니다.

평균 일치도만 보면 놓치는 것

첫째, 사람 채점자끼리의 일치도입니다. AI와 사람의 일치도 0.82는 사람과 사람의 일치도가 0.90일 때와 0.75일 때 전혀 다른 의미를 갖습니다. 후자라면 AI는 이미 채점자 수준에 도달한 것이고, 전자라면 아직 멀었습니다. AI의 일치도는 언제나 채점자 간 일치도와 나란히 놓고 읽어야 합니다.

둘째, 점수대별 분포입니다. 중간 점수대 답안이 대부분인 문항에서는 AI가 중간 점수만 찍어도 평균 일치도가 높게 나옵니다. 정작 판별이 중요한 최상위와 최하위 답안에서 어긋난다면 그 모델은 쓸 수 없습니다.

셋째, 어긋나는 방향입니다. AI가 사람보다 일관되게 후하게 주는지, 박하게 주는지, 아니면 무작위로 흩어지는지에 따라 대응이 다릅니다. 일관된 편향은 보정할 수 있지만 무작위 오차는 보정할 수 없습니다.

저희가 쓰는 판정 절차

저희가 쓰는 판정 절차는 다음과 같습니다. 아래 수치는 절차를 설명하기 위해 만든 예시 데이터이며, 특정 기관의 검증 결과가 아닙니다. 순서가 중요합니다. 앞 단계를 통과하지 못한 문항은 뒤 단계로 가지 않습니다.

  1. 채점자 간 일치도 확보. 채점자 3인 이상의 점수가 있는 답안만 씁니다. 채점자 간 가중 일치도가 0.70 미만인 문항은 채점 기준 자체를 손봐야 하므로 AI 검증 대상에서 뺍니다.
  2. 준거 점수 산출. 채점자마다 엄격성이 다르므로 다국면 라쉬 모형으로 보정한 점수를 준거로 삼습니다. 단순 평균은 엄격한 채점자가 많이 배정된 답안에 불리합니다.
  3. 전체 일치도 계산. AI 점수와 준거 점수의 가중 카파를 구합니다. 여기까지가 보통 보고되는 숫자입니다.
  4. 점수대별 분해. 준거 점수를 상·중·하 세 구간으로 나눠 구간마다 일치도와 평균 편차를 따로 봅니다.
  5. 편향 방향 확인. AI 점수에서 준거 점수를 뺀 값의 분포를 문항별로 그립니다. 평균이 0에서 멀면 체계적 편향, 분산이 크면 무작위 오차입니다.
문항별 AI–준거 점수 일치도
그림 1 (예시 데이터). 평균은 0.84였지만 문항별로는 0.55에서 0.93까지 벌어졌습니다. 평균만 봤다면 14개 전부 도입했을 것입니다.

예시 결과: 14개 중 11개

전체 일치도 0.84는 채점자 간 일치도 0.86과 거의 같았습니다. 여기서 멈췄다면 모든 문항을 도입 가능으로 판정했을 것입니다. 점수대별로 나누자 그림이 달라졌습니다.

구간답안 비율일치도평균 편차해석
상위 (만점 근처)12%0.71−0.6점AI가 박하게 줌
중간68%0.88+0.1점안정적
하위 (0점 근처)20%0.79+0.4점AI가 후하게 줌

상위 구간에서 박하게 주는 경향은 세 문항에 집중돼 있었습니다. 셋 다 “근거를 두 가지 이상 제시하면 만점” 같은 개수 기준이 있는 문항이었고, AI는 근거를 하나로 묶어 세는 경우가 많았습니다. 이 세 문항은 도입 불가로 판정하고 채점 기준을 다시 쓰도록 권고했습니다. 나머지 11개 문항은 편차가 작고 방향이 일정해 보정 후 도입 가능으로 판정했습니다.

도입 가능한 문항과 아닌 문항을 가르는 것은 평균 일치도가 아니라, 어긋나는 답안이 어디에 몰려 있는가입니다.

발주할 때 요구할 것

자동채점을 검토하는 기관이라면 일치도 숫자 하나 대신 다음 네 가지를 함께 요구하시길 권합니다.

  • 같은 답안에 대한 채점자 간 일치도
  • 점수 구간별 일치도와 평균 편차
  • 문항별 편향 방향과 크기
  • 도입 불가로 판정한 문항과 그 이유

마지막 항목이 특히 중요합니다. 모든 문항이 도입 가능하다고만 보고하는 검증은 신뢰하기 어렵습니다. 어떤 문항에서 안 되는지를 말할 수 있어야, 되는 문항에 대한 판정도 믿을 수 있습니다.

한 가지 덧붙이면

이 절차는 AI 채점을 사람 채점의 대체로 보지 않습니다. 도입 가능 판정을 받은 문항도 상위 구간 답안은 사람이 한 번 더 보도록 설계했습니다. AI가 하는 일은 채점을 끝내는 것이 아니라, 사람이 봐야 할 답안을 줄여 주는 것입니다.

Insights 목록으로 이 주제로 상담하기