2026.09.04 (금)

  • 맑음동두천 29.0℃
  • 맑음강릉 25.8℃
  • 맑음서울 29.6℃
  • 맑음대전 29.2℃
  • 맑음대구 27.3℃
  • 구름많음울산 25.6℃
  • 맑음광주 30.8℃
  • 구름많음부산 27.8℃
  • 맑음고창 30.9℃
  • 흐림제주 26.7℃
  • 맑음강화 28.3℃
  • 맑음보은 27.0℃
  • 맑음금산 28.4℃
  • 구름많음강진군 30.0℃
  • 구름많음경주시 25.8℃
  • 구름많음거제 27.7℃
기상청 제공

AI 성능 좌우하는 데이터 라벨링... 'Ground Truth'는 처음부터 존재하지 않는다

 

(포탈뉴스통신) AI 모델은 데이터에서 학습한다. 그러나 무엇을 학습할지는 데이터 자체가 아니라 '라벨(Label)'이 결정한다. 업계에서는 AI 성능을 높이기 위해 모델보다 데이터 품질을 먼저 관리해야 한다는 '데이터 중심 AI(Data-Centric AI)' 접근법이 확산되고 있다.

 

생산 설비의 불량 검사에서는 스크래치를 위치와 크기, 영향도에 따라 구분해야 하고, 고객 상담에서는 하나의 문장이 불만 접수와 환불 요청, 이탈 징후를 동시에 포함할 수 있다. 문서 처리 역시 동일한 정보가 문서 양식에 따라 서로 다른 위치에 존재한다.

 

이처럼 라벨은 데이터 안에 원래 존재하는 정보가 아니다. 기업이 AI를 통해 어떤 업무를 자동화하고 어떤 의사결정을 지원할 것인지에 따라 정의되는 비즈니스 기준에 가깝다. 따라서 분류 체계(Taxonomy)가 실제 업무 목적을 반영하지 못하면 수백만 건의 데이터를 구축하더라도 실무에 활용하기 어려운 AI 모델이 만들어질 수 있다.

 

최근 AI 업계에서는 데이터 수집보다 라벨링 품질 관리를 더욱 중요한 요소로 보고 있다. 연구에서는 데이터 품질이 단순히 데이터의 양이나 정제 수준이 아니라 라벨 기준, 데이터 대표성, 수집 과정, 재현 가능성까지 포함한다고 설명한다.

 

실제 프로젝트는 라벨 정의와 가이드라인을 설계하는 단계부터 시작된다. 이후 여러 작업자가 동일한 샘플을 검토해 일치도를 측정하고, 의견이 갈리는 사례를 반영해 기준을 지속적으로 수정한다. 운영 단계에서는 '골든 세트(Golden Set)'를 활용해 품질을 검증하고, 라벨 변경 이력과 작업자, 가이드라인 버전까지 기록해 문제가 발생했을 때 원인을 추적할 수 있어야 한다.

 

AI와 사람이 경쟁하는 관계도 아니다. 최근에는 AI가 먼저 데이터를 예측 라벨링(Pre-labeling)하고 사람이 이를 검토·수정하는 방식이 확산되고 있다. 특히 Active Learning은 AI가 가장 판단하기 어려운 데이터를 우선 선별해 전문가가 검토하도록 하면서 데이터 구축 효율을 높이는 방식으로 활용된다.

 

전문가들은 데이터 라벨링의 성과를 단순히 시간당 처리 건수로 평가해서는 안 된다고 지적한다. 작업자 간 일치도(Inter-Annotator Agreement), 전문가 수정 비율, 데이터 그룹별 오류율, 데이터 버전별 모델 성능 변화 등 다양한 지표를 함께 관리해야 실제 품질을 확인할 수 있다는 것이다.

 

특히 한국어와 베트남어를 함께 다루는 프로젝트에서는 높임말, 코드 스위칭(Code-Switching), 약어, 고유명사, 문화적 표현 차이까지 고려해야 한다. 단순 번역된 가이드라인만으로는 일관된 데이터 품질을 확보하기 어렵다는 평가다.

 

데이터 보안 역시 핵심 과제로 꼽힌다. 라벨링 데이터에는 개인정보(PII), 고객 문서, 공장 이미지, 통화 기록, 의료 정보 등이 포함될 수 있어 최소 권한 접근, 민감 정보 마스킹, 다운로드 제한, 작업 이력 관리 등 보안 체계를 함께 설계해야 한다.

 

SotaTek Korea(소타텍코리아)는 기업의 AI 프로젝트를 위해 데이터 분류 체계(Taxonomy) 설계부터 텍스트·이미지·음성·문서 데이터셋 구축, Pre-labeling, Active Learning, 다단계 품질 관리(QA), 버전 관리까지 데이터 운영(Data Operations)을 지원하고 있다. 또한 한국과 베트남을 연결하는 운영 체계를 기반으로 이중 언어 데이터 구축과 AI 모델 개발 조직 간 협업을 지원해 데이터 품질 개선 결과를 실제 AI 성능 향상으로 연결하고 있다.

 

업계에서는 AI 경쟁력이 모델 자체보다 신뢰할 수 있는 데이터 구축 체계에서 결정된다는 점을 강조한다. 결국 데이터 라벨링은 사람의 판단을 '정답'으로 만드는 과정이 아니라, 어떤 기준과 절차를 거쳐 데이터가 만들어졌는지를 설명할 수 있는 체계를 구축하는 작업이라는 것이 전문가들의 공통된 설명이다.


[뉴스출처 : 포탈뉴스통신]


포토이슈


정치

더보기

사회

더보기


경제핫이슈

더보기
기운찬, 버섯균사체 신소재 'GMK 추출물' 인체적용시험서 인지기능 개선 유의성 확인...식약처 기능성 원료 등록 절차 (포탈뉴스통신) 바이오 신소재 전문기업 (주)기운찬(대표 박종례)은 독자 개발한 복합버섯균사체 배양추출물에 대해 식품기능성 인체적용시험을 완료하고, 그 결과를 근거로 식품의약품안전처에 개별인정형 건강기능식품 원료 등록을 신청했다고 밝혔다. 회사는 해당 ‘복합버섯균사체 배양추출물’을 'GMK®추출물'로 표시하고 있다. 국가연구과제 지원 임상, 55세 이상 성인 대상 16주간 진행 인체적용시험은 국가연구과제의 지원을 받아 김천의료원과 고려대학교 구로병원이 공동으로 수행했다. 만 55세 이상 인지기능 저하를 호소하는 성인을 대상으로 16주간 무작위배정, 이중맹검, 위약대조 방식으로 설계되어 데이터의 신뢰성을 확보했다는 평가다. 시험은 2025년 4월 10일 첫 시험대상자 등록을 시작으로 2026년 1월 21일 마지막 시험대상자 완료까지 진행됐다. 안전성 시험은 대구가톨릭대학교 GLP센터를 통해 반복투여독성시험, 유전독성시험 등 다수의 시험이 완료됐다. 이번 인체적용시험 기간 중 중대한 이상 반응은 보고되지 않았다는 것이 회사 측 설명이다. 1차 유효성 평가지표 K-MMSE에서 유의미한 개선 확인 이번