블로그로 돌아가기

데이터 어노테이션 아웃소싱 비용 가이드

데이터 어노테이션 아웃소싱 비용을 가격 모델, 모달리티, QA, 재작업, 보안과 승인된 라벨당 비용으로 비교하는 구매자 가이드입니다.

표시 단가가 아니라 승인된 라벨당 비용을 비교하십시오

데이터 어노테이션 아웃소싱 비용은 원시 자산을 모델 팀이 승인하고 사용할 수 있는 라벨로 바꾸는 데 필요한 전체 비용입니다. 작업 설계, 도구 구성, 어노테이터 시간, 품질 검토, 이견 판정, 재작업, 보안 통제, 프로젝트 관리와 납품이 모두 포함됩니다. 박스나 문서당 가격이 낮아도 어려운 사례와 검토가 제외되어 있거나 엔지니어가 내보낸 파일을 다시 고쳐야 한다면 총비용은 더 커질 수 있습니다.

견적을 비교하려면 모든 공급업체에 동일한 대표 샘플, 가이드라인 버전, 출력 형식, 승인 규칙, 보안 요구사항과 물량 가정을 제공하십시오. 그런 다음 제출 단위가 아니라 품질관리 이후 승인된 단위를 기준으로 계산합니다. 이 가이드는 AI 조달, 제품 및 ML 운영 팀이 가격 모델, 모달리티별 원가 요인, 숨은 비용과 견적 정규화 방법을 검토하도록 돕습니다.

네 가지 가격 모델과 적합한 상황

작업 또는 객체 단가제는 이미지, 바운딩 박스, 텍스트 span, 오디오 분, 비디오 프레임 등 명확한 단위에 가격을 매깁니다. 단위가 안정적이고 업체들이 같은 방식으로 계산할 때 적합합니다. 건너뛴 항목, 거절 항목, 빈 항목, 중복 또는 다중 객체가 청구되는지와 검토 포함 여부를 계약서에 명시해야 합니다.

시간제는 탐색 작업, 복잡한 조사, 자주 바뀌는 taxonomy, 물량만으로 난이도를 예측하기 어려운 작업에 맞습니다. 전문가 시간이 투명해지지만 역할별 요율, 시간 기록 규칙, 파일럿 생산성 근거, 예산 상한이나 재검토 시점이 필요합니다.

전담팀 가격제는 한 달 등의 기간 동안 생산능력을 예약합니다. 지속적인 파이프라인과 빈번한 가이드라인 변경, 긴밀한 협업에 유리합니다. 인원수와 표면 요율을 곱하지 말고 교육, 휴가, 감독, QA와 예상 가동률 이후의 실질 생산능력을 비교해야 합니다.

성과 또는 관리형 서비스 가격제는 정의된 승인 조건을 통과한 검증 데이터셋처럼 합의된 결과를 기준으로 합니다. 범위가 안정적이면 예산이 단순해지지만 가정, 제외 사항, 변경 관리, 수정 책임이 분명해야 합니다. 어떤 모델도 항상 더 저렴하지 않습니다. 가장 큰 불확실성을 측정 가능하게 만드는 모델을 선택하십시오.

AWS SageMaker 가격 문서는 검토된 데이터셋 객체를 객체 가격의 기준으로 설명하며 Ground Truth 문서는 사람 라벨링, 통합, 작업 유형과 출력 메타데이터를 구분합니다. 공급업체 견적도 청구 이벤트를 이 정도로 명확히 정의해야 합니다.

공급업체 비교 전에 비용식을 만드십시오

총비용은 다음 항목으로 나눌 수 있습니다.

  • 일회성 설정: 샘플 분석, taxonomy와 가이드라인, 워크플로 구성, 통합, 보안 온보딩, 교육과 calibration;
  • 생산: 청구 단위 수와 단위 또는 시간 요율;
  • 품질: 2차 검토, gold check, 중복 라벨링, 판정, 감사 샘플링과 보고;
  • 예외: 전문가 검토, 어려운 자산, 개인정보 처리, 원천 데이터 정리와 승인된 변경;
  • 구매자 내부 비용: 데이터 준비, 질의 대응, 승인 테스트, 엔지니어링과 수정.

모든 공급업체에 일회성 비용과 반복 비용을 분리하도록 요청하십시오. 설정비 자체가 문제는 아닙니다. 잘 설계된 파일럿은 대규모 반복 오류를 방지합니다. 위험한 것은 정의되지 않은 비용이거나, 낮은 설정비 뒤에 taxonomy 결정을 구매자에게 계속 떠넘기는 것입니다.

모든 요율의 분모를 기록하십시오. 파일럿 이미지에는 객체가 평균 두 개지만 생산 이미지에는 스무 개라면 이미지당 단가는 의미가 달라집니다. 텍스트는 문서, token, span, judgment를 통일하고 음성은 미디어 분과 실제 작업 시간을 구분해야 합니다. 비디오는 clip, 표본 frame, track, keyframe 또는 event 중 무엇을 세는지 정해야 합니다.

모달리티별 비용 요인

이미지. 분류는 조밀한 객체 탐지나 segmentation보다 대체로 단순하지만 객체 수, 가림, 화질, 클래스 수, 경계 규칙, 최소 객체 크기와 속성이 생산성을 바꿉니다. polygon은 윤곽 복잡도, bounding box는 객체 밀도와 모호한 겹침의 영향을 받습니다. 한 개의 평균 요율 대신 난이도 구간별 파일럿 생산성을 요청하십시오.

비디오. 길이만으로 비용을 예측할 수 없습니다. frame rate, 샘플링 간격, track 수, 장면 전환, 가림, interpolation, 시간 일관성, event 정의와 전체 시퀀스 검토 여부가 모두 중요합니다. 1분의 정적인 CCTV 영상과 혼잡한 도로 영상은 같은 단위가 아닙니다.

텍스트와 문서. 문서 길이, 언어, 도메인, taxonomy 깊이, 결정을 위한 문맥, 겹치는 span, entity 관계와 외부 조사 필요성이 비용을 바꿉니다. 표나 레이아웃 문맥이 필요한 문서는 단어 수가 같아도 순수 텍스트보다 오래 걸릴 수 있습니다.

오디오와 음성. 길이, 잡음, 화자 수, 겹침, 억양, 언어 인력, transcription 수준, timestamp, diarization, 비언어 사건과 개인정보 삭제가 주요 요인입니다. 오디오 분당 가격에는 transcription, 라벨, 검토와 어려운 음원 할증 포함 여부를 적어야 합니다.

3D, 센서와 전문 데이터. point cloud, 의료 영상, 지리공간 자료, 법률 문서와 과학 자료에는 전문 도구와 자격 있는 검토자가 필요할 수 있습니다. 도구 지연, 좌표계, 다중 센서 동기화와 도메인 판단 규칙까지 throughput에 영향을 주므로 일반 crowd 요율과 직접 비교해서는 안 됩니다.

품질 비용을 견적 안에 넣으십시오

품질은 라벨링이 끝난 뒤 추가하는 마지막 검사 단계가 아닙니다. 견적은 교육, 자격평가, calibration, 진행 중 검사, 검토 범위, adjudication, 수정과 승인 보고를 설명해야 합니다. NIST AI Risk Management Framework는 측정지표, 시험 방법, 결과와 관련 전문성을 문서화하도록 권장합니다. 공식 준수를 주장하지 않는 프로젝트에도 유용한 조달 원칙입니다.

목표치를 정하기 전에 품질 단위와 오류 taxonomy를 정의하십시오. class label, box, polygon, text span, transcript segment와 track object는 서로 다른 측정이 필요합니다. 심각도, abstention, 부분 정답, 빈 자산과 모호한 항목 처리 방법도 명시해야 합니다. 분모, 표본 방식과 표본 수가 없는 단일 정확도 수치로는 견적을 정규화할 수 없습니다.

중복 라벨링은 설계 선택입니다. 명확한 모든 항목을 세 명에게 보내면 낭비일 수 있고, 주관적이거나 위험한 판단을 한 명에게만 맡기면 부족할 수 있습니다. 단일 생산, 선택적 overlap, hidden gold, 위험 기반 review와 전문가 판정을 조합하고 각 층을 별도로 가격화하십시오. 가이드라인 결함이 불일치를 만들었을 때 비용 책임도 정해야 합니다.

승인 단가를 바꾸는 숨은 비용

가장 큰 숨은 비용은 재작업입니다. 불완전한 지침, 일관되지 않은 원천 데이터, 늦은 taxonomy 변경, 학습 파이프라인과 맞지 않는 내보내기, 감사 표본만 수정하는 대응이 원인이 됩니다. 계약은 공급업체 오류, 구매자 변경, 원천 데이터 결함과 진짜 모호성을 구분하고 각각의 조치를 정해야 합니다.

도구에는 라이선스, 저장소, 컴퓨팅, 통합, 사용자 UI, 전송과 형식 변환 비용이 붙을 수 있습니다. 구매자 플랫폼을 쓰는지, 업체 플랫폼을 쓰는지, 관리 서비스와 플랫폼 비용이 동시에 붙는지 확인하십시오. 파일럿 중 실제 학습 파이프라인에 납품 파일을 넣어 보십시오. UI에서 맞아 보이는 것만으로는 부족합니다.

관리비에는 온보딩, 일상 조율, 질문, 보고, 변경 관리와 인력 교체가 포함됩니다. 누가 가이드라인을 소유하고 edge case를 답하는지, 결정이 작업자에게 얼마나 빨리 전달되는지, PM 시간에 한도가 있는지 물어야 합니다.

보안과 개인정보 보호는 제한된 작업 환경, 장치 통제, 접근 검토, 인력 심사, 데이터 위치, logging, redaction과 안전한 삭제를 통해 가격에 영향을 줍니다. 데이터가 이런 통제를 요구한다면 선택 항목이 아닙니다. 영국 ICO의 최신 data protection by design 안내는 설계 단계부터 필요한 개인정보, 접근과 보호조치를 결정하도록 설명합니다. 적용 법규는 구매자의 개인정보·법무 담당자가 확인해야 합니다.

정규화한 견적 비교 예시

동일한 샘플, taxonomy, 출력 schema와 승인 시험을 사용하는 100,000개 이미지 파일럿을 가정합니다. 업체 A는 제출 이미지당 0.08달러, 설정비 2,000달러이며 검토를 제외합니다. 업체 B는 샘플 검토를 포함해 이미지당 0.11달러, 설정비 3,000달러입니다. 이는 계산을 위한 가상 수치이며 시장 기준이 아닙니다.

A의 생산비는 8,000달러이고 표면 총액은 10,000달러입니다. 구매자 수정 없이 승인되는 비율이 82%이고 나머지 수정에 2,700달러가 필요하다고 가정하면 비교 총액은 12,700달러입니다. 승인된 82,000개로 나누면 승인 단위당 약 0.155달러입니다.

B의 표면 총액은 14,000달러입니다. 최초 승인율이 96%이고 포함된 수정으로 98,000개가 승인되며 구매자 승인 업무가 600달러라면 비교 총액은 14,600달러, 승인 단위당 약 0.149달러입니다. 이 가정에서는 표면 단가가 높은 B가 정규화 비용은 낮습니다. 가정이 바뀌면 결론도 바뀌므로 파일럿 근거와 민감도 범위를 사용해야 합니다.

일정, capacity, 보안 적합성, 문서와 수정 속도도 비교하십시오. 재무적으로 좋은 업체는 가장 싸거나 비싼 업체가 아니라 위험을 조정한 적합성이 가장 높은 업체입니다.

공급업체에 물어볼 질문

  • 청구 단위는 무엇이며 빈 항목, skip, reject, duplicate, multi-object는 어떻게 계산합니까?
  • 설정, platform, storage, transfer, management, reviewer, expert와 remediation 중 무엇이 포함됩니까?
  • 요율은 어떤 난이도를 가정하며 무엇이 할증이나 change order를 만듭니까?
  • 누가 label, review, adjudication, 관리와 승인을 맡고 어떤 자격이 필요합니까?
  • 지침이 바뀔 때 어노테이터를 어떻게 재교육하고 calibration합니까?
  • 보고서에 어떤 지표, 분모, 표본 수, severity와 승인 threshold가 나옵니까?
  • 업체 오류, 모호한 지침, 원천 데이터 결함, 범위 변경의 재작업은 누가 부담합니까?
  • 대표 파일럿의 throughput과 pass rate 근거 및 예산 범위는 무엇입니까?
  • 접근, logging, retention, deletion, confidentiality와 incident 대응 통제는 무엇입니까?
  • 요구 schema, 안정적 ID, lineage, 이슈 log, 수정 history와 최종 QA 근거를 납품할 수 있습니까?

견적 요청 전 예산 체크리스트

  • 작업 정의, taxonomy 버전, 언어, 모달리티와 출력 schema를 고정합니다.
  • 쉬운, 일반, 어려운, 모호한, 무효 항목이 포함된 대표 샘플을 제공합니다.
  • 총량뿐 아니라 난이도 구간별 물량을 제시합니다.
  • 청구 단위와 승인 단위를 별도로 정의합니다.
  • 품질지표, sampling 또는 overlap, severity, 판정과 release 기준을 정합니다.
  • 견적 전에 보안, 개인정보, 접근, 보존과 데이터 위치 요구를 공개합니다.
  • 구매자와 공급업체의 지침 질의 및 변경 승인 담당자를 정합니다.
  • 설정, 생산, QA, 전문가, 플랫폼, 관리와 contingency를 분리해 요청합니다.
  • 구매자 측 엔지니어링, 승인 시험과 수정 비용을 추정합니다.
  • 난이도, 생산성, 통과율과 변경량에 대해 낮음·예상·높음 시나리오를 만듭니다.

대표 샘플로 방어 가능한 견적을 만드십시오

가격 파일럿은 실제 생산 난이도를 재현해야 합니다. rare class, 복잡한 장면, 나쁜 오디오, 긴 문서, 여러 언어, edge case와 거절 대상까지 포함하고, 실제 출력과 구매자 승인까지 실행하십시오. 순수 라벨링 시간, 검토 시간, 질문 수, 통과율, 오류 심각도, 수정 회수와 제외 수를 기록합니다.

관련 계획에는 AI 데이터 수집 비용 가이드, 데이터 어노테이션 품질관리 워크플로, AI 데이터 서비스 업체 평가 가이드를 참고하십시오. 수집 제약, 라벨 품질과 업체 적합성을 분리해 볼 수 있습니다.

Smart Language Service는 이미지, 비디오, 텍스트 또는 오디오 워크플로의 대표 샘플을 기반으로 범위를 정의할 수 있습니다. 대표 샘플로 구체적인 어노테이션 견적을 요청하고 대규모 생산을 약정하기 전에 청구 단위, 품질 층, 예외 처리, 납품 형식과 승인 근거를 합의하십시오.