블로그로 돌아가기

15일 만에 5,040건의 은행 텍스트 납품——아시아 4개 시장을 아우르는 AI 데이터 수집 사례

본 케이스 스터디는 Smart Language Service가 AIxBlock와 협력하여 복잡한 다지역 텍스트 수집 프로젝트를 성공적으로 완수한 사례를 소개합니다. 촉박한 납기, 복잡한 언어 요구사항(일본어 타메구치, 광둥어와 영어의 코드스위칭, 보통화와 방언 혼용), AI 생성 콘텐츠를 완전히 배제하는 까다로운 품질 기준에도 불구하고, 일본, 중국 본토, 홍콩, 싱가포르 4개 지역에서 총 5,040건의 실제 은행 시나리오 문장을 15일 만에 납품하였으며, 100% 승인율을 달성했습니다.

프로젝트 배경

AIxBlock는 세계적인 AI 훈련 데이터 공급업체로서, 은행 도메인 자연어 이해(NLU) 모델을 위한 데이터셋 확장을 목표로 했습니다. 본 프로젝트는 일본, 중국 본토, 홍콩, 싱가포르 4개 시장에서 실제 은행 업무를 시뮬레이션한 이메일 및 인스턴트 메시징 스타일의 커뮤니케이션 텍스트를 수집하는 것이 목표였습니다.

핵심 과제: 단순한 번역이 아닌, 각 지역의 문화에 맞는 진정한 언어 변형이 요구되었습니다——일본어 타메구치(캐주얼어), 광둥어와 영어의 자연스러운 코드스위칭, 방언의 영향을 받은 중국어 표현 등. 또한 AI 생성 또는 합성 콘텐츠는 일체 금지되었습니다.

과제와 난관

이 프로젝트는 여러 가지 독특한 어려움을 안고 있었습니다:

  • 매우 촉박한 납기: 시작부터 납품까지 단 15일, 5,040건의 문장 완성
  • 복잡한 언어 요구사항: 4개 지역 각각의 고유한 언어 규칙——일본(히라가나 중심, 이모지 활용 캐주얼어), 홍콩(구어체 광둥어와 영어 혼용), 중국 본토(간체 중국어에 인터넷 신조어 및 방언 영향 포함), 싱가포르(싱글리시 특색을 가진 현지화 영어)
  • 엄격한 품질 기준: 모든 콘텐츠 100% 인간 생성, 각 문장 15-25단어(또는 동등한 문자 길이), 84개 하위 행동별 용어 정확한 삽입(1개 정확 일치 + 2개 의미 변형), 포멀/인포멀 비율 50/50 유지(±10% 허용)
  • 도메인 전문성: 모든 기여자는 은행 도메인 전문가이자 모국어 구사자여야 함

저희의 솔루션

Smart Language Service는 세 가지 핵심 축을 중심으로 프로젝트를 추진했습니다:

1. 신속한 기여자 모집 및 검증

프로젝트 시작 후 72시간 이내에 4개 지역에서 40명 이상의 은행 도메인 전문가를 모집하고 검증했습니다. 전원이 모국어 수준의 언어 능력과 최소 3년 이상의 은행 업계 경험을 보유하고 있습니다. 성별 비율도 ±10% 이내로 조정하여 요구사항을 완벽히 충족시켰습니다.

2. 구조화된 콘텐츠 생성 프레임워크

기여자들이 각 지역의 언어적 뉘앙스를 정확히 이해할 수 있도록 상세한 가이드라인을 마련했습니다:

  • 일본: 짧은 문장 구조, 한자보다 히라가나 중점 사용, 이모지와 카오모지를 활용한 감정 표현 강조
  • 홍콩: WhatsApp 및 소셜 미디어에서 흔히 볼 수 있는 실제 광둥어 구어체와 영어의 자연스러운 혼용 표현에 초점
  • 중국 본토: 인터넷 신조어와 지역 방언의 영향을 자연스러운 대화 흐름 속에서 반영
  • 싱가포르: 고유한 싱글리시 표현과 현지화된 은행 용어를 캡처

3. 다층적 품질 관리 체계

엄격한 품질 검증 프로세스를 실행했습니다:

  • 자동 검증: 문장 길이(15-25단어), 용어 삽입 정확성(정확 일치 + 2개 의미 변형) 확인
  • 수동 검토: 모국어 언어학자가 지역적 진정성, 톤 밸런스, 도메인 정확성 검증
  • 최종 샘플링: 납품 전 무작위 20% 샘플을 상위 프로젝트 매니저가 최종 확인
성공의 핵심 요소: 사전에 구축된 도메인 특화 언어 전문가 데이터베이스를 통해 모집 및 온보딩 단계를 생략하고 즉시 생산 단계에 돌입할 수 있었습니다. 이것이 납기 준수의 결정적 요인이었습니다.

납품 성과

프로젝트는 납기 내에 완료되었으며, 품질 측면에서 단 한 건의 반려도 없었습니다:

  • 5,040건의 문장을 4개 지역에 납품(지역별 1,260건)
  • 100% 승인율——모든 콘텐츠가 AIxBlock의 검토 기간을 조건부 승인이나 반려 없이 통과
  • 0% AI 생성 콘텐츠——모든 문장이 100% 인간 생성임을 확인 완료
  • 완벽한 용어 커버리지——84개 하위 행동 × 5개 용어 × (1 정확 일치 + 2 의미 변형) 완전 충족
  • 균형 잡힌 톤 분포——전 지역에서 포멀/인포멀 비율을 ±10% 이내로 유지

결론

본 프로젝트는 Smart Language Service가 복잡한 다지역 데이터 수집 프로젝트를 촉박한 납기 속에서도 품질을 희생하지 않고 실행할 수 있음을 입증했습니다. 견고한 기여자 네트워크, 구조화된 워크플로우, 철저한 QA 프로세스를 결합하여 최고 수준의 언어적 신뢰성과 도메인 정확성을 갖춘 데이터셋을 제공할 수 있었습니다.

AI 데이터 수집에 대해 논의하고 싶으신가요? info@smartlangservice.com 으로 연락해 주시거나, 서비스 페이지를 방문하여 자세한 내용을 확인하세요.