자막, 캡션, 전사는 서로 다른 납품물입니다
자막과 캡션, 전사의 차이는 사용 방식에서 시작합니다. 전사문은 오디오를 독립적으로 읽을 수 있는 문서로 만들고, 캡션은 영상 재생 중 의미 있는 음성·비음성 정보를 동기화해 보여 주며, 번역 자막은 보통 원어를 이해하지 못하는 시청자에게 대사를 전달합니다. 같은 음성 원본에서 출발할 수 있지만 비즈니스 목적, 접근성, 현지화, 플랫폼 요구가 다릅니다.
“영상을 텍스트로 만들어 달라”는 요청만으로는 타임코드, 화자 표시, 효과음, 번역, 화면 위치, 검색 가능한 문서, LMS용 파일 중 무엇이 필요한지 알 수 없습니다. 전사문은 동기화 캡션을 대신하지 못하고, 대사만 번역한 자막은 접근성에 필요한 화자와 소리 정보를 빠뜨릴 수 있습니다.
정의와 실제 산출물
전사(transcription)는 말과 합의된 범위의 중요한 소리를 문자로 변환합니다. 축어, 가독성을 높인 정리본, 화자 라벨, 타임스탬프, 출판용 문서 등으로 납품할 수 있습니다. 보통 영상과 별도로 읽지만 인터랙티브 전사문은 문장을 재생 시점과 연결할 수 있습니다.
캡션(captions)은 말뿐 아니라 이해에 필요한 음악, 웃음, 경보, 어조, 화자 정보까지 포함하는 동기화된 텍스트 대안입니다. W3C의 사전 녹화 캡션 설명도 이 차이를 명확히 합니다. 폐쇄형 캡션은 켜고 끌 수 있고, 개방형 캡션은 영상 픽셀에 구워져 끌 수 없습니다.
번역 자막(subtitles)은 주로 대사를 다른 언어로 전달합니다. 다만 지역과 플랫폼마다 용어가 달라 같은 언어의 접근성 텍스트도 subtitles라 부르기도 합니다. 따라서 이름만 쓰지 말고 포함할 정보와 기능을 명시해야 합니다.
SDH는 청각장애인용 자막으로, 번역 또는 동일 언어 대사에 화자 표시와 중요한 효과음을 더합니다. 현지화와 접근성을 함께 제공할 때 유용하지만 형식, 읽기 규칙, 플랫폼 표시는 별도로 정해야 합니다.
구매자 비교표
| 산출물 | 주요 목적 | 시간 정보 | 일반 내용 | 출력 |
|---|---|---|---|---|
| 전사문 | 읽기·검색·검토·보관 | 없음 또는 주기적 타임스탬프 | 발화, 선택적 화자·소리·시각 설명 | DOCX, TXT, HTML |
| 캡션 | 원어 오디오 접근 | 큐 단위 동기화 | 대사, 화자, 의미 있는 소리 | VTT, SRT, TTML/IMSC |
| 번역 자막 | 언어 간 이해 | 큐 단위 동기화 | 번역 대사와 선택적 화면 텍스트 | VTT, SRT, TTML/IMSC, 플랫폼 형식 |
하나의 교육 영상에 세 가지가 모두 필요할 수 있습니다. 웹페이지에는 검색 가능한 전사문, 플레이어에는 원어 캡션, 각 시장에는 번역 자막 또는 SDH를 제공하는 방식입니다. 승인된 원문과 타이밍을 공유하되 최종 산출물은 각각 검수해야 합니다.
접근성 요구를 번역 전에 확정하십시오
텍스트가 있다는 사실만으로 접근성이 충족되지는 않습니다. 사전 녹화된 동기화 미디어에 대해 WCAG 2.2 성공 기준 1.2.2는 명시된 예외를 제외하고 레벨 A에서 캡션을 요구합니다. W3C의 캡션은 말과 이해에 필요한 비음성 정보를 모두 포함합니다. 플레이어 아래의 대사 전사문은 동기화되지 않으며, 대사만 있는 번역 자막은 필요한 소리 정보를 포함하지 않을 수 있습니다.
W3C의 전사문 안내는 기본 전사문과 중요한 시각 정보까지 담는 서술형 전사문을 구분합니다. 전사문은 읽기를 선호하거나 더 많은 시간이 필요하거나 텍스트 검색과 다른 보조 기술을 사용하는 사람에게 유용합니다. 캡션과 전사문의 WCAG 역할이 다르므로 한 파일만으로 포괄적인 준수를 약속해서는 안 됩니다.
법적 의무는 관할권, 산업, 조직 정책, 유통 채널, 프로그램 이력에 따라 달라집니다. 미국 FCC의 인터넷 캡션 규정도 특정 TV 방영 프로그램과 연결된 범위를 갖고 있으며 모든 웹 영상에 적용되는 보편 규칙은 아닙니다. 접근성 또는 법무 책임자가 적용 기준을 정하고 발주서에 기록해야 합니다.
품질은 정확한 단어만의 문제가 아닙니다. FCC의 캡션 품질 프레임워크는 정확성, 동기성, 완전성, 배치를 핵심 요소로 봅니다. 텍스트가 맞아도 늦게 나오거나 너무 빨리 사라지거나 끝이 잘리거나 중요한 버튼을 가리면 시청자가 사용할 수 없습니다.
승인된 원어 트랙에서 현지화를 시작하십시오
먼저 원본 영상 버전을 잠그고 프레임 레이트, 길이, 오디오 구성, 편집 버전을 기록합니다. 대본, 인명, 용어, 발음, 브랜드 규칙, 화면 문구를 수집하십시오. 영상 수정 가능성이 있다면 변경 식별과 비용 규칙을 합의해야 합니다. 짧은 삽입도 모든 후속 큐를 이동시킬 수 있습니다.
다음으로 원어 전사문을 검토해 불명확한 발화, 이름, 숫자, 약어, 화자를 해결합니다. 그 후 합리적인 큐 경계, 표시 시간, 줄바꿈, 화자 변화, 효과음을 가진 원어 캡션 템플릿을 만듭니다. 이 템플릿은 번역의 기반이지만 고정 틀은 아닙니다. 언어마다 길이와 어순, 자연스러운 분절이 다릅니다.
문장 단위 치환이 아니라 시청 맥락에 맞게 번역합니다. 의미, 어조, 용어, 행동 유도를 지키면서 밀도를 조절하고, 승인된 지침에 따라 관용어, 단위, 호칭, 문화 요소를 현지화합니다. 화면 텍스트는 자막으로 처리할지 그래픽을 교체할지 별도 파일로 줄지 결정해야 합니다.
마지막으로 모든 언어를 실제 영상에서 검수합니다. 이중언어 문서 검토만으로는 타이밍, 잘림, 충돌, 글꼴, 인코딩, 장면 전환 문제를 모두 찾을 수 없습니다. 자막 번역과 문화 현지화 및 다국어 자막 QA 체크리스트도 함께 활용하십시오.
대상 플랫폼에 맞는 파일 형식
- TXT, DOCX, 구조화 HTML은 읽는 전사문에 적합합니다. 탐색이 필요하면 화자와 주기적 타임스탬프를 넣습니다.
- SRT는 널리 교환되고 단순하지만 기능이 제한되고 플랫폼별 동작이 다를 수 있습니다.
- WebVTT(.vtt)는 웹용 시간 정렬 텍스트 형식입니다. W3C WebVTT 규격은 캡션, 자막, 설명, 챕터, 메타데이터를 다룹니다.
- TTML 또는 IMSC는 전문 방송·스트리밍의 풍부한 구조에 쓰입니다. 필요한 프로파일을 지정해야 합니다.
- 플랫폼 전용 형식은 방송사, 스트리밍, LMS, 소셜 플랫폼, 편집 시스템에서 요구할 수 있으므로 전체 제작 전에 샘플 가져오기를 시험합니다.
- 오픈 캡션은 영상 픽셀이므로 끌 수 없고 사용자 스타일 조정, 검색, 재사용이 어렵습니다.
매니페스트에 편집 가능한 마스터, 언어 코드, 원본 버전, 프레임 레이트 가정, 납품 버전을 기록하십시오. `module03_ko-KR_sdh_v2.vtt` 같은 이름은 `final2.srt`보다 추적하기 쉽습니다. UTF-8 또는 요구 인코딩, 한글 글꼴과 구두점, 대상 기기 표시도 테스트해야 합니다.
타이밍, 화자, 소리, 배치 규칙
타임코드 기준, 최소·최대 큐 길이, 최대 줄 수, 줄당 문자, 읽기 속도 계산, 장면 전환, 겹말, 빠른 대사 처리 방식을 수치화하십시오. 모든 언어와 플랫폼에 맞는 하나의 보편적 숫자는 없으므로 최종 채널 사양을 따릅니다.
캡션과 SDH는 화면만으로 화자를 알기 어려울 때 화자를 표시하고, 이해에 필요한 소리를 포함하되 모든 소리를 설명하지는 않습니다. 음악도 출처, 분위기, 가사, 서사 기능이 중요할 때 표시합니다. 색상만으로 화자를 구분하지 마십시오. 번역 자막에서는 인명, 직함, 화면 그래픽, 다른 언어 대사를 같은 트랙에 넣을지 분리할지 정합니다.
배치는 얼굴, 시연, 안전 경고, 차트, 버튼, 로어 서드를 가리지 않아야 합니다. 위치 메타데이터를 지원하면 실제 플레이어에서 시험하고, 지원하지 않으면 안전 영역을 정합니다. 제작 모니터뿐 아니라 작은 모바일 화면도 확인합니다.
구매자 의사결정 트리
- 검색·다운로드·검토 가능한 문서가 필요한가? 전사문을 주문하고 필요한 화자, 타임스탬프, 시각 설명을 추가합니다.
- 재생 중 원어 오디오를 접근 가능하게 해야 하는가? 중요한 소리와 화자 표시가 있는 동일 언어 캡션을 주문합니다.
- 다른 언어 시청자가 대사를 이해해야 하는가? 번역 자막을 주문하고 접근성도 필요하면 현지화 SDH를 주문합니다.
- 접근성과 글로벌 배포가 모두 필요한가? 승인된 원어 캡션 템플릿 뒤에 플랫폼별 다국어 트랙을 제작합니다.
- 검색, 기록, 현지화, 재생에 모두 쓸 것인가? 원어 전사문, 원어 캡션, 번역 트랙, 버전 매니페스트를 패키지로 주문합니다.
- 라이브인가? 지연, 수정, 인력, 플랫폼, 비상 계획이 다른 별도 워크플로로 다룹니다.
불확실하면 다중 화자, 음악, 화면 텍스트, 숫자, 빠른 구간, 억양, 로어 서드가 있는 대표 영상으로 파일럿을 진행하십시오.
승인된 산출물 기준으로 견적을 비교하십시오
같은 “캡션 서비스”도 범위가 다를 수 있습니다. 원문 검토, 전사, 타이밍, 캡션 제작, 번역, 이중언어 검토, 영상 내 QA, 형식 변환, 업로드, 수정 횟수, 최종 교정을 분리해 견적받으십시오. 음성 인식이나 기계 번역을 쓰면 그 뒤의 사람 검토도 확인합니다.
수락 증거에는 언어·파일 목록, 검증 결과, 검토 체크리스트, 이슈 로그, 수정 파일, 정확한 영상 버전이 포함되어야 합니다. 시작·중간·끝의 완전한 큐와 어려운 구간을 확인하십시오. AI 학습 데이터용 전사는 요구가 크게 다를 수 있으므로 AI 학습 데이터 전사 서비스 가이드를 참고하십시오.
승인 전에는 모든 언어와 산출물의 존재, 올바른 영상 버전, 발화·이름·숫자·용어 정확성, 필요한 소리 정보, 번역 가독성, 타이밍·줄바꿈·배치, 인코딩·언어 태그·가져오기·트랙 선택, 문서형 전사문의 가독성, 모든 파생 파일의 수정 반영을 확인합니다.
정답은 세 가지 중 하나가 아니라 목적에 맞춘 조합인 경우가 많습니다. Smart Language Service에 원본 영상 한 개와 대상 플랫폼, 언어, 접근성 정책, 사용 목적을 보내 주시면 전체 견적 전에 필요한 전사, 캡션, 번역 자막, SDH, 형식, QA 범위를 확인해 드립니다.

