Subtítulos, captions y transcripción son entregables distintos
La respuesta práctica a subtítulos vs captions vs transcripción empieza por el uso: una transcripción convierte el audio en un documento legible; los captions muestran de forma sincronizada el habla y la información sonora necesaria para comprender el vídeo; y los subtítulos suelen hacer comprensible el diálogo en otro idioma. Pueden partir de la misma voz original, pero resuelven necesidades comerciales, de accesibilidad, localización y plataforma diferentes.
Pedir «el texto de este vídeo» no define si hacen falta códigos de tiempo, identificación de hablantes, sonidos, traducción, posición en pantalla, una página consultable o archivos importables en un LMS. Una transcripción no sustituye a los captions sincronizados, y los subtítulos que traducen solo el diálogo no aportan necesariamente la información no verbal necesaria para accesibilidad.
Definiciones y alcance real
La transcripción convierte el habla y, cuando se solicita, los sonidos relevantes en texto. Puede ser literal, depurada para lectura, etiquetada por hablante, temporizada o editada como documento publicable. Normalmente se consulta fuera del reproductor, aunque una transcripción interactiva puede resaltar frases y saltar al momento correspondiente.
Los captions son alternativas textuales sincronizadas del habla y del audio no verbal necesario para entender el contenido: música, risas, alarmas, tono o identificación de quien habla. La explicación de W3C sobre captions pregrabados establece esta diferencia. Los closed captions pueden activarse y desactivarse; los open captions están integrados en la imagen.
Los subtítulos representan principalmente el diálogo, normalmente traducido para personas que oyen el programa pero no dominan el idioma original. La terminología cambia entre países: algunos llaman subtítulos al texto accesible en el mismo idioma y muchas plataformas agrupan todas las pistas temporizadas bajo un solo menú. El comprador debe describir el contenido, no confiar solo en la etiqueta.
Los SDH, subtítulos para personas sordas o con dificultades auditivas, combinan diálogo traducido o intralingüístico con identificación de hablantes y sonidos relevantes. Son adecuados cuando una versión localizada también debe transmitir información de accesibilidad.
Tabla comparativa para compradores
| Entregable | Función | Tiempo | Contenido | Salida |
|---|---|---|---|---|
| Transcripción | Leer, buscar, revisar, archivar | Sin tiempos o marcas periódicas | Habla; opcionalmente hablantes, sonidos y visuales | DOCX, TXT, HTML |
| Captions | Acceso en el idioma del audio | Sincronización por cue | Diálogo, hablantes y sonidos | VTT, SRT, TTML/IMSC |
| Subtítulos | Comprensión entre idiomas | Sincronización por cue | Diálogo traducido y texto visual elegido | VTT, SRT, TTML/IMSC, formato propio |
Un mismo vídeo formativo puede necesitar los tres: transcripción consultable debajo de la lección, captions en el idioma original y subtítulos traducidos o SDH para cada mercado. El flujo eficiente reutiliza la transcripción y los tiempos aprobados, pero verifica cada entregable por separado.
Defina la accesibilidad antes de traducir
Tener texto no equivale a tener una solución accesible. Para medios sincronizados pregrabados, el criterio 1.2.2 de WCAG 2.2 exige captions en nivel A, salvo la excepción indicada por el propio criterio. W3C los define como alternativas sincronizadas tanto del habla como de la información sonora necesaria. Una transcripción bajo el reproductor no cumple la misma función porque no está sincronizada; unos subtítulos de solo diálogo pueden omitir hablantes y sonidos.
Las transcripciones cubren otras necesidades. La guía de W3C sobre transcripciones distingue la básica, que incluye habla y audio necesario, de la descriptiva, que añade información visual importante. Resultan útiles para quien prefiere leer, necesita más tiempo, busca texto o utiliza otros flujos de apoyo. Captions y transcripción tienen funciones WCAG diferentes; no prometa cumplimiento general por entregar un único archivo.
Las obligaciones legales dependen de jurisdicción, sector, organización, canal e historial del programa. Por ejemplo, las normas estadounidenses de la FCC para vídeo en Internet tienen un alcance definido relacionado con determinada programación emitida en televisión con captions; no son una regla universal para cualquier vídeo web. El responsable de accesibilidad o legal debe confirmar qué política se aplica y dejarla en el encargo.
La calidad tampoco se limita a palabras correctas. El marco de calidad de captions de la FCC considera exactitud, sincronización, integridad y colocación. Son categorías útiles para comprar el servicio incluso cuando la norma no gobierna el proyecto. Un cue correcto que llega tarde, dura muy poco, queda cortado o tapa un control esencial puede seguir siendo inutilizable.
Localice desde una pista original aprobada
Bloquee la versión del vídeo y registre frecuencia de imagen, duración, configuración de audio y edición. Reúna guion, nombres, terminología, pronunciación, reglas de marca y texto en pantalla. Si aún habrá cambios, acuerde cómo identificarlos y presupuestarlos; una inserción breve puede desplazar todos los cues posteriores.
Después cree y revise la transcripción original. Resuelva voz dudosa, nombres, números, siglas e identidad de hablantes antes de traducir. Construya luego una plantilla de captions con límites lógicos, tiempo de lectura, saltos de línea, cambios de hablante y sonidos. Puede servir de base, pero no debe ser rígida: la traducción cambia longitud, gramática y puntos naturales de corte.
Traduzca para la experiencia de visionado. Mantenga significado, tono, terminología y llamada a la acción mientras controla la densidad. Adapte modismos, unidades, tratamiento y referencias culturales solo según el brief aprobado. Decida si el texto en pantalla se subtitula, se sustituye gráficamente o se entrega como recurso aparte.
Revise cada idioma dentro del vídeo real. Una revisión bilingüe del texto no detecta todos los problemas de tiempo, recorte, colisión, fuente, codificación o cambio de plano. Consulte nuestras guías de traducción y adaptación cultural de subtítulos y QA de subtítulos multilingües.
Elija el formato para la plataforma de destino
- TXT, DOCX o HTML estructurado sirve para una transcripción legible. Añada hablantes y marcas periódicas si se necesita navegación.
- SRT se intercambia ampliamente y es sencillo, pero ofrece funciones limitadas y el comportamiento varía entre plataformas.
- WebVTT (.vtt) está pensado para texto temporizado en la web. La especificación WebVTT de W3C abarca captions, subtítulos, descripciones, capítulos y metadatos.
- TTML o IMSC admite estructuras más ricas en flujos profesionales, de emisión y streaming. Hay que indicar el perfil concreto.
- Formatos propios pueden ser obligatorios para una cadena, plataforma, LMS, red social o sistema de edición. Pruebe una importación antes del lote completo.
- Open captions son píxeles del vídeo, no una pista conmutable. Funcionan donde no hay soporte de texto, pero no pueden ocultarse, personalizarse o reutilizarse con facilidad.
El manifiesto debe registrar máster editable, código de idioma, versión fuente, supuesto de frame rate y versión entregada. `module03_es-ES_sdh_v2.vtt` es más trazable que `final2.srt`. Verifique UTF-8 o la codificación requerida, signos, fuentes y escritura no latina en el sistema de destino.
Especifique tiempos, hablantes, sonidos y posición
Defina base temporal, duración mínima y máxima, número de líneas, caracteres por línea, método de velocidad de lectura, cortes de plano, solapamiento y diálogo rápido. No existe una cifra universal válida para todos los idiomas y canales: manda la especificación final.
En captions y SDH, identifique al hablante cuando la imagen no lo deja claro e incluya sonidos relevantes sin narrar todo lo audible. Describa la música cuando su origen, ambiente, letra o función sea importante. No dependa solo del color. Para subtítulos localizados, decida si nombres, cargos, gráficos y diálogo extranjero comparten pista o van separados.
La colocación debe proteger rostros, demostraciones, avisos de seguridad, gráficos, botones y rótulos inferiores. Si hay metadatos de posición, pruébelos en el reproductor; si no, defina zonas seguras. Revise también en pantallas pequeñas.
Árbol de decisión del comprador
- ¿Necesita un documento que se pueda buscar, descargar o revisar? Pida transcripción y añada hablantes, tiempos y descripciones visuales cuando proceda.
- ¿Necesita acceso al audio original durante la reproducción? Pida captions intralingüísticos con sonidos e identificación de hablantes.
- ¿Necesita que otro mercado entienda el diálogo? Pida subtítulos traducidos; añada SDH localizado si también se requiere accesibilidad.
- ¿Necesita accesibilidad y alcance internacional? Apruebe primero una plantilla de captions original y produzca las pistas que exija cada plataforma.
- ¿Usará el contenido para búsqueda, archivo, localización y reproducción? Pida un paquete con transcripción, captions originales, pistas traducidas y manifiesto de versiones.
- ¿Es en directo? Trátelo como otro flujo, con requisitos propios de latencia, corrección, personal, plataforma y contingencia.
Si aún hay dudas, pilote un vídeo representativo con varios hablantes, música, texto en pantalla, números, secciones rápidas, acentos y rótulos inferiores.
Compare presupuestos por entregables aceptados
Dos propuestas pueden decir “captioning” e incluir trabajos distintos. Solicite precios separados para revisión original, transcripción, timing, creación de captions, traducción, revisión bilingüe, QA en vídeo, conversión, carga, rondas de cambios y correcciones. Si se usa reconocimiento de voz o traducción automática, confirme qué revisión humana sigue.
La evidencia de aceptación debe incluir inventario de idiomas y archivos, validaciones, checklist, registro de incidencias, archivos corregidos y versión exacta del vídeo. Muestree cues completos al principio, centro y final, además de los tramos difíciles. La transcripción para datos de entrenamiento de IA puede requerir otro diseño; nuestra guía de transcripción para datos de entrenamiento explica timestamps, hablantes y anotaciones para ese caso.
Antes de aprobar, confirme todos los idiomas y entregables; correspondencia con la versión correcta; exactitud de habla, nombres, cifras y términos; sonidos necesarios; traducción legible a velocidad real; tiempos, cortes, posición y cambios de plano; codificación, etiquetas de idioma, importación y selección de pista; legibilidad del documento; y propagación de las correcciones a todos los derivados.
La elección correcta suele ser una combinación deliberada, no una sola opción. Envíe a Smart Language Service un vídeo fuente con plataformas, idiomas, política de accesibilidad y usos previstos. Podemos confirmar transcripción, captions, subtítulos, SDH, formatos y QA antes de presupuestar toda la biblioteca.

