Volver al Blog

Coste de externalizar la anotación de datos

Compare el coste de externalizar anotación de datos por modelo de precio, modalidad, QA, retrabajo, seguridad y coste por etiqueta aceptada.

Compare el coste por etiqueta aceptada, no solo la tarifa

El coste de externalizar la anotación de datos es todo lo necesario para convertir activos sin etiquetar en datos que el equipo de modelos pueda aceptar y utilizar. Incluye diseño de la tarea, herramientas, tiempo de anotación, revisión, adjudicación, correcciones, controles de seguridad, gestión y entrega. Un precio bajo por caja o documento puede salir caro si excluye los casos difíciles o si los ingenieros deben reparar la exportación.

Para comparar propuestas, entregue a todos los proveedores la misma muestra representativa, versión de las instrucciones, formato de salida, criterios de aceptación, requisitos de seguridad y supuestos de volumen. Después calcule el coste por unidad aceptada tras el control de calidad, no solo por unidad enviada. Esta guía ayuda a compras, producto y operaciones de ML a comparar modelos de precio, factores por modalidad, costes ocultos y presupuestos normalizados.

Cuatro modelos de precio y cuándo utilizarlos

El precio por tarea u objeto cobra por imagen, caja, segmento de texto, minuto de audio, fotograma u otra unidad definida. Funciona cuando la unidad es estable y todos la cuentan igual. El contrato debe indicar si se facturan elementos vacíos, omitidos, rechazados, duplicados o con varios objetos y si la revisión está incluida.

El precio por hora sirve para exploración, investigación compleja, taxonomías cambiantes y tareas cuyo esfuerzo no se puede inferir del volumen. Hace visible el tiempo experto, pero exige tarifas por función, reglas de registro, evidencia de productividad del piloto y un límite o punto de revisión.

El equipo dedicado reserva capacidad durante un periodo. Puede encajar en flujos continuos con cambios frecuentes y colaboración estrecha. Compare capacidad productiva después de formación, vacaciones, supervisión, QA y utilización esperada, no solo número de personas por una tarifa.

El precio por resultado o servicio gestionado cubre una entrega acordada, por ejemplo un dataset validado que supera criterios definidos. Facilita el presupuesto cuando el alcance es estable, pero debe documentar supuestos, exclusiones, control de cambios y responsabilidad de reparación. Ningún modelo es siempre más barato; elija el que haga medible la mayor incertidumbre.

Los servicios públicos muestran la importancia de definir la unidad: AWS explica el precio por objetos del dataset revisados, mientras Ground Truth separa etiquetado humano, consolidación, tipos de tarea y metadatos. Una propuesta comercial debe ser igual de clara sobre qué genera un cargo.

Cree una ecuación de coste antes de comparar

Separe el coste total en:

  • preparación única: análisis de muestras, taxonomía, instrucciones, configuración, integraciones, seguridad, formación y calibración;
  • producción: unidades facturables por tarifa;
  • calidad: segunda revisión, pruebas gold, solapamiento, adjudicación, muestreo de auditoría e informes;
  • excepciones: revisión especializada, activos difíciles, privacidad, limpieza de origen y cambios aprobados;
  • coste interno del comprador: preparación, respuestas, pruebas de aceptación, ingeniería y reparación.

Pida separar gastos únicos y recurrentes. Una preparación pagada puede evitar errores repetidos; el riesgo es una tarifa indefinida o una preparación barata que devuelve todas las decisiones de taxonomía al comprador durante producción.

Registre el denominador. “Por imagen” no es comparable si el piloto contiene dos objetos y producción veinte. En texto, acuerde documento, token, span o decisión. En voz, distinga minutos de medios y minutos de trabajo. En vídeo, indique si se cuenta clip, fotograma, objeto seguido, fotograma clave o evento.

Factores de coste por modalidad

Imagen. Clasificar suele ser más simple que detección densa o segmentación, pero importan objetos por imagen, oclusión, calidad, clases, reglas de borde, tamaño mínimo y atributos. Los polígonos dependen del contorno; las cajas, de la densidad y solapamiento. Solicite productividad por tramo de complejidad.

Vídeo. La duración no basta. Frecuencia de fotogramas, intervalo de muestreo, cantidad de trayectorias, cambios de plano, oclusión, interpolación, consistencia temporal, definición de eventos y revisión de la secuencia cambian el esfuerzo. Un minuto estático no equivale a un minuto de tráfico denso.

Texto y documentos. Longitud, idioma, dominio, profundidad de taxonomía, contexto, segmentos superpuestos, relaciones y búsqueda externa cambian el coste. Los documentos con tablas o contexto de diseño pueden llevar más tiempo que texto plano con igual número de palabras.

Audio y voz. Influyen duración, ruido, hablantes, solapamiento, acento, disponibilidad lingüística, detalle de transcripción, timestamps, diarización, eventos no verbales y redacción de datos. “Por minuto de audio” debe indicar si incluye transcripción, etiquetas, revisión y recargo por audio difícil.

3D, sensores y datos especializados. Nubes de puntos, imágenes médicas, información geoespacial, documentos jurídicos y material científico pueden requerir herramientas y expertos. Latencia, sistemas de coordenadas, sincronización y reglas especializadas afectan la productividad; no se comparan con una tarifa general.

Incluya la calidad dentro de la propuesta

La calidad no es una inspección añadida al final. La propuesta debe explicar formación, calificación, calibración, controles durante producción, cobertura de revisión, adjudicación, corrección e informe de aceptación. El NIST AI Risk Management Framework pide documentar métricas, métodos, resultados y experiencia relevante; es un principio útil de compra aunque el proyecto no afirme cumplimiento formal.

Defina unidad de calidad y taxonomía de errores antes del objetivo. Clase, caja, polígono, span, segmento de transcripción y objeto seguido necesitan medidas distintas. Indique severidad, abstenciones, aciertos parciales, activos vacíos y casos ambiguos. Un porcentaje de precisión sin denominador, tamaño y método de muestra no normaliza presupuestos.

El solapamiento es una decisión, no una regla universal. Tres anotadores para todo desperdician recursos en casos claros; una sola persona puede ser insuficiente en decisiones subjetivas o de riesgo. Combine anotación simple, solapamiento dirigido, tareas gold ocultas, revisión por riesgo y adjudicación experta. Ponga precio separado a cada capa y defina quién paga si la discrepancia proviene de las instrucciones.

Costes ocultos que cambian el precio aceptado

El principal coste oculto es el retrabajo. Lo causan instrucciones incompletas, datos de origen incoherentes, cambios tardíos, exportaciones incompatibles o correcciones aplicadas solo a la muestra auditada. El contrato debe distinguir error del proveedor, cambio del comprador, defecto del origen y ambigüedad real, con una solución para cada caso.

Las herramientas añaden licencias, almacenamiento, cálculo, integración, interfaz personalizada, transferencia y conversión. Confirme si se utiliza su plataforma, la del proveedor o se cobran plataforma y gestión. Pruebe una entrega en el pipeline real durante el piloto; que se vea bien en la interfaz no garantiza que sirva para entrenar.

La gestión incluye onboarding, coordinación, consultas, informes, cambios y sustitución de personal. Pregunte quién mantiene las instrucciones, quién resuelve casos límite, cuánto tarda una decisión en llegar al equipo y si hay límite de horas de gestión.

Seguridad y privacidad pueden requerir entornos restringidos, controles de dispositivos, revisiones de acceso, comprobación de personal, ubicación de datos, registros, redacción y borrado seguro. No son extras cuando los datos los necesitan. La guía actual del ICO sobre protección de datos desde el diseño recomienda decidir desde el inicio qué datos personales, accesos y salvaguardas son necesarios. El comprador debe confirmar las obligaciones aplicables con sus responsables jurídicos y de privacidad.

Ejemplo de comparación normalizada

Imagine un piloto hipotético de 100.000 imágenes con la misma muestra, taxonomía, esquema y prueba de aceptación. A ofrece 0,08 dólares por imagen, 2.000 de preparación y no incluye revisión. B ofrece 0,11 por imagen con revisión muestreada y 3.000 de preparación. Son cifras ilustrativas, no referencias de mercado.

La producción de A cuesta 8.000 y el total visible es 10.000. Si el piloto indica que el 82 % supera aceptación sin reparación interna y corregir el resto cuesta 2.700, el total comparable es 12.700. Dividido entre 82.000 unidades aceptadas, son unos 0,155 dólares por unidad.

El total visible de B es 14.000. Si el 96 % pasa inicialmente, la corrección incluida eleva la entrega a 98.000 unidades y la aceptación interna cuesta 600, el total comparable es 14.600 o unos 0,149 por unidad. B tiene mayor tarifa, pero menor coste normalizado en este escenario. Si cambian los supuestos, puede invertirse; use evidencia del piloto y rangos, no este ejemplo como promesa.

Compare también plazo, capacidad, seguridad, documentación y velocidad de corrección. La opción financiera adecuada es la de mejor ajuste tras considerar riesgo, no siempre la tarifa menor o mayor.

Preguntas para cada proveedor

  • ¿Cuál es la unidad facturable y cómo se cuentan vacíos, omitidos, rechazados, duplicados o elementos con varios objetos?
  • ¿Qué costes de preparación, plataforma, almacenamiento, transferencia, gestión, revisión, expertos y reparación están incluidos?
  • ¿Qué complejidad presupone la tarifa y qué activa recargos o cambios?
  • ¿Quién anota, revisa, adjudica, gestiona y aprueba, y con qué cualificación?
  • ¿Cómo se forma y recalibra al equipo cuando cambian las instrucciones?
  • ¿Qué métricas, denominadores, tamaños de muestra, severidades y umbrales aparecen en el informe?
  • ¿Quién asume el retrabajo por error del proveedor, guía ambigua, origen defectuoso o cambio de alcance?
  • ¿Qué evidencia del piloto respalda productividad, tasa de aceptación y rango presupuestario?
  • ¿Qué controles de acceso, registro, conservación, borrado, confidencialidad e incidentes se aplican?
  • ¿Puede entregar esquema requerido, ID estables, linaje, registro de incidencias, historial de correcciones y evidencia QA?

Lista de presupuesto antes de pedir propuestas

  • Fije tarea, taxonomía, idiomas, modalidades y esquema.
  • Entregue una muestra con casos fáciles, normales, difíciles, ambiguos e inválidos.
  • Indique volumen por complejidad, no solo una cifra total.
  • Defina por separado unidad facturable y unidad aceptada.
  • Establezca métricas, muestreo o solapamiento, severidad, adjudicación y liberación.
  • Declare seguridad, privacidad, acceso, conservación y ubicación antes del precio.
  • Nombre responsables de consultas y aprobación de cambios en ambas partes.
  • Solicite líneas separadas para preparación, producción, QA, especialistas, plataforma, gestión y contingencia.
  • Estime ingeniería, aceptación y corrección internas.
  • Modele escenarios bajo, esperado y alto para complejidad, productividad, aceptación y cambios.

Obtenga una estimación defendible con una muestra real

El piloto de precio debe reproducir la dificultad: clases raras, escenas densas, audio deficiente, documentos largos, varios idiomas, casos límite y registros que deben rechazarse. Ejecute todo hasta exportación y aceptación. Mida tiempo activo, revisión, preguntas, tasa de aprobación, severidad, ciclos de corrección y exclusiones.

Consulte también nuestras guías sobre coste de recopilación de datos de IA, control de calidad en anotación y evaluación de empresas de datos de IA. Ayudan a separar restricciones de recopilación, calidad de etiquetas y ajuste del proveedor.

Smart Language Service puede definir una muestra representativa para imagen, vídeo, texto o audio. Solicite una estimación de anotación basada en esa muestra para acordar unidad facturable, capas de calidad, tratamiento de excepciones, formato y evidencia de aceptación antes de comprometer producción.