不要只比单价,要比每个验收合格标签的成本
数据标注外包成本不是“单张图片多少钱”这么简单,而是把原始数据转化为模型团队可以验收和使用的标签所需的全部投入。它包括任务设计、工具配置、标注工时、质量复核、争议裁定、返工、安全控制、项目管理和最终交付。报价中的单框或单文档价格很低,如果不包含难例、复核或可直接进入训练流程的导出格式,最终仍可能更贵。
让报价可比的有效办法,是向所有供应商提供同一批代表性样本、同一版规范、相同输出格式、验收标准、安全要求和数量假设。随后按质量控制后“验收合格的单位”计算成本,而不是只看提交数量。本指南面向 AI 采购、产品和机器学习运营团队,系统说明定价方式、不同模态的成本因素、隐性费用、报价归一化示例和预算清单。
四种定价方式及适用场景
按任务或对象计价可按图片、边界框、文本片段、音频分钟、视频帧或其他明确单位收费。它适合单位稳定、各方计数口径一致的项目。合同必须说明跳过、拒收、空白、重复或包含多个对象的素材是否计费,复核是否包含在内。
按小时计价适合探索性工作、复杂研究、经常变化的分类体系,以及无法仅凭数量估算工作量的任务。它能清楚显示专家投入,但买方需要按角色区分费率、规定工时记录方式,并用试点验证效率,设置预算上限或复核节点。
专属团队计价按月或其他周期预留产能,适合持续数据管线、规范频繁更新、需要紧密协作的项目。比较时应查看培训、休假、主管、质量控制和实际利用率后的有效产能,而不是简单用人数乘以单价。
按成果或托管服务计价围绕一项约定交付收费,例如一套通过明确验收标准的已验证数据集。范围稳定时便于预算,但报价必须写清假设、排除项、变更流程和返工责任。没有一种模式天然最低价,应选择能把项目最大不确定性量化的方式。
AWS 的 SageMaker 定价说明以经过复核的数据对象说明对象计费;Ground Truth 文档还区分人工标注、整合、任务类型和输出元数据。供应商至少也应如此清楚地定义“什么行为产生费用”。
先建立成本公式,再比较供应商
总成本可以拆成以下几部分:
- 一次性启动:样本分析、分类体系和规范设计、流程与集成、安全接入、培训和校准;
- 生产:计费单位数量乘以单位费率或人工费率;
- 质量:二次复核、金标准检查、重叠标注、裁定、抽样审计和报告;
- 例外:专家复核、困难素材、隐私处理、源数据清理和经批准的范围变更;
- 买方内部成本:准备数据、答疑、验收测试、工程接入和修复。
要求供应商分别列出一次性和持续费用。合理的启动费可以通过设计良好的试点减少大规模返工;真正的风险是费用定义不清,或者以低启动价中标后,把分类体系决策不断推回买方。
每个费率都必须写明分母。一张图片在试点中平均两个对象、在生产中平均二十个对象时,“按图计价”并不可比。文本项目要统一文档、词元、片段或判断次数;语音要区分媒体分钟和人工工作分钟;视频要说明按片段、抽样帧、跟踪对象、关键帧还是事件计数。
不同数据模态的成本驱动因素
图像标注。 分类通常比密集目标检测或分割简单,但对象密度、遮挡、画质、类别数量、边界规则、最小目标尺寸和属性字段都会改变效率。多边形成本随轮廓复杂度上升,边界框成本会受目标数量和重叠歧义影响。应要求供应商按复杂度分层提供试点效率,而不是只报一个混合均价。
视频标注。 时长不是充分的成本依据。帧率、采样间隔、轨迹数量、镜头切换、遮挡、插值、时序一致性、事件定义,以及复核人是否要观看完整序列都会影响工时。一分钟静态监控视频与一分钟拥挤交通视频不是同一工作单位。
文本与文档标注。 文档长度、语言、专业领域、分类体系深度、判断标签需要的上下文、重叠实体、关系标注和是否需要查阅外部资料都会改变成本。带表格或依赖版面语境的文档,即使字数相同,也可能比纯文本耗时。
音频与语音。 重要因素包括时长、噪声、说话人数、重叠语音、口音、语言资源、转写深度、时间戳、说话人分离、非语音事件和隐私删减。“每音频分钟”必须说明是否包含转写、标签、复核和困难音频附加费。
3D、传感器和专业数据。 点云、医疗图像、地理空间资料、法律文档和科研材料可能需要专用工具与合格专家。工具响应、渲染、坐标体系、多传感器同步和专业判断规则都会影响吞吐量,不能直接与通用众包价格比较。
质量成本必须进入报价主体
质量不是标注完成后再加的一次终检。报价应描述培训、资格测试、校准、过程检查、复核覆盖、裁定、纠错和验收报告。NIST AI 风险管理框架强调记录指标、测试方法、测量结果和相关专业人员;即使项目不宣称正式合规,这也是很有价值的采购原则。
在制定目标前,先定义质量单位和错误分类。类别标签、边界框、多边形、文本片段、转写片段和跟踪对象需要不同指标。严重度、弃权、部分正确、空白素材和歧义案例如何处理都要写清楚。没有分母、抽样方法和样本量的“准确率”无法用于比较报价。
重叠标注是设计选择,不是越多越好。所有清晰案例都交给三个人会浪费预算;主观或高风险任务只做单人标注又可能不足。可以组合单人生产、定向重叠、隐藏金标准、按风险复核和专家裁定,并分别标价。还要明确,当分歧来自规范而不是标注员时,由谁承担修订和返工成本。
容易遗漏的隐性成本
最大的隐性成本往往是返工。来源包括规范不完整、源数据不一致、分类体系后期变化、工具导出不符合训练流程,以及供应商只修复抽检样本而没有修复同类问题。合同应区分供应商错误、买方变更、源数据缺陷和真正歧义,并为每种情况规定处理方式。
工具费用可能包括许可证、存储、计算、集成、定制界面、数据传输和格式转换。要确认使用买方平台、供应商平台,还是同时收取托管服务费和平台费。试点期间必须把实际交付文件送入真实训练流程;在标注界面里看起来正确,并不等于导出可以使用。
管理成本包括入职、日常协调、问题处理、报告、变更控制和人员替换。它们可能打包,也可能单列。买方应确认谁维护规范、谁回答边界案例、决定多快传达到全体标注员,以及项目管理工时是否有上限。
安全与隐私会通过受限环境、设备控制、访问复核、人员审查、数据本地化、日志、脱敏和安全删除改变价格。需要这些措施的数据不能把它们当成可选附加项。英国 ICO 最新的隐私保护设计指南强调从设计阶段确定必要的个人数据使用、访问和保护措施。适用要求应由买方自己的隐私和法务负责人确认。
报价归一化示例
设想一个包含 100,000 张图片的试点。所有供应商使用同一批样本、分类体系、输出结构和验收测试。供应商 A 按每张 0.08 美元收费,启动费 2,000 美元,不含复核;供应商 B 每张 0.11 美元,包含抽样复核,启动费 3,000 美元。以下数字只是计算示例,不是市场基准。
A 的生产费为 8,000 美元,表面总价 10,000 美元。假设试点显示只有 82% 的单位无需买方修复即可通过,剩余修复预计需要 2,700 美元,则可比总成本为 12,700 美元。用 82,000 个合格单位计算,每个合格单位约 0.155 美元。
B 的表面总价为 14,000 美元。假设 96% 首次通过,报价内返工后交付 98,000 个合格单位,买方验收工作为 600 美元,则可比总成本 14,600 美元,每个合格单位约 0.149 美元。这个场景下,B 的原始单价较高,但归一化后较低。假设变化后结论可能反转,因此要用试点证据和敏感性区间决策,而不是把示例当成承诺。
还要比较工期、产能、安全适配、文档和返工速度。财务上更合适的是风险调整后综合匹配更好的供应商,而不是默认最低价或最高价。
向供应商提出的关键问题
- 计费单位到底是什么?空白、跳过、拒收、重复或多对象素材如何计数?
- 启动、平台、存储、传输、管理、复核、专家和返工费用包含哪些?
- 费率基于什么复杂度假设?什么情况触发附加费或变更单?
- 谁负责标注、复核、裁定、管理和最终批准?分别需要什么资格?
- 规范变化后如何重新培训和校准人员?
- 报告包含哪些质量指标、分母、样本量、严重度和验收阈值?
- 供应商错误、规范不清、源数据缺陷或范围变化分别由谁承担返工?
- 代表性试点提供了什么吞吐量与通过率证据?预算区间是什么?
- 访问、日志、保留、删除、保密和事件响应采用什么控制?
- 能否交付规定结构、稳定 ID、数据沿袭、问题日志、修订历史和最终质量证据?
询价前预算清单
- 固定任务定义、分类体系版本、语言、模态和输出结构。
- 提供包含简单、典型、困难、歧义和无效数据的代表性样本。
- 按复杂度说明数量,不只提供总数。
- 分别定义计费单位与验收合格单位。
- 确定质量指标、抽样或重叠规则、严重度、裁定和放行条件。
- 在报价前列出安全、隐私、访问、保留和数据位置要求。
- 指定买卖双方的规范答疑和变更批准负责人。
- 要求启动、生产、QA、专家、平台、管理和预备费用分别列示。
- 估算买方工程接入、验收测试和修复成本。
- 为复杂度、效率、通过率和变更量建立低、中、高三种情景。
用代表性样本得到可辩护的预算
定价试点必须复现生产难度,包括稀有类别、拥挤画面、低质量音频、长文档、多语言、边界案例和应拒收记录。完整运行到导出与买方验收,并记录有效标注时间、复核时间、提问量、通过率、错误严重度、返工轮次和排除数量。
规划时可继续阅读我们的 AI 数据采集成本指南、数据标注质量控制流程和 AI 数据服务公司评估指南,分别理解采集约束、标签质量和供应商适配。
Smart Language Service 可围绕图像、视频、文本或音频工作流设计代表性标注样本。请用代表性样本申请范围明确的标注估价,在承诺大批量生产前共同确定计费单位、质量层级、例外流程、交付格式和验收证据。

