按模型任务选择视频标注服务,而不是只比较标签数量
视频标注服务的价值,是把连续画面转化为既包含空间位置、又保留时间关系的训练数据。采购方首先要明确模型究竟需要检测目标、持续跟踪同一实例、估计姿态、分割轮廓、识别动作,还是定位事件,然后选择能够提供所需证据的最简标注方式。若把视频当成互不相关的图片文件夹,往往会丢掉视频最重要的时序信息。
因此,采购决策不能只看“每帧价格”。可执行的范围必须定义标注单位、抽帧规则、对象身份、遮挡与重现处理、插值政策、标签体系、输出格式、质量指标和验收测试。还要区分生产速度与验收成本:需要大量修复轨迹 ID 或转换格式的低价标签,最终可能比设计合理的托管流程更贵。
本指南面向计算机视觉、机器人、零售和移动出行团队,帮助买方比较标注类型、帧与序列策略、时序一致性、工具格式、成本因素和试点证据。
让标注类型直接对应模型输出
同一段视频可以形成多种有效数据集,但解决的问题不同。
- 帧级或片段分类为单帧、镜头或序列分配类别,例如正常/异常、结账开始、叉车运行或车辆动作。若无需定位,这种方式较高效,但必须规定动作边界。
- 边界框用矩形定位实例,适合目标检测和许多跟踪任务。需说明框只包含可见部分,还是在部分遮挡时估计完整目标范围。
- 目标轨迹用稳定 ID 连接不同帧中的同一实例,可支持多目标跟踪、路径、停留时间与互动分析。身份切换和轨迹断裂应成为独立质量缺陷。
- 多边形或实例掩码描绘对象轮廓,适用于精细空间理解、机器人、工业检查和重叠对象分离。轮廓随时间变化,因此成本通常高于框。
- 语义分割为相关像素分配类别,但不一定保留实例身份;实例分割区分每个对象;全景方案还会组合背景与可数对象。采购方必须写清训练管线需要哪一种。
- 关键点和骨架标注关节、工具端点、车轮或商品角点等固定地标,必须规定点位顺序、左右方向和可见状态。
- 动作、事件与时间段记录起点、终点、参与者及可能的关系,例如拿起商品、变道或设备进入禁区。边界容差应以帧数或时间量化。
Microsoft COCO 论文是目标检测和实例分割的重要原始参考,BDD100K 论文则展示了一套视频数据如何同时支持检测、车道标注、分割和多目标跟踪等异构任务。它们说明“视频标注”不是单一交付物,买方必须先明确任务和表示方式。
只有下游价值足够时才叠加多层标签。例如,零售项目可能需要人员轨迹、货架区域和拿取事件,但不必给每个人制作像素级掩码;机器人项目可能只为可操作物体制作掩码与关键点,背景则采用语义区域。
决定按帧标注还是按序列标注
第一项范围决策,是把帧视为独立样本,还是跟踪序列的一部分。
当模型处理静态图片、时间顺序价值有限,或抽样策略刻意寻找多样快照时,独立帧标注较合适,也便于多人并行并导出为图像格式。但机械地每隔若干帧抽一张,可能保留大量近重复画面、错过短暂事件,或让同一对象获得不一致身份。
当身份、移动、持续时间、转换或互动重要时,应采用序列标注。标注单位应是完整片段或定义明确的镜头,并规定对象进入、离开、被遮挡、重新出现以及跨剪辑点时如何处理。标注员需要看到足够的前后文,才能做出与模型评估一致的身份判断。
对可预测运动,关键帧插值可减少重复劳动。CVAT 官方术语文档把插值定义为使用 track 对象的视频模式:标注员制作关键帧,中间形状线性插值;其多边形轨迹文档还强调起点和方向要保持一致。自动化只是加速器,不是验收证据。快速运动、形变、镜头切换、遮挡和比例变化都需要增加关键帧或人工修正。
实用抽样方案可结合固定间隔、镜头或运动变化、重要事件附近的密集帧,以及对小目标、严重遮挡、低光、天气和罕见视角的风险加权。相邻帧应保持在同一个训练、验证或测试分组中,否则近重复画面会跨集合泄漏,让评估结果虚高。
把时序一致性写进验收标准
某一帧的框可以正确,但整条轨迹仍然错误,因此视频 QA 必须同时检查空间准确度与连续性。
首先定义身份规则。一个轨迹 ID 应始终属于同一真实实例。两个对象交叉时,复核要查看接近、重叠和分离全过程,而不是只看最后一帧。规定遮挡后何时可以沿用 ID、何时必须开启新轨迹,并根据模型与格式区分“被遮挡”“离开视野”和“不在场景”。
其次定义几何规则。没有对应的对象或相机运动时,框和掩码不应无故抖动。每一帧都应采用相同的边界原则:只标可见像素、估计完整形状,或使用特定类别规则。插值结果不仅要检查关键帧,还要抽查中点和运动转折处。
属性也要保持逻辑一致。类别、颜色、设备类型等持久属性不应随机变化;姿态、可见度、活动或信号灯状态等可变属性需要合法转换规则。事件还要写清起止定义,例如“手首次接触商品时开始,商品被稳定控制时结束”,并设数字化容差。
质量报告至少应分别展示几何一致度、类别与属性准确性、轨迹完整性、碎片与 ID 切换、事件边界一致性、漏标事件,以及格式验证结果。阈值必须与任务相关:安全小目标项目可能更关心漏标,而轨迹模型可能容忍稍松的框,却不能接受身份切换。还要要求供应商说明如何裁定分歧和回归检查修订。
可结合我们的计算机视觉图像标注指南与减少返工的标注规范指南,完善几何和边界案例。
在生产前确定工具、标签体系和输出格式
工具要服务于流程。确认其是否支持长视频、逐帧导航、播放速度、关键帧、插值、轨迹 ID、遮挡状态、掩码、关键点、时间段、评论、审计记录、权限和复核队列。必须用真实分辨率、编码、帧率和片段长度试运行;功能列表并不能证明工具在生产媒体上仍然流畅。
标签体系和说明应共同版本化。每个标签都要有定义、包含与排除规则、正反例、层级、属性和疑难政策,并覆盖截断、拥挤区、反射、屏幕、阴影、小目标、模糊、重复、剪辑点和不确定帧。试点中发现新边界案例时,要更新决策日志。
首次标注前就设计好导出:坐标原点、单位、舍入和框表示;帧编号、时间戳、可变帧率与源文件校验;类别、轨迹和标注 ID;多边形方向、掩码编码、关键点顺序、可见标志与事件区间;文件命名、目录、清单、标签版本、工具版本和转换记录。
COCO 风格 JSON 常用于图像检测、分割和关键点,但不会自动解决视频身份设计。工具原生格式可能保留轨迹,却造成平台绑定;自定义 JSON 贴合管线,但增加验证与转换工作。多传感器和场景标注可参考 ASAM OpenLABEL,其 JSON 规范覆盖对象、帧、数据流、坐标系、动作、事件及场景间关系。应因训练加载器能验证而选择格式,而不是只因名称熟悉。
采购阶段要求样例导出,并让真实训练加载器读取。随机可视化标签、核对计数与 ID;只有生产流程确实需要时才测试重新导入。通过 schema 的文件仍可能使用错误坐标或破坏时序身份。
识别真正的视频标注成本因素
成本由标注事件和复核复杂度驱动,而不是单看视频时长。一分钟静态访谈和一分钟拥挤路口时长相同,但对象数量和运动完全不同。
主要因素包括:有效抽样帧、平均与峰值对象数、轨迹长度、进出频率、遮挡密度、几何类型、类别与属性数量、分辨率和帧率、插值或预标注后的修正量、稀有类别搜索、专业人员、安全控制、复核与裁定深度、格式转换、验证和变更管理。
比较报价时,应看“每个验收序列成本”或其他经验证单位,而不是只看每帧价格。让所有供应商使用同一样本、标签体系、输出、QA 方案和阈值,并把设置、生产、复核、裁定和返修分开报价。
如需从更广的尽职调查角度比较服务范围、交付模式和供应商匹配度,可结合我们的 AI 数据服务公司比较 与本指南的视频专项证据。
例如,供应商 A 低价标注每十帧的框,但不检查身份连续性;供应商 B 建立关键帧轨迹,对可预测运动插值,复核所有遮挡转换,并报告 ID 切换。如果模型需要路径,A 并不是同一服务的便宜版本,而是另一个必须重标或工程修复的交付物。
自动化可能减少重复绘制,但节省多少取决于修正时间和错误分布。应用同一批试点序列比较人工与辅助流程,记录标注时间、复核时间、修正量、验收产出和不同条件下的缺陷。没有样本证据,不要把供应商的通用效率声明当成项目预测。
用可回答采购问题的试点来验证供应商
有效试点应是缩小版生产系统,而不是精心挑选的演示片。纳入正常材料和困难分层:拥挤、快速运动、部分与完全遮挡、相机运动、模糊、小目标、类别歧义、剪辑点和相关稀有事件。买方应保留一套生产人员未知的金标或裁定集。
试点前约定模型任务、源数据权利与安全、序列与抽帧规则、标签体系、身份和遮挡规则、目标导出、QA 样本与阈值、升级和修订责任、按复核后产出计算的吞吐量,以及变更后的重新估算机制。
试点期间记录各阶段工时、验收标签量、错误类别、身份缺陷、问题响应时间、规范变更、导出失败和评审一致性,并把简单与困难视频分开报告。把空画面和密集场景混成一个平均值,无法支持规模化决策。
试点结束时,应获取最终标注、验证后的导出、问题日志、更新后的规范、决策日志、QA 报告和扩量假设,并从头到尾检查若干完整序列。然后再决定通过、调整范围、运行第二轮专项试点或停止。
采购检查清单:
- 标注是否直接支持模型输出?
- 抽帧和序列边界是否明确?
- 轨迹身份、遮挡、重现和剪辑点是否有规则?
- 边界案例是否有正反例?
- 工具是否能处理生产视频而不产生时间误差?
- 目标格式是否通过真实训练加载器?
- 几何、类别、时序和 schema 质量是否分别衡量?
- 报价是否包含复核、裁定、修订和报告?
- 数据访问、保留和删除是否适合素材风险?
- 吞吐量是否按难度和验收产出报告?
强有力的视频标注服务方案会把标签与模型任务相连,保留时序含义,证明格式兼容,并按验收质量报价。向 Smart Language Service 提供一段有代表性的视频样本,即可获得标注方式与成本建议;我们可协助设计试点、按需本地化标签体系、管理生产与复核,并交付序列级验收证据。

