在发布前把翻译质量变成可衡量的决策
翻译质量保证不是在交稿前“再看一遍”,而是一套把“读起来要好”转化为可重复发布决策的工作体系。成熟的流程会先定义受众、用途和风险,再区分翻译、独立审校、质量评价、情境测试和发布批准;同时用统一的错误类型、严重程度、抽样规则和整改记录,说明为什么某个语言版本可以上线,或为什么必须暂停。
采购方需要的不是一个适用于所有内容的神奇分数,而是“译文是否适合既定用途”的证据。医疗说明、软件按钮、法律通知、营销标题和内部知识库的风险完全不同。本指南帮助本地化经理、采购团队和全球内容负责人制定验收标准、看懂 LQA 报告,并避免为“母语级质量”这类无法验证的承诺付费。
翻译 QA 与校对有什么不同
校对只是质量体系中的一个环节,通常关注目标语言的错别字、语法、标点、一致性和明显排版问题。它未必逐句核对原文含义,也未必在真实界面中测试变量、链接和按钮,更不会自动决定某项错误是否严重到需要阻止发布。
完整流程可包括源文准备、术语确认、译者自检、双语审校、自动检查、语言质量评估(LQA)、情境或功能测试、修订、回归检查和最终批准。ISO 17100规定了翻译服务的资源与核心过程要求;ISO 11669:2024为采购方提供项目规格、需求分析、风险评估和流程沟通框架。项目仍需根据实际用途制定验收简报,不能把标准名称当成自动合格证明。
生产前应明确角色:译者负责产出并自检;审校者对照源文核实含义、术语和用途;LQA 评价人员按约定模型检查样本或整批内容;情境测试人员查看最终页面、产品、文档或媒体;发布负责人接受剩余风险并签字。小项目可以一人兼任多个角色,但每次交接和证据仍要可追踪。对受监管、安全相关、公开发布或上线后难以撤回的内容,独立评审尤其重要。
建立评审员真正能一致使用的错误分类
错误分类应足够完整,又不能细到评审员无法稳定区分。面向采购和发布决策的分类通常包括:
- 准确性:误译、漏译、增译、未翻译内容,或目标文本与原文关系错误;
- 术语:未使用批准术语、同一概念前后不一致,或采用不符合专业领域的表达;
- 语言:语法、拼写、标点、句法、流畅度和不自然表达;
- 风格与语域:语气、品牌声音、正式程度或受众层级不符合要求;
- 本地规范与合规:日期、数字、单位、地址、法规引用、文化习惯或必备声明错误;
- 功能与格式:标签、占位符、链接、换行、截断、版式、文字方向或文件行为异常。
W3C ITS 2.0提供可互操作的本地化质量问题类型,并支持记录问题类别、说明和严重度。它适合作为分类参考,但项目只应采用评审员能够可靠判断的层级。欧盟委员会翻译总司的2024 年质量评价资料则公开展示了如何把质量要求映射到错误代码,并对随机样本进行评价。
严重度必须反映业务影响,而不是评审员个人不满。可采用三级:严重错误可能造成安全、法律、财务、隐私或重大声誉风险,破坏关键功能或使内容无法使用;主要错误改变含义、误导用户、违反重要指示或明显影响任务完成;次要错误是有限的语言或呈现缺陷,不改变核心含义,也不阻断任务。
每种内容都要配实例。药物剂量中的小数点错误可能是严重错误;按钮名称不一致若引导用户执行错误操作,可能是主要错误;缺少一个不换行空格通常是次要错误,但若破坏法定格式,严重度就会上升。不要仅凭错误类别自动判定严重度。
把错误转化为可执行的验收规则
ISO 5060:2024讨论了通过错误类型和罚分得到错误分数与质量等级的分析型评价方法,也涉及抽样和评价人员能力。采购方可以采用同样的逻辑,但不应假装一个分数能适用于所有项目。
例如,可给次要错误 1 分、主要错误 5 分,并规定任何确认的严重错误都会触发暂停。再按每 1,000 个审查词、片段、屏幕或其他稳定单位进行归一化。验收条件可以写成:“无严重错误;每 1,000 个审查词不超过 10 个加权分;所有功能故障已修复;所有主要修订均完成回归测试。”这些数字仅为示例,真实阈值应来自风险、试点数据和利益相关方的容忍度,而不是复制供应商模板。
还要规定重复错误如何计数。同一错误术语出现 80 次,可能只有一个根因,却影响 80 次用户接触,因此报告中应同时列出发生次数和唯一根因。源文缺陷、偏好性修改和范围外改写可以不计入供应商错误分,但仍需单独记录和解决。
用抽样控制成本,而不是隐藏风险
并非每个项目都值得 100% 人工复核,但“抽查 10%”只有在说明选择方法后才有意义。评审前必须确定抽样单位、总体、规模、选择方法和升级规则。
可靠方案通常结合随机样本和风险样本。随机样本用于观察常见内容;风险样本覆盖安全警告、价格、营销声明、法律通知、行动按钮、高流量页面和新术语;同时确保不同文件、译者、语言、内容类型和生产批次都有代表。当出现严重错误或某一分层的主要错误聚集时,应自动扩大复核范围。
例如,10 万词版本可以从每个文件随机抽取内容,同时对安全警告、数字和新批准术语进行 100% 检查。如果某个分层发现严重错误,或主要错误超过阈值,则暂停发布并把该分层扩大为全量复核。这个方案的可信度来自抽样与决策相连,而不是比例看起来很大。
不同语言不能只汇总成一个平均分。全球平均合格可能掩盖小语种市场失败。应按语言和高风险内容组报告样本量、错误数量、严重度、归一化分数及发布状态。
在正式评分前校准评审员
评审意见不一致会制造噪声、拖慢进度并造成无效返工。校准的目标是在分数影响付款或发布前,让团队对规则形成一致理解。
让所有评审员独立检查同一组具有代表性的片段,其中要包含刻意设计的模糊案例。每个人都需标记问题范围、类别、严重度、建议修正和理由。随后根据项目简报、术语库、风格指南及产品情境比较结果,解决分歧,并把新实例写回错误指南。重复一轮,直到关键区分能够稳定执行。
一致性要分层观察:评审员是否发现同一个问题、是否选择同一类别、是否给出同一严重度?单一百分比可能隐藏真正的分歧来源。把裁定结果放入持续更新的决策日志,避免每个批次都重复争论相同边界问题。
还要防止个人偏好变成“错误”。正确译文不应只因评审员更喜欢另一种说法而被重写。计分问题必须能指向明确指示、含义缺陷、受众问题或功能影响;风格建议可单独记录,不应扭曲验收指标。
在真实情境中测试最终译文
双语文件里正确的句子,放进产品后仍可能失败。情境测试关注的是最终体验,而非导出的文本表格。
软件和网站要测试文字扩展、截断、换行、按钮、链接、变量、复数、性别、排序、搜索、从右到左显示、日期数字格式及高风险流程截图。文档要检查表格、页码引用、页眉、字体、图表和打印或 PDF 输出。字幕要检查时间轴、说话人语境、断行、阅读负荷和画面文字。营销内容则要确认最终标题、视觉、CTA、落地页和当地市场声明相互一致。
每个问题都应连接到稳定的字符串 ID、片段、页面、屏幕、时间戳或文件位置,并用截图或渲染文件保存证据,而不是只写自由文本意见。修复后要回归检查相关情境和邻近内容,因为一次修订可能引入新的截断、标签错误或术语不一致。
如需确定生产方式和复核深度,可参阅我们的翻译工作流中的人工审核、人工翻译与 MTPE 的选择以及网站本地化与翻译的区别。
要求一份能支持决策的 LQA 报告
有用的报告不能只是没有结论的批注表。它应包含项目和版本、语言与文件、评价人员和日期;采用的规格、术语库、风格指南和分类版本;总体规模、样本量、选择方法与风险分层;每个问题的稳定位置、源文、译文、类别、严重度、理由和建议修订;按语言、类别、严重度和内容组归一化的统计;严重及系统性问题、根因、整改负责人和期限;复测证据、未解决例外,以及“通过、有条件通过或不通过”的明确建议。
采购方比较供应商时,应关注其如何定义验收、抽样、校准评审员、处理申诉和证明修复,而不能只看一个总分。可要求查看脱敏样例,并让供应商解释一个问题从发现、裁定、修复、回归测试到发布决策的完整链路。
本地化发布检查清单
批准上线前,请确认:
- 当前源文、范围、受众、市场和内容风险已经记录;
- 目标“地区语言”而非只有语言名称已经确定;
- 术语、风格、产品引用和禁止翻译项已批准;
- 译者、审校者、评价人员、测试人员和发布负责人职责清晰;
- 分类、严重度、抽样、阈值和升级规则在评分前已达成一致;
- 数字、标签、占位符、术语和完整性自动检查成功;
- 必要的双语审校与风险 LQA 已完成;
- 最终渲染内容通过情境和功能测试;
- 所有严重及主要问题均有处理结论、负责人和复测记录;
- LQA 后的修改已回归测试;
- 最终报告说明剩余风险和授权批准人;
- 源文件、批准译文、报告、决策和版本历史按政策保存。
真正有效的质量保证会形成一项可审计的选择:发布、带有明确例外发布,或暂停修订。向潜在合作伙伴索取 LQA 报告样例和书面验收标准。Smart Language Service 可协助设计基于风险的翻译质量保证流程,完成多语言翻译与审校,并按语言交付支持最终发布决策的证据。

