表示単価ではなく、合格ラベル当たりの費用を比べる
データアノテーション外注費用とは、原データをモデル開発チームが受け入れて利用できるラベルに変えるまでの総費用です。タスク設計、ツール設定、作業時間、品質レビュー、判定、手戻り、セキュリティ対策、プロジェクト管理、納品を含みます。ボックスや文書当たりの価格が安くても、難しい項目やレビューが対象外で、社内エンジニアが出力を修正するなら総費用は高くなります。
見積りを比較可能にするには、全社へ同じ代表サンプル、同じガイドライン版、出力形式、受入条件、セキュリティ要件、数量仮定を渡します。そのうえで提出単位ではなく、品質管理後に合格した単位当たりの費用を計算します。本ガイドでは、AI調達、製品、MLオペレーション担当者向けに、料金モデル、形式別の要因、隠れた費用、見積りの正規化方法を説明します。
四つの料金モデルと適する案件
タスクまたはオブジェクト単価は、画像、バウンディングボックス、テキスト範囲、音声分、動画フレームなど明確な単位で請求します。単位が安定し各社の数え方が同じ場合に向きます。スキップ、却下、空、重複、複数対象の素材を請求するか、レビューを含むかを契約で明記します。
時間単価は、探索的な作業、複雑な調査、頻繁に変わる分類体系、数量だけでは工数を予測できないタスクに向きます。専門家の時間は見えますが、役割別単価、時間報告ルール、試行での生産性根拠、上限または見直し点が必要です。
専属チーム料金は月などの期間で作業能力を予約します。継続案件、頻繁なガイドライン変更、密な連携に適します。人数と表面単価だけでなく、研修、休暇、監督、QA、想定稼働率を差し引いた実効能力で比較します。
成果またはマネージドサービス料金は、定義した受入条件を通過する検証済みデータセットなど、合意済み成果に対して支払います。範囲が安定していれば予算化しやすい一方、前提、対象外、変更管理、修正責任が必要です。常に最安の方式はありません。最大の不確実性を測定可能にする方式を選びます。
AWSのSageMaker料金説明は、レビューされたデータセットオブジェクトをオブジェクト料金の基準として説明し、Ground Truth文書は人手ラベル、統合、タスク形式、出力メタデータを区別しています。ベンダーも何が請求イベントになるかを同じ程度に明確にすべきです。
ベンダー比較前に総費用の式を作る
総費用は次に分解できます。
- 一時費用:サンプル分析、分類体系とガイドライン、ワークフロー設定、連携、セキュリティ導入、研修、キャリブレーション;
- 生産費:請求単位数に単価または労務費を掛けた金額;
- 品質費:二次レビュー、ゴールドチェック、重複付与、裁定、監査抽出、報告;
- 例外費:専門家レビュー、難しい素材、個人情報処理、原データ整備、承認済み変更;
- 購入側費:準備、質問対応、受入試験、技術連携、修正。
一時費用と反復費用を分けて提示してもらいます。設定費自体は問題ではなく、良い試行は大量の手戻りを防ぎます。危険なのは定義のない費用や、安い設定費の後で分類判断を購入側へ戻し続けることです。
単価には必ず分母を書きます。試行画像は平均2対象、生産画像は20対象なら「画像当たり」は同じ仕事ではありません。テキストは文書、token、span、judgmentを統一し、音声はメディア分と人の作業分を区別します。動画はclip、抽出frame、track、keyframe、eventのどれを数えるか決めます。
データ形式別の費用要因
画像。 分類は密な検出やsegmentationより単純なことが多いものの、対象数、隠れ、画質、クラス数、境界ルール、最小対象、属性が効率を変えます。polygonは輪郭の複雑さ、bounding boxは密度と重なりの曖昧さに左右されます。一つの平均価格ではなく難易度帯別の試行実績を求めます。
動画。 長さだけでは見積もれません。frame rate、抽出間隔、track数、場面転換、隠れ、interpolation、時間的一貫性、event定義、全系列を見るレビューかどうかが工数を変えます。静止に近い1分映像と混雑道路の1分映像は同じ単位ではありません。
テキスト・文書。 長さ、言語、専門領域、分類体系の深さ、判断に必要な文脈、重複span、entity関係、外部調査が費用を左右します。表やレイアウト文脈を必要とする文書は、語数が同じでも平文より時間がかかります。
音声。 長さ、ノイズ、話者数、重なり、アクセント、言語人材、transcriptionの深さ、timestamp、diarization、非発話イベント、個人情報削除が要因です。音声分単価に文字起こし、ラベル、レビュー、難音声加算が含まれるか確認します。
3D・センサー・専門データ。 point cloud、医療画像、地理データ、法務文書、科学資料では専用ツールと有資格レビューが必要な場合があります。ツール遅延、座標系、複数センサー同期、専門判断ルールもthroughputを変えるため、一般作業者の単価とは比較できません。
品質費を見積り本体に含める
品質はラベル付与後に追加する最終検査ではありません。見積りには研修、資格確認、キャリブレーション、工程内検査、レビュー範囲、裁定、修正、受入報告を含めます。NIST AI Risk Management Frameworkは、測定指標、試験方法、結果、関係する専門性の文書化を求めています。正式な準拠を主張しない案件でも有効な調達原則です。
目標値の前に品質単位とエラー分類を定義します。クラス、box、polygon、text span、transcript segment、track objectは異なる測定が必要です。重大度、棄権、部分正解、空素材、曖昧項目の扱いも決めます。分母、抽出法、標本数のない「精度」一つでは見積りを正規化できません。
重複アノテーションは設計判断です。明確な全項目を3人に渡すと浪費になり、主観的または高リスク判断を1人だけで行うと不足します。単独生産、選択的overlap、hidden gold、リスク別review、専門家裁定を組み合わせ、各層を別価格にします。ガイドラインが原因の不一致を誰が負担するかも定めます。
合格単価を変える隠れた費用
最大の隠れ費用は手戻りです。不完全な指示、不整合な原データ、遅い分類変更、学習パイプラインに合わない出力、監査標本だけを直す対応が原因になります。契約でベンダー誤り、購入側変更、原データ欠陥、本当の曖昧さを分け、それぞれの対応を定めます。
ツールにはライセンス、保存、計算、連携、カスタム画面、転送、形式変換費があります。購入側のplatformかベンダーplatformか、管理費とplatform費を二重に請求するか確認します。試行中に納品ファイルを実際の学習処理へ入れてください。画面上で正しく見えるだけでは不十分です。
管理費には導入、日次調整、質問、報告、変更管理、人員交代が含まれます。ガイドライン所有者、境界例の回答者、決定を作業者へ伝える時間、PM時間の上限を確認します。
セキュリティとプライバシーは、制限環境、端末制御、アクセス審査、人員確認、データ所在、logging、redaction、安全な削除により費用を変えます。データが必要とするなら任意の追加項目ではありません。英国ICOの最新データ保護設計ガイドは、設計時点から必要な個人情報、アクセス、保護策を決める考え方を示しています。適用要件は購入側のプライバシー・法務担当者が確認します。
正規化した見積り比較例
同じサンプル、分類体系、出力schema、受入試験を使う10万画像の仮想案件を考えます。A社は提出画像当たり0.08ドル、設定費2,000ドルでレビューは対象外。B社は標本レビュー込みで0.11ドル、設定費3,000ドルです。以下は計算例であり、市場相場ではありません。
A社の生産費は8,000ドル、表示総額は10,000ドルです。購入側の修正なしに82%が合格し、残りの修正に2,700ドルかかるとすれば、比較総額は12,700ドルです。合格した82,000件で割ると約0.155ドルです。
B社の表示総額は14,000ドルです。初回合格率96%、料金内修正後に98,000件が承認され、購入側受入作業が600ドルなら、比較総額14,600ドル、合格単位当たり約0.149ドルです。この仮定では表示単価が高いB社の正規化費用が低くなります。仮定次第で逆転するため、試行根拠と感度範囲が必要です。
日程、能力、セキュリティ適合、文書、修正速度も比較します。財務面で適切なのは最低または最高単価ではなく、リスク調整後の適合が最も良い会社です。
各ベンダーへの質問
- 請求単位は何か。空、skip、reject、duplicate、複数対象をどう数えるか。
- 設定、platform、保存、転送、管理、reviewer、専門家、修正費のどれを含むか。
- 単価はどの難易度を前提とし、何が追加料金や変更票になるか。
- 誰がlabel、review、adjudication、管理、承認を担当し、必要資格は何か。
- 指示変更時に作業者をどう再研修し、calibrationするか。
- 報告にどの指標、分母、標本数、重大度、受入基準が出るか。
- ベンダー誤り、曖昧な指示、原データ欠陥、範囲変更の修正を誰が負担するか。
- 代表試行のthroughputと合格率の根拠、予算幅は何か。
- アクセス、logging、保存、削除、守秘、incident対応の統制は何か。
- 指定schema、安定ID、lineage、問題一覧、修正履歴、最終QA証拠を納品できるか。
見積り依頼前の予算チェックリスト
- タスク定義、分類体系版、言語、形式、出力schemaを固定する。
- 容易、通常、困難、曖昧、無効を含む代表サンプルを渡す。
- 総数だけでなく難易度帯別の数量を示す。
- 請求単位と合格単位を分けて定義する。
- 品質指標、samplingまたはoverlap、重大度、裁定、release条件を決める。
- セキュリティ、プライバシー、アクセス、保存、データ所在を価格前に示す。
- ガイドライン質問と変更承認の双方責任者を決める。
- 設定、生産、QA、専門家、platform、管理、予備費を分けて依頼する。
- 購入側の技術連携、受入試験、修正費を見積もる。
- 難易度、生産性、合格率、変更量の低・標準・高シナリオを作る。
代表サンプルで説明可能な見積りを得る
価格試行は生産の難しさを再現します。希少クラス、混雑場面、悪い音声、長文、多言語、境界例、却下対象を含め、実際の出力から購入側受入まで通します。実作業時間、レビュー時間、質問数、合格率、エラー重大度、修正回数、除外数を記録します。
計画には、AIデータ収集費用ガイド、データアノテーション品質管理、AIデータサービス企業の評価ガイドも参照できます。収集制約、ラベル品質、供給会社の適合を分けて判断できます。
Smart Language Serviceは画像、動画、テキスト、音声の代表サンプルを基に作業範囲を設計できます。代表サンプルによる明確なアノテーション見積りをご依頼ください。大量生産を確約する前に、請求単位、品質層、例外処理、納品形式、受入証拠を合意します。

