GUIDES

自動化する前に AI 分類を評価する

説得力のあるデモは 1 つの例にすぎません。評価は、チームが実際に受け取るメッセージに対してルールがどう振る舞うかを測ります。めったに起きてほしくない事例も含めて。

Label a held-out set, compare model decisions with it, and review errors before changing a workflow.
Label a held-out set, compare model decisions with it, and review errors before changing a workflow.

しきい値を選ぶ前に、まず 1 回評価を通す

これは説明用の計算で、Jev の実測ベンチマークではありません。ホールドアウトのデータが 100 件あるとします。あるしきい値で 80 件が自動承認され、そのうち 78 件が参照ラベルと一致し、2 件が誤りでした。残り 20 件は人による確認に回ります。自動化の適用率は 80%、自動承認された結果の正確さは 78 / 80 = 97.5% です。どちらの数字も、その 2 件の誤りが深刻な損害を出したかどうかは教えてくれません。

誤りはラベルと結果の重さで分けて見てください。商品タグの誤りと、誤って承認した返金では、コストが違います。権限の判定は分類器の外に置いたまま、同じ例と同じモデル版でしきい値を比較します。最後のホールドアウトでしきい値を選び、それを独立した検証結果と呼んではいけません。

説明用。実行できるコードでも Jev の実測でもない
held_out = 100
automated_correct = 78
automated_wrong = 2
review = 20
coverage = (78 + 2) / 100 = 80%
automated_accuracy = 78 / 80 = 97.5%

バッチ処理を試す · 判定を試す

再現できる評価記録を残す

元の行の識別子を自社のシステムに残し、人によるラベル、ルールの版、要求したモデル、実際に返ったモデル、しきい値、リクエスト識別子、結果を一緒に保存します。エンドツーエンドの遅延と、確認できた失敗は別々に記録してください。基盤のモデルが変わるなら、提供元の名前だけでは追跡できません。

まずは提案のみのモードで始め、顧客のデータを書き換えられないようにします。自動化を止められる責任者を決め、公開前に停止条件を明文化します。ラベル、モデル版、メッセージの言語が変わったら再評価します。画面が翻訳されていることは、その言語で同じ品質という証拠にはなりません。

検証用データは分けておく

ラベルとその定義を書き出します。業務を知る人に代表的なレコードをラベル付けしてもらいます。意見が割れた場合は、基準として使う前に解消します。指示を調整するために使わない、別のセットを確保してください。

判定を試す

重要な誤りを数える

全体の正確さは、小さくても重要なカテゴリの失敗を隠します。ラベルごとに誤りを数え、曖昧な事例を確認し、選んだしきい値で手作業がどれだけ残るかを測ります。実際の流入にある言語とチャネルの差も含めてください。

段階的に展開する

まずは提案モードから始めます。モデルの判定と既存の結果を比較し、可逆なステップだけを自動化します。失敗率や確認件数が上がったら止める条件を決めておきます。リクエスト識別子とモデル名を評価結果と一緒に保存すると、後の比較が意味を持ちます。

判定を試す ↗
プランと利用方法を質問

製品情報を探す

回答は公開済みの製品ガイドに基づきます。アカウント固有の質問はサポートへお問い合わせください。

お問い合わせ
デイリーボーナス

毎日2クレジットを無料で獲得

UTCの1日につき無料で2クレジット。7日分の受け取りで合計14クレジットです。購入不要で、有効期限はありません。

    毎日00:00 UTCにリセット。連続ログインは不要です。

    判定を試す →

    次の判断をワークスペースに取り込みましょう。

    1日1回の匿名試行 · 登録で20クレジット · トライアルはカード不要

    ログイン ↗

    ご要望をお聞かせください

    分類したいワークフロー、想定する処理量、必要な結果をご記入ください。emailで返信します。

    10~2,000文字。パスワード、APIキー、支払い情報は絶対に含めないでください。