AIに仕分けを任せるかどうかを、全体の正解率で決めてはいけない。76%と出たら「使えない」と判断しがちだが、確信度で帯に分けると景色が変わる。手元で作った50件の例では、全体の一致率が76%でも、確信度0.9以上の21件は全部正解だった。
決め方はこうなる。上の帯だけ自動に回し、下の帯は人が見る。判断に使うのは全体の率ではなく、帯ごとの率だ。
以下の式と数字は、2026年9月20日にMicrosoft 365のExcel(バージョン16)で計算させた。50件のデータは式を確かめるために私が作った架空のもので、どのモデルの実力を示すものでもない。自分の職場の数字は、自分で50件測るしかない。
任せられる仕事かどうかは、3つの問いで決まる
測る前に、そもそも任せられる形かを見る。次の3つに全部「はい」と答えられないなら、測っても意味がない。
1つ目は、答えが有限の選択肢に収まるか。問い合わせの担当部署なら経理・総務・営業・その他の4つに収まる。「この案件をどう進めるべきか」は収まらない。
2つ目は、正解が後から分かるか。振り分けた問い合わせは、担当者が見れば正しかったか分かる。将来の売上予測は、当たったかどうかが分かるまで数か月かかる。測れないものは改善できない。
3つ目は、間違えても戻せるか。仕分けの間違いは、担当者間で回せば直る。外部へのメール送信や、請求データの更新は戻せない。戻せない操作は、確信度がいくつでも人が押す。
この3つを通ると、判定の仕事として切り出せる。通らないものは、AIに下書きだけ作らせて人が決める形にする。
50件の記録シートは6列でいい
必要な列はこれだけだ。1行が1件になる。
| 列 | 中身 |
|---|---|
| A | 通し番号 |
| B | 件名か、入力の最初の20字 |
| C | AIの判定 |
| D | 確信度(0から1) |
| E | 人の判定(正解) |
| F | 直すのにかかった分 |
G列に一致の判定を入れる。
=IF(OR(C2="",E2=""),"",IF(C2=E2,1,0))
これで1が正解、0が誤りになる。50行ぶん入れたら、集計シートで帯ごとに数える。
確信度0.9以上の件数: =COUNTIF(記録!$D$2:$D$51,">=0.9")
うち誤り: =COUNTIFS(記録!$D$2:$D$51,">=0.9",記録!$G$2:$G$51,0)
0.9以上の一致率: =ROUND(1-COUNTIFS(記録!$D$2:$D$51,">=0.9",記録!$G$2:$G$51,0)/COUNTIF(記録!$D$2:$D$51,">=0.9"),3)
COUNTIFSは条件を並べるだけなので、帯を増やすのも簡単だ。0.6以上0.9未満を数えるなら、">=0.6"と"<0.9"を両方渡す。
全体で76%でも、上の帯は21件すべて正解だった
作った50件を集計させると、こうなった。
| 確信度の帯 | 件数 | 誤り | 一致率 |
|---|---|---|---|
| 0.9以上 | 21 | 0 | 100% |
| 0.6以上0.9未満 | 19 | 5 | 73.7% |
| 0.6未満 | 10 | 7 | 30.0% |
| 全体 | 50 | 12 | 76.0% |
全体の76%だけを見て判断すると、この仕組みは捨てることになる。4件に1件間違えるなら使えない、と考えるからだ。
帯に分けると話が変わる。0.9以上の21件は全部正解で、これは全体の42%にあたる。この42%を自動に回せば、人が見るのは58%で済む。残りの帯は誤りが混ざっているので、人が見る。
なぜこうなるかというと、確信度が答えの確率分布から出ているからだ。選択肢のうち1つに確率が集中していれば高く、割れていれば低くなる。人が迷う問い合わせは、モデルでも割れる。だから確信度の低い行に誤りが集まる。この性質が本当に成り立つかは、モデルによって違う。公開されている測定では、間違えた回答すべてで確信度が下がっていた例がある。その検証はJevの性能を突き合わせた記事に書いた。
逆に、対話型のモデルに「確信度も返して」と頼んで出てくる数字は、文章の一部として書かれているだけで較正されていない。0.95と書いてあっても95%当たるとは限らない。だから自分の50件で、帯ごとの一致率を必ず数える。
損益分岐は、直す時間で決まる
自動化する価値があるかは、金額で出る。月300件の問い合わせを振り分ける場合で計算した。前提は、1件を人が仕分けるのに2分、時給1,500円、AIが間違えた1件を直すのに10分、AIの呼び出しが1件0.004円。
| 項目 | 金額 |
|---|---|
| 全部人がやる | 15,000円 |
| 人が見るぶん(174件) | 8,700円 |
| 自動での手戻り | 0円 |
| 呼び出しの費用 | 1.2円 |
| 自動化したときの合計 | 8,701円 |
| 月の差額 | 6,299円 |
手戻りが0円なのは、この50件では0.9以上の一致率が100%だったからだ。実際には誤りが混ざる。もし0.9以上の一致率が97%なら、自動の126件のうち3.8件が誤りになり、手戻りは945円。合計は9,646円で、差額は5,354円に縮む。
呼び出しの費用が1.2円というのが効いている。料金はどのモデルを選んでも事務の量では小さい。9月のモデルの料金を並べた記事で計算したとおりで、効いてくるのは人が動く時間のほうだ。
しきい値を動かすとどうなるか
しきい値を0.9から0.6に下げると、自動に回る件数は21件から40件に増える。人が見るのは10件で済む。そのかわり、0.6以上0.9未満の帯には誤りが5件混ざっているので、自動での誤りが増える。
どちらが得かは、直す時間で決まる。直しに10分かかるなら、誤りを1件通すと10分の損失だ。人が1件見るのに2分なら、5件を人が見たほうが安い。直しが1分で済む仕事なら、しきい値を下げて自動を増やしたほうが得になる。
式にすると、しきい値を下げて増える自動件数に、その帯の誤り率と直しの時間を掛けたものが、減る確認時間より小さければ下げていい。私は最初0.9で始めて、1か月動かしてから下げるかを決めている。
踏んだ失敗
しきい値を決めずに始めると、結局すべて人が見ることになる。確信度が返ってきても、使う場所がないからだ。記録シートを作る前に、しきい値をどこに置くかを決めておく。値は後から直せばいい。
自己申告の確信度をそのまま信じるのも危ない。較正されていないモデルでは、0.95と書いて間違えることがある。50件を数えるまでは、確信度は「並べ替えの順番」としてしか使えない。高い順に並べて、上から何件までが正解かを見る。
戻せない操作を確信度で自動化するのも避けている。メールの送信、請求データの更新、在庫の引き当て。これらは確信度が1.0でも人が押す。判定と実行を分けて、判定だけを任せる。
起きた誤りの種類を数えるのも効く。同じ種類の誤りが固まっているなら、依頼文を直せば減る。種類の分け方はチェックリストの作り方の記事で使った4分類がそのまま使える。
依頼文は、判定と確信度だけを返させる
測定に使う依頼文はこれで足りる。文章を書かせないのが要点だ。
次の問い合わせを読み、JSONだけを返す。説明の文章は書かない。
{"department": "経理|総務|営業|その他", "confidence": 0から1の数}
迷うときは confidence を下げる。根拠は書かない。
---
(ここに問い合わせの本文)
返ってきたJSONをそのまま記録シートのC列とD列に貼る。50件たまったら集計シートを見る。0.9以上の一致率が95%を超えていれば、その帯は自動に回せる。90%を下回るなら、しきい値を上げるか、依頼文の選択肢の書き方を直す。
判定だけを返す専用のモデルも出てきている。文章を作らないぶん速くて安い。仕組みは文章を書かないAIの記事に書いた。ただし測り方はここに書いたものと同じで、変わるのは呼び出し先だけだ。
計測に使うのは50件。100件あればなお良いが、50件で帯ごとの傾向は見える。0.9以上が20件前後あれば、その帯の一致率は判断に使える。5件しかなければ、まだ判断できない。



