文章を書かないAI「Jev」の仕組み。選択・点数・確率だけを返すモデルを、事務の判定に使えるか

2026-09-20AIの使い方

問い合わせメールを読んで、経理か総務か営業かに振り分ける。この作業に文章はいらない。要るのは「経理」の2文字と、その判断をどれだけ信じてよいかの数字だけだ。

2026年9月15日にTypeSafe AIが公開したJevは、そこだけをやるモデルだった。文章を返さない。返すのは型の決まった値と確率。同社はこれを「System Oneモデル」と呼んでいる。

先に断っておく。Jevは早期アクセスで待機リストがあり、私はまだ動かしていない。以下の仕様と数字は、公式ブログ、公式ドキュメント、報道記事を2026年9月20日に読んで確かめた範囲だ。自分で測った値は1つもない。

返ってくるのは3つの形だけ

Jevへの質問は3種類しかない。公式ドキュメントの例を、事務の仕事に置き換えるとこうなる。

質問の形 何を返すか 事務での例
Choice 選択肢から1つ。最大255個まで この問い合わせの担当は経理か総務か営業か
Score 順序のある段階の上の位置。2〜10段階 相手の不満の強さを0から2で
Noul 0から1の確率 この文面は返金を求めているか

Choiceは選んだ答えに加えて、選択肢ごとの確率と確信度を返す。Scoreは1.035のように段階の間の値も返る。Noulは確率そのものが答えなので、別枠の確信度がない。数字がそのまま信じてよさの度合いになる。

呼び出しはHTTPでPOST https://api.typesafe.ai/v1/systemone、モデル名はjev-latest。Python向けのSDKはpip install typesafe-sdkで入り、Python3.10以上が要る。1回の呼び出しに複数の質問を並べられて、10個目の質問を足してもトークン代は増えるが時間はほとんど変わらない、と実践記事の著者は書いている。

速いのは、文章を作らないから

いまの対話型のモデルが遅いのは、答えそのものより、答えを文章にする工程が長いからだ。1文字ずつ次を予測して並べる。100字の返事には100回の予測が要る。

Jevは文章を作る機能を捨てている。状態を受け取り、1回の並列処理で型つきの値と確率を出す。だから「経理」という答えに、文章を組み立てる時間がかからない。確信度は、モデルが出した確率分布の形から計算される。分布が1つの選択肢に尖っていれば高く、散らばっていれば低い。

学習の方法も違う。対話型のモデルで使われるRLHFやRLVRではなく、TypeSafe AIはRLCD(Reinforcement Learning for Calibrated Decisions)という方法を使ったと書いている。狙いは較正だ。確信度0.9と出したものが、実際に9割当たる状態に近づける。同社は「確信度が高いほど正確」「似た入力には似た答えを返す」と説明している。

公表されている数字と、外から出てきた数字

項目 出どころ
入力の料金 100万トークンあたり0.042ドル 公式ブログ
出力の料金 無料 公式ブログ
応答時間 70から500ミリ秒 公式ブログ
対話型モデルとの比較 0.114秒に対し8.566秒。193.6倍速く444.6倍安い 公式の社内評価
外部の実測 1,018件の分類で中央値256ミリ秒 実践記事の著者

最後の行を見てほしい。公称の下限が70ミリ秒で、外の人が実際に1,018件流したら中央値256ミリ秒だった。遅いという話ではなく、公称は良い条件での値だということだ。

比較のほうはもっと差が出ている。VercelのCEOは「p95で18倍速く、より正確」と報告した。一方でBryo AIは「Geminiのほうがわずかに正確だが、10倍から20倍高い」としている。193.6倍という数字は、TypeSafe AI自身が自社のワークフローで測ったものだ。報道記事はこの点を名指しで指摘している。

事務の判定に置き換えると

毎日繰り返している判定のうち、答えが有限の選択肢に収まるものが対象になる。問い合わせメールの一次振り分け。請求書の科目の候補出し。シフト希望を受け付けてよいかの可否。どれも出力は短く、必要なのは判断と、その確からしさだ。

逆に、対象にならない仕事もはっきりしている。議事録の要約、メールの下書き、マニュアルの文章。Jevは文字列を作れないので、この種の仕事は今までどおり対話型のモデルに投げることになる。私が以前書いた議事録をAIに書かせる手順は、そのまま使い続ける領域だ。

確信度でしきい値を切る

Jevを使う使わないに関係なく、判定をAIに任せるときの型はこれになる。確信度で3つに分け、それぞれ扱いを変える。

確信度 扱い 向く仕事
0.9以上 そのまま自動で処理する 定型の問い合わせ、毎月同じ取引先の請求書
0.6から0.9 AIの案を初期値にして担当が確認する 複数の部署にまたがる問い合わせ
0.6未満 AIの案は見ずに人が読んで決める 初めての種類、金額の大きい取引

公式ドキュメントも、高い確信度は自動処理へ、中くらいは確認へ、低いものは人へ、という分け方を勧めている。金銭が動く操作は確信度0.85超といった高いしきい値にする、という例も載っている。

この表の0.9と0.6は、私が置いた仮の値だ。自分の職場で30件ほど手で答え合わせをして、間違いが混ざり始める境目を見つけて決め直してほしい。

読み違えやすい3つの点

「ハルシネーションがない」を「答えが間違わない」と読むと事故る。この言葉が指しているのは、返ってくる値が必ず決めた型に収まるということだ。選択肢にない部署名が返ることはないし、数値を求めた場所に文章が入ることもない。報道記事は「0%という数字は実測ではない。答えは間違いうる」と書いている。型が守られることと、判断が正しいことは別だ。

公称の193.6倍を、そのまま社内の企画書に書くと後で困る。上に書いたとおり、外部の報告は18倍だったり、精度で他社が上回ったりしている。自分のデータで50件ほど測ってから数字を出すほうが安全だ。

3つ目は苦手分野だ。ドキュメントは、数を正確に数えることと日付の計算が苦手だと明記している。否定表現や言外の条件も字義どおりに取る。「来月の頭までに返事が要る」を日付に変換させるような使い方は外れる。状態に関係のない情報を詰め込むほど精度が落ちる、とも書かれている。渡す情報は絞る。

待機リストのあいだに試せること

Jevが来るまで待つ必要はない。いま使っているモデルでも、判定と確信度だけを返させる型は作れる。依頼文はこれだけでいい。

次のメールを読み、JSONだけを返す。説明の文章は書かない。
{"department": "経理|総務|営業|その他", "confidence": 0から1の数, "refund": 0から1の数}
判断に迷うときは confidence を下げる。
---
(ここにメール本文)

返ってきたJSONを表に落とし、confidenceが0.6未満の行だけ人が読む。この運用に慣れておけば、Jevが使えるようになったときに、置き換えるのは呼び出し部分だけで済む。

ただし1つ注意がある。対話型モデルが自己申告する確信度は較正されていない。0.9と書いてあっても9割当たる保証はなく、根拠なく高い数字を出す傾向がある。較正を売りにしているJevの確信度とは別物だと思って、しきい値は手元の答え合わせで決めること。

使うかどうかの判断

同じ判定を毎日100件以上しているなら、待機リストに登録して自分のデータで測る価値がある。料金の桁が変わるので、件数が多いほど差が出る。

月に数十件なら、いまのモデルで足りる。呼び出し先を増やすと、APIキーの管理も監視も増える。件数の少ない判定のために増やす手間ではない。

私自身は待機リストに並んで、使えるようになったら問い合わせの振り分けで50件を手で答え合わせするつもりだ。その結果は、出たらこの記事に追記する。

出典(すべて2026年9月20日確認): TypeSafe AI「Introducing System One Models & Jev」(公式ブログ)、TypeSafe AI公式ドキュメント(System One、Quick Start)、gihyo.jp「TypeSafe AI、AIモデル「Jev」の早期提供を開始」、MarkTechPost「TypeSafe AI Releases Jev」、DEV Community「How to Use Jev」。

JevTypeSafe AI判定問い合わせ確信度