Jevの性能を公称値と外部の測定で突き合わせた。正解率91.7%、遅延421ミリ秒、確信度は当てになるか

2026-09-20AIの使い方

TypeSafe AIが公称している「193.6倍速い」は、同社が自分で作ったワークフローで測った数字だ。外部の人が測ると17倍から580倍までばらついた。速さの主張は方向としては合っているが、倍率はタスク次第で1桁変わる。

一方で、外から検証しにくいと思っていた確信度のほうは、公開されている再現可能なベンチマークで裏が取れていた。60件のうち間違えた5件は、すべて確信度が下がっていた。

以下は2026年9月20日に、公式ブログ、報道記事、公開されているベンチマークのリポジトリ、実際に動かした人の記事を読んで集めたものだ。私自身はまだ待機リストで、動かしていない。モデルの仕組みと料金は前に書いたJevの記事にある。

公称値は、他社モデルの答えを正解として測っている

TypeSafe AIが公開しているベンチマークは、4つのワークフロー(セキュリティ事案の対応、監視、請求書処理、カスタマーサービス)で作られている。この作りには2つの限定がついている。

1つ目は、正解の作り方だ。参照答えはGPT-6 AstraとClaude Fable 5.1の答えの平均で、人が作った正解ではない。つまり測っているのは「大きいモデルとどれだけ同じ答えを出すか」であって、業務上の正しさではない。

2つ目は、ワークフローをTypeSafe AIの担当チームが書いていることだ。自社のモデルが得意な形に寄る余地がある。報道記事もこの点を名指しで指摘していた。

その前提で公称値を見ると、一致率は67.8%、1件あたりの費用は0.0004ドル、遅延は0.4秒。比較対象のGPT-5.6 Terraは1件あたり0.0304ドル、遅延10.1秒だった。費用で76倍、遅延で25倍の差になる。よく引用される193.6倍という数字は、このうちの1件(0.114秒と8.566秒)から出ている。

構造化出力のエラー率という項目もあって、Jevは0%、GPT-5.6 Terraは0.58%、Claude Opus 5は5.73%と書かれている。この0%は「型が崩れない」という意味で、答えが合っている率ではない。

60件の手作業ラベルでは91.7%だった

外部の測定でいちばん作りが丁寧なのは、GitHubで公開されている再現可能なベンチマークだった。エージェントが呼び出す道具の危険度を4種類に分類させる課題で、60件を手作業でラベル付けしている。内訳は明らかに分かるものが34件、あいまいなものが14件、引っかけが12件。

難易度 件数 正解率
明らかに分かる 34 100%
あいまい 14 71.4%
引っかけ 12 91.7%
全体 60 91.7%(55/60)

引っかけよりあいまいな問題のほうが正解率が低い。これは人でも同じで、判断が割れる問題は割れる。遅延はp50で421.6ミリ秒、p95で542.0ミリ秒だった。公称の70〜500ミリ秒の上のほうに寄っている。

間違えた回答は、必ず確信度が下がっていた

このベンチマークのいちばんの収穫は、正解率ではなく確信度のほうだった。報告にはこう書かれている。間違えた回答には、すべて確信度の低下が伴っていた。確信度1.000を返して間違えたことは、全実行を通して一度もなかった。

これが本当なら、運用の設計が単純になる。確信度が1.000に近い回答はそのまま流し、下がっている回答だけ人が見ればいい。60件のうち人が見るべきは5件前後という計算になる。

なぜ確信度が当たるのかは、学習のしかたで説明されている。TypeSafe AIはRLCD(Reinforcement Learning for Calibrated Decisions)という方法を使っていて、確率そのものを正直に出すことを目的に学習させたとしている。対話型のモデルが自己申告する「確信度90%」とは作りが違う。あちらは文章の一部として数字を書いているだけで、較正されていない。

ただし、確かめられたのは60件の1つの課題でだ。自分の書類で同じ性質が出るかは、自分で数えるまで分からない。

日本の開発者が40回試した結果

実際に動かした報告も出ている。会話の要約を4段階に分類させる課題で、10件ずつ4パターン、合計40回を計測したものだ。

結果は、4パターンとも10回中10回が期待した段階に一致。中央値の遅延は0.643秒から0.674秒。1回あたりの費用は0.000025ドルから0.000027ドルで、日本円にすると1回0.004円ほどになる。比較対象では、Gemini 3.5 Flashが2.1秒、DeepSeek V4 Flashが7.2秒だった。3倍から11倍の差だ。

面白いのは確信度の出方で、simple、complex、reasoningの3段階では1.0を返したのに、mediumだけ0.57から0.67に下がっていた。人でも迷うのは中間だから、ここが下がるのは理屈に合っている。

つまずきも書かれていた。既存の振り分けの仕組みに組み込もうとして、接続先のURLとして/v1/systemoneを直接指定できず、その回は単体で呼び出す形に変えている。既存のライブラリが対話型モデルの作法を前提にしていると、そのままでは差し替えられない。

速さの倍率が17倍から580倍までばらつく理由

集めた数字を並べると、こうなる。

測った人 課題 Jevの速さ 比較対象
TypeSafe AI(自社) 4つのワークフロー 0.4秒 GPT-5.6 Terra 10.1秒
TypeSafe AI(自社) デモの1件 0.114秒 GPT-5.6 Terra 8.566秒
外部の抽出タスク 文章からの抽出 0.35秒 Claude Fable 5.1 8.83秒
外部の分類 会話の段階分け 0.65秒 Gemini 3.5 Flash 2.1秒
公開ベンチマーク 危険度の分類 0.42秒(p50) 比較なし

Jevの側は0.114秒から0.65秒で、5倍ほどの幅しかない。ばらついているのは比較対象のほうだ。Gemini 3.5 Flashの2.1秒とClaude Fable 5.1の8.83秒では4倍違う。だから倍率は、どのモデルと比べたかでほとんど決まる。

さらに、出力の長さが効く。対話型のモデルは文章を作るぶんだけ時間がかかるので、長い答えを求める課題ほど差が開く。抽出タスクで580倍という数字が出たのは、比較対象が長い文章を返していたからだと読める。自分の職場で何倍になるかは、自分の課題で測るしかない。

事務の仕事に引き写すとき

判定をモデルに任せるなら、測る件数の目安が要る。上のベンチマークは60件、開発者の検証は40件だった。私は50件を目安にしている。50件で誤りが2件なら4%で、そこから先は誤りの種類を見たほうが早い。

確信度を使った振り分けは、前のJevの記事に書いた3段階でいい。高い確信度はそのまま流し、中くらいは人が確認し、低いものは人が決める。境目の数字は、自分のデータで決める。上の40回の検証では、迷う段階だけ0.57から0.67に落ちていた。この幅が自分の書類でどこに出るかを見れば、しきい値はそこに置ける。

費用の桁は、事務の量ならどう転んでも小さい。1回0.004円なら、月300件で1.2円だ。9月のモデルの料金を並べた記事で計算したとおり、事務の仕事では料金より間違いを直す時間のほうが高くつく。だから確信度が当てになるかどうかが、料金より大事になる。

まだ分かっていないこと

日本語での精度は、公開されている測定の中に見つからなかった。上の検証は英語の課題が中心だ。日本語の書類で同じ正解率が出るかは確認していない。

長い文章を入れたときの挙動も分からない。公式のドキュメントに文脈の長さの上限が書かれておらず、探した範囲では見つからなかった。関係のない情報を入れるほど精度が落ちる、という記述はあった。

待機リストの進み方も分からない。申し込んでから使えるようになるまでの日数は、公表されていない。私の申し込みはまだ通っていない。使えるようになったら、問い合わせの振り分けで50件を数えて、この記事に追記する。

出典(すべて2026年9月20日確認): TypeSafe AI公式ブログ「Introducing System One Models & Jev」、DataCampによる技術解析記事、The Registerの報道、GitHubのthemsquared/jev-benchmark、クラスメソッドDevelopersIOの検証記事、MarkTechPostの記事。数字はそれぞれの出典に書かれていたもので、私が測ったものではない。

JevTypeSafe AIベンチマーク確信度判定