TypeSafe AIが公称している「193.6倍速い」は、同社が自分で作ったワークフローで測った数字だ。外部の人が測ると17倍から580倍までばらついた。速さの主張は方向としては合っているが、倍率はタスク次第で1桁変わる。
一方で、外から検証しにくいと思っていた確信度のほうは、公開されている再現可能なベンチマークで裏が取れていた。60件のうち間違えた5件は、すべて確信度が下がっていた。
以下は2026年9月20日に、公式ブログ、報道記事、公開されているベンチマークのリポジトリ、実際に動かした人の記事を読んで集めたものだ。私自身はまだ待機リストで、動かしていない。モデルの仕組みと料金は前に書いたJevの記事にある。
公称値は、他社モデルの答えを正解として測っている
TypeSafe AIが公開しているベンチマークは、4つのワークフロー(セキュリティ事案の対応、監視、請求書処理、カスタマーサービス)で作られている。この作りには2つの限定がついている。
1つ目は、正解の作り方だ。参照答えはGPT-6 AstraとClaude Fable 5.1の答えの平均で、人が作った正解ではない。つまり測っているのは「大きいモデルとどれだけ同じ答えを出すか」であって、業務上の正しさではない。
2つ目は、ワークフローをTypeSafe AIの担当チームが書いていることだ。自社のモデルが得意な形に寄る余地がある。報道記事もこの点を名指しで指摘していた。
その前提で公称値を見ると、一致率は67.8%、1件あたりの費用は0.0004ドル、遅延は0.4秒。比較対象のGPT-5.6 Terraは1件あたり0.0304ドル、遅延10.1秒だった。費用で76倍、遅延で25倍の差になる。よく引用される193.6倍という数字は、このうちの1件(0.114秒と8.566秒)から出ている。
構造化出力のエラー率という項目もあって、Jevは0%、GPT-5.6 Terraは0.58%、Claude Opus 5は5.73%と書かれている。この0%は「型が崩れない」という意味で、答えが合っている率ではない。
60件の手作業ラベルでは91.7%だった
外部の測定でいちばん作りが丁寧なのは、GitHubで公開されている再現可能なベンチマークだった。エージェントが呼び出す道具の危険度を4種類に分類させる課題で、60件を手作業でラベル付けしている。内訳は明らかに分かるものが34件、あいまいなものが14件、引っかけが12件。
| 難易度 | 件数 | 正解率 |
|---|---|---|
| 明らかに分かる | 34 | 100% |
| あいまい | 14 | 71.4% |
| 引っかけ | 12 | 91.7% |
| 全体 | 60 | 91.7%(55/60) |
引っかけよりあいまいな問題のほうが正解率が低い。これは人でも同じで、判断が割れる問題は割れる。遅延はp50で421.6ミリ秒、p95で542.0ミリ秒だった。公称の70〜500ミリ秒の上のほうに寄っている。
間違えた回答は、必ず確信度が下がっていた
このベンチマークのいちばんの収穫は、正解率ではなく確信度のほうだった。報告にはこう書かれている。間違えた回答には、すべて確信度の低下が伴っていた。確信度1.000を返して間違えたことは、全実行を通して一度もなかった。
これが本当なら、運用の設計が単純になる。確信度が1.000に近い回答はそのまま流し、下がっている回答だけ人が見ればいい。60件のうち人が見るべきは5件前後という計算になる。
なぜ確信度が当たるのかは、学習のしかたで説明されている。TypeSafe AIはRLCD(Reinforcement Learning for Calibrated Decisions)という方法を使っていて、確率そのものを正直に出すことを目的に学習させたとしている。対話型のモデルが自己申告する「確信度90%」とは作りが違う。あちらは文章の一部として数字を書いているだけで、較正されていない。
ただし、確かめられたのは60件の1つの課題でだ。自分の書類で同じ性質が出るかは、自分で数えるまで分からない。
日本の開発者が40回試した結果
実際に動かした報告も出ている。会話の要約を4段階に分類させる課題で、10件ずつ4パターン、合計40回を計測したものだ。
結果は、4パターンとも10回中10回が期待した段階に一致。中央値の遅延は0.643秒から0.674秒。1回あたりの費用は0.000025ドルから0.000027ドルで、日本円にすると1回0.004円ほどになる。比較対象では、Gemini 3.5 Flashが2.1秒、DeepSeek V4 Flashが7.2秒だった。3倍から11倍の差だ。
面白いのは確信度の出方で、simple、complex、reasoningの3段階では1.0を返したのに、mediumだけ0.57から0.67に下がっていた。人でも迷うのは中間だから、ここが下がるのは理屈に合っている。
つまずきも書かれていた。既存の振り分けの仕組みに組み込もうとして、接続先のURLとして/v1/systemoneを直接指定できず、その回は単体で呼び出す形に変えている。既存のライブラリが対話型モデルの作法を前提にしていると、そのままでは差し替えられない。
速さの倍率が17倍から580倍までばらつく理由
集めた数字を並べると、こうなる。
| 測った人 | 課題 | Jevの速さ | 比較対象 |
|---|---|---|---|
| TypeSafe AI(自社) | 4つのワークフロー | 0.4秒 | GPT-5.6 Terra 10.1秒 |
| TypeSafe AI(自社) | デモの1件 | 0.114秒 | GPT-5.6 Terra 8.566秒 |
| 外部の抽出タスク | 文章からの抽出 | 0.35秒 | Claude Fable 5.1 8.83秒 |
| 外部の分類 | 会話の段階分け | 0.65秒 | Gemini 3.5 Flash 2.1秒 |
| 公開ベンチマーク | 危険度の分類 | 0.42秒(p50) | 比較なし |
Jevの側は0.114秒から0.65秒で、5倍ほどの幅しかない。ばらついているのは比較対象のほうだ。Gemini 3.5 Flashの2.1秒とClaude Fable 5.1の8.83秒では4倍違う。だから倍率は、どのモデルと比べたかでほとんど決まる。
さらに、出力の長さが効く。対話型のモデルは文章を作るぶんだけ時間がかかるので、長い答えを求める課題ほど差が開く。抽出タスクで580倍という数字が出たのは、比較対象が長い文章を返していたからだと読める。自分の職場で何倍になるかは、自分の課題で測るしかない。
事務の仕事に引き写すとき
判定をモデルに任せるなら、測る件数の目安が要る。上のベンチマークは60件、開発者の検証は40件だった。私は50件を目安にしている。50件で誤りが2件なら4%で、そこから先は誤りの種類を見たほうが早い。
確信度を使った振り分けは、前のJevの記事に書いた3段階でいい。高い確信度はそのまま流し、中くらいは人が確認し、低いものは人が決める。境目の数字は、自分のデータで決める。上の40回の検証では、迷う段階だけ0.57から0.67に落ちていた。この幅が自分の書類でどこに出るかを見れば、しきい値はそこに置ける。
費用の桁は、事務の量ならどう転んでも小さい。1回0.004円なら、月300件で1.2円だ。9月のモデルの料金を並べた記事で計算したとおり、事務の仕事では料金より間違いを直す時間のほうが高くつく。だから確信度が当てになるかどうかが、料金より大事になる。
まだ分かっていないこと
日本語での精度は、公開されている測定の中に見つからなかった。上の検証は英語の課題が中心だ。日本語の書類で同じ正解率が出るかは確認していない。
長い文章を入れたときの挙動も分からない。公式のドキュメントに文脈の長さの上限が書かれておらず、探した範囲では見つからなかった。関係のない情報を入れるほど精度が落ちる、という記述はあった。
待機リストの進み方も分からない。申し込んでから使えるようになるまでの日数は、公表されていない。私の申し込みはまだ通っていない。使えるようになったら、問い合わせの振り分けで50件を数えて、この記事に追記する。
出典(すべて2026年9月20日確認): TypeSafe AI公式ブログ「Introducing System One Models & Jev」、DataCampによる技術解析記事、The Registerの報道、GitHubのthemsquared/jev-benchmark、クラスメソッドDevelopersIOの検証記事、MarkTechPostの記事。数字はそれぞれの出典に書かれていたもので、私が測ったものではない。



