世界で話題の新AIスターJev、ひと言も話さないのにどう使う?
要約
OpenAIの元研究者Diogo AlmeidaがTypeSafe AIを創業し、文章を生成しない意思決定モデルJevを公開した。型付きの選択、スコア、確率によって、低遅延の自動化、ブラウザーエージェント、コンテキスト圧縮、モデルルーティングを狙う。

新しいモデルが次々と登場し、文章も会話もできることを競って証明している。しかし、いま最も注目を集め、ネットを席巻しているのは Jev だ。
Jev は話さない。
Diogo Almeida は OpenAI の元研究者で、ChatGPT の開発に携わり、その後、人間のフィードバックによる強化学習(RLHF)を提案した。
この手法は、ここ数年の大規模言語モデルの方向性をある意味で決定づけた。しかし業界を成長へ押し上げる一方で、Almeida は次第に疑問を抱くようになった。
「一度きりの成功した革新はあったが、それを本当に役立つものにはできなかった。」
問題の所在を理解するまでには時間がかかった。業界は人間の言語を処理する能力ばかり最適化してきた。4年間でその能力は大きく伸びたが、コンピューターが使う「言語」は異なるため、自動化にはあまり役立たなかったという。
2年前、Almeida は OpenAI を離れ、Erik Gafni、Sasha Sheng と TypeSafe AI を創業した。同社はステルス状態を続け、9月15日に DCVC 主導の4,000万ドルのシード調達と最初のモデル Jev を発表した。

Jev は Transformer ベースだが、意図的に大規模言語モデルではなく、完全な文章を出力しない。
プログラムの状態と事前定義した質問を渡すと、選択肢、スコア、0から1までの確率といった型付きの答えに、信頼度を添えて返す。
TypeSafe はこれを「校正された意思決定」と呼ぶ。Jev が初めて公開されたとき、多くの人が戸惑った理由でもある。

画像は、同じ依頼に対する Jev と大規模言語モデルの違いを示している。
AI界で最も注目されるモデルは ChatGPT と別の道を行く
Jev を理解するには、まず大規模言語モデルの発想を脇に置くとよい。
カスタマーサポートを例にしよう。顧客から「決済サービスに数日間つながらず、事業に影響が出ている」と連絡が来た場合、技術部門か請求部門か、不満の強さ、緊急性を判断する必要がある。
TypeSafe のインターフェースでは、同じリクエスト内の質問が一つの入力を共有しつつ、独立して並列評価される。分類と緊急度を同時に処理できる。

出力は3種類ある。Choice は利用者が定義した最大255項目の一覧から一つを選び、ルーティングや分類に向く。Score は指定した尺度で緊急度、品質、リスクを評価する。Noul は実質的な真偽判定で、数値が真である確率を示す。
すべての答えには確率分布と信頼度が付く。強く型付けされているため、JSON 用プロンプトや追加のパーサーは不要で、結果が突然 Markdown のコードブロックで包まれる心配もない。

直接的な利点は、時間と費用を抑え、自由生成に伴う形式エラーを減らせることだ。
TypeSafe によると、Jev のエンドツーエンド遅延は70~500ミリ秒で、同種の大規模言語モデルより20~200倍速い。

現在の公開価格は入力10億 token 当たり42ドル、100万 token 当たり0.042ドルで、出力は無料だ。質問や選択肢の説明は入力 token を消費するが、生成された答えの長さに応じた追加料金はない。

出力候補をあらかじめ定義するため、モデルが候補の外へ逸脱して幻覚を起こすことはない。ただし、候補の中から誤ったものを選ぶ可能性は残る。

公開された Ably Pong のデモでは、Jev が12秒間に47回の操作判断を行ったのに対し、Gemini、Claude、GPT は同じ時間で2~3回だった。後者の判断自体は大半が正しかった。
プログラムはボールの位置と方向、パドルの位置、ボールがパドルに到達するときの予測縦座標を Jev に渡す。Jev は「上へ、下へ、そのまま」の三択から選ぶ。

Jev の使い方
Jev で遊べる製品を作るには、ゲームプログラムとリアルタイム通信が必要だ。このプロジェクトではバックエンドがゲームを進めてモデルを呼び、Ably が新しい状態をブラウザーへ送る。ゲームのルール、画面、通信を Jev が作るのではなく、繰り返される三択の判断部分だけに Jev が組み込まれている。
速度は用途を広げる。Jev はコンピューター操作の判断層としてエージェントを高速に動かせるほか、情報の重要度を判定し、数百万 token のコンテキストを素早く絞り込む用途にも使える。
Browser Use の公開プロジェクト jev-ultrafast はブラウザーエージェントだ。各ページで操作可能な要素を読み、ボタン、入力欄、名称、現在値を番号付きの一覧にする。
Jev はこの構造化された状態、ユーザーの目標、操作履歴を受け取る。選択肢は、現在のページに実在する要素から動的に作られる。
Jev を操作判断層として使い、コンピューターを高速に操作する
航空券検索なら、「チューリヒからロンドンへの片道便を探し、指定日、人数、座席クラスを設定し、条件に合う結果が出たら停止する」といった目標になる。
各ラウンドで、次にクリック、入力、ドロップダウン選択、待機のどれを行うかを同時に尋ねる。クリックなら何番、入力なら何番かも聞く。質問は同じページ状態を共有するが、答えは別々だ。
最後に、選択した操作に対応する対象だけを使う。クリックが選ばれたならクリック対象を採用し、他の答えは一時的に無視する。
**都市名の入力が必要なときは、小さな文章生成モデルを別に呼び、目標と入力欄に基づいて文字列を作る。**ブラウザーが操作した後、新しいページ状態を読み直す。

Jev が情報の重要度を判断し、ほぼ瞬時にコンテキストを圧縮する
Vercel のソフトウェアエンジニア Pranit Sharma は、同社がコマンドの安全性を確認する分類器に OpenAI の ChatGPT Luna 5.6 を使っていたと説明した。Luna を Jev に置き換えると処理は5~18倍速くなり、精度も大きく向上したという。
Bryo AI の CTO Nikhil Mudholkar も、業務メール分類で Jev と Gemini を比較した。Gemini の精度はわずかに高かったが、費用は10~20倍だった。
同じ仕組みは自分でも構築できる。件名、本文、受信時刻、必要な文脈を含む表を用意し、処理を明確な質問へ分割する。
「注文が二重請求され、今日中に対応してほしい」というメールなら、Choice でサポート、営業、提携、その他のどのキューへ送るかを判断し、Noul で明示的な対応要求の有無を判定し、Score で優先度を付けられる。
Earendil の CTO Armin Ronacher は、「この方法は幻覚への対応責任の一部を利用者へ移す。確率が50%なら無視できるかもしれないが、95%なら利用できると判断する必要がある」と説明する。
別の用途はモデルルーティングだ。タスクに特定モデルが必要かを予測するのは有用だが、その判断に大規模言語モデルを使うと高価になる。安価で高速な Jev ならリアルタイムの振り分けが可能になる。
最も賢明な決断
Jev の名称は19世紀の経済学者 William Stanley Jevons に由来する。ジェボンズのパラドックスは、商品のコストが下がるほど利用量が増えることを示す。この場合、知性のコスト低下は知性の利用拡大につながる。
呼び出しが安くなれば、以前は費用に見合わなかった場所でも使われる。Almeida が描くのは巨大な少数のアプリが独占する未来ではなく、小さな知的判断が各所で動く、「現在の大型アプリより初期のインターネットに近い」未来だ。
TypeSafe は Jev の具体的なアーキテクチャを公開していない。外部では、オープンソースの大規模言語モデルを改変したものではないかと推測されている。
同社はこれを System One Models と呼ぶ。Daniel Kahneman の直感的思考の概念から取り、推論の連鎖ではなく直感的判断を重視し、特定タスク向けに調整するモデルだ。
複雑な判断は明確な質問に分け、すべてを一つのモデルへ任せるのではなく、コードで結果を組み合わせることを推奨している。
Almeida は、合成データを扱う道へ進むと早くから予測していたことが、会社の上場や実際の人間のフィードバックに依存すること以上に、人生で最も賢明な決断だったかもしれないと語った。
現在この路線を採る企業は TypeSafe だけだが、Ronacher は実用価値が検証されれば追随者が現れるとみる。TypeSafe も用途別のモデルを増やす計画だ。
前線研究所に当たるかと問われた Almeida は、「前線研究所の主な産物は恐怖か誇大宣伝だ。私たちの主な製品は知性であってほしい。無限の富や宗教的な物語、データセンター内で神を作ることに固執する研究所ではない」と答えた。
Jev 公開後は需要が予想を超え、API が一時応答できなくなった。ある利用者は過去3日分のニッチな情報フィードを読み、8つの質問を投げて誘導的な投稿や隠れ広告を除外した。実行は約2秒、1回0.007ドルだった。
別のチームはマーケティング分析全体に組み込み、Meta の広告ライブラリを走査し、広告形式ごとの寿命を比較し、撮影前に企画の競争力を評価した。人手による判断を30倍高速化し、費用を3ドル未満に抑えた。
AI の言葉は減ったが、ソフトウェアがこなす仕事は増えた。
仲間を募集しています
📮 履歴書送付先 hr@webcal.ai
✉️ メール件名「氏名+希望職種」(履歴書にプロジェクト、作品、関連リンクを添えてください)


編集チーム
Product Team @ WebCal
WebCalを支える公式プロダクトチームです。私たちは、高性能なコンピューティングインフラと分散型クラウドソリューションを構築しています。



