刷屏全球的 AI 新頂流 Jev,一句話都不說,到底怎麼玩?
內容摘要
前 OpenAI 研究員 Diogo Almeida 創辦 TypeSafe AI,推出不生成句子的決策模型 Jev。它透過強型別選擇、評分與機率輸出,瞄準低延遲自動化、瀏覽器代理、上下文壓縮和模型路由。

各類新模型層出不窮,恨不得向全世界證明自己能寫、能聊。然而,近期風頭最勁、刷屏全網的頂流,卻是 Jev。
它並不說話。
Diogo Almeida 是 OpenAI 的研究員,他參與了 ChatGPT 的研發工作,後來又提出了基於人類回饋的強化學習演算法(RLHF)。
這在某種程度上定義了過去幾年大型語言模型的走向。可是在這套方法把整個產業推向繁榮的同時,Almeida 卻對它越來越懷疑。
「我們有了一次性成功的創新,但沒有把它變成真正有用的東西。」
他花了很長時間才想明白問題出在哪裡:我們一直在最佳化人類語言的處理能力……四年來,我們在處理人類語言方面表現得非常出色,但這對自動化來說並沒有用,因為電腦使用的是不同的「語言」。
兩年前,Almeida 離開 OpenAI,和 Erik Gafni、Sasha Sheng 一起創辦 TypeSafe AI。公司一直處於隱身狀態,直到 9 月 15 日才正式亮相,同時帶來兩樣東西:由 DCVC 領投的 4,000 萬美元種子輪融資,以及第一個模型 Jev。

Jev 依然是一個基於 Transformer 的模型,但它刻意不是大型語言模型,也不會輸出完整句子。
你給它一段程式狀態和一個預先定義好的問題,它會回傳一個型別化答案:一個選項、一個分數,或一個介於 0 和 1 之間的機率,外加信心分數。
TypeSafe 把這種輸出稱為「校準後的決策」。這也是 Jev 第一次進入公眾視野時,許多人第一反應是困惑的原因。

截圖展示了 Jev 與大型語言模型面對相同請求時的表現差異。
AI 圈最火的模型,跟 ChatGPT 不是同一條路
要理解 Jev 在做什麼,不妨先放下大型語言模型的思維習慣。
換成客服場景就容易理解。使用者來訊表示,支付服務已連續幾天無法連線並影響生意。此時系統需要判斷:應該交給技術還是帳務團隊、對方有多不滿,以及事情是否緊急。
依照 TypeSafe 的介面設計,同一次請求中的問題共享一份輸入,但會獨立、平行評估,因此分類和緊急程度可以一起處理。

其輸出有三種基本形式。Choice 從使用者定義的清單中選出一項,最多支援 255 個選項,適合路由與分類。Score 將輸入放到指定尺度上評分,用來衡量緊迫程度、品質或風險。Noul 本質上是是非判斷,數字答案代表該敘述為真的機率。
每次回答都會附帶完整的機率分布與信心分數,結果具有強型別,不需要撰寫 JSON 提示詞、不需要額外解析器,也不用擔心模型突然把結果包進 Markdown 程式碼區塊。

這種方式最直接的好處是省時、省錢,也減少自由生成造成的格式錯誤。
TypeSafe 公布的數據顯示,Jev 的端到端延遲介於 70 至 500 毫秒,比同類大型語言模型快 20 至 200 倍。

依目前公開價格,輸入每十億 token 為 42 美元,亦即每百萬 token 0.042 美元;輸出免費。新增問題與選項說明仍會占用輸入 token,但不再依生成答案的長度另行收費。

由於使用者可以事先定義輸出結果,因此模型不會在選項範圍外產生幻覺。所謂 Jev 不會產生幻覺,是指它不會跳出預設選項亂答;在選項範圍內選錯仍然有可能。

在公開的 Ably Pong 展示中,Jev 在 12 秒內做出 47 次操作決策;Gemini、Claude 和 GPT 在同一時間只做出兩三次,儘管後者多數時候仍判斷正確。
程式會把遊戲數值直接交給 Jev:球的位置與運動方向、球拍位置,以及球到達球拍時預計所在的縱座標。Jev 再從「向上、向下、保持不動」三個選項中選一個。

Jev 有哪些使用方式
要用 Jev 做成可玩的產品,仍需要遊戲程式和即時通訊。上述專案由後端推進遊戲、呼叫模型,再透過 Ably 把新狀態傳給瀏覽器。換言之,遊戲規則、畫面與連線都不是 Jev 生成的;它只被插入反覆執行的三選一決策環節。
速度帶來了更多應用場景。Jev 可以充當電腦操作的決策層,協助代理快速執行指令;也可以做上下文壓縮,判斷哪些內容是關鍵資訊,迅速縮小上百萬 token 的上下文。
Browser Use 的公開專案 jev-ultrafast 實作的是瀏覽器代理。每到一個網頁,它先讀取目前可操作的元素,整理成帶編號清單:哪個是按鈕、哪個是輸入框、名稱是什麼、目前填了什麼。
Jev 取得這份結構化狀態、使用者目標與操作歷史。程式提供給它的選擇空間,也會依目前頁面實際存在的元素動態生成。
以查機票為例,目標可以是「尋找蘇黎世到倫敦的單程航班,設定指定日期、人數和艙等,出現符合條件的結果後停止」。
每一輪,程式會同時提出幾個問題:下一步應該點擊、輸入、選擇下拉選項,還是等待?如果點擊,應該點哪個編號?如果輸入,應該填哪個編號?這些問題共享同一份網頁狀態,但分別回答。
最後,程式只採用與實際操作相符的目標;如果選擇點擊,就使用點擊目標,其他答案暫時不用。
**遇到需要輸入城市名稱時,程式會另外呼叫一個生成文字的小模型,根據目標和目前輸入框產生要填寫的內容。**瀏覽器執行後,再讀取頁面的新狀態。

由 Jev 判斷上下文中的重要資訊,實現近乎即時的上下文壓縮
Vercel 軟體工程師 Pranit Sharma 表示,公司原本使用 OpenAI 的 ChatGPT Luna 5.6 執行分類器,檢查指令安全性。改用 Jev 後,處理速度提高 5 至 18 倍,準確性也大幅提升。
Bryo AI 的 CTO Nikhil Mudholkar 也測試了 Jev 和 Gemini 分類商務郵件的表現。Gemini 的準確率略高,但成本高出 10 至 20 倍。
我們也可以依這個思路自行搭建。先準備一張表,每列包含郵件主旨、內文、收到時間與必要上下文。
再把業務拆成幾個明確問題。例如郵件寫著「訂單被重複扣款,希望今天處理」,可用 Choice 判斷應進入售後、銷售、合作或其他佇列;用 Noul 判斷寄件者是否明確要求採取行動;再用 Score 判斷處理優先級。
Earendil 的 CTO Armin Ronacher 解釋:「歸根究柢,這種方式把處理幻覺的部分責任轉移給使用者。使用者需要決定:如果機率只有 50%,或許可以忽略;但如果達到 95%,就能利用它。」
Ronacher 表示,Jev 的另一個潛在應用是模型路由。預測某項任務是否需要特定模型很有用,但用大型語言模型完成這項判斷非常昂貴。Jev 成本低且速度快,因此可以實現即時路由。
最明智的決定
Jev 的名字取自 19 世紀經濟學家 William Stanley Jevons。Jevons 悖論指出,當某種商品的成本下降,人們會使用更多這種商品。在此情境下,智慧成本下降應會促使智慧被更廣泛地運用。
也就是說,呼叫一旦變便宜,就會被用到更多原本不值得使用的地方。Almeida 顯然很滿意這個類比。他設想的未來不是幾個龐大應用壟斷一切,而是大量微小的智慧判斷分散運行,「更像早期網際網路,而不是人們現在努力打造的大型應用」。
TypeSafe 至今未公開 Jev 的具體架構,外界普遍猜測它是在某個開源大型語言模型的基礎上改造而來。
公司把這類模型稱為 System One Models,名稱源自 Daniel Kahneman 對直覺思維的概念,強調依靠直覺判斷而非推理鏈,並針對具體任務專門調校。
官方建議把複雜判斷拆成數個明確問題,再由程式碼組合答案,而不是一次讓模型包辦所有工作。
Almeida 透露,他很早就預判自己會走上處理合成資料這條路;這或許是他一生最明智的決定,比公司上市更明智,甚至比依賴真實人類回饋更明智。
目前採取這條路線的公司只有 TypeSafe,但 Ronacher 預計,隨著實用價值逐漸獲得驗證,跟進者將陸續出現。TypeSafe 也計畫針對不同場景推出更多模型版本。
被問到公司是否算前沿實驗室時,Almeida 說:「前沿實驗室的主要產物不是恐懼,就是炒作。我希望我們的主要產品是智慧。我們不屬於那種一心創造無限財富、建構宗教式敘事,或試圖在資料中心造神的實驗室。」
Jev 上線後,需求一度超出預期,API 短暫無法回應。有人用它篩選小眾資訊流,讀取過去三天的相關貼文並提出八個問題;執行約兩秒,單次成本 0.007 美元,用來排除誘餌內容與隱藏廣告。
另有團隊把 Jev 接進整套行銷分析流程,掃描 Meta 廣告資料庫、比較不同廣告格式的存活週期,並在拍攝前評估創意腳本的競爭力。原本需要人工完成的判斷速度提升 30 倍,成本壓到 3 美元以內。
AI 少說了很多話,軟體卻多做了幾件事。
我們正在招募夥伴
📮 履歷投遞信箱hr@webcal.ai
✉️ 郵件主旨「姓名+職位名稱」(請隨履歷附上專案、作品或相關連結)


官方團隊
Product Team @ WebCal
WebCal 官方產品團隊。我們致力於構建高效能運算基礎設施與去中心化雲解決方案。



