전 세계를 휩쓴 AI 신흥 강자 Jev, 한마디도 하지 않는데 어떻게 쓸까?
요약
OpenAI 출신 연구원 Diogo Almeida가 TypeSafe AI를 설립하고 문장을 생성하지 않는 의사결정 모델 Jev를 공개했다. 형식화된 선택, 점수, 확률을 통해 저지연 자동화, 브라우저 에이전트, 컨텍스트 압축, 모델 라우팅을 겨냥한다.

새 모델들이 끊임없이 등장하며 글을 쓰고 대화할 수 있다는 점을 증명하려 한다. 하지만 최근 인터넷을 휩쓴 가장 뜨거운 모델은 Jev다.
Jev는 말을 하지 않는다.
Diogo Almeida는 OpenAI 연구원으로 ChatGPT 개발에 참여했고, 이후 인간 피드백 기반 강화학습(RLHF)을 제안했다.
이 방식은 지난 몇 년간 대규모 언어 모델의 방향을 어느 정도 규정했다. 그러나 이 방법이 업계를 호황으로 이끄는 동안 Almeida는 점점 더 의문을 품었다.
“한 번의 성공적인 혁신은 있었지만, 그것을 진정으로 유용한 것으로 만들지는 못했다.”
그는 문제를 파악하는 데 오랜 시간이 걸렸다고 말했다. 업계는 인간 언어 처리 능력을 계속 최적화했고 4년 동안 매우 뛰어난 수준에 도달했지만, 컴퓨터는 다른 ‘언어’를 사용하기 때문에 자동화에는 그다지 유용하지 않았다는 것이다.
2년 전 Almeida는 OpenAI를 떠나 Erik Gafni, Sasha Sheng과 TypeSafe AI를 설립했다. 회사는 잠행을 이어가다 9월 15일 DCVC가 주도한 4,000만 달러 규모의 시드 투자와 첫 모델 Jev를 공개했다.

Jev는 Transformer 기반이지만 의도적으로 대규모 언어 모델이 아니며 완전한 문장을 출력하지 않는다.
프로그램 상태와 미리 정의한 질문을 주면 선택지, 점수, 0과 1 사이의 확률 같은 형식화된 답과 신뢰도 점수를 반환한다.
TypeSafe는 이를 ‘보정된 결정’이라고 부른다. Jev가 처음 대중에게 알려졌을 때 많은 사람이 혼란스러워한 이유이기도 하다.

이미지는 동일한 요청에 대한 Jev와 대규모 언어 모델의 결과를 비교한다.
AI 업계에서 가장 뜨거운 모델은 ChatGPT와 다른 길을 간다
Jev가 무엇을 하는지 이해하려면 대규모 언어 모델의 익숙한 사고방식을 잠시 내려놓는 편이 좋다.
고객 지원 상황을 생각해 보자. 고객이 결제 서비스에 며칠째 접속하지 못해 사업에 지장이 있다고 알렸다. 시스템은 기술팀과 청구팀 중 어디로 보낼지, 불만이 어느 정도인지, 사안이 긴급한지를 판단해야 한다.
TypeSafe 인터페이스에서는 같은 요청의 질문들이 하나의 입력을 공유하지만 독립적으로 병렬 평가된다. 분류와 긴급도를 동시에 처리할 수 있다.

출력은 세 가지다. Choice는 사용자가 정의한 최대 255개의 목록에서 하나를 골라 라우팅과 분류에 활용한다. Score는 지정한 척도에서 긴급성, 품질, 위험을 평가한다. Noul은 참과 거짓을 판정하며 숫자는 해당 명제가 참일 확률을 뜻한다.
각 답에는 전체 확률 분포와 신뢰도가 포함된다. 강한 타입의 결과이므로 JSON 프롬프트나 별도의 파서가 필요 없고, 모델이 갑자기 결과를 Markdown 코드 블록으로 감싸는 문제도 없다.

가장 직접적인 장점은 시간과 비용을 줄이고 자유 생성에서 생기는 형식 오류를 줄이는 것이다.
TypeSafe가 공개한 수치에 따르면 Jev의 종단 간 지연 시간은 70500밀리초로, 유사한 대규모 언어 모델보다 20200배 빠르다.

현재 공개 가격은 입력 10억 token당 42달러, 즉 100만 token당 0.042달러이며 출력은 무료다. 질문과 선택지 설명은 입력 token을 사용하지만 생성 답변 길이에 따른 추가 요금은 없다.

사용자가 가능한 출력을 미리 정의하므로 모델은 그 범위 밖의 답을 지어내지 않는다. 다만 ‘환각이 없다’는 말은 선택지 밖으로 벗어나지 않는다는 뜻이며, 범위 안에서 잘못 고를 가능성은 남아 있다.

공개된 Ably Pong 시연에서 Jev는 12초 동안 47번의 조작 결정을 내렸다. Gemini, Claude, GPT는 같은 시간에 두세 번만 결정했지만 대부분의 판단은 정확했다.
프로그램은 공의 위치와 방향, 패들의 위치, 공이 패들에 도달할 때 예상되는 세로 좌표를 Jev에 직접 전달한다. Jev는 ‘위로, 아래로, 그대로’ 중 하나를 선택한다.

Jev를 활용하는 방법
Jev로 실제 게임을 만들려면 게임 프로그램과 실시간 통신이 여전히 필요하다. 위 프로젝트에서는 백엔드가 게임을 진행하고 모델을 호출하며 Ably가 새 상태를 브라우저에 보낸다. 게임 규칙, 화면, 네트워크를 Jev가 만드는 것이 아니라 반복되는 3지선다 결정 단계에만 Jev가 들어간다.
속도는 활용 범위를 넓힌다. Jev는 컴퓨터 조작의 판단 계층으로 에이전트가 지시를 빠르게 실행하도록 돕고, 중요한 정보를 가려내 수백만 token의 컨텍스트를 신속히 압축할 수도 있다.
Browser Use의 공개 프로젝트 jev-ultrafast는 브라우저 에이전트다. 페이지마다 조작 가능한 요소를 읽고 버튼, 입력란, 이름, 현재 값을 번호 목록으로 정리한다.
Jev는 구조화된 상태, 사용자 목표, 조작 기록을 받는다. 가능한 선택지는 현재 페이지에 실제로 존재하는 요소를 기준으로 동적으로 만들어진다.
Jev를 조작 판단 계층으로 사용해 컴퓨터를 빠르게 제어하기
항공권 검색이라면 “취리히에서 런던으로 가는 편도 항공편을 찾고 날짜, 인원, 좌석 등급을 설정한 뒤 조건에 맞는 결과가 나타나면 중지한다”는 목표를 줄 수 있다.
매 단계에서 클릭, 입력, 드롭다운 선택, 대기 중 무엇을 할지 동시에 묻는다. 클릭한다면 몇 번 요소인지, 입력한다면 몇 번 입력란인지도 묻는다. 질문은 같은 페이지 상태를 공유하지만 각각 답한다.
프로그램은 선택된 동작과 맞는 대상만 사용한다. 클릭이 선택되면 클릭 대상만 쓰고 다른 답은 잠시 무시한다.
도시명을 입력해야 할 때는 작은 텍스트 생성 모델을 따로 호출해 목표와 현재 입력란에 맞는 내용을 만든다. 브라우저가 실행한 뒤 새 페이지 상태를 다시 읽는다.

Jev로 정보의 중요도를 판단해 컨텍스트를 거의 즉시 압축하기
Vercel의 소프트웨어 엔지니어 Pranit Sharma는 명령 안전성을 확인하는 분류기에 OpenAI의 ChatGPT Luna 5.6을 사용했다고 밝혔다. Luna를 Jev로 교체하자 처리 속도가 5~18배 빨라지고 정확도도 크게 향상됐다.
Bryo AI의 CTO Nikhil Mudholkar도 업무 이메일 분류에서 Jev와 Gemini를 비교했다. Gemini의 정확도가 조금 높았지만 비용은 10~20배 더 들었다.
같은 방식은 직접 구축할 수 있다. 제목, 본문, 수신 시간, 필요한 맥락이 담긴 표를 만들고 업무를 명확한 질문으로 나눈다.
“주문이 두 번 결제됐으니 오늘 처리해 달라”는 메일이라면 Choice로 지원, 영업, 제휴, 기타 대기열 중 어디로 보낼지 정하고, Noul로 발신자가 명시적으로 행동을 요청했는지 판단하며, Score로 우선순위를 매길 수 있다.
Earendil의 CTO Armin Ronacher는 “결국 이 방식은 환각 처리 책임 일부를 사용자에게 옮긴다. 확률이 50%라면 무시할 수 있지만 95%라면 활용할 수 있다고 결정해야 한다”고 설명했다.
또 다른 잠재적 용도는 모델 라우팅이다. 특정 작업에 어떤 모델이 필요한지 예측하는 일은 유용하지만 대규모 언어 모델로 판단하면 비싸다. Jev는 저렴하고 빨라 실시간 라우팅이 가능하다.
가장 현명한 결정
Jev라는 이름은 19세기 경제학자 William Stanley Jevons에서 따왔다. 제번스의 역설은 상품 가격이 내려가면 사용량이 늘어난다고 말한다. 이 경우 지능 비용의 하락은 지능의 더 폭넓은 활용으로 이어질 수 있다.
호출이 저렴해지면 예전에는 비용이 아까웠던 곳에도 쓰인다. Almeida가 그리는 미래는 소수의 거대한 앱이 모든 것을 독점하는 모습이 아니라, 작은 지능형 판단이 곳곳에서 실행되는 “오늘날의 대형 앱보다 초기 인터넷에 가까운” 모습이다.
TypeSafe는 Jev의 구체적인 아키텍처를 공개하지 않았다. 외부에서는 오픈소스 대규모 언어 모델을 개조했을 것으로 추측한다.
회사는 이를 System One Models라고 부른다. Daniel Kahneman의 직관적 사고 개념에서 이름을 따와 추론 사슬보다 직관적 판단을 강조하고, 특정 작업에 맞춰 조정한다.
복잡한 판단은 명확한 질문 여러 개로 나눈 뒤 코드에서 결과를 조합하고, 하나의 모델에 전부 맡기지 말라고 권한다.
Almeida는 합성 데이터를 다루는 길로 갈 것을 일찍 예상한 일이 회사 상장이나 실제 인간 피드백에 의존하는 것보다도 현명한, 인생 최고의 결정이었을지 모른다고 말했다.
현재 이 노선을 택한 회사는 TypeSafe뿐이지만 Ronacher는 실용성이 검증되면 후발 주자가 나타날 것으로 본다. TypeSafe도 다양한 용도에 맞춘 모델을 더 내놓을 계획이다.
회사가 프런티어 연구소냐는 질문에 Almeida는 “프런티어 연구소의 주요 산출물은 공포나 과장이다. 우리의 주력 제품은 지능이길 바란다. 무한한 부, 종교적 서사, 데이터센터 안의 신을 만들려는 연구소가 아니다”라고 답했다.
Jev 출시 후 수요가 예상을 넘어 API가 잠시 응답하지 못했다. 한 사용자는 지난 3일간의 틈새 정보 피드를 읽고 8개 질문을 던져 낚시성 콘텐츠와 숨은 광고를 걸러냈다. 실행 시간은 약 2초, 비용은 0.007달러였다.
다른 팀은 Jev를 마케팅 분석 전체에 연결해 Meta 광고 라이브러리를 스캔하고 광고 형식별 수명을 비교하며 촬영 전 아이디어의 경쟁력을 평가했다. 사람이 하던 판단을 30배 빠르게 처리하고 비용을 3달러 아래로 낮췄다.
AI는 훨씬 적게 말했지만 소프트웨어는 더 많은 일을 해냈다.
함께할 동료를 모집합니다
📮 이력서 접수 이메일 hr@webcal.ai
✉️ 이메일 제목 “이름 + 지원 직무” (이력서에 프로젝트, 포트폴리오 또는 관련 링크를 첨부해 주세요.)


편집팀
Product Team @ WebCal
WebCal 공식 제품팀입니다. 우리는 고성능 컴퓨팅 인프라와 탈중앙화 클라우드 솔루션을 구축합니다.



