Jev是什麼
Jev 是 TypeSafe AI 推出的 AI 結構化決策模型,創始人是前 OpenAI 研究員 Diogo Almeida。Jev基於 Transformer 但不是大語言模型,不會輸出句子,而是在預設選項內返回類型化決策:Choice(選項)、Score(評分)、Noul(概率),附帶置信度。模型響應延遲約 70—500 毫秒,專用於 Agent 高頻判斷場景,如工具路由、工單分流、遊戲決策。

Jev的主要功能
- Choice 選項決策:從預設的選項列表(最多 255 個)中選出最合適的一項,返回選項、概率分佈和置信度,適用於路由和分類。
- Score 評分:將輸入按自定義量表(如 1–5 級)打分,返回分數、概率和置信度,用於衡量緊迫度、質量或風險等級。
- Noul 是非判斷:對”這條陳述是否爲真”輸出一個 0–1 的概率值,適用於是否需要轉人工、是否需採取行動等二元判斷。
- 並行多問題:一次 API 調用可同時混問多個問題,共享同一份輸入、獨立並行評估,加問題幾乎不增加延遲也不產生上下文腐化。
- 置信度輸出:Choice 和 Score 附帶校準後的置信度評分,代碼可據此做分流——高置信自動執行、低置信升級大模型或轉人工。
- 無幻覺類型化輸出:嚴格限定在用戶預設的選項和類型範圍內返回,無需 JSON 解析,杜絕格式錯誤和越界亂答。
- 極低延遲:端到端響應約 70–500 毫秒,比同類大語言模型快 20–200 倍,支持每秒約 10 次的高頻決策循環。
Jev 的三種輸出形態
- Choice(選項決策):從用戶預先定義的選項列表中(最多 255 個)選出最合適的一項,返回所選選項、各選項的概率分佈以及置信度,適用於路由、分類、工具選擇等”多選一”場景。
- Score(量表評分):將輸入狀態按用戶劃定的評分量表打分,返回分數、各級別概率分佈和置信度,適用於緊迫度評估、質量評級、風險分級等”打幾分”場景。
- Noul(是非判斷):對一條陳述是否爲真輸出一個 0–1 之間的概率值,不單獨返回置信度,適用”是否需要轉人工””是否要求採取行動”等二元判斷場景。
三者關係:可在同一次 API 調用中任意混用,共享同一份輸入狀態、並行獨立評估——加問題幾乎不增加延遲,也不會產生上下文腐化。
如何使用Jev
- 註冊賬號:訪問Jev官網 https://console.typesafe.ai/ ,註冊可直接使用。
- 獲取 API Key:在控制檯創建並複製 API Key,用於後續的接口調用鑑權。
- 準備輸入狀態(State):把當前局面整理成結構化的文本或數據,如遊戲狀態、網頁元素清單、郵件內容等,Jev 看的是狀態描述而非原始畫面。
- 定義問題(Questions):根據需求選用三種原語——Choice(選項決策)、Score(量表評分)、Noul(是非判斷),每個問題只問一件具體的事。
- 發送請求調用:通過 REST API 或官方 SDK 發送請求,State 和多個問題放在同一次調用中,模型會並行評估所有問題。
- 解析類型化結果:直接拿到選項/分數/概率及置信度等強類型結果,無需寫 JSON 提示詞或額外解析器,代碼可直接消費。
- 用代碼組合多問題:把複雜判斷拆成多個原子問題後,用代碼邏輯加權組合各維度結果,而非讓模型在一次提問內權衡。
- 接入置信度分流:根據返回的置信度設計策略,如高於 90% 自動執行、60–90% 升級調用大模型、低於 60% 轉人工。
- 用自有數據校準驗證:上線自動決策規則前,先用業務數據檢驗模型概率與實際結果是否相符,不能只看單次置信度數值。
- 與生成模型搭配使用:需要產出文字的場景(如填寫表單內容)另行調用生成模型,Jev 專職負責”選哪個”的高頻判斷環節。
Jev的核心優勢
- 極致速度:端到端延遲僅 70–500 毫秒,比同類大語言模型快 20–200 倍,支持每秒約 10 次高頻決策循環。
- 無格式幻覺:輸出嚴格限定在用戶預設的選項和類型範圍內,無需 JSON 解析,杜絕亂答和格式錯誤。
- 校準置信度:返回經過校準的概率分佈和置信度評分,代碼可據此做自動執行、模型升級或人工介入的分流決策。
- 並行多問題:一次調用可同時評估多個獨立問題,共享同一份輸入且幾乎不增加延遲、不產生上下文腐化。
- 決策與生成解耦:把”判斷”從完整文本生成中剝離出來,避免爲大模型殺雞用牛刀,讓生成模型專注其擅長的文字產出。
- 代碼可組合:原子化問題設計讓業務邏輯沉澱在代碼中,優先級變化只需改係數而非重寫 prompt,可控性和可維護性更強。
- 語義理解通用:基於 Transformer 架構,具備通用語義理解能力,規則和候選頻繁變化時無需像傳統分類器那樣重新訓練。
Jev的同類競品對比
| 對比維度 | Jev(System One 決策模型) | Gemini 2.5 Flash(通用 LLM 做分類判斷) |
|---|---|---|
| 模型本質 | 專爲決策訓練的分類模型,無文本生成能力 | 通用自迴歸多模態大模型,文本生成是主業 |
| 響應延遲 | 70–500 毫秒,穩定可預期 | 數百毫秒至數秒,受 prompt 長度和輸出 token 影響大 |
| 調用成本 | 輸入 0.042 美元/百萬 Token,輸出免費 | 輸入輸出雙向計費,綜合成本高 10–20 倍 |
| 分類準確率 | 社區實測商業郵件分類中略低於 Gemini | 通用任務上準確率更高,語義理解更全面 |
| 輸出形態 | 類型化決策+概率分佈+校準置信度 | 自由文本或約束 JSON,無原生校準置信度 |
| 幻覺控制 | 嚴格限定預設選項,無格式幻覺 | 存在越界輸出、字段漂移的可能 |
| 多任務並行 | 一次調用並行評估多個獨立問題,零額外延遲 | 需串行多次調用或拼裝複雜 prompt,易上下文腐化 |
| 多模態能力 | 僅處理結構化文本狀態 | 原生支持圖文音視頻,可直接”看圖判斷” |
Jev的應用場景
-
Agent 路由與工具調度:高頻判斷當前意圖該調用搜索、數據庫還是代碼執行,只從預設的有效 API 列表中選擇,消除幻覺工具名的同時用毫秒級響應支撐 Agent 的快速循環。
-
客服工單分流:一次調用並行判斷工單的歸屬團隊、緊急程度和信息是否齊全,讓每天百萬級的郵件/工單以近乎零成本完成自動分診。
-
遊戲與模擬決策:接收遊戲引擎輸出的結構化狀態,在預設動作集內以每秒約 10 次的速度高頻選招,驅動 DOOM、Mario 等遊戲的 AI 玩家。
-
瀏覽器自動化:將頁面元素編號後由 Jev 逐步決定點擊哪個按鈕、填寫哪個輸入框,僅在需要產出文字時才轉調生成模型,實現查機票等任務十幾步操作僅數秒完成。
-
上下文壓縮與模型路由:在百萬級 Token 的長上下文中判斷哪些信息關鍵、哪些可丟棄,並實時預測任務複雜度以決定派給輕量模型還是旗艦模型,實現成本與效果的最優分配。
數據統計
相關導航
暫無評論...
