AI訓練模型

Jev

Jev是什麼 Jev 是 TypeSafe A...

標籤:

Jev是什麼

Jev 是 TypeSafe AI 推出的 AI 結構化決策模型,創始人是前 OpenAI 研究員 Diogo Almeida。Jev基於 Transformer 但不是大語言模型,不會輸出句子,而是在預設選項內返回類型化決策:Choice(選項)、Score(評分)、Noul(概率),附帶置信度。模型響應延遲約 70—500 毫秒,專用於 Agent 高頻判斷場景,如工具路由、工單分流、遊戲決策。

Jev

Jev的主要功能

  • Choice 選項決策:從預設的選項列表(最多 255 個)中選出最合適的一項,返回選項、概率分佈和置信度,適用於路由和分類。
  • Score 評分:將輸入按自定義量表(如 1–5 級)打分,返回分數、概率和置信度,用於衡量緊迫度、質量或風險等級。
  • Noul 是非判斷:對”這條陳述是否爲真”輸出一個 0–1 的概率值,適用於是否需要轉人工、是否需採取行動等二元判斷。
  • 並行多問題:一次 API 調用可同時混問多個問題,共享同一份輸入、獨立並行評估,加問題幾乎不增加延遲也不產生上下文腐化。
  • 置信度輸出:Choice 和 Score 附帶校準後的置信度評分,代碼可據此做分流——高置信自動執行、低置信升級大模型或轉人工。
  • 無幻覺類型化輸出:嚴格限定在用戶預設的選項和類型範圍內返回,無需 JSON 解析,杜絕格式錯誤和越界亂答。
  • 極低延遲:端到端響應約 70–500 毫秒,比同類大語言模型快 20–200 倍,支持每秒約 10 次的高頻決策循環。

Jev 的三種輸出形態

  • Choice(選項決策):從用戶預先定義的選項列表中(最多 255 個)選出最合適的一項,返回所選選項、各選項的概率分佈以及置信度,適用於路由、分類、工具選擇等”多選一”場景。
  • Score(量表評分):將輸入狀態按用戶劃定的評分量表打分,返回分數、各級別概率分佈和置信度,適用於緊迫度評估、質量評級、風險分級等”打幾分”場景。
  • Noul(是非判斷):對一條陳述是否爲真輸出一個 0–1 之間的概率值,不單獨返回置信度,適用”是否需要轉人工””是否要求採取行動”等二元判斷場景。

三者關係:可在同一次 API 調用中任意混用,共享同一份輸入狀態、並行獨立評估——加問題幾乎不增加延遲,也不會產生上下文腐化。

如何使用Jev

  • 註冊賬號:訪問Jev官網 https://console.typesafe.ai/ ,註冊可直接使用。
  • 獲取 API Key:在控制檯創建並複製 API Key,用於後續的接口調用鑑權。
  • 準備輸入狀態(State):把當前局面整理成結構化的文本或數據,如遊戲狀態、網頁元素清單、郵件內容等,Jev 看的是狀態描述而非原始畫面。
  • 定義問題(Questions):根據需求選用三種原語——Choice(選項決策)、Score(量表評分)、Noul(是非判斷),每個問題只問一件具體的事。
  • 發送請求調用:通過 REST API 或官方 SDK 發送請求,State 和多個問題放在同一次調用中,模型會並行評估所有問題。
  • 解析類型化結果:直接拿到選項/分數/概率及置信度等強類型結果,無需寫 JSON 提示詞或額外解析器,代碼可直接消費。
  • 用代碼組合多問題:把複雜判斷拆成多個原子問題後,用代碼邏輯加權組合各維度結果,而非讓模型在一次提問內權衡。
  • 接入置信度分流:根據返回的置信度設計策略,如高於 90% 自動執行、60–90% 升級調用大模型、低於 60% 轉人工。
  • 用自有數據校準驗證:上線自動決策規則前,先用業務數據檢驗模型概率與實際結果是否相符,不能只看單次置信度數值。
  • 與生成模型搭配使用:需要產出文字的場景(如填寫表單內容)另行調用生成模型,Jev 專職負責”選哪個”的高頻判斷環節。

Jev的核心優勢

  • 極致速度:端到端延遲僅 70–500 毫秒,比同類大語言模型快 20–200 倍,支持每秒約 10 次高頻決策循環。
  • 無格式幻覺:輸出嚴格限定在用戶預設的選項和類型範圍內,無需 JSON 解析,杜絕亂答和格式錯誤。
  • 校準置信度:返回經過校準的概率分佈和置信度評分,代碼可據此做自動執行、模型升級或人工介入的分流決策。
  • 並行多問題:一次調用可同時評估多個獨立問題,共享同一份輸入且幾乎不增加延遲、不產生上下文腐化。
  • 決策與生成解耦:把”判斷”從完整文本生成中剝離出來,避免爲大模型殺雞用牛刀,讓生成模型專注其擅長的文字產出。
  • 代碼可組合:原子化問題設計讓業務邏輯沉澱在代碼中,優先級變化只需改係數而非重寫 prompt,可控性和可維護性更強。
  • 語義理解通用:基於 Transformer 架構,具備通用語義理解能力,規則和候選頻繁變化時無需像傳統分類器那樣重新訓練。

Jev的同類競品對比

對比維度 Jev(System One 決策模型) Gemini 2.5 Flash(通用 LLM 做分類判斷)
模型本質 專爲決策訓練的分類模型,無文本生成能力 通用自迴歸多模態大模型,文本生成是主業
響應延遲 70–500 毫秒,穩定可預期 數百毫秒至數秒,受 prompt 長度和輸出 token 影響大
調用成本 輸入 0.042 美元/百萬 Token,輸出免費 輸入輸出雙向計費,綜合成本高 10–20 倍
分類準確率 社區實測商業郵件分類中略低於 Gemini 通用任務上準確率更高,語義理解更全面
輸出形態 類型化決策+概率分佈+校準置信度 自由文本或約束 JSON,無原生校準置信度
幻覺控制 嚴格限定預設選項,無格式幻覺 存在越界輸出、字段漂移的可能
多任務並行 一次調用並行評估多個獨立問題,零額外延遲 需串行多次調用或拼裝複雜 prompt,易上下文腐化
多模態能力 僅處理結構化文本狀態 原生支持圖文音視頻,可直接”看圖判斷”

Jev的應用場景

  • Agent 路由與工具調度:高頻判斷當前意圖該調用搜索、數據庫還是代碼執行,只從預設的有效 API 列表中選擇,消除幻覺工具名的同時用毫秒級響應支撐 Agent 的快速循環。
  • 客服工單分流:一次調用並行判斷工單的歸屬團隊、緊急程度和信息是否齊全,讓每天百萬級的郵件/工單以近乎零成本完成自動分診。
  • 遊戲與模擬決策:接收遊戲引擎輸出的結構化狀態,在預設動作集內以每秒約 10 次的速度高頻選招,驅動 DOOM、Mario 等遊戲的 AI 玩家。
  • 瀏覽器自動化:將頁面元素編號後由 Jev 逐步決定點擊哪個按鈕、填寫哪個輸入框,僅在需要產出文字時才轉調生成模型,實現查機票等任務十幾步操作僅數秒完成。
  • 上下文壓縮與模型路由:在百萬級 Token 的長上下文中判斷哪些信息關鍵、哪些可丟棄,並實時預測任務複雜度以決定派給輕量模型還是旗艦模型,實現成本與效果的最優分配。

數據統計

相關導航

暫無評論

暫無評論...