Laya是什麼
Laya 是開源的非自迴歸AI決策模型,模型不做文本生成,基於 ModernBERT/mmBERT 雙向編碼器,對一段文本加類型化問題只做一次前向傳播,約 33ms 輸出結構化結果與校準概率。模型內置語言路由支持 100+ 語言。相比閉源模型Jev,Laya在準確率(76.6% vs 72.7%)、多語言支持(100+語言)和成本(本地部署免費)上更具優勢。

Laya的主要功能
-
單次前向決策:輸入一段狀態加一組類型化問題,一次前向傳播直接返回結構化結果,不做文本生成,約 33ms。
-
三種決策原語:choice 從候選項中選一個並給出各項概率;score 在有序量表上打分並給出分佈;noul 回答是非問題並返回 0–1 的成立概率。
-
語言自動路由:Router 在 <0.5ms 內檢測輸入腳本與語言,自動分發到英文或多語言 checkpoint,避免選錯模型導致”自信地答錯”。
-
置信度門控:概率經 RLCD 訓練具備統計意義,可按閾值把高置信決策自動放行、低置信轉人工。
-
內置工作流預設:提供模型路由、提示注入防護、內容安全審覈、工單分診等預置問題模板,開箱即用。
-
本地微調:附帶 Kaggle notebook,支持用自有數據完成造數據、RLCD 訓練、溫度擬合、評測的完整微調流程。
Laya的技術原理
- 雙向非自迴歸架構:基於 ModernBERT-large(421M)或 mmBERT-base(322M)雙向編碼器,輸入 token 同時可見前後文;推理時不逐字生成文本,而是爲每個候選選項分配獨立 [MASK] 位,一次前向輸出所有選項的 logits,經 Softmax 歸一化爲概率分佈——這是 33ms 級延遲的來源。
- RLCD 強化學習訓練:以對數評分、球面評分、等級概率評分等嚴格真評分規則作爲獎勵,模型只有在輸出真實後驗概率時才能獲得高分,不確定時置信度自然降低,避免傳統大模型”盲目自信”的問題。
- 語言路由機制:Router 在 forward 之前用純 Python 檢測 Unicode 字符集與語言,據此選擇 checkpoint;因爲英文 checkpoint 在非拉丁文字上會以 0.95 置信度給出 0 準確率的答案,置信度本身無法預警,所以路由決策必須在推理前完成。
- 概率校準:出廠 checkpoint 存在過度自信,需按(問題類型、選項數)在自有數據上擬合溫度;擬合後平均 ECE 可從 0.466 降至 0.081,此時概率纔可直接用於自動放行決策。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Laya
- 安裝:
pip install laya,PyPI 包,兩天內從 0.1.0 更到 0.3.4,注意接口仍在變動。 - 加載模型:
Router(preload=True)預加載三個 checkpoint,避免冷啓動時每次切語言重建模型。 - 準備狀態:把要分析的文本組裝成 dict,如
{"from": ..., "subject": ..., "body": ...},支持任意語言或 JSON 結構。 - 定義問題:用 JSON 寫一組類型化問題,指定 type(choice / score / noul)、instructions 和 criteria(選項或量表)。
- 執行預測:調用
router.predict(state, questions),一次前向傳播返回所有答案,英文走 laya、 Hindi 等自動走 multilingual。 - 讀取結果:從
res["answers"]取 choice 標籤、score 分值或 noul 概率,res["routing"]會解釋爲什麼選了這個 checkpoint。 - 置信度門控:對
confidence設閾值(如 0.85),高置信自動處理、低置信轉人工——但前提是先在自己的數據上做過溫度擬合。
Laya的核心優勢
-
極速推理:單次前向傳播約 33ms(T4),批量低至 7.2ms/題,比閉源的 TypeSafe Jev 快約 7.8 倍。
-
零幻覺風險:不生成文本、只輸出結構化決策,沒有解析負擔,也不存在編造內容的問題。
-
概率可校準:經 RLCD 嚴格真評分規則訓練,置信度有統計意義,可直接驅動自動放行/人工複覈流程。
-
校準精度領先:溫度擬合後 ECE 僅 0.081,優於 Jev 的 0.246,typed-decisions 準確率 0.766 也超過 Jev 的 0.727。
-
多語言路由:內置 Router 亞毫秒級識別 100+ 語言並自動選 checkpoint,避免英文模型在非拉丁文字上”自信地答錯”。
-
完全開源零成本:Apache-2.0 協議、權重開放、可自託管,對比 Jev 的 $0.042/百萬 token API 費用,長期使用成本爲零。
-
輸出類型化:choice / score / noul 三種原語覆蓋分類、打分、是非判斷絕大多數結構化決策場景。
Laya的項目地址
- GitHub倉庫:https://github.com/NandhaKishorM/laya
- HuggingFace模型庫:https://huggingface.co/convaiinnovations/laya
Laya的同類競品對比
| 維度 | Laya(開源) | TypeSafe Jev |
|---|---|---|
| 協議/權重 | Apache-2.0,權重完全開放 | 閉源,僅 API 調用 |
| 延遲(單題) | 32.8 ms(T4 實測) | 236–276 ms p50(第三方實測) |
| typed-decisions 準確率 | 0.766(微調版) | 0.727 |
| ECE 校準誤差 | 0.081(溫度擬合後) | 0.246 |
| Banking77 高基數分類 | 0.425(77 選項,弱) | 0.870(72 選項,強) |
| 語言覆蓋 | 100+ 語言,Router 自動分發 | 無公開多語言基準 |
| 成本 | 自託管 $0 | $0.042 / 1M tokens |
| 數據隱私 | 可完全本地跑,數據不出境 | 需上傳至第三方 API |
| 軟分佈匹配(soft acc) | 0.471 | 0.580(更貼合教師分佈) |
| 開箱即用性 | 基礎模型零樣本接近隨機,需微調 | 商用 API,默認即可用 |
Laya的應用場景
- 客服工單自動分診:判斷部門歸屬(billing/technical/sales)、緊急程度、用戶挫敗感和流失風險,高置信自動派單、低置信轉人工。
- 內容安全與審覈:檢測毒性、騷擾、威脅內容,noul 原語輸出違規概率,適合社區和 UGC 平台實時審覈。
- 提示注入防護(Guardrails):在 Agent 系統入口檢測越獄、注入、密鑰泄露等攻擊,33ms 級延遲可嵌入每次請求鏈路。
- 智能模型路由:在混合大模型架構中判斷請求該走小模型還是前沿模型,用極低成本完成調度決策,節省推理費用。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...