Step Edge是什麼
Step Edge是階躍星辰推出的端側模型全家桶,包含基礎模型、Audio、GUI、Gen 四大成員,面向手機與汽車等終端打造。模型通過端雲協同架構,讓 Agent 在本地實現 0.1 秒級響應,同時保障全模態數據隱私,在 29 項核心評測中取得第一,並配套自研 Step Inference NPU 引擎優化終端推理。

Step Edge的主要功能
-
Step Edge 基礎模型:端側多模態理解與推理,支持文本、圖像、視頻、OCR、空間理解與工具調用。
-
Step Edge Audio:端側音頻理解與語音識別,覆蓋中文、英文等多語種 ASR 與音頻問答。
-
Step Edge GUI:端側 GUI Agent,支持手機與桌面應用的視覺感知、元素定位與自動化操作。
-
Step Edge Gen:端側圖像生成與編輯,支持文生圖、圖生圖及局部編輯,在 OneIG、DPG-Bench 等評測中領先。
Step Edge的技術原理
-
端雲協同架構:簡單高頻任務由端側本地處理,複雜長鏈路推理交由雲端完成,實現速度、能力與成本的整體平衡。
-
全模態本地推理:文本、視覺、語音等多模態數據在終端本地處理,敏感信息不出端,通過本地計算保障隱私安全。
-
Step Inference NPU 引擎:自研終端推理引擎,針對手機、汽車等硬件進行算子與內存優化,降低文本、視覺、語音等輸入形態的端到端延遲。
-
低延遲 Toolcall 執行:端側本地工具調用延遲低至 0.1 秒,支持高頻交互場景下的實時響應,減少對雲端鏈路的依賴。
如何使用Step Edge
Step Edge 全家桶尚未明確開放公測或 API,目前處於發佈亮相階段。
Step Edge的項目地址
- 項目官網:https://static.stepfun.com/blog/step-edge/
Step Edge的同類競品對比
| 對比維度 | Step Edge | Qwen3-VL |
|---|---|---|
| 產品形態 | 端側模型全家桶(基礎+Audio+GUI+Gen) | 開源多模態大模型系列 |
| 端側優化 | 專爲終端場景深度優化,配套自研 NPU 引擎 | 支持端側部署,但主要面向通用多模態任務 |
| GUI Agent | 端側 GUI 模型,OSWorld 等評測領先 | 需結合外部框架實現 GUI 自動化 |
| 音頻能力 | 獨立 Audio 模型,ASR 與音頻理解一體化 | 主要聚焦視覺與文本,音頻非核心方向 |
| 圖像生成 | 內置 Gen 模型,支持端側文生圖與編輯 | 以理解爲主,生成能力非主打 |
| 隱私策略 | 全模態本地處理,原生端雲協同 | 端側可運行,但協同策略需自行搭建 |
Step Edge的應用場景
-
智能手機助手:端側實時語音識別與 GUI 自動化操作,離線完成訂外賣、發消息、查相冊等高頻任務。
-
車載智能座艙:本地處理語音指令與車內視覺感知,保障駕駛數據隱私,實現導航、空調、娛樂的零延遲控制。
-
端側圖像創作:手機本地文生圖與修圖,無需上傳照片至雲端,滿足用戶即時創作與隱私保護雙重需求。
-
工業終端巡檢:在弱網工廠或戶外場景,端側模型本地識別設備故障圖像與音頻異常,實時上報關鍵信息。
-
IoT 邊緣設備:在智能家居、穿戴設備中部署,本地完成語音喚醒、視覺識別與簡單決策,降低雲端成本。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...