NeoHorse-1是什麼
NeoHorse-1 是基元律動聯合無問芯穹、清華、北大、港中文、阿里巴巴等推出的開源 Agent 模型,含 4B 與 9B 兩版。模型採用 Agent-Native 後訓練,用 Routing Harness 的真實執行軌跡爲訓練數據,將路由信號複用爲訓練課程排序依據,實現評測反饋→數據配比→模型更新閉環。模型覆蓋工具調用、任務規劃、深度搜索與代碼生成,9B 版均分 69.04、超底座 3.44 分,原生支持 26 萬 token 上下文,可本地部署。

NeoHorse-1的主要功能
-
工具調用:根據任務需求自動選擇並調用外部工具,完成多步驟操作。
-
任務規劃:將複雜任務拆解爲可執行的子步驟,並進行長程規劃與調度。
-
深度搜索:在多輪交互中主動檢索、整合信息,支撐結論的證據鏈。
-
代碼生成:生成可用代碼並基於環境反饋調試修復,直至任務完成。
NeoHorse-1的技術原理
- Harness 軌跡驅動的 Agent-Native 訓練:訓練語料用 Routing Harness 真實執行產生的結構化軌跡爲核心,涵蓋請求、路由、工具調用、環境反饋與錯誤恢復,較傳統問答語料多出能力需求、執行決策、環境結果三個維度。成功與失敗軌跡均被保留,經結構檢查與六維質量評估後入選,使訓練目標直接指向任務完成。
- 能力引導的數據配比:路由器將任務按能力需求分爲 C0–C3 四檔,信號離線複用爲訓練依據:將路由記錄拆爲”預測—行動—結果”三段,用預測段排課程、用結果段定位能力短板,據此調整下一輪數據配比,形成評測反饋→數據配比→模型更新閉環。
- 遞歸自我改進(RSI)的單輪驗證:分 Data-RSI 與 Model-RSI 兩部分:前者指模型持續執行產生新軌跡、篩選後作爲後續訓練材料自然積累;後者指按評測短板更新模型並放回 Harness 模型池。當前僅驗證單次閉環,信號與獎勵設計仍由人類設定。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用NeoHorse-1
-
安裝下載工具:執行
pip install -U modelscope安裝 ModelScope 命令行工具。 -
下載模型:運行
modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B拉取權重(4B 版本同理,按需選擇)。 -
部署服務:使用 SGLang(
pip install "sglang==0.5.17")或 vLLM 啓動推理服務,配置--context-length 262144、--reasoning-parser qwen3和--tool-call-parser qwen3_coder。 -
API 調用:通過 OpenAI SDK 將
base_url指向本地服務地址(如http://localhost:8000/v1),即可像調用 OpenAI 接口一樣發送請求。 -
注意資源:實際可用上下文取決於 GPU 顯存,顯存不足時可先降低上下文長度再部署。
NeoHorse-1的核心優勢
-
Agent-Native 訓練:訓練數據直接來自真實執行軌跡而非傳統問答語料,目標直指任務完成,而非通用模型的事後適配。
-
失敗軌跡利用:訓練集同時保留成功與被替換的失敗記錄,讓模型學會”哪裏易錯、出錯後如何恢復”。
-
路由信號複用:將在線路由的 C0–C3 能力分檔信號離線轉化爲訓練依據,實現”評測反饋→數據配比→模型更新”閉環。
-
小尺寸高性能:4B 版 Agent 表現已超越多個參數量更大的通用模型,9B 版均分 69.04、超底座 3.44 分,部署成本更低。
-
超長上下文:原生支持 262,144 tokens,可擴展至約 101 萬 tokens,適配長程 Agent 任務。
NeoHorse-1的項目地址
- GitHub倉庫:https://github.com/TokenRhythm/NeoHorse
- HuggingFace模型庫:https://huggingface.co/collections/TokenRhythm/neohorse-1
- arXiv技術論文:https://arxiv.org/pdf/2609.08183
NeoHorse-1的同類競品對比
| 對比維度 | NeoHorse-1-9B | Qwen3.5-9B |
|---|---|---|
| 十項基準均分 | 69.04 | 65.60(+3.44 分) |
| QwenClawBench(Harness Agent 任務) | 48.73 | 44.04 |
| PinchBench(標準化工作流) | 82.25 | 74.55(+7.70) |
| BFCL v4(函數調用/工具使用) | 67.43 | 64.88 |
| tau²-Bench(多輪人機工具交互) | 90.82 | 88.04 |
| HumanEval(代碼正確性) | 98.17 | 92.68 |
| 訓練方式 | Agent-Native 後訓練:Harness 軌跡 + 路由信號課程 + 在策略蒸餾 | 通用四階段後訓練,無 Agent 執行軌跡 |
| 訓練數據 | 真實執行軌跡(含失敗與恢復記錄),六維質量評估篩選 | 通用語料 + 合成數據 |
| 上下文長度 | 262,144 tokens(可擴展至約 101 萬) | 長上下文(相對較短) |
| 協議/生態 | Apache-2.0,SGLang/vLLM/Ollama 等全框架支持 | Apache-2.0,通用模型 |
| 定位 | 專精 Agent 場景(工具調用、規劃、深搜、代碼) | 通用推理與對話 |
NeoHorse-1的應用場景
-
智能體任務執行:作爲 OpenClaw 等 Harness 中的執行模型,自動完成文件操作、軟件使用等真實電腦任務,並在失敗後自主恢復。
-
工具調用與 API 編排:在多工具環境中自動選擇、組合並調用外部 API,適合構建自動化工作流助手。
-
深度搜索與研究助理:多輪主動檢索、交叉驗證信息並附證據鏈,支撐帶引用的調研報告生成。
-
企業辦公自動化:在 WorkBuddy Bench 類多領域職場場景中處理日程調整、數據整理、報表生成等長程多步驟任務。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...