NeoHorse-1 – 基元律動聯合無問芯穹等開源的 Agent 模型

AI工具3周前發佈新公告 AI管理員
0 0

NeoHorse-1是什麼

NeoHorse-1 是基元律動聯合無問芯穹、清華、北大、港中文、阿里巴巴等推出的開源 Agent 模型,含 4B 與 9B 兩版。模型採用 Agent-Native 後訓練,用 Routing Harness 的真實執行軌跡爲訓練數據,將路由信號複用爲訓練課程排序依據,實現評測反饋→數據配比→模型更新閉環。模型覆蓋工具調用、任務規劃、深度搜索與代碼生成,9B 版均分 69.04、超底座 3.44 分,原生支持 26 萬 token 上下文,可本地部署。

NeoHorse-1 – 基元律動聯合無問芯穹等開源的 Agent 模型

NeoHorse-1的主要功能

  • 工具調用:根據任務需求自動選擇並調用外部工具,完成多步驟操作。
  • 任務規劃:將複雜任務拆解爲可執行的子步驟,並進行長程規劃與調度。
  • 深度搜索:在多輪交互中主動檢索、整合信息,支撐結論的證據鏈。
  • 代碼生成:生成可用代碼並基於環境反饋調試修復,直至任務完成。

NeoHorse-1的技術原理

  • Harness 軌跡驅動的 Agent-Native 訓練:訓練語料用 Routing Harness 真實執行產生的結構化軌跡爲核心,涵蓋請求、路由、工具調用、環境反饋與錯誤恢復,較傳統問答語料多出能力需求、執行決策、環境結果三個維度。成功與失敗軌跡均被保留,經結構檢查與六維質量評估後入選,使訓練目標直接指向任務完成。
  • 能力引導的數據配比:路由器將任務按能力需求分爲 C0–C3 四檔,信號離線複用爲訓練依據:將路由記錄拆爲”預測—行動—結果”三段,用預測段排課程、用結果段定位能力短板,據此調整下一輪數據配比,形成評測反饋→數據配比→模型更新閉環。
  • 遞歸自我改進(RSI)的單輪驗證:分 Data-RSI 與 Model-RSI 兩部分:前者指模型持續執行產生新軌跡、篩選後作爲後續訓練材料自然積累;後者指按評測短板更新模型並放回 Harness 模型池。當前僅驗證單次閉環,信號與獎勵設計仍由人類設定。

NeoHorse-1 – 基元律動聯合無問芯穹等開源的 Agent 模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用NeoHorse-1

  • 安裝下載工具:執行 pip install -U modelscope 安裝 ModelScope 命令行工具。
  • 下載模型:運行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B 拉取權重(4B 版本同理,按需選擇)。
  • 部署服務:使用 SGLang(pip install "sglang==0.5.17")或 vLLM 啓動推理服務,配置 --context-length 262144、--reasoning-parser qwen3 和 --tool-call-parser qwen3_coder。
  • API 調用:通過 OpenAI SDK 將 base_url 指向本地服務地址(如 http://localhost:8000/v1),即可像調用 OpenAI 接口一樣發送請求。
  • 注意資源:實際可用上下文取決於 GPU 顯存,顯存不足時可先降低上下文長度再部署。

NeoHorse-1的核心優勢

  • Agent-Native 訓練:訓練數據直接來自真實執行軌跡而非傳統問答語料,目標直指任務完成,而非通用模型的事後適配。
  • 失敗軌跡利用:訓練集同時保留成功與被替換的失敗記錄,讓模型學會”哪裏易錯、出錯後如何恢復”。
  • 路由信號複用:將在線路由的 C0–C3 能力分檔信號離線轉化爲訓練依據,實現”評測反饋→數據配比→模型更新”閉環。
  • 小尺寸高性能:4B 版 Agent 表現已超越多個參數量更大的通用模型,9B 版均分 69.04、超底座 3.44 分,部署成本更低。
  • 超長上下文:原生支持 262,144 tokens,可擴展至約 101 萬 tokens,適配長程 Agent 任務。

NeoHorse-1的項目地址

  • GitHub倉庫:https://github.com/TokenRhythm/NeoHorse
  • HuggingFace模型庫:https://huggingface.co/collections/TokenRhythm/neohorse-1
  • arXiv技術論文:https://arxiv.org/pdf/2609.08183

NeoHorse-1的同類競品對比

對比維度 NeoHorse-1-9B Qwen3.5-9B
十項基準均分 69.04 65.60(+3.44 分)
QwenClawBench(Harness Agent 任務) 48.73 44.04
PinchBench(標準化工作流) 82.25 74.55(+7.70)
BFCL v4(函數調用/工具使用) 67.43 64.88
tau²-Bench(多輪人機工具交互) 90.82 88.04
HumanEval(代碼正確性) 98.17 92.68
訓練方式 Agent-Native 後訓練:Harness 軌跡 + 路由信號課程 + 在策略蒸餾 通用四階段後訓練,無 Agent 執行軌跡
訓練數據 真實執行軌跡(含失敗與恢復記錄),六維質量評估篩選 通用語料 + 合成數據
上下文長度 262,144 tokens(可擴展至約 101 萬) 長上下文(相對較短)
協議/生態 Apache-2.0,SGLang/vLLM/Ollama 等全框架支持 Apache-2.0,通用模型
定位 專精 Agent 場景(工具調用、規劃、深搜、代碼) 通用推理與對話

NeoHorse-1的應用場景

  • 智能體任務執行:作爲 OpenClaw 等 Harness 中的執行模型,自動完成文件操作、軟件使用等真實電腦任務,並在失敗後自主恢復。
  • 工具調用與 API 編排:在多工具環境中自動選擇、組合並調用外部 API,適合構建自動化工作流助手。
  • 深度搜索與研究助理:多輪主動檢索、交叉驗證信息並附證據鏈,支撐帶引用的調研報告生成。
  • 企業辦公自動化:在 WorkBuddy Bench 類多領域職場場景中處理日程調整、數據整理、報表生成等長程多步驟任務。
© 版權聲明

相關文章

暫無評論

暫無評論...