Iris – 小紅書 AllSpark 團隊開源的搜索智能體

AI工具14小時前發佈新公告 AI管理員
0 0

Iris是什麼

Iris 是小紅書 AllSpark 團隊開源的搜索智能體,含 35B(Iris-mini)和 397B(Iris-pro)兩個版本。Iris能在真實網絡中自主決定搜什麼、怎麼讀、何時收斂作答,通過從網頁超鏈接反向構造夠難且可解的訓練數據,採用 SFT 與強化學習交替的SFT–RL Climbing訓練法。在 BrowseComp、DeepSearchQA、HLE 等四大基準上取得同量級最強開源成績,35B 版本已逼近萬億參數模型,搜索能力可外溢到通用工具調用等任務。

Iris – 小紅書 AllSpark 團隊開源的搜索智能體

Iris的主要功能

  • 自主網絡搜索:自己決定搜什麼、如何閱讀檢索結果、何時繼續或停止,邊搜邊推理邊作答。
  • 多步跨頁推理:能多個網頁逐步鎖定唯一答案,而非靠關鍵詞匹配走捷徑。
  • 中英文複雜檢索:在 BrowseComp、BrowseComp-ZH 等中英文網頁檢索任務上均達到同量級開源最強。
  • 證據覆蓋型問答:回答時完整覆蓋證據鏈,在 DeepSearchQA 上表現領先。
  • 專家級難題求解:能處理 HLE 這類需要專家級推理的高難度問題。
  • 上下文管理:支持截斷、壓縮等上下文管理策略,長鏈路搜索不中斷,小模型獲益尤爲明顯。
  • 能力外溢:未經專門訓練即可勝任通用工具調用和辦公協作等任務。

Iris的技術原理

  • 反向造題的數據構造:以種子頁面爲答案,順超鏈接聚成實體圖譜,在圖譜上生成必須跨頁多步推理的題目,再把題面中答案以外的實體改寫成描述性指代以抹掉可匹配的線索,最後用參考模型雙重篩選,閉卷答不出、給證據能唯一答對才保留,全程自動化、可隨語料規模擴展。
  • SFT–RL Climbing 交替訓練:SFT 階段用強教師模型在真實搜索工具上生成軌跡,經結果過濾和”判官”單步過濾後訓練;RL 階段讓模型在真實網絡邊搜邊學,每輪結束後把最難做對和最高效解出的軌跡回灌下一輪 SFT,隨模型變強題目自動變難,形成自適應課程。
  • 訓練工程內化:判分與摘要用自建模型在訓練集羣內部完成,不依賴任何外部 API,避免網絡波動干擾訓練循環;同時訓練與線上使用同一套摘要器,消除訓練與推理的錯位。
  • 超長軌跡斷點續跑:少數拖後腿的超長會話不再整段丟棄,在請求級別中斷、下一步從已提交前綴繼續,使 GPU 在同步調度下保持高利用率。
  • 對齊式評測協議:所有對比系統在相同工具、上下文、判分模型及同一上下文管理策略下、僅用單 ReAct 智能體評測,排除多智能體和測試時自我驗證等框架取巧,讓分數真實反映模型本身能力。

Iris – 小紅書 AllSpark 團隊開源的搜索智能體

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Iris

  • 克隆代碼倉庫:執行 git clone https://github.com/AllSpark-Research/Iris 獲取推理與評測代碼。
  • 下載模型權重:從 HuggingFace 集合 huggingface.co/collections/AllSpark-Research/iris 下載 Iris-mini(35B)或 Iris-pro(397B)權重。
  • 配置運行環境:按倉庫要求安裝依賴(如 vLLM/SGLang 等推理框架),並配置好搜索工具接口(聯網檢索是 Search Agent 的必要前提)。
  • 加載模型並接入工具:用 ReAct 智能體形式加載模型,將搜索引擎作爲工具註冊給模型調用。
  • 提出問題運行推理:輸入問題,模型會自動規劃搜索查詢、閱讀網頁、多步推理並收斂給出帶證據的答案。

Iris的核心優勢

  • 同量級最強開源成績:在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四個搜索基準上全面領先同量級開源模型,397B 的 Iris-pro 部分項目反超萬億參數級模型。
  • 小體量逼近超大模型:35B 的 Iris-mini 在 BrowseComp 上拿下 82.2 分,已逼近 Kimi-K2.6 等數十倍參數量的模型,讓小模型在垂域上具備挑戰超大模型的能力。
  • 數據構造自動化且高質量:從網頁超鏈接反向造題、抹掉可匹配線索、雙重篩選”夠難且可解”,全程無需人工出題,可隨語料規模無限擴展。
  • 訓練工程穩健高效:判分與摘要內化到訓練集羣,徹底擺脫外部 API 依賴;超長軌跡斷點續跑讓 GPU 持續滿載,大幅降低訓練不確定性。
  • 訓練與線上一致:訓練時壓縮檢索內容的摘要器與評測、線上使用的是同一套,不存在訓練與使用的錯位。
  • 能力外溢,通用性強:搜索能力泛化到通用工具調用和辦公協作等從未專門訓練的任務,Search 是可複用的原子能力。

Iris的項目地址

  • GitHub倉庫:https://github.com/AllSpark-Research/Iris
  • HuggingFace模型庫:https://huggingface.co/collections/AllSpark-Research/iris
  • arXiv技術論文:https://arxiv.org/pdf/2609.04304

Iris的同類競品對比

對比維度 Iris(小紅書 AllSpark) Kimi-K2.6(月之暗面)
模型定位 開源 Search Agent 專用模型 萬億參數通用大模型(兼具 Agent 能力)
參數規模 Iris-mini 35B(MoE 激活 3B)/ Iris-pro 397B(MoE 激活 17B) 約 1T 參數
BrowseComp mini 82.2 / pro 88.6 單智能體 83.2 / Agent Swarm(300 子智能體)86.3
參數效率 35B 體量即逼近 K2.6 萬億級單智能體水平 需 1T 參數達到相近水平
開放性 權重、評測代碼、數據構造與訓練配方全部開源 開源權重,但數據與訓練細節未公開
評測公平性 統一工具/上下文/判分模型,單 ReAct 無框架取巧 Agent Swarm 依賴多子智能體加成,協議不同難直接對齊
能力外溢 未專門訓練即可勝任 BFCL、τ-bench、OfficeQA、APEX 通用模型,工具調用爲通用能力而非專門外溢

Iris的應用場景

  • 深度研究/調研報告:自動多輪檢索、跨頁推理、證據覆蓋完整,適合行業研究、競品分析、學術調研等 Deep Research 類產品。
  • 複雜事實覈查:答案需跨多個網頁多步鎖定,適合闢謠、事實覈查、盡職調查等”必須找到出處”的場景。
  • 中英文雙語搜索:BrowseComp 與 BrowseComp-ZH 雙優,天然適合中英混合語料的跨境信息檢索。
  • 通用工具調用智能體:能力外溢至 BFCL、τ-bench 等 General Tool Use 任務,可作爲 Agent 產品的通用底座。
  • 辦公協作(Cowork):在 OfficeQA、APEX 等辦公任務上無需專門訓練即可上手,適合嵌入辦公助手處理文檔問答與流程任務。
© 版權聲明

相關文章

暫無評論

暫無評論...