LoHoSearch是什麼
LoHoSearch 是美團 LongCat 團隊推出的下一代搜索智能體評測基準,基於覆蓋 762 萬維基百科實體、2.65 億條關係邊的知識圖譜自動生成題目,替代傳統人工出題模式。基準收錄 544 道經人工覈驗的高質量題目,覆蓋音樂、影視、地理等 11 個領域,通過控制搜索空間與結構複雜度雙維度製造挑戰。當前最強模型 GPT-5.5 準確率僅 34.74%,遠低於其在 BrowseComp 上 90% 以上的表現,爲長程搜索推理與上下文管理提供更具區分度的評測標準。

LoHoSearch的主要功能
- 知識圖譜自動化建圖:用完整英文維基百科爲數據源,構建 762 萬實體節點與 2.65 億條有向邊的超大規模知識圖譜,每個實體標註 Wikidata 類型與入度熱度,爲全局視角選題提供基礎。
- 雙維度難度控制:從搜索空間與結構複雜度兩個維度系統調控題目難度,突破人工出題的認知天花板。
- 樹結構與圖結構採樣:樹結構通過放大搜索空間製造難度,圖結構則在巨大搜索空間之上引入環形依賴與交叉約束,進一步疊加結構複雜度。
- 自動化 QA 生成與驗證:從子圖抽取維基描述改寫爲自然語言題目,經關係提取、子圖覆蓋檢查、答案滿足度驗證三層自動篩選,再輔以人工複覈確保質量。
- 多模型性能評測:支持對主流搜索智能體進行標準化評測,輸出準確率、工具調用次數、校準誤差等核心指標,直觀反映模型長程推理能力。
LoHoSearch的技術原理
- 知識圖譜自動化構建:用完整英文維基百科爲數據源,抽取 762 萬個實體頁面作爲節點,提取正文內 2.65 億條超鏈接作爲有向邊,爲每個實體標註 Wikidata P31 類型與入度熱度,構建全局知識網絡。
- 雙維度難度定義:從”搜索空間”和”結構複雜度”兩個正交維度量化題目難度,突破人工出題的認知侷限。
- 樹結構子圖採樣:通過放大搜索空間製造難度,從單一答案節點向下展開多條獨立分支,每條分支對應一個高候選空間的約束條件,使排除成本指數級上升。
- 圖結構子圖採樣:在巨大搜索空間基礎上引入環形依賴與交叉約束,多個條件節點彼此 interconnected,求解需同時滿足多組咬合關係,疊加結構複雜度形成雙重挑戰。
- 關係提取與自然語言生成:從採樣子圖中抽取各實體的維基百科描述,用大模型改寫爲連貫的自然語言問題,確保每個線索完整保留原始子圖中的關係信息。
如何使用LoHoSearch
- 加載數據:通過
datasets庫直接加載meituan-longcat/LoHoSearch,獲取 544 道題目與標準答案。 - 查看結構:數據集包含題目文本、對應子圖結構、領域標籤及經知識圖譜校驗的唯一答案。
- 接入評測:將題目輸入待測搜索智能體,記錄其推理軌跡與最終輸出。
- 自動判分:對照數據集提供的標準答案,驗證模型輸出是否滿足全部約束條件並統計準確率。
- 對比分析:用數據集附帶的子圖複雜度與領域標籤,分維度分析模型在不同難度與主題下的表現。
LoHoSearch的核心優勢
- 突破人工出題天花板:傳統人工基準受限於標註者已知實體範圍,LoHoSearch 依託全局知識圖譜,能系統識別高搜索空間與高結構複雜度的”真難題”。
- 難度顯著高於現有基準:同一模型在 BrowseComp 上準確率 58.84%,在 LoHoSearch 上僅 10.02%,平均工具調用從 35 次增至 61 次,挑戰強度提升 74%。
- 區分度更強:現有上下文管理策略在 BrowseComp 上提升 14.03%,在 LoHoSearch 上僅提升 6.8%,更能真實反映策略在長程複雜場景下的邊際效益。
- 結構複雜度獨立可控:圖結構題目準確率(8.01%)顯著低於樹結構(11.89%),證明結構複雜度是獨立於搜索空間之外的額外難度來源,可被單獨量化。
LoHoSearch的項目地址
- HuggingFace模型庫:https://huggingface.co/datasets/meituan-longcat/LoHoSearch
- arXiv技術論文:https://arxiv.org/pdf/2606.12837
LoHoSearch的同類競品對比
| 維度 | LoHoSearch | BrowseComp |
|---|---|---|
| 出題方式 | 知識圖譜自動化生成 + 人工覈驗 | 人工設計 |
| 題目數量 | 544 道 | 數百道 |
| 覆蓋領域 | 11 個領域(音樂、影視、地理等) | 未明確分領域 |
| 難度控制 | 搜索空間 + 結構複雜度雙維度 | 人工主觀控制 |
| 最強模型準確率 | GPT-5.5:34.74% | GPT-5.5 Pro:90.1% |
| 工具調用中位數 | 59 次 | 26 次 |
| 上下文策略提升 | +6.8% | +14.03% |
| 飽和狀態 | 遠未飽和,區分度高 | 已接近飽和 |
| 適用場景 | 長程搜索推理、上下文管理評測 | 基礎搜索能力評測 |
LoHoSearch的應用場景
- 搜索智能體能力評測:爲具備長程推理能力的搜索 Agent 提供高難度標準化測試,精準定位模型在複雜信息檢索鏈條中的短板。
- 上下文管理策略驗證:評估 Summary、Discard-all、Verify 等上下文壓縮與驗證策略在超長交互場景下的真實增益,避免在簡單基準上高估策略效果。
- 模型迭代對標:爲研究團隊提供未飽和的評測標準,支撐模型版本迭代時的能力邊界探測與性能對比。
- 搜索算法研究:爲需要多步推理、交叉驗證的複雜搜索算法研究提供可控難度的數據集與評測框架。
- 智能體產品選型:幫助企業在選型搜索智能體方案時,通過 LoHoSearch 區分不同模型在真實複雜查詢場景下的實際表現。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...