騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

AI教程10小時前發佈新公告 AI管理員
0 0

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

最近騰訊的混元 Hy3出了,WorkBuddy 直接能免費用到,大家搶着用都幹排隊了。

Hy3 是 4 月底發佈的 Hy3 preview 升級版。

在真實工作的模型盲測中,Hy3 均分優於 GLM 5.1。在推理、智能體、長上下文等任務更是比肩國內外更大尺寸旗艦模型(參數規模往往是 Hy3 的 2~5 倍)的效果。

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

既然 Hy3 的宣傳說比肩更大尺寸(2-5倍)旗艦模型,比 GLM 5.1 實測強,那肯定要根據這個宣傳測測的。

我選擇了兩個參數量比 Hy3 高的:GLM 5.1,DeepSeek-V4-Pro,一個和他參數量差不多的:DeepSeek-V4-Flash,一起橫評一下。

是騾子是馬,咱拉出來溜溜!

 

01. 模型實測

 

case 1 前端設計

提示詞:

做一個 AI 模型橫評 Dashboard。

 

內容包括:

  • 1.頂部展示 4 個模型:hy3、GLM 5.1、DeepSeek V4 Pro、DeepSeek V4 Flash。
  • 2.中間是評分矩陣:代碼、推理、寫作、視覺、速度、穩定性。
  • 3.右側展示當前選中模型的優缺點。
  • 4.底部展示測試 case 運行記錄。

設計要求:

  • 1.不要做營銷落地頁。
  • 2.要像專業 SaaS 工具,信息密度高但不亂。
  • 3.支持桌面和手機。
  • 4.有真實交互:切換模型、篩選測試類型、排序分數。
  • 不要使用大漸變背景、玻璃擬態、空洞裝飾。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 完成度很高,信息架構最像真實橫評工具:頂部 KPI、4 個模型卡、評分矩陣、右側模型詳情、雷達圖、維度明細、優缺點、規格區、測試記錄和篩選都齊了。

桌面中段左側有一塊明顯空白,造成頁面瀏覽節奏不均。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 的結構清楚,做了 6 維度 × 4 模型的評分矩陣,選中列、篩選按鈕、測試歷史表都能工作。

但設計辨識度偏弱,像“標準白底 SaaS 表格 demo”;矩陣區域有大塊空白,頁面密度控制不好;細節上少了模型畫像、規格、圖形化能力面板,記憶點不夠。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 卡片、條形圖、表格都很穩,視覺剋制,沒亂用裝飾。

但所謂“評分矩陣”只展示當前選中模型的 6 個維度,不是真正的四模型橫向矩陣。信息層級少,像模型詳情頁 + 記錄表,不太像完整橫評工作台。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 頁面沒有跑起來。瀏覽器報了 Invalid or unexpected token,模型卡片、矩陣、詳情、測試記錄全都沒渲染,只剩暗色外殼和空表頭。

本 case 排名:Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash > GLM 5.1

case 2 3D物理交互

提示詞:

做一個 3D 小球迷宮。

 

要求:

  1. 使用 Three.js。
  2. 畫面中有一個傾斜迷宮板和一個小球。
  3. 通過鍵盤方向鍵控制迷宮板傾斜。
  4. 小球會根據傾斜方向滾動。
  5. 有牆體、終點、失敗洞口。
  6. 到達終點顯示通關時間。
  7. 掉進洞口後重置。
  8. 要有基礎物理效果,不能只是改座標假裝滾動。

非常穩,本地自帶 three.min.js,可直接跑;物理實現清楚,有傾斜板、滾動小球、牆體碰撞、洞口掉落重置、終點、計時、掉落次數、移動端 D-pad。按鍵後球的位置和計時都明顯變化。

DeepSeek-V4-Pro:

DeepSeek-V4-Pro 思路很高級,用了 React Three Fiber + Rapier,構建也通過,說明知道該用物理引擎。

但實際玩起來問題有點大,左右重力邏輯是混亂的,板子翹起來卻往高處跑。

DeepSeek-V4-Flash:

有 canvas、有迷宮、有計時、有洞口和通關彈窗。

缺點是遊戲系統仍偏薄:洞口少、HUD 信息少、左右重力邏輯是混亂的,板子翹起來卻往高處跑。。

GLM 5.1:

完成度很高,畫面裏有完整迷宮、牆體、多個失敗洞口、終點、陰影、HUD、最佳時間、WASD/方向鍵、R 重開、鼠標視角旋轉。

但是上下左右重力邏輯都是混亂的,板子翹起來卻往高處跑。

本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

case 3 塔防遊戲

提示詞:

做一個迷你塔防遊戲。

 

要求:

  1. 地圖上有固定路徑,敵人沿路徑移動。
  2. 玩家可以在空地放置炮塔。
  3. 炮塔自動攻擊範圍內最近的敵人。
  4. 敵人死亡掉金幣。
  5. 每一波敵人數量和速度增加。
  6. 有生命值、金幣、波次、暫停、重新開始。
  7. 炮塔至少有兩種:單體高傷、範圍低傷。
  8. 遊戲要能平衡到至少玩 5 波。

Hy3:

Hy3 有三種塔:箭塔、炮塔、冰塔,覆蓋單體、AOE、減速;還有出售返還、暫停、重開、波次狀態。UI 清楚,敵人血條、路徑、塔位反饋都好,像一個完整小遊戲原型。

DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的React/Vite 版本,放塔和 5 波流程可用。

但整體更像基礎 Demo:只有兩種塔、沒有日誌/出售/減速/敵人類型變化,視覺也比較簡單。

DeepSeek-V4-Flash:

DeepSeek-V4-Flash 單文件完成度不錯,能放塔、開波、擊殺返錢,有事件提示和塔屬性面板。

短板是隻有兩種塔,敵人和策略深度一般,界面觀感弱。

GLM 5.1:

GLM 5.1 的遊戲結構很產品化:10 波、兩種塔、多敵人類型、速度按鈕、事件日誌、右側商店信息完整。

但畫面偏暗,戰鬥反饋不直觀;塔類型少,也沒有出售/升級。

本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Flash > DeepSeek-V4-Pro

case 4代碼調試

提示詞:

下面這段 Python 代碼用於找出數組中和爲 target 的兩個數下標,但有 bug。請指出 bug、給出修復代碼,並補充 3 個測試用例。

 

def two_sum(nums, target):

seen = {}

for i, n in enumerate(nums):

if target – n in seen:

return [i, seen[n]]

seen[n] = i

return []

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 標準用例解釋清楚,能指出 [2,7,11,15] 會 KeyError,修復代碼正確,測試覆蓋基本、重複、無解。

只是對“只有 n == target – n 才正確”的表述略絕對,原始返回順序如果嚴格要求 [0,1],[3,3] 原代碼也可能是反的。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 的修復和測試是對的,4 個用例覆蓋也全。但解釋裏說 seen[n] 可能是“當前數字 n 的索引,即 i 本身”,這不嚴謹,因爲 seen[n] = i 發生在判斷之後,通常還沒寫入。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 明顯錯誤,把問題誤判成“返回順序反了”,但仍然寫 seen[n],沒有改成 seen[target – n]。標準用例 [2,7,11,15], target=9 仍會 KeyError,給出的測試自己都跑不過。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 準確抓到核心:判斷的是 target – n in seen,所以返回必須取 seen[target – n]。還補充了 seen[n] 可能 KeyError 或命中舊重複值,解釋很嚴謹。修復代碼和測試都正確。

本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

case 5 中文寫作

提示詞:

請把下面這段話改成更自然的公衆號正文,不要像 AI 寫的。

原文:

在人工智能快速發展的今天,Agent 已經不再只是一個技術概念,而是正在成爲改變生產力的重要工具。對於普通人來說,理解 Agent 的意義非常重要,因爲它不僅能夠提升工作效率,還能夠幫助我們重新思考人與機器的關係。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 審稿意識很強,能準確指出原文裏的 AI 腔來源,改寫也有公衆號開頭的抓力。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 乾淨,短、直接、不油膩。但信息量偏少,把 Agent 寫成普通效率工具,少了“主動執行、多步驟任務、人機分工變化”這些關鍵點。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 雖然比原文口語化,但還保留了明顯模板: 不只是……、實打實地……、工作效率翻倍、重新想想。人和機器之間,到底誰該聽誰的,這句也有標題黨味。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 具體、有場景,不只說“提升效率”,而是寫到訂機票、整理文檔、盯進度、報表、郵件、資料歸檔,讀者能馬上理解 Agent 的用處。語氣也比較自然,沒有太多模板句。小問題是“與其……不如……”用了兩次。

本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

case 6約束遵循

提示詞:請用 JSON 輸出,不要 Markdown,不要解釋。

任務:給一家 AI 編程工具設計 5 條中文廣告語。

約束:

  • 1. 每條不超過 16 個漢字。
  • 2. 不能出現“效率”“智能”“未來”三個詞。
  • 3. 每條都要包含一個動詞。
  • 4. JSON 字段爲 slogans,值爲字符串數組。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 的JSON 格式規範,字段正確,剛好 5 條,全是中文短句,沒有英文、空格、多餘解釋。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 的JSON 合規,文案更有畫面感,但有幾條偏長,比如:開口說需求,代碼自己長、把想法丟進去就行。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 格式沒問題,但約束遵循最弱。用了 bug、AI 這樣的英文;改完bug直接上線、一人一AI撐起全棧,也比較誇張,像宣傳話術。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 也很穩,5 條都短,節奏統一。但用了 Bug這個英文單詞。

本 case 排名:Hy3 > DeepSeek-V4-Pro> GLM 5.1 > DeepSeek-V4-Flashcase 7

代碼重構

提示詞:下面函數已經在線上跑了兩年,現在要支持優惠券、會員折扣、區域稅率。請設計重構方案。

function calcTotal(items, user) {

let total = 0

for (const item of items) {

total += item.price * item.count

}

if (user.vip) total *= 0.9

total *= 1.06

return Math.round(total * 100) / 100

}

要求:

  • 1. 不要過度設計。
  • 2. 保留可測試性。
  • 3. 給出 TypeScript 代碼。
  • 4. 給出單元測試樣例。
  • 5. 說明哪些邏輯應該配置化。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 拆分純函數、配置對象、稅率/會員折扣/優惠券邊界講得清楚,工程判斷穩。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 落地紮實、測試覆蓋廣、零依賴可跑。扣分點是 User 改成 membership,如果原線上是 vip 字段,會有兼容風險。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 思路方向對:常量配置化、計算順序固化、不搞策略模式。

但實現問題最多:優惠券先於會員折扣,且會員折扣按 subtotal 扣,組合券時容易和業務直覺不一致;固定券沒有最終兜底,疊加多券可能算成負數整體像一版草稿。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 設計講得好:配置注入、遷移節奏、哪些不要過度設計都說到了,尤其:先用舊硬編碼配置迴歸,再接運營後台,很像真實工程處理。

扣分點是代碼片段也有小瑕疵,pricing.ts 沒展示從 types.ts 導入類型,測試裏 DiscountPolicy/TaxPolicy 也沒導入,直接複製不一定能跑。

case 8 Excel自動化

提示詞:

我有一張銷售表,字段如下:

日期、銷售員、城市、產品、銷售額、成本、客戶類型。

請設計一個 Excel 分析模板,要求:

  1. 自動計算毛利、毛利率。
  2. 按月份、城市、銷售員生成透視分析。
  3. 找出毛利率低於 15% 的訂單。
  4. 生成一個管理層看板。
  5. 給出需要使用的公式、透視表字段配置、圖表類型。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 真實交付了 .xlsx,並且有生成腳本、公式列、條件格式、自動彙總、KPI 和 3 張圖表。雖然沒有真正創建 Excel 透視表,但給了透視字段說明。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 結構清楚,6 張 Sheet 的設計完整,KPI 公式和 FILTER 低毛利清單比較可落地。毛利率在透視表裏用“毛利 / 銷售額”的計算字段很嚴謹。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash 方案有基本框架,但公式細節問題多:低毛利標記沒有防除零,COUNTIF(I:I,<0.15) 少了引號,透視表毛利率建議也不夠準確。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1 很接近實際 Excel 搭建流程。超級表、透視表、低毛利預警、切片器、時間軸、閾值放到設置單元格,這些都很實用。但部分公式寫法偏說明性質,比如 =總毛利/總銷售額。

本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

case 9 DCF估值

提示詞:

基於以下假設做一個 DCF 估值。

2026 年自由現金流 1200 萬,之後 4 年增長率分別爲 18%、15%、12%、8%。永續增長率 3%,WACC 10%。淨債務 2000 萬,流通股 1000 萬股。

請計算:

  1. 顯性期現金流現值。
  2. 終值。
  3. 企業價值。
  4. 股權價值。
  5. 每股價值。
  6. 做 WACC 9%-11%、永續增長 2%-4% 的敏感性分析。

Hy3:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

Hy3 折現口徑正確:2026–2030 五年現金流按 t=1..5 折現,2030 年末終值也折現 5 年,基準每股 21.95 元是對的,還實際生成了 HTML 報告和計算腳本。

DeepSeek-V4-Pro:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Pro 也有本地腳本,但核心口徑錯了:把 2026 年 1,200 萬 FCF漏掉,只從 2027 年開始折現;終值也只折現 4 年,所以估值被抬高到 23.14 元。

DeepSeek-V4-Flash:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

DeepSeek-V4-Flash和 DeepSeek-V4-Pro 犯了同一個 DCF 口徑錯誤:漏掉 2026 現金流,終值折現期少一年。但比 DeepSeek-V4-Pro 差的是沒有本地文件,解釋也更短。

GLM 5.1:

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

GLM 5.1計算和口徑嚴謹,明確寫了估值日、年末現金流約定、終值折現 5 年,敏感性 5×5 也完整。結論裏的終值佔比、交叉驗證提醒有金融建模意識,可惜沒有生成本地交付文件。

本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

 

02. 測試總結

 

從測試結果來看,Hy3的宣傳還是很實誠的,確實整體跑下來要比 GLM 5.1要強,我比較驚訝的是比DeepSeek-V4-Pro 都要強一點。

Hy3 在前端、塔防、約束遵循、代碼重構、Excel 自動化、DCF 這些題都拿到第一,尤其強在能交付:會生成文件、能跑頁面、能把需求拆成真實產物。

GLM 5.1 在代碼調試、中文寫作、DCF 口徑這些需要判斷力的題上很強,解釋嚴謹,金融建模意識也好。

DeepSeek V4 Pro 更像一個中規中矩的工程型選手,結構化能力不錯,代碼重構裏還真的跑通了 20 個測試。

DeepSeek V4 Flash 適合輕量任務。單文件頁面、小型 Demo、快速草稿還可以,但一到需要嚴謹推理、約束遵循、複雜業務口徑,就有點弱了。

騰訊混元 Hy3 實測 – 與 GLM 5.1、DeepSeek V4 Pro 橫向對比

 

03. 一些分享

 

測下來,對 Hy3 的感覺挺明確:日常工作裏真的可以拿來幹活了。

當然也要先說清楚,我這次測試用的是 WorkBuddy。騰訊自家的 Agent 接騰訊自家的模型,多少可能會有一點適配加成。但不管怎麼說,最後跑出來的結果擺在那裏:頁面能跑、文件能交、複雜任務也能拆得住,整體完成度確實不錯。

更關鍵的是,現在在 WorkBuddy 裏用 Hy3 還不用花錢,可以免費用兩週。對經常跑代碼、做頁面、寫分析的人來說,這基本等於先省下半個月 Token 費。後面如果接 API,價格也不算貴,甚至比 DeepSeek-V4-Pro 還低一點。

還有一個我比較期待的地方:Hy3 已經接進了騰訊不少產品,比如元寶、微信讀書這些。剛好這些也是我平時會用的工具。

我也看到 Hy3 在 7 月 8 日上午 10 點左右算力消耗衝到峯值,後面還出現排隊,下午排隊率一度超過 50%。這說明一件事:覺得它好用的,應該不止我一個。

這次測完,我會把 Hy3 放進日常工作備選裏,希望國產模型越做越好。

原文鏈接:騰訊 Hy3 出了,讓我來看看宣傳裏有沒有灌水

© 版權聲明

相關文章

暫無評論

暫無評論...