
最近騰訊的混元 Hy3出了,WorkBuddy 直接能免費用到,大家搶着用都幹排隊了。
Hy3 是 4 月底發佈的 Hy3 preview 升級版。
在真實工作的模型盲測中,Hy3 均分優於 GLM 5.1。在推理、智能體、長上下文等任務更是比肩國內外更大尺寸旗艦模型(參數規模往往是 Hy3 的 2~5 倍)的效果。

既然 Hy3 的宣傳說比肩更大尺寸(2-5倍)旗艦模型,比 GLM 5.1 實測強,那肯定要根據這個宣傳測測的。
我選擇了兩個參數量比 Hy3 高的:GLM 5.1,DeepSeek-V4-Pro,一個和他參數量差不多的:DeepSeek-V4-Flash,一起橫評一下。
是騾子是馬,咱拉出來溜溜!
01. 模型實測
case 1 前端設計
提示詞:
做一個 AI 模型橫評 Dashboard。
內容包括:
- 1.頂部展示 4 個模型:hy3、GLM 5.1、DeepSeek V4 Pro、DeepSeek V4 Flash。
- 2.中間是評分矩陣:代碼、推理、寫作、視覺、速度、穩定性。
- 3.右側展示當前選中模型的優缺點。
- 4.底部展示測試 case 運行記錄。
設計要求:
- 1.不要做營銷落地頁。
- 2.要像專業 SaaS 工具,信息密度高但不亂。
- 3.支持桌面和手機。
- 4.有真實交互:切換模型、篩選測試類型、排序分數。
- 不要使用大漸變背景、玻璃擬態、空洞裝飾。
Hy3:

Hy3 完成度很高,信息架構最像真實橫評工具:頂部 KPI、4 個模型卡、評分矩陣、右側模型詳情、雷達圖、維度明細、優缺點、規格區、測試記錄和篩選都齊了。
桌面中段左側有一塊明顯空白,造成頁面瀏覽節奏不均。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的結構清楚,做了 6 維度 × 4 模型的評分矩陣,選中列、篩選按鈕、測試歷史表都能工作。
但設計辨識度偏弱,像“標準白底 SaaS 表格 demo”;矩陣區域有大塊空白,頁面密度控制不好;細節上少了模型畫像、規格、圖形化能力面板,記憶點不夠。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 卡片、條形圖、表格都很穩,視覺剋制,沒亂用裝飾。
但所謂“評分矩陣”只展示當前選中模型的 6 個維度,不是真正的四模型橫向矩陣。信息層級少,像模型詳情頁 + 記錄表,不太像完整橫評工作台。
GLM 5.1:

GLM 5.1 頁面沒有跑起來。瀏覽器報了 Invalid or unexpected token,模型卡片、矩陣、詳情、測試記錄全都沒渲染,只剩暗色外殼和空表頭。
本 case 排名:Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash > GLM 5.1
case 2 3D物理交互
提示詞:
做一個 3D 小球迷宮。
要求:
- 使用 Three.js。
- 畫面中有一個傾斜迷宮板和一個小球。
- 通過鍵盤方向鍵控制迷宮板傾斜。
- 小球會根據傾斜方向滾動。
- 有牆體、終點、失敗洞口。
- 到達終點顯示通關時間。
- 掉進洞口後重置。
- 要有基礎物理效果,不能只是改座標假裝滾動。
非常穩,本地自帶 three.min.js,可直接跑;物理實現清楚,有傾斜板、滾動小球、牆體碰撞、洞口掉落重置、終點、計時、掉落次數、移動端 D-pad。按鍵後球的位置和計時都明顯變化。
DeepSeek-V4-Pro:
DeepSeek-V4-Pro 思路很高級,用了 React Three Fiber + Rapier,構建也通過,說明知道該用物理引擎。
但實際玩起來問題有點大,左右重力邏輯是混亂的,板子翹起來卻往高處跑。
DeepSeek-V4-Flash:
有 canvas、有迷宮、有計時、有洞口和通關彈窗。
缺點是遊戲系統仍偏薄:洞口少、HUD 信息少、左右重力邏輯是混亂的,板子翹起來卻往高處跑。。
GLM 5.1:
完成度很高,畫面裏有完整迷宮、牆體、多個失敗洞口、終點、陰影、HUD、最佳時間、WASD/方向鍵、R 重開、鼠標視角旋轉。
但是上下左右重力邏輯都是混亂的,板子翹起來卻往高處跑。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
case 3 塔防遊戲
提示詞:
做一個迷你塔防遊戲。
要求:
- 地圖上有固定路徑,敵人沿路徑移動。
- 玩家可以在空地放置炮塔。
- 炮塔自動攻擊範圍內最近的敵人。
- 敵人死亡掉金幣。
- 每一波敵人數量和速度增加。
- 有生命值、金幣、波次、暫停、重新開始。
- 炮塔至少有兩種:單體高傷、範圍低傷。
- 遊戲要能平衡到至少玩 5 波。
Hy3:
Hy3 有三種塔:箭塔、炮塔、冰塔,覆蓋單體、AOE、減速;還有出售返還、暫停、重開、波次狀態。UI 清楚,敵人血條、路徑、塔位反饋都好,像一個完整小遊戲原型。
DeepSeek-V4-Pro:
DeepSeek-V4-Pro 的React/Vite 版本,放塔和 5 波流程可用。
但整體更像基礎 Demo:只有兩種塔、沒有日誌/出售/減速/敵人類型變化,視覺也比較簡單。
DeepSeek-V4-Flash:
DeepSeek-V4-Flash 單文件完成度不錯,能放塔、開波、擊殺返錢,有事件提示和塔屬性面板。
短板是隻有兩種塔,敵人和策略深度一般,界面觀感弱。
GLM 5.1:
GLM 5.1 的遊戲結構很產品化:10 波、兩種塔、多敵人類型、速度按鈕、事件日誌、右側商店信息完整。
但畫面偏暗,戰鬥反饋不直觀;塔類型少,也沒有出售/升級。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Flash > DeepSeek-V4-Pro
case 4代碼調試
提示詞:
下面這段 Python 代碼用於找出數組中和爲 target 的兩個數下標,但有 bug。請指出 bug、給出修復代碼,並補充 3 個測試用例。
def two_sum(nums, target):
seen = {}
for i, n in enumerate(nums):
if target – n in seen:
return [i, seen[n]]
seen[n] = i
return []
Hy3:

Hy3 標準用例解釋清楚,能指出 [2,7,11,15] 會 KeyError,修復代碼正確,測試覆蓋基本、重複、無解。
只是對“只有 n == target – n 才正確”的表述略絕對,原始返回順序如果嚴格要求 [0,1],[3,3] 原代碼也可能是反的。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的修復和測試是對的,4 個用例覆蓋也全。但解釋裏說 seen[n] 可能是“當前數字 n 的索引,即 i 本身”,這不嚴謹,因爲 seen[n] = i 發生在判斷之後,通常還沒寫入。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 明顯錯誤,把問題誤判成“返回順序反了”,但仍然寫 seen[n],沒有改成 seen[target – n]。標準用例 [2,7,11,15], target=9 仍會 KeyError,給出的測試自己都跑不過。
GLM 5.1:

GLM 5.1 準確抓到核心:判斷的是 target – n in seen,所以返回必須取 seen[target – n]。還補充了 seen[n] 可能 KeyError 或命中舊重複值,解釋很嚴謹。修復代碼和測試都正確。
本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
case 5 中文寫作
提示詞:
請把下面這段話改成更自然的公衆號正文,不要像 AI 寫的。
原文:
在人工智能快速發展的今天,Agent 已經不再只是一個技術概念,而是正在成爲改變生產力的重要工具。對於普通人來說,理解 Agent 的意義非常重要,因爲它不僅能夠提升工作效率,還能夠幫助我們重新思考人與機器的關係。
Hy3:

Hy3 審稿意識很強,能準確指出原文裏的 AI 腔來源,改寫也有公衆號開頭的抓力。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 乾淨,短、直接、不油膩。但信息量偏少,把 Agent 寫成普通效率工具,少了“主動執行、多步驟任務、人機分工變化”這些關鍵點。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 雖然比原文口語化,但還保留了明顯模板: 不只是……、實打實地……、工作效率翻倍、重新想想。人和機器之間,到底誰該聽誰的,這句也有標題黨味。
GLM 5.1:

GLM 5.1 具體、有場景,不只說“提升效率”,而是寫到訂機票、整理文檔、盯進度、報表、郵件、資料歸檔,讀者能馬上理解 Agent 的用處。語氣也比較自然,沒有太多模板句。小問題是“與其……不如……”用了兩次。
本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
case 6約束遵循
提示詞:請用 JSON 輸出,不要 Markdown,不要解釋。
任務:給一家 AI 編程工具設計 5 條中文廣告語。
約束:
- 1. 每條不超過 16 個漢字。
- 2. 不能出現“效率”“智能”“未來”三個詞。
- 3. 每條都要包含一個動詞。
- 4. JSON 字段爲 slogans,值爲字符串數組。
Hy3:

Hy3 的JSON 格式規範,字段正確,剛好 5 條,全是中文短句,沒有英文、空格、多餘解釋。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的JSON 合規,文案更有畫面感,但有幾條偏長,比如:開口說需求,代碼自己長、把想法丟進去就行。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 格式沒問題,但約束遵循最弱。用了 bug、AI 這樣的英文;改完bug直接上線、一人一AI撐起全棧,也比較誇張,像宣傳話術。
GLM 5.1:

GLM 5.1 也很穩,5 條都短,節奏統一。但用了 Bug這個英文單詞。
本 case 排名:Hy3 > DeepSeek-V4-Pro> GLM 5.1 > DeepSeek-V4-Flashcase 7
代碼重構
提示詞:下面函數已經在線上跑了兩年,現在要支持優惠券、會員折扣、區域稅率。請設計重構方案。
function calcTotal(items, user) {
let total = 0
for (const item of items) {
total += item.price * item.count
}
if (user.vip) total *= 0.9
total *= 1.06
return Math.round(total * 100) / 100
}
要求:
- 1. 不要過度設計。
- 2. 保留可測試性。
- 3. 給出 TypeScript 代碼。
- 4. 給出單元測試樣例。
- 5. 說明哪些邏輯應該配置化。
Hy3:

Hy3 拆分純函數、配置對象、稅率/會員折扣/優惠券邊界講得清楚,工程判斷穩。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 落地紮實、測試覆蓋廣、零依賴可跑。扣分點是 User 改成 membership,如果原線上是 vip 字段,會有兼容風險。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 思路方向對:常量配置化、計算順序固化、不搞策略模式。
但實現問題最多:優惠券先於會員折扣,且會員折扣按 subtotal 扣,組合券時容易和業務直覺不一致;固定券沒有最終兜底,疊加多券可能算成負數整體像一版草稿。
GLM 5.1:

GLM 5.1 設計講得好:配置注入、遷移節奏、哪些不要過度設計都說到了,尤其:先用舊硬編碼配置迴歸,再接運營後台,很像真實工程處理。
扣分點是代碼片段也有小瑕疵,pricing.ts 沒展示從 types.ts 導入類型,測試裏 DiscountPolicy/TaxPolicy 也沒導入,直接複製不一定能跑。
case 8 Excel自動化
提示詞:
我有一張銷售表,字段如下:
日期、銷售員、城市、產品、銷售額、成本、客戶類型。
請設計一個 Excel 分析模板,要求:
- 自動計算毛利、毛利率。
- 按月份、城市、銷售員生成透視分析。
- 找出毛利率低於 15% 的訂單。
- 生成一個管理層看板。
- 給出需要使用的公式、透視表字段配置、圖表類型。
Hy3:

Hy3 真實交付了 .xlsx,並且有生成腳本、公式列、條件格式、自動彙總、KPI 和 3 張圖表。雖然沒有真正創建 Excel 透視表,但給了透視字段說明。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 結構清楚,6 張 Sheet 的設計完整,KPI 公式和 FILTER 低毛利清單比較可落地。毛利率在透視表裏用“毛利 / 銷售額”的計算字段很嚴謹。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 方案有基本框架,但公式細節問題多:低毛利標記沒有防除零,COUNTIF(I:I,<0.15) 少了引號,透視表毛利率建議也不夠準確。
GLM 5.1:

GLM 5.1 很接近實際 Excel 搭建流程。超級表、透視表、低毛利預警、切片器、時間軸、閾值放到設置單元格,這些都很實用。但部分公式寫法偏說明性質,比如 =總毛利/總銷售額。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
case 9 DCF估值
提示詞:
基於以下假設做一個 DCF 估值。
2026 年自由現金流 1200 萬,之後 4 年增長率分別爲 18%、15%、12%、8%。永續增長率 3%,WACC 10%。淨債務 2000 萬,流通股 1000 萬股。
請計算:
- 顯性期現金流現值。
- 終值。
- 企業價值。
- 股權價值。
- 每股價值。
- 做 WACC 9%-11%、永續增長 2%-4% 的敏感性分析。
Hy3:

Hy3 折現口徑正確:2026–2030 五年現金流按 t=1..5 折現,2030 年末終值也折現 5 年,基準每股 21.95 元是對的,還實際生成了 HTML 報告和計算腳本。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 也有本地腳本,但核心口徑錯了:把 2026 年 1,200 萬 FCF漏掉,只從 2027 年開始折現;終值也只折現 4 年,所以估值被抬高到 23.14 元。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash和 DeepSeek-V4-Pro 犯了同一個 DCF 口徑錯誤:漏掉 2026 現金流,終值折現期少一年。但比 DeepSeek-V4-Pro 差的是沒有本地文件,解釋也更短。
GLM 5.1:

GLM 5.1計算和口徑嚴謹,明確寫了估值日、年末現金流約定、終值折現 5 年,敏感性 5×5 也完整。結論裏的終值佔比、交叉驗證提醒有金融建模意識,可惜沒有生成本地交付文件。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
02. 測試總結
從測試結果來看,Hy3的宣傳還是很實誠的,確實整體跑下來要比 GLM 5.1要強,我比較驚訝的是比DeepSeek-V4-Pro 都要強一點。
Hy3 在前端、塔防、約束遵循、代碼重構、Excel 自動化、DCF 這些題都拿到第一,尤其強在能交付:會生成文件、能跑頁面、能把需求拆成真實產物。
GLM 5.1 在代碼調試、中文寫作、DCF 口徑這些需要判斷力的題上很強,解釋嚴謹,金融建模意識也好。
DeepSeek V4 Pro 更像一個中規中矩的工程型選手,結構化能力不錯,代碼重構裏還真的跑通了 20 個測試。
DeepSeek V4 Flash 適合輕量任務。單文件頁面、小型 Demo、快速草稿還可以,但一到需要嚴謹推理、約束遵循、複雜業務口徑,就有點弱了。

03. 一些分享
測下來,對 Hy3 的感覺挺明確:日常工作裏真的可以拿來幹活了。
當然也要先說清楚,我這次測試用的是 WorkBuddy。騰訊自家的 Agent 接騰訊自家的模型,多少可能會有一點適配加成。但不管怎麼說,最後跑出來的結果擺在那裏:頁面能跑、文件能交、複雜任務也能拆得住,整體完成度確實不錯。
更關鍵的是,現在在 WorkBuddy 裏用 Hy3 還不用花錢,可以免費用兩週。對經常跑代碼、做頁面、寫分析的人來說,這基本等於先省下半個月 Token 費。後面如果接 API,價格也不算貴,甚至比 DeepSeek-V4-Pro 還低一點。
還有一個我比較期待的地方:Hy3 已經接進了騰訊不少產品,比如元寶、微信讀書這些。剛好這些也是我平時會用的工具。
我也看到 Hy3 在 7 月 8 日上午 10 點左右算力消耗衝到峯值,後面還出現排隊,下午排隊率一度超過 50%。這說明一件事:覺得它好用的,應該不止我一個。
這次測完,我會把 Hy3 放進日常工作備選裏,希望國產模型越做越好。
原文鏈接:騰訊 Hy3 出了,讓我來看看宣傳裏有沒有灌水