腾讯 Hy4 preview 测评

利益相关:本篇测评撰写于笔者在混元供职期间

短的结论:鹅家有女初长成

基本情况:

在模型研发大加速的背景下,头部厂商已经把模型发布间隔压进了两个月乃至一个半月,这背后是整个模型生产管线的高速运转。而经过 Hy3 锤炼的混元团队也敏捷起来,Hy4 preview 距离上次发布也仅有 7 周。

但间隔短不意味着模型提升小,换代之后的Hy4 preview 规模也来到了可攻可守的“舒适区”,这个参数量可以塞下比前 300B 更大的知识空间,Agent 能力经过良好调教也可以与更大 Size 的模型相媲美。

就逻辑能力来看,Hy4 preview 基本持平发布早 10 天的同尺寸 GLM-5.3,推理效率差一些,但在更低的定价下,任务成本依然占优。而 Agent 能力同样持平 GLM-5.3,在不同任务领域互有胜负。

成绩数据

之前在 Hy3 评测中,笔者曾申明今后混元的成绩不会进榜。这是考虑到简单的几个数字表达能力有限,而且由于笔者使用封闭题目,其他人无法复现分数。结合笔者身份,给出分数会存在诸多解释成本,故隐去。

详细分析

  • 编程:前代 Hy3 站在基本可用线上,能应付中低难度的开发任务,而前代的边缘知识不足导致其在更综合更前沿的领域里折戟。两个月时间里也涌现出像 Kimi K3 这样的国产新顶流,Hy3 无论在绝对性能还是性价比上都已有较大劣势。而 Hy4 preview 则一次性空降到国产头部阵营。

  • 审美方面是 Hy4 preview 的强势领域,这在 Hy3 时代就有所体现,到了 4 代则全方面加强。常规的网页和应用 UI,建模,动画,乃至游戏开发等需要审美的场景,Hy4 preview 都有强势表现,细节把控方面甚至能做到优于 K3。但这种表现并不稳定,偶尔也会输出下限更低,观感较差的产物,而且受限于 Hy4 preview 尚不具备视觉能力,模型自测难以发现这类问题,有赖于用户反馈。

  • Hy4 preview 有着较强的开发纪律,前置环节会尽量多调研和收集资料,后置也会在力所能及范围内多做测试,交付一个模型自己满意的版本。这也导致Hy4 preview 同任务的最终步数远超前代,项目 J 这类明确要求先调查再行动的任务,前代只草草象征性搜一两篇材料就动工,而新版则至会花费近一半时间在资料调查上,最终呈现效果丰富,内容殷实,拿到了国产中第一个 J 项目 A 评级。

  • 不过一体两面的是,Hy4 preview 的自测在前端任务场景会过重,其直出代码本身质量就不算低,靠大量自测也只能进行局部改进,这带来了一定的任务时间和成本浪费。如果要求不做额外运行自检,Hy4 preview 也能交付可用性相当高的产物,而耗时会下降 1/3。对非前端任务,禁用自测带来的效率改善并不大,反而质量下降的风险更高,得不偿失。

  • 稳定性:混元系列截止到 Hy3 都一直被输出稳定性困扰,多 Pass 很难输出一致内容,导致前代极限能力虽然能进入第一梯队,但用户实际体验只在二梯队中游。Hy4 preview 则几乎克服了这种问题,稳定性也来到国产优秀水平。其中 9/28 的任务 3 Pass 输出一致,低于 GLM-5.3 的 10 个,高于其他下位模型。在输出不一致的任务中,下限也较高,不会像前代偶尔滑落到完全不可用程度。

  • 推理效率:前代 Hy3 处理复杂推理,尤其解空间化简类问题会过度依赖暴力搜索的问题在 Hy4 preview 被延续和放大,这导致其平均 Token 消耗也大幅上涨,持平了 DeepSeek Pro。但不同的是 Hy3 的暴力搜索效率不高,花费了 Token 但找不出或找不全答案,而 Hy4 preview 则可以拿到答案。换言之,Hy4 preview 的推理效率其实有相当提升,只不过还存在过程优化空间。

  • 幻觉控制:Hy4 preview 较 GLM-5.3 要略低一些。尤其在长文本处理方面精度不低。虽然达不到行业顶级的低幻觉水平,但表现同样稳定且高可用,这对于驱动 WorkBuddy 从事文字办公类场景会是利好。


赛博史官曰:

在大模型革命性技术出现之前,模型训练恐怕已没有秘密,新一代模型能做多好,多快,更多的是组织学范畴的问题。智谱靠着高速转动的数据飞轮极速崛起,月之暗面靠正确的方法论和一以贯之的坚持一鸣惊人,混元则是这棵树上绽放的新葩。从替补席走到台前的混元如今也需要迎接用户更加挑剔的审视,真正的考验从此刻开始。


原文链接:https://mp.weixin.qq.com/s/t8AQNc1d-cVIdeBl7_jJ1A