采编:互联网的一些事(imyixieshi)


8月28日,腾讯混元发布并开源新一代大语言模型Hy4 preview。

这次模型的总参数量做到7700亿,激活参数490亿,上下文长度达到100万Token。上一代Hy3的总参数量为2950亿。相比之下,Hy4 preview的规模直接扩大了一大截。

参数变大只是其中一项,腾讯这次公布的测试成绩,也有不少变化。
在Terminal Bench 2.1测试中,Hy4 preview拿到85.4分,比Hy3高14.6分。按照腾讯公布的数据,这一成绩超过DeepSeek V4 Pro,并与Claude Opus 5持平。
DeepSWE的变化更加明显,Hy3在这项测试中的成绩是28.0分,Hy4 preview提升到64.3分。
这类测试主要看软件工程能力。简单说,就是模型不只是写几段代码,还要处理更完整的软件开发任务。
腾讯混元还公布了Hy4 preview的API费用 。输入费用 为6元/百万Token,输出费用 为18元/百万Token,缓存命中费用 为0.3元/百万Token。

近来 ,Hy4 preview已经开源,腾讯元宝、ima、WorkBuddy、CodeBuddy等产品都已经接入。腾讯云TokenHub和OpenRouter也可以调用相关API。
其中,WorkBuddy给了两周限时体验。

腾讯公司公关总监张军8月28日公布消息称,Hy4 preview即日起在WorkBuddy开放限时体验。同时,Hy3的免费体验时间延长到9月30日。

对于普通用户来说,这个安排倒是比较简单。新模型可以直接试,旧模型也还能继续用。
至于770B参数到底能带来多大的变化,还是得实际用起来才知道。
腾讯这次重点展示的场景,主要有四个:软件工程、办公分析、游戏开发和科学研究。
软件工程方面,Hy4 preview增加了对长周期开发任务的理解、规划、调试和验证能力。前端代码生成也进行了优化,包括页面视觉效果和交互体验。
办公方面,腾讯提到了复杂文档处理、数据分析和跨文件协作。比如把一堆资料交给模型,它可以先提取信息,再继续生成文档、表格和演示文稿。
游戏开发方面,模型支持根据需求生成可运行的游戏原型,并可以通过多轮交互继续修改项目,同时支持主流游戏引擎的操作。输入需求后,模型可以生成可运行的游戏原型。后面还可以继续对项目进行修改。
科研方面,腾讯混元公布了一项比较特殊的测试结果。配合科研智能体Hyra,Hy4 preview参与了三维Blaschke–Lebesgue几何问题的研究。腾讯称,相关体积下界从0.380799推进到了0.41104。
另外,腾讯还组织了一轮内部盲测。共有163名内部专家参与,测试覆盖203个工程任务。Hy4 preview平均得分2.99分,满分4分。同一轮测试中,GLM-5.3得分2.92分,Kimi K3得分2.94分。
两两比较时,Hy4 preview对GLM-5.3的胜率为46.8%,对Kimi K3的胜率为51.2%。
这组数据是腾讯内部测试结果,具体测试任务和评分方式并没有全部公开,所以更适合当作借鉴 。

腾讯方面表示,Hy4 preview近来 仍处于早期版本阶段,训练过程还有优化空间。在部分复杂任务中,模型存在过度自我验证的问题。
此外,Hy4 preview属于语言模型,没有原生多模态生成能力。涉及图片任务时,平台会自动切换其他模型,并按照对应规则计算积分。
近来 ,模型已经上线腾讯旗下多个产品。WorkBuddy两周限时体验,Hy3则免费到9月30日。
7700亿参数看起来很大,但真正用起来怎么样,还得看普通用户自己跑一遍。尤其是写代码、处理文件、做数据分析这些任务,实际感受可能比参数数字更直接。
你觉得本次Hy4 preview的升级,能否拉近国产开源大模型与海外顶尖模型的差距?





