# 混元Hy4 preview发布:770B开源、1M上下文,腾讯这次先把模型塞进真实工作流
前面我们刚写完 GLM-5.3:同一个基座靠后训练,把长程 Coding 继续往上推。
8 月 28 日,腾讯混元也交卷了:Hy4 preview 已经放出权重,而且不是只讲聊天能力,直接把重点写成“真实生产力”。
软件工程、跨文件办公、游戏原型、科研推理,这些都是它要打的场景。
先把结论放前面:Hy4 preview 很值得试,但别因为“770B、1M、开源”三个词就把它当成所有项目的默认答案。 它现在是 preview,官方自己也承认复杂任务会想得偏久、会过度验证;适合拿真实任务测,不适合只看一张柱状图下结论。
下面这张是腾讯 8 月 28 日发布页的首屏截图,发布时间和“开源、生产力场景”的定位都在这里。

# 一、先把发布信息说清楚
截至本文发布,Hy4 preview 的关键信息如下:
| 项目 | 信息 |
|---|---|
| 发布与开源 | 2026 年 8 月 28 日发布,权重已在 Hugging Face、ModelScope、GitCode、CNB 等平台开放 |
| 模型架构 | MoE,总参数 770B,单 Token 激活 49B |
| 上下文 | 1M Token |
| 许可证 | Apache License 2.0,可用于商业场景,但仍要遵守许可证和平台规则 |
| 体验入口 | WorkBuddy、CodeBuddy、元宝、ima;也可用腾讯云 TokenHub、OpenRouter API |
| 首发活动 | WorkBuddy / CodeBuddy 限时两周免费体验 |
| API 参考价 | 输入 6 元/百万 Token、输出 18 元/百万 Token、缓存命中 0.3 元/百万 Token |
上面每一项不是二手转述:开源、产品入口、免费体验和美元计价可以在 腾讯官方发布页 (opens new window) 核对;模型链接、许可证、推理参数和部署命令则在 官方 GitHub 仓库 (opens new window) 里。
这里有一个容易被标题带偏的点。
“770B”不是一次请求就要完整激活 770B 参数。 Hy4 是混合专家模型(MoE):官方说明它有 256 个路由专家和 1 个共享专家,每个 Token 会选中其中 8 个路由专家再加共享专家,所以激活参数是 49B。
这不等于本地部署就轻松。推理时仍要存下大体量权重、KV Cache 和并发资源。官方 vLLM 示例为 FP8 版本配置了 8 路张量并行;想私有化的录友,先算显存、机器和吞吐,不要只拿“49B 激活”当采购依据。
# 二、它不是只把模型做大,而是盯着“把活干完”
腾讯给 Hy4 的定位是“为生产力而生”。这个词听着像发布会话术,拆开看其实对应四类很具体的任务:
- 软件工程:理解代码、规划、调试、验证长程开发任务,连前端视觉和交互也被单独提到。
- 办公和分析:从多份杂乱材料里做分析,再交付文档、表格、演示稿。
- 游戏开发:一句需求起一个可玩的原型,并能围绕游戏引擎多轮迭代。
- 科学研究:AI 研发、分子动力学、凝聚态物理、基础数学等复杂问题的理解和求解。
官方发布页还给出了多项基准图。截图里的蓝柱子是 Hy4;但要注意,这些结果和基准设置由官方发布,能说明模型覆盖面广,不能替代你自己仓库里的成功率测试。

更值得关注的是它的训练闭环。
Hy4 preview 首次参与了训练方法、数据策略、评估体系和底层算子的自动优化:模型提出方案,跑实验,把代码、日志和结果带回下一轮探索。官方称,它还会分析推理系统瓶颈,在算子融合、通信优化等方向迭代,端到端吞吐相对基线提升 31.8%。
别把这句话理解成“模型已经自动把自己训练成更强模型”。准确说,它进入了有人设计边界、可运行实验和反馈回流的研发循环。 模型能给出候选方案、执行和归因,但目标定义、环境控制、评价标准仍然是研发团队搭好的。这个方向真正有价值的地方,是把 Agent 从“写一次代码”往“持续做实验并验收结果”推进。
# 三、2.99 分领先了,但这不是第三方冠军宣言
发布资料中最容易传播的一组数字,是 163 名腾讯内部专家、203 个工程任务的盲测:
| 对比 | Hy4 preview | 对方 | 该怎么读 |
|---|---|---|---|
| 对 GLM-5.3 | 2.99 / 4.00 | 2.92 / 4.00 | Hy4 略高,差距 0.07 分 |
| 对 Kimi K3 | 2.99 / 4.00 | 2.94 / 4.00 | Hy4 略高,差距 0.05 分 |
数据出自腾讯官方,评测是内部组织的盲测,不是公开、独立、可完全复现的排行榜。官方仓库还给出胜平负:对 GLM-5.3 为 46.8% 胜 / 12.8% 平 / 40.4% 负;对 Kimi K3 为 51.2% 胜 / 7.9% 平 / 40.9% 负。
所以我的解读很克制:它足以证明 Hy4 已经能坐上第一梯队的牌桌,但不够证明“所有任务都全面胜过 GLM 或 Kimi”。 两场对比的胜负都没有拉开到碾压,提示词、工具权限、上下文材料、评委标准,都会改变结果。
这也是为什么我更看重真实长任务。InfoQ 的独立上手里,Hy4 能完成复杂的采购调研、四端产品和季度复盘,但也出现了报价口径不一致、简单算术出错、交付脚本路径写死等“最后一公里”问题。这份实测 (opens new window) 的结论很像多数开发者会遇到的现实:它可以当能干的执行者,关键结论和交付验收仍要有人把关。
# 四、preview 不只是后缀,官方把短板写出来了
很多模型发布喜欢只写能力清单,Hy4 的官方仓库特意放了 Known Limitations:
- 复杂任务的推理时间有时比需要的更长。
- 有过度验证自己工作的倾向。
- 预训练和后训练还有提升空间,所以先用 preview 收集真实反馈。
这三个字很关键。
“更会检查”不总是好事。 对高失败成本的改代码、数学、复杂排障,多检查几轮可能换来成功率;对批量分类、格式转换、能自动校验的流水线,过长推理会直接变成延迟和账单。
官方 API 默认是 high 推理强度,想要直接回答可传 reasoning_effort: "no_think"。最实用的测试方式不是问它“你强不强”,而是拿同一批真实任务分别测高推理和无思考模式,记录:
- 一次完成率;
- 总 Token 与耗时;
- 人工接管次数;
- 自动化测试、构建、数据校验的最终通过率。
这四项会比“某个榜第几名”更接近你的成本。
# 五、开源真正改变的是选择空间
闭源模型再强,如果代码、数据或模型权重不能离开内网,它仍然可能不在候选名单里。
Hy4 preview 用 Apache-2.0 发布,并同时提供 FP8 权重、vLLM / SGLang 的部署指引、OpenAI 兼容 API、工具调用和推理解析配置。这意味着它比“仅能网页聊天”的模型多了三条路:
- 内网或专有云部署,数据边界由团队自己控制;
- 用自己的工具链、审计和 Agent 框架接入;
- 根据业务做量化、微调或二次工程优化。
但开源不是零成本。
模型尺寸、GPU、服务稳定性、权重版本、监控、内容安全和升级维护,都会从云厂商账单变成你自己的工程账单。私有化是“可控性”换“运维责任”,不是免费 API。
如果只是先验证任务适配性,优先用 WorkBuddy / CodeBuddy 或 API 跑小规模 A/B;只有数据边界或稳定吞吐是真需求,再进入部署评估。
# 六、和 GLM-5.3、Kimi K3、DeepSeek V4 怎么选
不站队,还是算三笔账:失败成本、数据边界、任务规模。
| 你的处境 | 建议优先试谁 | 原因 |
|---|---|---|
| 代码、资料不能出内网,且有运维能力 | Hy4 preview | 权重已开源,Apache-2.0,部署和工具调用文档齐全 |
| 中长程 Coding、Agent 任务,要看公开的后训练打法 | GLM-5.3 与 Hy4 同题 A/B | GLM-5.3 强调长程 Coding 后训练;Hy4 强调真实生产力和开源,别用别人的柱状图替代自己的仓库 |
| 前端交互、视觉理解或多模态工作流 | Kimi K3 / 有视觉能力的模型 | Hy4 此次主打的是文本生产力模型,任务输入不止文字时先确认能力边界 |
| 批量、可自动验收、价格高度敏感 | DeepSeek V4 | 能便宜地跑量,优先看总成本和自动验收;不必每一步都上最大模型 |
| 失败一次代价极高的核心工程 | 顶级闭源模型 + 人工复核 | 成功率、工具稳定性、审计流程比“是否开源”更优先;Hy4 可以作为第二个审稿人或候选方案 |
Hy4 最大的优势,不是替所有人做统一答案,而是把“开源、长上下文、生产力 Agent”一起放进了可选项。
已经在用国产模型的录友,可以先用两个任务试:一个是带测试的真实代码修改,一个是多文件分析后产出文档。不要给标准答案,保留你平常会遇到的脏数据、冲突需求和失败命令。
模型选型不是看谁发布得更响,是看谁在你的约束里交付得更稳。
# 资料来源
腾讯官方发布公告:https://www.tencent.com/zh-cn/tencent-releases-and-open-sources-tencent-hy4-preview/
Tencent-Hunyuan/Hy4-preview 官方仓库:https://github.com/Tencent-Hunyuan/Hy4-preview
Hy4 preview Hugging Face 模型卡:https://huggingface.co/tencent/Hy4-preview
InfoQ:WorkBuddy 实测与局限:https://www.infoq.cn/article/SxrNXURUimQf4hL83ybj
评论
验证登录状态...