一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

刚刚:腾讯混元 Hy3 发布并开源:295B MoE,Agent 能力和产品体验跃升

时间:2026-07-08 08:35:02 编辑:袖梨 来源:一聚教程网

原创 NLPer 2026-07-07 00:00 江苏

腾讯 Hy3 发布并开源~

今天下午,腾讯混元 Hy3 正式发布,并同步开放 Hy3 和 Hy3-FP8 权重。

这是一个面向推理、代码、工具调用和长程任务的大规模 MoE 模型:总参数 295B,激活参数 21B,MTP 层参数 3.8B,支持 256K 上下文。模型权重已经出现在 Hugging Face、ModelScope、GitCode 和 CNB;API 已上腾讯云 TokenHub。

这次发布把 Agent 能力、产品反馈、开源权重、API 价格和部署入口放在了一起。WorkBuddy/CodeBuddy、元宝、Marvis、ima 等腾讯内部产品已经接入 Hy3,腾讯也把真实产品里的任务成功率、稳定性、幻觉率和多轮能力数据一起公布了出来。

Hy3 是腾讯混元从 preview 版本继续往前推进的正式版本。腾讯把它称为“快慢思考融合的混合专家模型”,重点落在办公、代码、搜索、工具调用和多轮任务里的稳定执行。

295B MoE,21B 激活参数

Hy3 采用 MoE 架构,总参数 295B,激活参数 21B,MTP 层参数 3.8B,80 层主网络,192 个专家,每次 Top-8 激活,支持 256K 上下文。

这套规格把 Hy3 放在大规模稀疏模型路线里。总参数规模拉高,用专家路由扩展模型容量;每次只激活一部分参数,把推理成本压到更可用的位置。256K 上下文则对应长文档、长对话、代码仓库和多步骤 Agent 任务。

项目

Hy3 规格

架构

MoE

总参数

295B

激活参数

21B

MTP 层参数

3.8B

主网络层数

80

专家数量

192 experts,Top-8 activated

上下文长度

256K

支持精度

BF16

Hy3 还提供了reasoning_effort参数。示例把no_think作为默认直接回答模式,把high放到数学、代码和复杂推理任务里。日常请求直接回答,复杂任务再拉高推理强度,这会影响速度、成本和最终体验。

从 preview 到 Hy3,重点落到 Agent

Hy3 preview 是 4 月发布的版本,preview 之后腾讯混元团队收到了 50 多个产品团队的反馈,随后修复任务执行和交互里的问题,并继续提升后训练数据质量和规模。

Hy3 的迭代路径更像一条产品反馈链:真实业务先暴露问题,模型团队再把问题回收到后训练和评测里,改进后的能力继续回到产品。

Hy3 已经接入 WorkBuddy/CodeBuddy、元宝、Marvis、ima 等产品,覆盖办公自动化、代码任务、知识库问答、文件编辑、电脑诊断、生活服务和多轮对话等场景。这里考验的不只是问答能力,模型还要理解需求、规划步骤、调用工具、处理失败,再把结果交付出来。几组产品侧数字:

场景

Hy3 相关数据

WorkBuddy

办公任务成功率从 72% 升至 90%,平均耗时缩短 34%

ima

Agent 任务系统稳定性达到 95.1%

Marvis Agent

文件编辑、文件管理、电脑诊断与操作等场景任务完成率达到 93.7%,相比 preview 提升 12.7%

元宝

综合办公与生活服务场景接入 Hy3,用于执行复杂任务并交付 PPT、Word、Excel、PDF、HTML 等文件

放到具体产品里看,这些数字对应的是 Agent 落地时最常见的压力:任务成功率、耗时、工具调用、多轮约束和事实可靠性。

幻觉、多轮和工具调用

一组更贴近产品体验的内部评估:Hy3 在真实场景内部评估中,幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%。综合多轮测试里的问题率从 17.4% 降到 7.9%,MRCR 从 42.9% 提升到 75.1%。

搜索、长文档、知识库问答、办公材料生成,都绕不开事实约束。模型在证据不够时乱补,会直接影响用户能不能把它接进业务链路。

多轮任务的压力也更大。真实需求不会只说一句话就结束,用户会追加限制、修改目标、补充文件、纠正结果,模型要记住前面的约束,不能越跑越偏。

工具调用则决定 Agent 能不能真正执行起来。代码、文件、浏览器、搜索、表格、PPT 生成都依赖工具链。模型如果反复调用错工具、乱填参数、失败后继续硬跑,Agent 就会从自动执行变成自动制造问题。

评测结果

Hy3 的评测图里放了 SWE-bench Pro、SWE-bench Multilingual、NL2repo、Terminal Bench 2.1、BrowseComp、MCP Atlas、ClawEval、SkillsBench、HLE、FrontierScience-Olympiad、MathArena Apex、AA-LCR 等任务。

评测任务的选择也偏向 Agent 和生产力场景。SWE-bench 和 NL2repo 看代码与仓库任务,Terminal Bench 看终端环境下的任务执行,BrowseComp 看浏览器和信息查找,MCP Atlas 看工具生态,ClawEval 和 SkillsBench 更靠近 Agent 技能和工具使用。

Hy3 相比 Hy3 preview 的提升比较集中。例如 Terminal Bench 2.1 从 58.0 提到 71.7,BrowseComp 从 67.1 提到 84.2,NL2repo 从 35.3 提到 45.6,SkillsBench 从 29.1 提到 55.3。它没有在所有项目上压过最强闭源模型,代码、工具、终端、浏览器和长程任务是这次最突出的几条线。

腾讯内部组织了来自不同工种的 270 位专家,在真实工作中盲测模型效果,最后得到 312 条有效比较。结果是 Hy3 均分 2.67/4,高于 GLM-5.1 的 2.51/4,优势主要出现在前端、CI/CD、数据与存储等类别。

盲测数据和公开 benchmark 看的不是同一件事。公开评测看能力边界,真实工作盲测更接近使用体验:模型放进工作流之后,能不能稳定完成任务。

开源入口和调用方式

Hy3 的使用入口已经公开。GitHub 仓库提供模型介绍、benchmark、OpenAI-compatible API 示例、vLLM 和 SGLang 部署命令、微调文档和量化说明。Hugging Face 上tencent/Hy3tencent/Hy3-FP8已经上线。

部署侧,Hy3 给了 vLLM 和 SGLang 两条路线。vLLM 启动命令包含 MTP speculative config、tool-call parser 和 reasoning parser;SGLang 示例也包含 tool-call parser、reasoning parser、speculative 参数和 served model name。除了权重文件,推理框架、工具调用和 reasoning parser 这些工程入口也一起出现了。

API 价格也已经公布,输入 1 元/百万 tokens,输出 4 元/百万 tokens,输入命中缓存 0.25 元/百万 tokens。长上下文和多轮 Agent 任务会反复携带历史、工具结果、文件内容和系统提示,缓存命中价格会直接影响使用成本。

总结

Hy3 这次发布可以看成腾讯混元的一次完整交付:模型规格、开源权重、API 价格、评测图、产品侧反馈和部署入口都放在了一起。

295B 总参数、21B 激活参数、256K 上下文,把 Hy3 放在大规模稀疏模型路线里;Hy3 和 Hy3-FP8 权重同步开放,让开发者可以继续做部署、量化和二次验证;WorkBuddy、ima、Marvis、元宝等产品侧数据,也把模型校准放回了真实场景。

Hy3 后续的表现,要回到开发者工作流里看:能不能稳定读长文档、处理仓库级代码任务、控制工具调用、减少无效重试、在多轮约束下保持方向。单个 benchmark 分数只能说明一部分,真实任务会更快暴露模型的长处和短板。

Hy3 把国产开源模型继续推向 Agent、代码和工具调用这条主线。模型发布也开始从权重和榜单,变成一套更完整的工程交付。

参考链接

  • Hy3 blogpost:https://hy.tencent.com/research/hy3

  • GitHub 仓库:https://github.com/Tencent-Hunyuan/Hy3

  • Hugging Face:Hy3:https://huggingface.co/tencent/Hy3

  • Hugging Face:Hy3-FP8:https://huggingface.co/tencent/Hy3-FP8

  • ModelScope:Hy3:https://modelscope.cn/models/Tencent-Hunyuan/Hy3

  • GitCode:Hy3:https://ai.gitcode.com/tencent_hunyuan/Hy3

进技术交流群请添加AINLP小助手微信(id: ainlp2)

请备注具体方向+所用到的相关技术点

关于AINLP

AINLP 是一个有趣有AI的自然语言处理社区,专注于 AI、NLP、机器学习、深度学习、推荐算法等相关技术的分享,主题包括LLM、预训练模型、自动生成、文本摘要、智能问答、聊天机器人、机器翻译、知识图谱、推荐系统、计算广告、招聘信息、求职经验分享等,欢迎关注!加技术交流群请添加AINLP小助手微信(id:ainlp2),备注工作/研究方向+加群目的。

热门栏目