尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
腾讯混元Hy3深度解析:295B参数只激活21B,推理效率怎么做到提升40%的
7月6日腾讯混元Hy3正式发布7月20日宣布限时免费延长到8月5日。说实话295B参数、Apache 2.0开源、API定价输入1元/输出4元/百万token——这些数字单独拿出来都不算特别惊人但放在一起看你会发现腾讯这次打了一套组合拳。我最感兴趣的不是参数规模而是它那个快慢思考融合的架构设计。295B的总参数一次推理只激活21B——这个7%的激活率在MoE模型里算是相当激进的。更关键的是它把快思考和慢思考两个模式融合在同一个模型里而不是像GPT-5那样需要显式地切换推理模式。快慢思考融合Hy3最被低估的设计快慢思考这个概念来自丹尼尔·卡尼曼的《思考快与慢》。简单说人脑有两种思考模式系统1快思考是直觉的、自动的、不费力的系统2慢思考是分析的、刻意的、费力的。在AI领域这个概念的落地方式是对于简单问题比如今天天气怎么样用快模式快速回答对于复杂问题比如帮我分析这个代码库的性能瓶颈用慢模式深度思考。GPT-5的做法是用户自己选择用哪个模式。Hy3的做法不一样——它把两个模式融合在同一个模型里模型自己判断该用哪个模式。简单问题复杂问题用户输入Hy3 路由判断快思考路径激活 21B 参数慢思考路径激活更多专家单次推理延迟 500ms成本低0.56元/百万token多步推理Chain-of-Thought激活额外专家如代码/数学专家成本高输出 4元/百万token输出结果这个设计的巧妙之处在于用户不需要显式选择模式模型自己判断任务的复杂度。你问11等于几它自动走快路径你问帮我分析这个SQL查询的性能瓶颈并给出优化建议它自动走慢路径。实现这个的关键是Hy3的动态门控机制——一个轻量级的分类器在推理前先判断token的复杂度然后决定激活哪些专家。# Hy3 快慢思考融合的简化实现importtorchimporttorch.nn.functionalasFclassFastSlowRouter(torch.nn.Module):Hy3 风格的快慢思考路由器def__init__(self,d_model:int,n_fast_experts:int,n_slow_experts:int):super().__init__()self.d_modeld_model self.n_fastn_fast_experts self.n_slown_slow_experts# 复杂度判断器预测 token 是否需要慢思考self.complexity_gatetorch.nn.Sequential(torch.nn.Linear(d_model,d_model//4),torch.nn.GELU(),torch.nn.Linear(d_model//4,1),torch.nn.Sigmoid())# 专家路由门self.fast_gatetorch.nn.Linear(d_model,n_fast_experts,biasFalse)self.slow_gatetorch.nn.Linear(d_model,n_slow_experts,biasFalse)defforward(self,x:torch.Tensor,fast_experts:list,slow_experts:list): x: [batch, seq, d_model] # 步骤1: 判断复杂度complexityself.complexity_gate(x)# [batch, seq, 1]# 步骤2: 根据复杂度分配专家fast_logitsself.fast_gate(x)# [batch, seq, n_fast]slow_logitsself.slow_gate(x)# [batch, seq, n_slow]# 复杂度低 → 多用快专家复杂度高 → 多用慢专家fast_weightsF.softmax(fast_logits,dim-1)*(1-complexity)slow_weightsF.softmax(slow_logits,dim-1)*complexity# 步骤3: 加权融合快慢专家输出outputtorch.zeros_like(x)fore,expertinenumerate(fast_experts):outputfast_weights[:,:,e:e1]*expert(x)fore,expertinenumerate(slow_experts):outputslow_weights[:,:,e:e1]*expert(x)returnoutput为什么只激活21B是个巧妙的设计Hy3的295B参数中一次推理只激活21B——也就是7%的激活率。这个数字看起来很小但背后有个很精妙的计算参数多 知识容量大。295B参数意味着模型可以记住更多的知识、更多的模式、更多的语言习惯。在需要广博知识的任务上比如开放域问答、多语言翻译大参数量的优势很明显。激活少 推理快、成本低。每次推理只激活21B意味着计算量和显存占用都只有21B量级。这比全量推理295B少了93%的计算量。换句话说Hy3的策略是用295B的参数来存储知识用21B的激活来执行推理。存储和计算分离这在MoE架构里是一个经典的优化思路但Hy3把它做到了一个比较极致的程度。Hy3 MoE 模型93% 参数不参与计算295B 参数知识存储21B 激活推理执行推理节省显存和算力传统 Dense 模型70B 参数70B 激活推理限时免费背后的商业逻辑腾讯把Hy3的限时免费延长到8月5日这个操作值得玩味。从表面上看这是让更多用户体验产品。但往深了想腾讯在下一盘更大的棋Hy3不只是一个大模型它是腾讯整个AI生态的入口。Hy3背后连着腾讯的多个产品线微信的AI助手、腾讯云的AI服务、腾讯文档的智能写作、企业微信的智能客服。用户通过Hy3的API进来了后面自然会被引导到腾讯的整个生态里。# 腾讯 AI 生态的模型路由概念性代码classTencentAIRouter:腾讯内部 AI 模型路由MODELS{hunyuan_hy3:{api:https://api.hunyuan.cloud.tencent.com/v1,use_case:通用对话、代码生成、文档写作,pricing:输入1元/输出4元/百万token,},hunyuan_hy3_free:{api:https://api.hunyuan.cloud.tencent.com/v1/free,use_case:免费试用限时到8月5日,pricing:免费,},}defroute(self,user_tier:str)-str:ifuser_tierfree_trial:returnhunyuan_hy3_freereturnhunyuan_hy3这和OpenAI的策略完全不同。OpenAI的全系产品都是闭源的你只能通过API用——用多少付多少。腾讯走的是开源免费试用生态绑定的路线——开源吸引开发者免费试用降低门槛生态绑定实现商业变现。写在最后腾讯混元Hy3的发布让我看到了国产大模型在技术架构创新上的一个有意思的尝试。快慢思考融合不是一个新的概念但Hy3把它做到了模型内自动判断的程度这在工程上确实需要不小的勇气。295B参数只激活21B推理效率提升40%Apache 2.0开源限时免费——这些数字和策略放在一起腾讯的意图很明确在AI大模型的牌桌上既要占技术位又要占生态位。对开发者来说Hy3的免费期到8月5日现在是体验的最佳时机。用过的都懂等收费了再想白嫖就来不及了。标签腾讯混元Hy3、MoE架构、快慢思考、开源大模型、AI推理优化
RELATED

相关推荐

# 倒计时器 — HarmonyOS TextInput与计时任务管理深入实践

# 倒计时器 — HarmonyOS TextInput与计时任务管理深入实践

一、应用概述 倒计时器(Countdown Timer)是日常生活中使用频率极高的工具类应用,广泛应用于烹饪计时、番茄工作法、运动训练、考试倒计时、会议提醒等场景。不同于普通的时钟或秒表,倒计时器的核心逻辑是从预设的时间点递减至零&a…

📅 2026/8/24 23:56:32
2026年上半年十大网络攻击和数据泄露事件

2026年上半年十大网络攻击和数据泄露事件

2026年上半年,网络攻击和数据泄露事件再次激增,影响范围广泛;诸多迹象表明,人工智能技术的使用日益普及。重大事件包括针对思科SD-WAN系统的零日攻击,以及针对Ivanti和Fortinet管理工具的漏洞利用;此外&…

📅 2026/8/24 23:56:36
LangChain 是一个用于开发基于大语言模型(LLM)应用的开源框架,旨在简化 LLM 应用的构建流程

LangChain 是一个用于开发基于大语言模型(LLM)应用的开源框架,旨在简化 LLM 应用的构建流程

LangChain 是一个用于开发基于大语言模型(LLM)应用的开源框架,旨在简化 LLM 应用的构建流程,支持链式调用(Chains)、数据检索增强(RAG)、记忆管理(Memory)、工…

📅 2026/8/24 23:56:35
MORE NEWS

更多资讯

📰

Semantic Kernel Python OpenAPI 插件实战:从 OpenAPI 规范到可调用 Kernel Function 的完整示例解析

Semantic Kernel Python OpenAPI 插件实战:从 OpenAPI 规范到可调用 Kernel Function 的完整示例解析 【免费下载链接】semantic-kernel Integrate cutting-edge LLM technology quickly and easily into your apps 项目地址: https://gitcode.com/GitHub_Trendin…

📰

汽车油耗计算方法与影响因素全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

DeepTutor 快速上手指南:4 步把你的讲义变成会引经据典的私人 AI 导师

DeepTutor 快速上手指南:4 步把你的讲义变成会引经据典的私人 AI 导师 【免费下载链接】DeepTutor DeepTutor: Lifelong Personalized Tutoring. https://deeptutor.info/. 项目地址: https://gitcode.com/GitHub_Trending/dee/DeepTutor 你让 AI 讲一道题&a…

📰

GPT Researcher 如何用 source_urls 与 complement_source_urls 只研究指定的一组网页

GPT Researcher 如何用 source_urls 与 complement_source_urls 只研究指定的一组网页 【免费下载链接】gpt-researcher An autonomous agent that conducts deep research on any data using any LLM providers 项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-resea…

📰

开源AI Agent平台选型实战:10款企业级工具对比

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

MongoDB索引构建策略:优化性能与减少阻塞影响的实践

MongoDB索引构建策略:优化性能与减少阻塞影响的实践 1. MongoDB索引构建基础与挑战 MongoDB作为NoSQL数据库的代表,其索引机制直接影响查询性能。索引构建是数据库日常维护的重要环节,尤其在数据量大的环境下,不当的索引策略可能导…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬