尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Kimi k3 “deepseek 2.0时刻”
Kimi K3‌是月之暗面公司于‌2026 年 7 月 17 日‌正式发布的新一代 AI 大模型拥有‌2.8 万亿参数‌和‌100 万 token 上下文窗口‌是全球参数规模最大的开源模型已于‌2026 年 7 月 27 日晚‌正式开源模型权重与技术报告。k3的编程能力‌在 Code Arena 前端编程榜单中以‌1679 分‌登顶首位超过 Claude Fable 5 的 1631 分这是开源模型第一次在这个维度上反超顶级闭源。‌综合能力在 Artificial Analysis Intelligence Index 中获得‌57 分‌位列全球第三仅次于 Claude Fable 5 和 GPT-5.6 Sol马斯克也对kimi k3进行了称赞紧接着用户量的暴涨导致算力不足暂停会员注册这次的热度被称为deepseek 2.0时刻。一、核心特点1. 用更少的计算承载更大的模型Kimi K3总参数量达到2.8万亿但每次推理只调用约1040亿参数。相比所有参数都参与计算的传统稠密模型它能在扩大知识容量的同时控制计算量。相较Kimi K2K3的整体扩展效率提高约2.5倍。这意味着K3的提升不只是“参数更多”而是能够以更高效率利用这些参数。2. 从处理长文档升级到处理完整项目K3支持约100万token上下文是常见128K模型的近8倍、256K模型的约4倍。这使它不仅能阅读一篇长文档还可以同时处理大型代码仓库、多份研究资料和较长的工具调用记录。相比上下文较短的模型K3在长时间编程和跨文件分析中更不容易遗忘前面的要求。3. 从“生成代码”升级到“完成工程”传统代码模型擅长补全函数或生成单个文件但面对真实项目往往难以持续完成查看代码、修改文件、运行测试和修复错误的完整流程。K3更强调长程编程和工具操作。在Terminal-Bench 2.1中K3取得88.3分与GPT-5.6 Sol的88.8分接近在SWE-Marathon中取得42.0分高于GPT-5.6 Sol的39.0分和Claude Fable 5的35.0分。因此K3的主要突破不是“更会写代码”而是更接近能够独立推进项目的工程智能体。4. 从“回答问题”升级到“交付成果”K3能够连续搜索资料、分析数据、运行代码并最终制作报告、电子表格、网页或演示文稿。在AA-Briefcase办公任务测试中K3发布初期取得1543 Elo排名第二其分析质量Elo达到1754略高于Claude Fable 5的1744。不过K3的演示质量Elo为1471低于GPT-5.6 Sol的1660说明它在分析能力上更突出成果的视觉表达仍有提升空间。5. 同时理解文字和视觉信息K3能够直接理解图片、网页截图、图表和设计稿。相比先通过OCR提取文字、再由语言模型分析的传统方案它可以保留布局、颜色和空间关系。这让K3在网页复刻、界面操作和视觉编程中更具优势。发布后K3一度在Arena React代码榜以1694分排名第一显示出较强的前端生成能力。总体来看K3的超越主要集中在长程编程、多文件分析、工具调用和成果交付上并不意味着它在所有场景中都全面领先。以Arena通用文本榜为例K3 Max截至2026年7月29日以1486±10分暂列第11名其优势明显偏向复杂任务而非普通对话。二、背后的主要技术传统上把一个语言模型做大主要就是堆层数、堆参数。K3 的设计思路更立体它让信息沿着三个方向同时流动序列长度、网络深度、模型宽度。你可以把它想象成一栋楼长度是每层楼有多宽敞深度是楼有多少层宽度是每层能同时容纳多少个专业工种。序列方向上K3 用了一套混合注意力把三层 Kimi Delta Attention 配一层 Gated MLA三比一的比例贯穿整个网络。深度方向上一套叫 Attention Residuals 的机制让每一层都能回头看之前所有层的信息。宽度方向上每层注意力后面接一个 Stable LatentMoE从896个专家里每次只挑16个干活。右侧是主干每个 block 由三层 KDA 加一层 Gated MLA 组成暗红色的连线就是 AttnRes让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家左下是 KDA 模块底部是原生视觉通路 MoonViT-V2。1. KDA 混合线性注意力Kimi Delta AttentionKDA用于降低长序列的注意力计算成本。传统 Softmax 注意力处理 1M 上下文时KV Cache 会直接撑爆显存。K3 的方案是每个 Block 3 层 KDA 1 层 Gated MLA线性注意力把注意力成本从平方级压到线性级——不必每来一个新 token 就重翻全部历史只维护一个持续更新的笔记本KDA 更进一步给笔记本每一栏配了可学习的遗忘开关由模型决定哪些需要记住哪些需要遗忘Gated MLA全局注意力则周期性保留精确的全局检索能力防止细节丢失通过3 层 KDA 线性注意力 1 层 Gated MLA 全局注意力”的 3:1 组合将百万级上下文解码速度提升约 6.3 倍。2.Attention Residuals注意力残差常规的深层网络有个隐忧信息是一层一层顺着往上传的传到几十层之后最底下那层学到的东西可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传传到最后跟原话往往对不上。注意力残差让网络里每一个模块都能越过中间所有层直接回头去调取最初的输入、以及之前任意一个模块的输出。普通网络像流水线上的工人只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人随时能调出仓库里的原材料和之前任何一道工序的成品按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。AttnRes改善信息在深层网络中的传递减少模型层数增加后出现的信息损失Gated MLA通过压缩注意力中的键值信息降低KV缓存占用并利用门控机制动态控制信息传递。K3的93层网络中有69层使用KDA、24层使用Gated MLA从而兼顾长上下文效率和信息处理精度。3. Stable LatentMoE 超稀疏 MoEK3采用Stable LatentMoE混合专家架构总参数量达到2.8万亿但每个token仅激活约1040亿参数。模型设置896个专家每次只选择其中16个参与计算。相当于把一个巨大的模型拆成很多个专家子网络每次只唤醒其中几个来处理当前的输入。好比一家 896 人的会诊医院每个病人只安排 16 个最对口的专家出诊其他人待命。医院名义规模巨大但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因参数量做得极大但每个 token 实际激活的计算量被控制得很小。相比所有参数同时参与推理的稠密模型这种稀疏激活方式既能扩大模型容量又能控制计算成本。官方称其整体扩展效率较Kimi K2提升约2.5倍。4.原生多模态MoonViT-V2K3集成约4.01亿参数的MoonViT-V2视觉编码器将图片信息转换成模型能够理解的表示并与文字共同参与推理。相比“先用OCR识别文字再交给语言模型”的方案原生多模态能够保留图片中的布局、颜色和空间关系因此更适合网页截图复刻、图表分析、界面操作和视觉编程。总结K3 的最大意义不在于参数最大而在于验证了开源模型也可以在超长上下文智能体这个闭源最后的堡垒上掰手腕,让国产模型的优点不再只是便宜。
RELATED

相关推荐

解决欧路词典与WD Discovery冲突的DLL兼容性问题

解决欧路词典与WD Discovery冲突的DLL兼容性问题

1. 问题现象与初步诊断最近遇到一个挺有意思的故障案例:用户运行欧路词典时突然弹出"FuncServer_WDC_x86.exe 应用程序错误"的提示框,导致软件无法正常使用。这个错误提示看起来像是某个后台服务进程崩溃了,但实际排查后发现解决方…

📅 2026/9/11 5:13:56
5分钟上手alpaca-backtrader-api:从安装到第一个回测策略的快速教程

5分钟上手alpaca-backtrader-api:从安装到第一个回测策略的快速教程

5分钟上手alpaca-backtrader-api:从安装到第一个回测策略的快速教程 【免费下载链接】alpaca-backtrader-api Alpaca Trading API integrated with backtrader 项目地址: https://gitcode.com/gh_mirrors/al/alpaca-backtrader-api alpaca-backtrader-api是…

📅 2026/9/11 19:34:23
Pixie性能优化指南:提升PHP数据库操作速度的10个技巧

Pixie性能优化指南:提升PHP数据库操作速度的10个技巧

Pixie性能优化指南:提升PHP数据库操作速度的10个技巧 【免费下载链接】pixie Database query builder for PHP, framework agnostic, lightweight and expressive. 项目地址: https://gitcode.com/gh_mirrors/pixie3/pixie Pixie是一款轻量级、表达力强的PHP…

📅 2026/9/13 9:17:18
MORE NEWS

更多资讯

📰

DeepSeek Harness桌面端实测:插件与Skill体系、内网部署及使用指南

DeepSeek Harness 出了桌面端?消息是周五晚上在技术群里看到的,当时有人发了句“deepseek harness桌面版写综述巨好用”,底下瞬间炸出几十条追问:怎么装、插件怎么选、能不能在内网跑。我原本以为这玩意儿就是个命令行工具套了个界…

📰

Obsidian + WorkBuddy + Gitee:本地优先的 AI 知识库搭建指南

1. 为什么我要折腾这套组合拳先说结论:我用了大半年时间,把散落在微信收藏、浏览器书签、备忘录、各种云文档里的东西,全部收拢到了一个本地优先的知识库里。核心工具就三样——Obsidian做知识容器,WorkBuddy做 AI 处理引擎&#…

📰

GPT-6 Astra与Tripo3D:智慧农业3D大屏从调研到可巡检实录

用 GPT-6 Astra 和 Tripo3D 做智慧农业 3D 大屏:从调研到可巡检园区全流程实录1. 项目概述:为什么我会想把 AI 大模型和 3D 生成塞进农业大屏先说结论:这个项目不是做一个“好看的数字孪生演示”,而是真正要落地的可巡检园区系统。…

📰

Unity3D双人联网跑酷源码拆解:网络同步实现与避坑指南

简介:一份基于Unity3D的双人联网跑酷游戏完整工程,面向游戏开发初学者、进阶学习者,也可用作毕业设计、课程设计或工程实训项目。项目围绕双人联机对战与跑酷玩法展开,涵盖场景搭建、角色控制、网络同步、UI交互等核心模块&#x…

📰

博途HMI组态从入门到实战:选型、变量连接、仿真调试与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

一键派活AI Agent:从灵感到任务闭环的卡片管理法

你有没有过这种感觉:灵光一闪的时候,激动得恨不得马上落地,赶紧把它丢进待办清单,但过了几天再看,那条待办依然只有一句话,既想不起背景,也搞不清下一步。更气人的是,当你终于下定决…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬