尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
杀疯了!4GB 显存跑 70B 大模型,不量化不剪枝,GitHub 狂揽 2.8 万 Star
本地跑大模型的人绕不开量化这个词。模型装不下显存就压成 8bit、4bit效果差一点也得接受不然根本跑不起来。我自己的显卡 8G不量化的话14B 以上的模型想都不用想。前阵子翻到 AirLLM 这个项目它做的事情刚好相反不量化不蒸馏不剪枝跑原始权重然后告诉你 4GB 显存就能跑 70B 的模型140GB 的东西塞进 4GB 显存里听着就不太对劲。我把 README 和社区的实测帖都翻了一遍确认它不是吹牛觉得值得写一篇。这项目 2023 年底就有了一直在更新最近支持的模型越来越多热度又起来了。简介AirLLM 是一个 Python 库Apache 2.0 协议开源GitHub 上 2.8万 Star。它的用途就一个让显存不大的显卡也能跑大模型。官方给的数字是这样的模型参数量需要的显存Llama 3.x 70B70B约 4GBLlama 3.1 405B405B约 8GBDeepSeek-V3671B约 12GBKimi K3MoE2.8T实测 3.72GB这些数字说的都是原始权重没有经过量化也就是说跑出来的效果就是模型本来的效果。先把话说在前面它跑得很慢慢到什么程度我在使用场景那节讲能接受这一点再往下看。它能做什么4GB 显存跑 70B 模型大模型推理的时候不是整个模型同时干活是一层一层往下算的。AirLLM 的做法就是显存里只放当前这一层算完挪走再读下一层进来。模型权重整个放在硬盘上用到哪层读哪层。所以显存占用只取决于单层多大跟模型总大小没关系。70B 的模型一层大概 1.6GB4GB 显存够用。MoE 架构的模型还更省DeepSeek-V3、Kimi K3 这种每次推理只激活一部分专家AirLLM 只把当前用到的那个专家读进来所以 2.8T 的模型显存占用也不高。主流开源模型基本都支持用法就是传一个模型 ID一行代码的事。支持的模型列表很长Llama 2/3/3.1/4、Qwen 全系列、DeepSeek V2/V3/R1、Mistral、Mixtral、Phi、Gemma、ChatGLM、百川、InternLM、Yi。官方说新出的热门模型基本发布当天就能用。想快一点可以开压缩默认是不压缩的想快一点的话它给了 4bit 和 8bit 两种压缩选项官方说最多快 3 倍。README 里有张对比图同样一段推理不压缩 449 秒8bit 是 237 秒4bit 是 157 秒。代价是精度有一点损失官方的说法是可以忽略。开压缩之前要先装 bitsandbytes快速开始那节有命令。Mac 和纯 CPU 也能跑没有 N 卡也能用。Mac 只支持 M 系列芯片装好 mlx 和 torch代码跟在 Linux 上写的一样。它还支持纯 CPU 推理速度更慢但能把流程跑通适合手头什么卡都没有的情况。预取机制默认开着GPU 算当前这一层的时候下一层已经在后台从硬盘往内存里读了两件事同时进行官方数据是能快 10% 左右。这个功能默认就是开的我们不用做任何配置。快速开始装库就一行pip install airllm想用压缩加速的话再装一个pip install -U bitsandbytes代码跟平时用 transformers 差不多from airllm import AutoModel model AutoModel.from_pretrained(Qwen/Qwen3-32B) input_text [中国的首都是哪里] input_tokens model.tokenizer(input_text, return_tensorspt, return_attention_maskFalse, truncationTrue, max_length128, paddingFalse) generation_output model.generate( input_tokens[input_ids].cuda(), max_new_tokens20, use_cacheTrue, return_dict_in_generateTrue) print(model.tokenizer.decode(generation_output.sequences[0]))想跑更大的模型改一行模型名就行。Qwen3-235B 大概占 3GB 显存DeepSeek-V3 大概占 12GB。有几个坑提前说一下1、第一次跑的时候它会先把模型整个下载下来再一层一层拆开存到磁盘所以磁盘空间一定要够。70B 的模型光下载就要 130GB 上下拆分还会再占一份。磁盘不够的话报错信息很迷惑官方 FAQ 专门写了这一条。2、模型文件最好放 SSD 上它大部分时间都花在从硬盘读权重机械硬盘会慢到离谱。硬盘实在紧张的话可以传delete_originalTrue拆完之后把原始模型文件删掉能省一半空间。3、Llama 这类需要申请权限的模型要传 Hugging Face 的 token 才能下载。Qwen、DeepSeek 这些没有这道门槛直接下。使用场景先说适合的1、离线批量任务 比如本地有一批文档要总结、一批数据要打标扔给它慢慢跑跑一晚上出结果这种场景速度不重要能跑完就行。2、本地实验和学习 想看看 70B 的模型到底什么水平又不想租云上的卡用它在自己机器上就能试。跑的是原始权重我们看到的效果就是模型真实的效果没有被量化坑过一遍。3、数据不能出本地的场合 有些行业的数据没法传到外面的服务上本地部署是硬要求显存又不够这种时候它是少数几个能走通的方案。再说不适合的任何要实时交互的场景都不行。 在线聊天、客服、代码补全这些等不起它的速度瓶颈在硬盘读数据上快的时候一两秒出一个字慢的时候几十秒出一个字都有可能。社区里有人在 RTX 6000 Ada 上实测跑出过将近 300 秒一个字的成绩它就不是干这个的。想本地跑聊天助手的话用 llama.cpp 或者 Ollama 加载量化模型体验好得多。我的看法我对这个项目的定位是它解决的是能不能跑的问题不是跑得快不快的问题。Hacker News 上有人拿速度说事说一分钟出不了几个字。速度确实是它的短板这个没什么好争的但反过来想手里只有消费级显卡的人以前根本没机会在自己机器上碰 70B、671B 这个量级的模型现在至少能跑了。批量任务挂一晚上早上起来看结果我觉得是可以接受的。我做 Java 出身早几年用大模型就是调接口接口后面怎么跑的跟我没关系。这两年自己折腾本地模型才发现显存是最现实的一道坎多大的模型、多少钱的卡先过这一关再说。AirLLM 把这关的门槛拉得很低这是我介绍它的理由之一。最后强调如果你的需求是本地跑个助手聊天不要用这个等一个字几十秒谁也受不了。它适合的就是批量任务和本地实验这两类事。开源地址https://github.com/lyogavin/airllm点击下方卡片关注极客之家这个公众号曾分享过许多有趣的开源项目。如果你不想逐篇翻阅历史文章也可以直接关注微信公众号“极客之家”通过后台留言与我们互动交流这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容
RELATED

相关推荐

我做了8年技术支持,公司却开始让AI客服替我接工单

我做了8年技术支持,公司却开始让AI客服替我接工单

我是做技术支持和实施的,干了8年,常年泡在客户现场,帮人调系统、排故障、写操作手册。说好听点是客户信赖的“老师”,说难听点就是哪里炸了去哪里的救火队员。 去年下半年,我第一次真觉得饭碗在晃。我们组原本12个人&…

📅 2026/8/23 5:52:40
Nature 文献一键变成中文PPT!谷歌 Notebook LM生成完整结构 + 专业图表,实测体验震撼我一整天

Nature 文献一键变成中文PPT!谷歌 Notebook LM生成完整结构 + 专业图表,实测体验震撼我一整天

各位同仁好,我是七哥。一个在高校里从事人工智能 相关领域研究,钻研用大模型AI实操的学术人。可以和七哥交流学术写作或Gemini、GPT、Claude 等大模型 学术实操相关问题,多多交流,相互成就,共同进步。 这次谷歌旗下的Notebook LM也升级了,它将这两能力融合在一起,可…

📅 2026/8/23 5:52:41
3步快速掌握Workstation.UaClient:构建高效OPC UA工业通信应用

3步快速掌握Workstation.UaClient:构建高效OPC UA工业通信应用

3步快速掌握Workstation.UaClient:构建高效OPC UA工业通信应用 【免费下载链接】opc-ua-client Visualize and control your enterprise using OPC Unified Architecture (OPC UA) and Visual Studio. 项目地址: https://gitcode.com/gh_mirrors/op/opc-ua-client…

📅 2026/8/23 5:52:41
MORE NEWS

更多资讯

📰

鸿蒙串口直连:Flutter+libserialport FFI适配指南

1. 为什么工业串口通讯在鸿蒙上绕不开“物理层直连” 做物联网硬件接入的人,几乎每天都要和串口打交道。RS232、RS485、TTL电平,这些在应用层开发者眼里快被遗忘的老家伙,却是工业现场最可靠的“默认语言”。我在一个基于Flutter的物联网网关…

📰

OSINT情报分析中的进制转换实战:从日志到线索

刚开始接触开源网络情报的时候,我也是从一份乱糟糟的日志开始。那次分析任务里有一串看起来像是随机字符的东西: 5052494e54455354 。旁边还跟着一个IP段,一个MAC地址前缀。当时我盯了半天,脑子里全是浆糊——直到我把那串十六进…

📰

SSM实战:智慧社区缴费报修平台的设计与开发

刚拿到"智慧社区缴费报修服务平台"这个需求时,我心里其实有点复杂。SSM(Spring SpringMVC MyBatis)这套组合在今天的Java生态里已经算老古董了,身边不少同事已经换上Spring Boot全家桶。但项目背景摆在那里&#xff1…

📰

SpringBoot家政服务管理系统:订单状态机与连锁门店分账设计实战

做家政服务管理系统这类项目,很多人第一反应是“这不就是一个订单加用户的 CRUD 项目吗”。等真正动手才会发现,前面的判断只对了一半:单看功能入口,确实是下单、派单、完成、结算这条线;但把标题里“一站式家政服务运…

📰

从C语言到Redis:深度解析数据类型的存储、转换与工程陷阱

1. "0000"背后的四个维度:看懂数据类型的本质1.1 一个数字的不同身份"0000"这个字符串,几乎是每个程序员最早敲进编辑器的东西。但你有没有想过:同样的四个零,在C语言里是int,在Python里是int但背…

📰

Oracle存储过程中显示游标(cursor)的使用:从声明到循环取数的完整实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬