尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
大模型压缩神器AngelSlim完全指南:量化、投机解码、稀疏化一站式搞定
人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是腾讯混元团队开源的大模型压缩工具包将量化、投机解码投机采样、稀疏注意力、蒸馏、Token 剪枝等主流模型压缩算法整合进统一框架覆盖 Qwen3、Hunyuan、DeepSeek、GLM 等主流 LLM/VLM/语音/扩散模型端到端打通从压缩到部署的全流程。本文面向新手带你 5 分钟上手这个「大模型压缩神器」掌握一键量化、推理加速与长上下文稀疏化的完整用法。 认识AngelSlim一站式大模型压缩工具箱AngelSlim 的设计目标是更易用 更全面 更高效高度集成FP8/INT8/INT4 量化、Eagle3 投机解码训练、Stem 稀疏注意力等算法全部注册进统一引擎一条命令即可调用持续创新除工业界通用算法外还内置自研算法如 DAQ、DFlare、D-Cut、Stem、LeptoQuant 等性能导向支持在单卡上完成 Qwen3-235B、DeepSeek-R1 级别大模型的量化压缩。它覆盖的模型场景与压缩策略如下模型类型量化投机解码其他压缩技术LLMQwen3/Hunyuan/DeepSeek/GLMFP8、INT8、INT4-GPTQ/AWQ、NVFP4Eagle3、DFlare、DFly、MTP、SpecExitStem 等稀疏注意力VLMQwen3-VL、Qwen2.5-VLFP8、INT8、INT4Eagle3Token 剪枝IDPruner、VisionZip扩散模型FLUX、SDXL 等FP8-Dynamic、FP8-Weight-Only-DeepCache、TeaCache语音Qwen3-Omni、Qwen2-AudioFP8、INT8Eagle3-完整的模型与技术矩阵可参考官方文档首页 docs/source/index.md。 快速上手安装AngelSlim并一键压缩模型安装步骤pip一条命令pip install angelslim依赖清单见 requirements/requirements.txt按需安装可选依赖如[sparse]、[multimodal]。核心工作流配置驱动四步完成压缩AngelSlim 采用「YAML 配置驱动」的设计整体流程分为四步核心引擎在 angelslim/engine.pyPrepare Model通过模型注册工厂加载目标模型Prepare Data加载校准数据集内置 ShareGPT 等示例数据如 dataset/sharegpt_gpt4/sharegpt_gpt4_256.jsonlRun执行选定的压缩算法量化/投机采样/稀疏化Save / Deploy导出压缩权重直接对接 vLLM、SGLang 等推理框架。最快体验一条命令完成FP8量化仓库的 configs/ 目录下按「模型 × 压缩策略」组织了大量现成 YAML例如对 Qwen3-1.7B 执行静态 FP8 量化python3 tools/run.py -c configs/qwen3/ptq/fp8_static/qwen3-1_7b_fp8_static.yaml配置文件由三大块组成tools/run.py 负责解析调度配置块作用常见字段model指定要压缩的模型name、model_path、torch_dtypecompression指定压缩算法与参数name: PTQ、quantization.name: fp8_staticdataset指定校准数据集data_path、num_samples、batch_size以 configs/qwen3/ptq/fp8_static/qwen3-1_7b_fp8_static.yaml 为例ignore_layers可以跳过对精度敏感的lm_head层。修改配置的完整教程见 docs/source/design/prepare_config.md。 显存不足时可切换 low-memory 模式或PTQWeightOnly路径直接处理 safetensors不占 GPU 显存例如 FP8 block-wise 分块量化脚本 tools/fp8_quant_blockwise.py 支持多 GPU 并行。 量化FP8/INT8/INT4压缩方案怎么选量化是 AngelSlim 支持最完整的压缩方向核心入口是 angelslim/compressor/quant/ptq.py支持的算法一览算法特点适用场景FP8-Static / Dynamic显存减半精度几乎无损首选方案INT8-Dynamic兼容性好消费级 GPUINT4-GPTQ / AWQ4bit 极致压缩显存极度紧张W4A8-FP8权重 4bit 激活 FP8DeepSeek-R1 类超大 MoENVFP4 / MXFP4新一代 4bit 格式Blackwell 等新硬件量化前后权重分布从「密集小值」变为「低比特离散值」如下面的权重直方图对比所示BF16 vs FP8精度表现如何以 Qwen3 系列为例数据来自 README 官方基准模型量化方式CEVALMMLUGSM8KHumanEvalQwen3-8BBF1679.2774.7887.7963.41Qwen3-8BFP8-Static78.2374.7986.9662.20Qwen3-8BINT4-GPTQ77.1973.2686.4362.20FP8 量化后各项指标与原始模型基本持平而权重体积直接减半。更多算法细节见 docs/source/features/quantization/fp8.md、docs/source/features/quantization/gptq.md 和 docs/source/features/quantization/awq.md。除 PTQ训练后量化外AngelSlim 还提供QAT量化感知训练、QAD量化感知蒸馏基于 Megatron-Core 分布式与QAT Zero3方案适合对精度要求苛刻的场景详见 docs/source/features/quantization/qat.md。 投机解码Eagle3与DFlare无损加速推理大模型推理慢投机解码Speculative Decoding是精度无损的加速方案让一个小而快的草稿模型先「猜」出多个 token再由目标模型一次性并行验证。AngelSlim 内置了完整的投机解码训练与测试工具链angelslim/compressor/speculative/支持的方法包括Eagle3目前最成熟、加速最稳的方案LLM/VLM/语音模型均有 1.4~1.9× 实测解码加速DFlare块扩散式投机解码框架通过「逐层融合」把目标模型多层隐藏状态融合给草稿层使用最高实现5.52× 端到端加速DFly / MTP新一代草稿方法在 Hy3-A21B 上平均1.98~2.40×加速SpecExit推理早退算法推理类任务可提前结束思考进一步省算力。训练脚本示例scripts/speculative/train_eagle3_online.sh、scripts/speculative/run_dflare_online.sh算法原理与复现步骤见 docs/source/features/speculative_decoding/eagle/index.md 和 docs/source/features/speculative_decoding/dflare.md。✂️ 稀疏化Stem加速长上下文Prefill处理 32K~128K 长上下文时Prefill 阶段的注意力计算量随序列长度平方增长。AngelSlim 的稀疏注意力模块angelslim/compressor/sparsity/通过动态跳过低重要性注意力块来削减计算Stem稳定版先用低成本的块级打分估计每个 attention block 的重要性再只对 top-k 关键块执行精确注意力Prefill 大幅提速且质量基本无损MInference / FlexPrefill / XAttention 等实验性算法亦可一键调用。如上图所示在 FP8-W8A8 Stem 配置下模型在 SWE-bench Verified72.40 vs 74.40等基准上与 BF16 基线基本持平。使用方式与其他压缩策略统一——只需一份 YAMLpython tools/run.py -c configs/sparse/stem/qwen3-8b_stem_torch.yaml参数说明与原理推导参考 docs/source/features/sparse_attention/stem.md更多稀疏策略配置在 configs/sparse/。 还有哪些隐藏能力蒸馏支持全精度模型与量化模型的 QAT 式蒸馏见 angelslim/compressor/distill/QADMegatron-Core 量化感知蒸馏TP/EP/CP/SP 分布式下直接训练量化模型配置示例 configs/qwen3/mcore_qad/qwen3_moe_nvfp4.yamlToken 剪枝视觉 Token 压缩统一框架IDPruner、VisionZip、FastV 等 11 种算法在 75% 压缩率下平均保留94.42%精度配置见 configs/qwen2_5_vl/pruning/SmoothQuant / 旋转变换量化前对权重做平滑/旋转预处理见 angelslim/compressor/transform/。 部署验证压缩完直接上线压缩后的模型可直接对接主流推理引擎仓库自带部署脚本docs/source/deployment/deploy.md# vLLM 启动 OpenAI 兼容 API 服务 bash scripts/deploy/run_vllm.sh --model-path $MODEL_PATH --port 8080 -d 0,1,2,3 -t 4 # 离线快速验证 python scripts/deploy/offline.py $MODEL_PATH Hello, my name is # 精度评测lm-evaluation-harness bash scripts/deploy/lm_eval.sh -d 0,1 -t 2 -r $RESULT_PATH --tasks ceval-valid,mmlu,gsm8k $MODEL_PATH 学习路径小结想做什么从哪入手第一次量化docs/source/getting_started/quickstrat.md改配置/换模型docs/source/design/prepare_config.md研究算法实现angelslim/compressor/ 下 quant / speculative / sparsity 目录复现性能数据evaluation/ 与 README.md 中 Benchmark 章节AngelSlim 用「一个引擎 一份 YAML」的极简设计把原本分散在多个项目里的大模型压缩技术整合成了开箱即用的工具链——无论你想省显存、降延迟还是压缩长上下文都能在这里找到对应的一键方案。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐如何快速掌握fastai模型剪枝神经网络稀疏化与压缩完整指南如何快速掌握fastai模型剪枝神经网络稀疏化与压缩完整指南 fastai深度学习库是一款强大的工具帮助开发者和研究人员快速构建和训练各种深度学习模型。在实人工智能深度学习FlashMLA模型压缩指南结合量化与稀疏的双重优化策略FlashMLA模型压缩指南结合量化与稀疏的双重优化策略 FlashMLA作为高效的MLA解码内核项目通过量化与稀疏化双重优化策略在保持模型性能的同时显著算子库大模型如何高效压缩Denoising Diffusion模型权重量化与稀疏化协同优化终极指南如何高效压缩Denoising Diffusion模型权重量化与稀疏化协同优化终极指南 Denoising Diffusion模型作为当前AI图像生成领域的核人工智能深度学习媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

计算机组成原理入门:从冯诺依曼结构到CPU与存储层次

计算机组成原理入门:从冯诺依曼结构到CPU与存储层次

简介:《计算机组成原理入门指南》是一份面向零基础读者的 PDF 教程,以冯诺依曼体系结构为主线,依次讲解运算器、控制器、存储器、输入输出设备,并深入分析中央处理器内部的寄存器、程序计数器、指令寄存器、控制单元与算术逻辑单元…

📅 2026/10/11 17:21:47
SpringBoot+Vue+MyBatis+MySQL企业级后台管理系统实战:从数据库设计到权限控制

SpringBoot+Vue+MyBatis+MySQL企业级后台管理系统实战:从数据库设计到权限控制

在企业内部和高校院系里,我最常接到的需求之一,就是把散落在 Excel、纸质表单和个人电脑里的数据统一收拢到一个后台管理平台里。这次这个"企业级信息学科平台管理系统"就是典型代表,技术栈非常标准——SpringBootVueMyBatisMySQL架…

📅 2026/10/11 17:21:47
页眉页脚与精准分页:dompdf.js 浏览器 PDF 生成 pageConfig 完整实战教程

页眉页脚与精准分页:dompdf.js 浏览器 PDF 生成 pageConfig 完整实战教程

【免费下载链接】dompdf.js HTML to PDF in the browser — one line of code for selectable, searchable vector PDFs (10,000 pages). Pure frontend: zero backend, zero runtime deps. TypeScript over a Rust WebAssembly engine; an html2canvas/jsPDF alternative. 项…

📅 2026/10/11 17:21:47
MORE NEWS

更多资讯

📰

经典ASP遗留系统运维实战:源码结构、IIS部署与高频故障排查

简介:面向ASP初学者及Web开发者的源码实践包,主体是一个ASP实现的论坛(BBS)项目,涵盖用户注册、登录、发帖、回帖、板块管理等典型业务模块,涉及表单提交、数据校验、分页显示、权限管理等常见Web场景&…

📰

Cursor 规则编写效率翻倍:用 TaoToken 统一 Key 打通多模型调试

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

接口服务限流方案实战:TaoToken 统一 Key 通道下的令牌桶与 QPS 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

分页查询性能优化:深分页扫描、游标分页与键集分页实战

我最早意识到分页查询不是“写个 LIMIT 就完事”的东西,是在维护一个订单后台列表的时候。那张表其实不算大,几百万行,接口就是很普通的列表查询,前几十页都很快,结果用户翻到第 200 页直接转圈圈,接口超时…

📰

MySQL事件调度器实战:从定时清理到自动化任务管理

1. 事件功能到底解决什么问题先讲一个特别常见的业务场景:每天凌晨要把三个月前的操作日志清理掉,或者要把订单表里超过一小时未支付的记录改成“已超时关闭”,再比如每天早上九点给运营同学提前算好前一天的销售汇总。这些活儿有个共同点——…

📰

EasyOCR离线OCR系统:中日韩混合文本识别与结构化提取

简介:本资源是一个基于EasyOCR构建的轻量级OCR文字识别系统实现包,面向Python初学者、机器学习入门者及课程设计实践者,解决图像中文字自动提取与结构化输出的实际问题,适用于文档数字化、截图转文本、多语言信息采集等典型场景。…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬