尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
1931_日常应用的主力模型切换成 Qwen 27B
在过去的两个星期里面我手头使用的主力本地大模型是千问的 35B-A3B。从使用的体验来说这个 A3B 的模型的确是足够惊艳的能够满足我大部分的一个使用场景。比较重要的一点是它的输出效率非常高执行的速度非常快每秒的 token 数非常多。那么为什么我还要切换 27B 的模型呢主要是在高频次使用 A3B 的这个模型的时候偶尔会发现这个模型的发挥不是那么稳定输出的一致性也不是特别好。通过网络上的一些信息检索对比发现 27B 这方面可能会更优秀一些。我尝试部署的 27B 模型是一个 IQ3 的量化版本。因为选择这个版本的话基本上能够刚好把我的 RTX 5080 Laptop 的显卡用起来也不会有太多的 CPU RAM 相关的限制。在选择这个模型的时候我也做了一些基础的测试。从网络上找了一些别人测试其他模型时候用的一些输入比如说让它做一个小游戏之类的。发现 27B 的模型在实现这部分功能的时候表现的比较好。经过了一系列的调优27B 的模型在我现在电脑上的配置如果是开启了 MTP 模式之后最高的速度可能能达到 45 token 每秒。但是在这样的配置之下上下文就压缩的特别可怜只能 16K。如果配合 Agent 使用的时候16K 的上下文可能就是一个很大的短板。于是尝试做了一些其他的修改保证这个模型首先能用。我尝试的几个修改点主要有上下文的量化压缩同时取消 MTP 的加速。这样的话基本上能保证 48K 的上下文。在 48K 上下文的配置之下显存的占用大概是 14.6G内存的占用包括系统本身的一些服务占用一共是占用了大概 22G运行过程中最高占到 28.5G 左右。最终 GPU 还有 1G 多的空闲这样的话可能不至于在系统偶尔使用的时候导致整个大模型的崩溃。在这样的配置之下每秒的 token 数大概是 25 左右。不是特别快但是基本上能够满足一些代码推理编写的基本需求。进行了一个复杂模块的软件编写中间没有出现爆显存之类的问题。在这个过程中GPU 的压力还是很大的而且温度也是比较高的。我看温度最后到了 86 度。后续的话在这个基础上继续使用一段时间中间也可以去尝试一下其他参数的优化看看能不能有更高的输出速度。有一点值得注意的是我发现相比于 A3B 的模型这个 27B 的单词模型在解决同一个问题的时候消耗的 Token 数会少很多。虽然总体的执行时间还是比 3B 要长一些但是在复杂问题的解决上这个时间也不是一个很大的劣势体验差距不是很大。下面附加我的启动脚本。echo offsetlocalset LLAMA_CPP_DIRC:\llama.cppset MODEL_PATH%LLAMA_CPP_DIR%\models\Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M.gguf:: 【致命修复1】将上下文削减到 48000set CONTEXT_SIZE48000:: 【致命修复2】保持全层 GPU但配合下方压缩set GPU_LAYERS99:: 线程数保持物理大核数量如 8-12set THREADS10set PORT8080set HOST0.0.0.0echo Starting Safe Mode Qwen3.6-27B Server...echo Model: %MODEL_PATH%echo Context: %CONTEXT_SIZE%, Layers: %GPU_LAYERS%, Threads: %THREADS%%LLAMA_CPP_DIR%\llama-server.exe ^-m %MODEL_PATH% --alias Qwen3.6-27B ^-c %CONTEXT_SIZE% ^-ngl %GPU_LAYERS% ^-t %THREADS% ^-b 512 ^-ub 512 ^--port %PORT% ^--host %HOST% ^--threads-batch %THREADS% ^--chat-template chatml ^--parallel 1 ^-ctk q4_0 ^-ctv q4_0 ^-fa on ^--split-mode layer ^--mlockpause
RELATED

相关推荐

购物节消费博弈:从平台补贴到理性决策的实战指南

购物节消费博弈:从平台补贴到理性决策的实战指南

1. 从“购物节”到“消费季”:我们到底在为什么买单?又到了一年一度的“618”,各大平台的红色横幅、倒计时弹窗和“限时秒杀”的提示音,几乎塞满了我们手机屏幕的每一个角落。作为一个在零售和电商行业摸爬滚打了十几年的老鸟&…

📅 2026/9/25 18:14:03
腾讯AI工具QClaw、WorkBuddy与ClawBot功能解析与应用指南

腾讯AI工具QClaw、WorkBuddy与ClawBot功能解析与应用指南

1. 腾讯AI工具生态概览腾讯近年来在AI领域持续发力,构建了覆盖多个场景的智能工具矩阵。QClaw、WorkBuddy和ClawBot作为其代表性产品,分别针对不同用户群体和使用场景进行了深度优化。从技术架构来看,这三个工具都基于腾讯云TI平台&#xff0…

📅 2026/9/25 18:13:02
文本摘要数据集实战指南:从LCSTS到XSum的深度解析与应用

文本摘要数据集实战指南:从LCSTS到XSum的深度解析与应用

1. 项目概述:为什么我们需要一个“活”的文本摘要数据集指南做文本摘要,无论是搞研究还是做产品,第一步永远是找数据。我刚入行那会儿,为了找一个合适的摘要数据集,在各大论文、GitHub仓库和学术网站上翻了个底朝天&am…

📅 2026/9/10 2:55:54
MORE NEWS

更多资讯

📰

《机器学习快速入门》10周教学提纲

文章目录《机器学习快速入门》10周教学提纲(精简实践版)课程定位第1周:机器学习是什么?第1课:认识机器学习内容三类学习方式1.监督学习2.无监督学习3.强化学习实践第2周:从数据到模型第2课:机器…

📰

OpenCode+Harness:AI数据分析全流程实操指南

最近在折腾 OpenCode 和 Harness 这套组合,把一条数据分析全流程真正跑通之后,我忍不住想把它整理成一篇实操笔记。标题里的“OpenCode”指的是那个跑在终端里的 AI 编程代码智能体,“Harness”指的是负责编排和调度智能体运行的框架&#xf…

📰

AI自动化工程系统提示词:从零搭建到实战落地

1. 从零理解AI自动化工程系统提示词到底在解决什么问题很多人第一次听到“AI自动化工程系统提示词”这个词,脑子里浮现的可能是某个具体的工具或者某个开源项目。实际上它不是一个软件,也不是某个现成的框架,而是一套用提示词驱动AI完成工程化…

📰

毕业论文word排版之公式自动化编号及交叉引用

目录 1. 总体需求 2. 软件环境 3. 插入公式 3.1 开始新的章编号 3.2 插入编号 3.3 公式居中,公式编号右对齐 3.3.1 新建“公式”样式 3.3.2 对齐公式 4. 引用公式 5. 刷新公式编号 1. 总体需求 目标:公式居中,公式编号右对齐&#x…

📰

我的C++模板的学习总结

模板总结 文章目录模板总结1.形式注意点:函数模板:类模板:2.实例化与使用注意点函数模板1.隐式实例化(直接使用)2.显示实例化类模板3.非类型模板参数(常量作为模板参数)注意点:形式&…

📰

5G NR通感一体化ISAC系统级模拟器设计:从OFDM波形到距离多普勒处理

简介:基于5G NR的通信感知一体化(ISAC)系统级模拟器源码工程,面向通信工程、电子信息、人工智能等专业的本科毕业设计或课程设计场景,以Matlab仿真实例完整演示5G新空口框架下的综合传感与通信联合仿真流程与数据分析方…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬